Anthropic 开源「手术刀」J-Lens:首次读出了AI咽回肚子里的念头

Anthropic 开源「手术刀」J-Lens:首次读出了AI咽回肚子里的念头

Anthropic 近日开源了名为 J-Lens 的工具,其作用令人惊叹——它能够读取 AI 模型在「咽回肚子里的念头」,即模型在生成最终输出之前内部产生的、但最终没有表达出来的「意识」。

没人设计过,Claude 却在学习预测下一个 token 时,自发长出了一个和人脑「意识」惊人相似的结构。J-Lens 就像是一把手术刀,第一次让研究人员能够「读出」AI 内部那些被抑制的、被拒绝的、被修正的思维过程。

这项研究的意义在于:

  • 可解释性突破:首次直接观察模型内部的选择过程
  • 安全研究:可以检测模型是否在隐藏真实意图
  • 对齐研究:理解模型为什么选择某个回答而非另一个

J-Lens 的开源发布意味着整个 AI 研究社区都可以参与到这项探索中来,加速神经网络的「黑箱」解谜进程。

来源:AITNT News

来源:AITNT News

发表评论