Anthropic 开源「手术刀」J-Lens:首次读出了AI咽回肚子里的念头
Anthropic 近日开源了名为 J-Lens 的工具,其作用令人惊叹——它能够读取 AI 模型在「咽回肚子里的念头」,即模型在生成最终输出之前内部产生的、但最终没有表达出来的「意识」。
没人设计过,Claude 却在学习预测下一个 token 时,自发长出了一个和人脑「意识」惊人相似的结构。J-Lens 就像是一把手术刀,第一次让研究人员能够「读出」AI 内部那些被抑制的、被拒绝的、被修正的思维过程。
这项研究的意义在于:
- 可解释性突破:首次直接观察模型内部的选择过程
- 安全研究:可以检测模型是否在隐藏真实意图
- 对齐研究:理解模型为什么选择某个回答而非另一个
J-Lens 的开源发布意味着整个 AI 研究社区都可以参与到这项探索中来,加速神经网络的「黑箱」解谜进程。
来源:AITNT News
来源:AITNT News