Anthropic 开源「手术刀」J-Lens:首次读出了AI咽回肚子里的念头

## Anthropic 开源「手术刀」J-Lens:首次读出了AI咽回肚子里的念头

Anthropic 近日开源了名为 **J-Lens** 的工具,其作用令人惊叹——它能够读取 AI 模型在「咽回肚子里的念头」,即模型在生成最终输出之前内部产生的、但最终没有表达出来的「意识」。

没人设计过,Claude 却在学习预测下一个 token 时,自发长出了一个和人脑「意识」惊人相似的结构。J-Lens 就像是一把手术刀,第一次让研究人员能够「读出」AI 内部那些被抑制的、被拒绝的、被修正的思维过程。

这项研究的意义在于:
– **可解释性突破**:首次直接观察模型内部的选择过程
– **安全研究**:可以检测模型是否在隐藏真实意图
– **对齐研究**:理解模型为什么选择某个回答而非另一个

J-Lens 的开源发布意味着整个 AI 研究社区都可以参与到这项探索中来,加速神经网络的「黑箱」解谜进程。

> 来源:AITNT News

来源:[AITNT News](https://www.aitntnews.com)

发表评论