Anthropic 找到 Claude 思维盲区:AI 真的知道自己想

阅读  ·  发布日期 2026-07-25 21:53  ·  潍坊九州聚网络科技有限公司

Anthropic 最近搞出一个叫 Jacobian lens(简称 J-lens) 的工具,第一次清晰地看到了大语言模型在回答问题时的内部活动。他们发现的,有些很平常,有些让人背后发凉。

J-space:AI 思考的暗室

Anthropic 用 J-lens 在 Claude Opus 4.6 内部找到一个隐藏区域,叫 J-space。这个区域里的词,和模型即将输出的内容密切相关。

如果 Claude 是个人,你可以把 J-space 里的词理解为它开口前的内心独白

真正在做 vs 嘴上在说

研究最重要的发现:大语言模型实际在做的事,往往跟它嘴上说自己在做的事不一样

监控 J-space 里的词,给了 Anthropic 一个新的手段——去理解并控制自家模型。

Anthropic 已经把成果发表成论文,并且和开源平台 Neuronpedia 合作做了个可交互的 demo,谁都可以上手试。

AI 行业反响

Goodfire(同样做 AI 可解释性工具的公司)的首席科学家 Tom McGrath 评价:这是非常好、很有意思的工作。

对企业的意义

AI 黑盒问题是企业部署最大的障碍。老板们不敢用 AI,是因为不知道 AI 会做什么、会说什么、会避开什么。

Anthropic 的研究走在了前面:让 AI 的思考过程可视化

九州聚数字人系统的产品逻辑也是一样的——不卖黑盒,卖可解释、可追溯、可审计的 AI。客户能在后台看到 AI 的决策依据,知道它在什么时候、为什么这么回答。

AI 知道自己想说什么,是下一代企业级 AI 的入场券。