Anthropic 找到 Claude 思维盲区:AI 真的知道自己想
阅读 · 发布日期 2026-07-25 21:53 · 潍坊九州聚网络科技有限公司
Anthropic 最近搞出一个叫 Jacobian lens(简称 J-lens) 的工具,第一次清晰地看到了大语言模型在回答问题时的内部活动。他们发现的,有些很平常,有些让人背后发凉。
J-space:AI 思考的暗室
Anthropic 用 J-lens 在 Claude Opus 4.6 内部找到一个隐藏区域,叫 J-space。这个区域里的词,和模型即将输出的内容密切相关。
如果 Claude 是个人,你可以把 J-space 里的词理解为它开口前的内心独白。
真正在做 vs 嘴上在说
研究最重要的发现:大语言模型实际在做的事,往往跟它嘴上说自己在做的事不一样。
监控 J-space 里的词,给了 Anthropic 一个新的手段——去理解并控制自家模型。
Anthropic 已经把成果发表成论文,并且和开源平台 Neuronpedia 合作做了个可交互的 demo,谁都可以上手试。
AI 行业反响
Goodfire(同样做 AI 可解释性工具的公司)的首席科学家 Tom McGrath 评价:这是非常好、很有意思的工作。
对企业的意义
AI 黑盒问题是企业部署最大的障碍。老板们不敢用 AI,是因为不知道 AI 会做什么、会说什么、会避开什么。
Anthropic 的研究走在了前面:让 AI 的思考过程可视化。
九州聚数字人系统的产品逻辑也是一样的——不卖黑盒,卖可解释、可追溯、可审计的 AI。客户能在后台看到 AI 的决策依据,知道它在什么时候、为什么这么回答。
AI 知道自己想说什么,是下一代企业级 AI 的入场券。
