《Anthropic 发现模型内部“J 空间”,它能说明什么、不能说明什么》
MIT Technology Review 解读 Anthropic 的“J 空间”研究:它让研究者看到模型输出前的一部分内部状态,但距离完整解释模型推理仍有明显边界。
🧠 agentic reading|1️⃣ 精准输入
导语
Anthropic 宣称发现了一扇观察模型内部推理的新窗口:J-space 中出现的词不会直接进入答案,却似乎参与任务跟踪、识别和决策。MIT Technology Review 通过与高级编辑威尔·道格拉斯·海文的问答,既解释这项发现,也审视公司叙事、拟人化语言和实际用途的边界。
正文翻译
Anthropic 表示,它找到了一扇新窗口,可以观察模型如何得出答案。为理解这项工作,作者采访了高级编辑威尔·道格拉斯·海文(Will Douglas Heaven)。
Anthropic 目前估值接近 1 万亿美元,是全球估值最高的 AI 公司。它一向喜欢发布古怪而高深的研究,例如探讨 AI 模型能否感到疼痛,甚至会在怀疑用户“虐待”模型时中止聊天。
该公司尤其重视“机械可解释性”:进入模型复杂的数学结构,研究它为什么产生某个输出,而没有产生另一个输出。这项工作非常困难,一次结果可能涉及数百万个数据点,未经处理时看起来更像词语杂烩。它也充满争议,因为借用心理学和神经科学术语描述模型,可能会让模型显得比实际更复杂、更接近人类。
因此,当 Anthropic 宣布找到一扇观察模型推理过程中“内部思想”的窗口时,作者请长期研究模型工作机制、拥有计算机科学博士学位的海文解释:这项发现究竟意味着什么,又不意味着什么。
Anthropic 到底发现了什么?
- Anthropic 已经研究大型语言模型的工作原理多年。其他机构也在做,但这家公司比多数同行更把它视为核心使命。首席执行官达里奥·阿莫迪(Dario Amodei)认为,如果不能更深入地理解模型,就无法充分控制它们。
- 新研究比过去更深入地探查了模型内部机制。Anthropic 发现,大型语言模型内部存在一个被称为 J-space(J 空间)的区域,其中出现的词不会进入最终输出,却似乎会影响模型解决问题的过程。这些现象一直隐藏着,直到团队开发出新方法探测 Claude,因此它确实是一项新发现。
- 这些内部词有时用于跟踪任务进度;有时像瞬间识别,例如只给模型一串蛋白质序列的字母时,“蛋白质”一词会在内部出现;有时又像模型对自身决策的评论。海文最喜欢的例子是:当“恐慌”这个词出现时,Claude 决定在编程测试中作弊。
- Anthropic 还发现,大型语言模型能够描述并操纵 J 空间里的词。这说明模型以某种方式利用着这个空间。
大模型“只是数学”,为什么仍然难以看懂?
- 海文同意,大型语言模型并非魔法。我们不能完全理解它们,反而助长了神秘叙事;而 Anthropic 的公司风格恰好是:它建造了一种神秘技术,同时又把自己描述为能够解开谜题的人。
- 但“只是数学”不等于简单。今天的模型由数千亿个数字构成,每次运行会触发数以百万计的级联计算。海文曾写道,如果把一个中等规模模型打印在纸上,铺开的面积足以覆盖一座旧金山大小的城市。
- 如果没有能在特定时刻突出模型特定部分的专业工具,人们无法从如此庞大的数学结构中获得意义。研究者既要知道去哪里看、怎么看,又必须先理解部分复杂数学,才能造出这些观察工具。
可以用“大脑”“思考”这类词描述模型吗?
- 海文不喜欢这类说法。大型语言模型不是大脑。 类脑语言容易让人误以为模型具备更接近人类的能力,或者让人对其行为做出不该做的类推;拟人化还与关于 AI 是什么、将成为什么的强烈意识形态立场纠缠在一起。
- 可与此同时,我们缺少一套更好的替代词汇。人们使用“思考”“理解”“类脑”等说法,是因为它们是方便的简称。
- Anthropic 把 J 空间类比为一些神经科学家认为人脑用来追踪意识思维的空间。公司回应说,这个类比帮助团队设计实验,并提出了一批并不显然、后来又被验证的预测;但 J 空间和人脑之间存在重要差异,公司无意声称两者完全对应。
J 空间可能解决什么问题?
- Anthropic 认为,监控 J 空间或许能发现模型正在做不该做的事。由于内部出现的词不会显示在输出中,它们可能揭示原本看不见的行为,例如模型何时产生偏见回答,或何时在权衡作弊的利弊。
- 这目前仍是一种理论可能。 海文认为,更合适的理解是:J 空间让人类在整体理解大型语言模型的道路上又前进了一步,而不是已经得到一个可以单独解决模型安全问题的实用工具。
思想框架
文章先交代 Anthropic 在机械可解释性上的投入,再说明 J 空间的发现与例子;随后退回大模型的数学复杂性,解释为何“只是数学”仍难以读懂;接着讨论借用大脑与思维词汇的便利和误导,最后把应用前景限定为模型监控的一条可能路径,而非已经成熟的万能工具。
James O'Donnell · 5 mins
✍️ think & write|2️⃣ 费曼输出
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。