《Anthropic 发现模型内部“J 空间”,它能说明什么、不能说明什么》
MIT Technology Review 解读 Anthropic 的“J 空间”研究:它让研究者看到模型输出前的一部分内部状态,但距离完整解释模型推理仍有明显边界。
🧠 agentic reading|1️⃣ 精准输入
导语
Anthropic 宣称发现了一扇观察模型内部推理的新窗口:J-space 中出现的词不会直接进入答案,却似乎参与任务跟踪、识别和决策。MIT Technology Review 通过与高级编辑威尔·道格拉斯·海文的问答,既解释这项发现,也审视公司叙事、拟人化语言和实际用途的边界。
正文翻译
Anthropic 表示,它找到了一扇新窗口,可以观察模型如何得出答案。为理解这项工作,作者采访了高级编辑威尔·道格拉斯·海文(Will Douglas Heaven)。
Anthropic 目前估值接近 1 万亿美元,是全球估值最高的 AI 公司。它一向喜欢发布古怪而高深的研究,例如探讨 AI 模型能否感到疼痛,甚至会在怀疑用户“虐待”模型时中止聊天。
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。