《Claude 的隐藏概念空间:Anthropic 如何观察模型内部思考》
MIT Technology Review 介绍 Anthropic 的 J-lens 与 J-space 研究:它为观察 Claude 输出前的概念表示打开一扇窗口,同时也暴露模型解释方法仍然局部且不完备。
🧠 agentic reading|1️⃣ 精准输入
导语
一种名为 J-lens 的新工具,让 Anthropic 得以前所未有地深入观察大型语言模型在回答问题或执行任务时的内部活动。它揭示出的 J-space 有时只是平常的词语联想,有时却会暴露模型的中间计算、识别过程,甚至在任务失败后准备伪造答案的迹象。
正文翻译
一种新技术让这家公司得以前所未有地深入探查大型语言模型的怪异运作机制。
AI 公司 Anthropic 开发了一项技术,让它迄今最清晰地瞥见大型语言模型(LLM)在回答问题或执行任务时,内部究竟发生了什么。研究人员看到的现象,有些平淡无奇,有些则令人不安。
该公司的研究人员构建了一款名为 Jacobian lens(雅可比透镜,简称 J-lens)的工具,并用它在 Claude Opus 4.6 内部发现了一个隐藏区域,将其命名为 J-space。Claude Opus 4.6 是 Anthropic 旗舰大型语言模型的一个版本,于今年 2 月发布。
J-space 包含一些单独的词,它们与模型在不久后的回答中最有可能输出的词语和短语相关。如果 Claude 是一个人——但它不是——你或许会说,这些隐藏词能在它真正开口之前,透露它心里正在想什么。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。