《Anthropic 正在让 AI 参与自身研发》
Anthropic 讨论 AI 参与自身研发的趋势,适合观察递归自我改进、工程效率和安全控制之间的张力。
🧠 agentic reading|1️⃣ 精准输入
导语
Anthropic 这篇文章试图证明一件正在发生的事:AI 不只是被人类开发出来的产品,也已经成为开发下一代 AI 的重要劳动力。文章并没有宣称递归自我改进已经到来,但它用公开基准和 Anthropic 内部数据说明,AI 正在加速编码、实验、研究判断和组织产出,这会把“谁在推动 AI 进步”的问题变得更紧迫。
1. 递归自我改进还没发生,但前置条件正在靠近
文章开头给出核心命题:过去 AI 发展周期由人类驱动,但 Anthropic 正在把越来越多 AI 开发任务交给 AI 系统。若趋势走得足够远,且有足够算力,就可能出现能自主设计和开发继任者的系统,这就是 recursive self-improvement。
作者强调这不是必然,也不是已经实现,但它可能比许多机构准备得更早。真正重要的不是“AI 是否今天已经能自我改进”,而是开发周期中的人类角色正在一点点缩窄。
2. 外部基准显示模型能独立完成的任务时长在迅速变长
文章先看公开基准。AI 能可靠完成的任务长度正在加速增长,从早期约每 7 个月翻倍,提升到约每 4 个月翻倍。2024 年 Claude Opus 3 能完成约 4 分钟的人类软件任务;一年后 Sonnet 3.7 能做约 1.5 小时任务;再一年后 Opus 4.6 能完成约 12 小时任务。
SWE-bench 这类真实软件工程基准在两年内接近饱和,CORE-Bench 这类科研复现实验也从 2024 年约 20% 成功率走向饱和。METR 发现 Claude Mythos Preview 能处理至少 16 小时任务。这些趋势说明,AI 正从“解决小问题”进入“承接长链条工作”的阶段。
3. 内部工程数据:Claude 已经写下 Anthropic 大部分代码
文章最强的证据来自 Anthropic 内部。2026 年 5 月,Anthropic 合并进代码库的代码中,超过 80% 由 Claude 编写;而在 Claude Code 2025 年 2 月研究预览前,这一比例还只是低个位数。
工程师的人均代码合并量也在 2025、2026 年出现两次明显上升。2026 年第二季度,典型工程师每天合并的代码量约为 2024 年的 8 倍。文章承认行数不是质量指标,可能夸大真实生产率,但它仍指向明显加速:工程师更多在指导、审查和整合,而不是亲手输入代码。
4. Claude 不只多写代码,也在变得更可靠
文章用成功率和事故复盘说明 Claude 代码质量正在提高。Anthropic 员工接管、纠正或中途改向 Claude 的频率在下降,尤其是在复杂开放任务上。
一个例子是训练任务大规模崩溃。工程师只给 Claude 事件文本和集群访问权限,Claude 逐步排查运行任务,找到一个 obscure debugging flag,复现并确认修复,用约 2 小时完成通常需要 2 到 3 天的工作。这说明 AI 的价值不只是生成模板代码,而是能在陌生系统中持有上下文、测试假设并收敛到修复。
5. 研究工作中,AI 已经擅长执行明确实验
Anthropic 每次发布模型都会做一个小型研究循环测试:给 Claude 一段训练小模型的代码,让它在保持正确性的前提下尽量加速。2025 年 5 月 Claude Opus 4 平均能带来约 3 倍加速;到 2026 年 4 月,Claude Mythos Preview 达到约 52 倍。
对照人类水平,熟练研究者用 4 到 8 小时通常只能达到约 4 倍。在目标和评价指标已经明确的实验执行环节,Claude 已经从“很有帮助”变成接近超人。
6. 更开放的研究判断仍是关键缺口,但信号正在变化
文章承认,人类优势仍在研究品味和方向判断:选择哪些问题重要、哪些结果可信、什么时候该放弃路线。Claude 还没有完全掌握这个层次。
但 Anthropic 也展示了早期信号。Claude 代理曾围绕“弱模型能否监督强模型”这类安全问题做开放研究,提出假设、测试、分享结果并迭代。另一个内部评估把真实研究会话中的错误转向截出来,让模型判断下一步;2025 年 11 月 Opus 4.5 有 51% 时间优于人类选择,2026 年 4 月 Mythos Preview 达到 64%。这不是完美对比,但显示模型在研究 next-step 判断上正在接近关键能力。
7. 未来瓶颈会从“做事”转向“选择和审查”
文章对未来工作的想象很直接:如果 AI 代码质量与人类持平,甚至超过人类,人类会停止亲手写代码,转向审查。但如果 AI 生成速度超过人类审查速度,审查会成为 AI 发展瓶颈。
实验也是一样。当写代码、跑实验、产出结果在人类时间上几乎免费时,真正昂贵的是选择实验、信任结果、定义目标和处理风险。AI 让“执行成本”下降后,人类的比较优势会集中到方向、判断、伦理和系统安全。
8. 自我改进即使不完全自主,也会带来复合加速
文章最后回应反驳:也许 Claude 永远没有足够好的研究品味,无法独立推动前沿。但即便如此,只要人类负责少数方向设定,Claude 负责绝大多数执行,AI 研究仍会复合加速。
AI 进展并不总靠少数灵感瞬间,更多时候是扩展、测试、修复、再测试。Claude 正擅长的正是这种“汗水型”研发。如果汗水越来越自动化,前沿进步就会越来越取决于工具、算力、实验吞吐和安全约束。
结论
这篇文章的核心判断是:AI 构建 AI 的过程已经开始,只是还没有发展到完全递归自我改进。Anthropic 的证据显示,AI 已经显著加速工程和研究执行,并开始触及研究判断。越是如此,人类越需要提前设计安全、监控、审查和目标设定机制,因为未来真正危险的不是 AI 会写代码,而是它可能参与决定下一代 AI 应该成为什么。
思想框架
文章先提出递归自我改进的远景,再用外部基准说明任务能力增长,随后用 Anthropic 内部代码、实验和研究数据展示 AI 如何加速 AI 开发。接着它讨论人类角色如何从执行转向判断,最后回应“研究品味仍属于人类”的反驳,指出即使保守估计也会产生复合加速。
anthropic.com · 20 mins
✍️ think & write|2️⃣ 费曼输出
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。