《E242|最快半年AI跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地》
节目讨论了硅谷在自进化AI模型上的竞赛,和陈天桥首席科学家交流了关键技术与挑战。 嘉宾认为最快半年内可能实现能自我进化的AI雏形,但仍需解决安全和算力问题。 这场竞争将决定未来AI模型的主导地位与产业格局。
🧠 agentic reading|1️⃣ 精准输入
导语
这期《硅谷101》讨论大模型自我进化:从深度研究、代码能力、长程任务,到递归自我提升、验证、科学发现模型和创业组织的“品味”。这份稿件按节目原顺序整理,目标是让读者像读一篇长访谈一样读完,而不是只看摘要。
正文翻译
1. 节目开场:为什么自我进化成了今年的核心议题
- 主持人红军从 Anthropic 的一个说法切入:这家公司承认,现在约 80% 的代码已经不是人写的,而是 Claude 自己写的。更重要的是,这家以谨慎著称的 AI 公司同时发出警告:AI 可能很快就要自己设计、自己训练下一代 AI。这个方向被称为递归自我提升,也就是 RSI。
- 本期请到两位正在做这件事的一线研究员:杜少雷 Simon 是华盛顿大学计算机系副教授,也是 ApplDex 的首席科学家,负责训练与推理方向;李贝宾是 ApplDex 首席科学家,负责代码自进化方向。ApplDex 由陈天桥出资创立并亲自主导,它不做图片生成,也不做视频生成,而是专注做 Heavy Duty Solver,也就是面向没有标准答案、需要解决科学难题的模型。
- 主持人解释,ApplDex 想做的不是从已知信息里找答案的普通模型,而是 discovery model:提出人类还没有想到过的假设,再自己想办法验证,去解决尚未被解决的科学问题。节目由此提出核心问题:如果 AI 真的可以教自己,人类科学家还剩下什么?
2. 深度研究、代码和自进化,其实共用同一条能力主线
- 主持人先问:过去几年模型训练方向不断变化,从深度研究到代码能力,再到今年的自进化,这些到底是几个方向,还是同一条主线?
- 嘉宾回答,从训练角度看,核心其实都是推理能力和长程推理能力的提升。模型在环境中探索、执行动作,得到信号后再继续下一步探索;无论是深度研究还是代码环境,内核都是相似的,只是应用方向不同。
- 自我进化并不是全新概念。往前看,AI 和机器学习里的自我进化讨论可以追溯到八九十年代;如果只说语言模型的自我进化,也至少可以追到大约三年前。Google 曾有语言模型作为优化器的工作,贝宾在 AutoGen 相关工作中也接触过 agent optimizer,也就是让智能体优化自身。
- 这两年变化在于模型能力变强了,能自我优化的对象越来越多。代码能力尤其关键:合成数据生成、自然语言数据清理、自我训练代码、算法代码、底层基础设施代码,很多环节都以代码形式存在。一旦模型写代码能力上来,用它提升自己、训练自己,就变得非常自然。
3. 贝宾的研究线:从多智能体到智能体强化学习
- 贝宾回顾自己的背景:最早在微软研究院做多智能体合作,那时还不叫自我进化,而叫智能体。但同事的工作已经开始包含“自我进化”的雏形,例如 agent optimizer 和 teachable agent,让智能体学习下一次做类似事情时可用的技能。
- 当时常用的概念还是上下文管理、提示工程等。后来贝宾去了 Meta 和 xAI,开始关注 agentic reinforcement learning,也就是用强化学习加强智能体能力,包括使用工具、写代码,以及通过 MCP 工具完成任务的能力。
- 大约一年前,贝宾和 Simon 已经意识到模型提高自己是非常可行的。强化学习数据生成中,有很大一部分本来就由代码完成。后来 Karpathy 发表关于自动研究的内容,让“模型自己做科研”的概念突然火起来。
4. 今年的不同:递归、自主、长程任务
- 主持人接着问,今年说的 RSI 和过去的自我进化有什么不同?贝宾解释,如果把自我进化想象成一个圆环:模型自己找问题、自己出题、自己解答、自己训练自己,那么 RSI 里的 R 指的是 recursive,也就是一层一层向上递归增长。
- 今年最大的变化不是想法新,而是模型能力上来了。Anthropic 提到 80% 的代码由模型写成,模型能完成过去人类大约一天才能完成的工作。当模型可以处理长程任务时,它就可以在一个任务里多次提高自己;而过去的语言模型优化器可能只能优化两三个小时,时间一长,小错误会自我积累,最后无法继续迭代。
- 主持人引用一个速度变化:2024 年 3 月的 Claude 3 Opus 能完成相当于人类约 4 分钟的任务;一年后,Claude 3.7 Sonnet 可以处理约 1.5 小时的任务;再过一年,Claude 4.6 Opus 可以处理长达 12 小时的任务。嘉宾补充,业界一个较被接受的判断是,模型可完成任务对应的人类时间大约每 7 个月翻一倍。
- 这里的长程任务,指的是需要多个步骤、多个环节互相印证的一系列任务。比如处理一期播客,不只是校对文字稿,而是从规划、剪辑、检查、修正到最终成片,跨越十几个步骤。如果模型能在无人监督下完成 20 到 30 小时的人类任务,就可以说它具备了长程任务能力。
5. 长程任务的技术难点:上下文、数据和基础设施
- 具体怎么做到长程任务?嘉宾说,模型架构首先要创新。传统自注意力在计算上近似平方复杂度,上下文 token 越多,推理资源消耗越大。100 万上下文是极端挑战,虽然已有一些架构和工程方案可以支持更长上下文,但真正训练好并不容易。
- 第二是训练数据。让推理引擎支持 100 万上下文不算最难,难的是模型如果没有在超长数据上训练,就会进入分布外状态。100 万上下文相当于几部《哈利·波特》放在一起,而现实中即使是大型代码仓库,也未必能充分填满和覆盖这样的上下文。因此预训练和后训练的数据处理都是巨大挑战。
- 第三是基础设施。难点不只在测试时推理,也在训练时基础设施。如果让语言模型直接输出 100 万 token,需要在 GPU 和 kernel 层做大量优化。训练长程任务相对于普通任务,难度是指数级增长。
- Simon 补充,即便有 100 万上下文,真正的长程任务仍可能超过这个范围,所以还需要智能体架构、记忆技术等,去处理有限上下文甚至近似无限上下文中的任务推进。
6. 为什么代码能力是自进化的关键入口
- 主持人总结,训练一个模型本质上离不开三件事:数据、基础设施和算法,而这三件事都高度依赖写代码。因此,Claude 表现出强基础模型研发能力,很大程度上来自 coding 能力提升;自进化能力也与 coding 紧密相关。
- 嘉宾基本同意。模型如果能写代码,就能参与数据清理、训练环境搭建、评测、基础设施优化和算法实验。代码不仅是应用能力,也是模型改造自身训练流程的接口。
- 但节目也强调,自进化不是让模型随便写代码就结束。真正困难的是闭环:模型能否发现自己的问题、构造训练环境、生成数据、验证提升是否真实,并把结果稳定地用于下一轮迭代。
7. ApplDex 的定位:不是聊天机器人,而是重型问题求解器
- 主持人把话题转向 ApplDex:这是一个非常激烈的战场,因为模型公司都在争夺基础模型和自进化能力。Simon 认为,ApplDex 的价值在于专注。它不是聊天机器人,也不主要迎合用户偏好,而是聚焦 Heavy Duty Solver:解决真正困难、具有科学意义的问题。
- 他认为,大模型训练的很多配方、算法和流程在业内已经相对透明,差距更多来自执行力和组织架构。ApplDex 从陈天桥开始,自上而下都非常投入。陈天桥会频繁和团队、AI 交流,并在方向和判断上提供指导。公司仍是小 startup culture,摩擦小,交流成本低,能集中做一件事。
- 贝宾补充,AI for science 已经做了十多年,他读博前就在医疗和自闭症领域做相关工作。过去十多年,信息技术用于科学研究并没有产生足够规模化的成果;但随着生成模型和发现模型能力提升,未来不到 10 年,真正做出有科研价值和现实意义的成果有很大希望。
- 他也强调,世界上的科研问题几乎无限,有价值的问题也无限,但人的精力有限,GPU 也有限。关键是如何在有限资源里找到最有价值的问题。ApplDex 有一个 Heavy Duty Discovery 团队,专门和不同顶级科学家交流,从几千个科研问题中筛选最有价值的问题来做。
8. AI for science 与 Heavy Duty Solver 的区别
- 主持人追问:AI for science 和 Heavy Duty Solver 有什么区别?嘉宾解释,很多垂直领域模型会用大量特定领域数据训练,例如生物领域模型。但 ApplDex 的 Heavy Duty Solver 仍然更像通用模型,它强调验证、分析、搜索、计划等原能力。
- 这些原能力对真正的难题都有意义。ApplDex 会着重训练这些能力,但不太会把一半数据都押到某一个具体领域,比如生物。AI for science 和 Heavy Duty Solver 有很大重叠,但后者不等于只做某一个科学垂类。
- 主持人提到 DeepMind 等公司在生物医药模型上的进展,从蛋白质折叠到药物与蛋白结合预测。即便只解决新药研发流程中偏上游的计算预测部分,也能支撑巨额融资。这说明科学问题空间非常广阔,生物、医药、物理、太空、材料等方向都只是其中一部分。
9. “最快半年跑通闭环”到底是什么意思
- 主持人问贝宾:你说 AI 可能最快半年完成自我进化和提升,这句话到底是什么意思?
- 贝宾解释,半年指的是最快半年内开始跑通一个闭环。难度最大的部分可能是后训练。要让 RSI 中的递归跑很多轮,需要更久;但如果只说跑完一个 loop,也就是一次循环,半年到一年左右可能可以做到。
- 例如,模型在某个领域里发现自己写的代码有什么问题,构造训练环境和训练数据,再自我验证训练后是否有提升,然后继续迭代。这个循环本身可能半年内跑通。Anthropic 近期提到约 80% 的代码由模型写成,也说明这个方向正在逼近突破。
- 但贝宾也说,目前市面上最强模型仍没有完全解决一些问题。其中让他睡不着的是:我们怎么知道模型在自我进化时满足人类需求,而没有跑偏?跑偏可以是安全上的,也可以是目标上的。比如你让它造一个更好的材料科学模型,它可能真的造出来了,但在你没有观测的成本、输水性或其他性能上做出巨大妥协。
10. 安全与验证:为什么人还在读每一步输出
- 主持人问,安全和不择手段达成目标这两个问题,现在解决了吗?贝宾说,在他看来还没有完全解决,但他乐观地认为会很快出现方法。
- 目前最笨也最有效的方法,是穷举尽可能多的可能性,并且由人读模型输出、读智能体每一步操作,确保每一步都在可理解、可控制范围内。一旦发现模型做出愚蠢或不对劲的行为,就停下智能体循环,手动调整,再让它继续提升。
- 未来能不能有一个智能体代替他做这种“手调”?贝宾提到一个半开玩笑但可行的概念:员工蒸馏。能否把他和同事每天做的事情,蒸馏到智能体或模型能力里?如果三个月内能把人的判断和操作蒸馏进 ApplDex 模型或脚手架,许多读代码、改代码、读模型输出、读智能体输出的日常工作,都能加速自我进化和迭代流程。
- 主持人进一步问,如果真的把贝宾“蒸馏”了,他会担心失业吗?贝宾说,不担心肯定是假的。他回忆 2021 年 GPT-3 被放进 GitHub Copilot 时,他打一个函数名,模型就能补全整个函数。那时他还在读博士最后一年,觉得自己可能毕业即失业。但五年之后,他仍在这里,只是日常工作从一个函数一个函数地写,变成在更高维度监控不同智能体写代码。模型会取代他今天做的事,但不一定能取代他五年后会做的事。
11. 验证智能体、漂移问题和递归的难点
- 主持人指出,如果未来有一个 AI agent 能代替贝宾做监督、校验和验证,相当于 AI 开始自己当考官,模仿人的品味和价值观做判断。那是否意味着 RSI 闭环跑通?
- 贝宾区分说,这可能意味着 SI,也就是 self-improvement,自我提升部分跑通了;但 R,也就是 recursive,递归,还要更多时间。即使一个 loop 能跑通,每次迭代后或几次迭代后,仍需要人检查递归漂移。半年到一年或许能解决 loop,但不能完全解决漂移。
- 他希望未来几年把漂移逐步缩小。比如普通模型每次迭代漂移 10,如果能降到 1 就很好;未来目标是降到 0.1 甚至 0.01。这样人类监控周期就不必那么频繁,可以更有信心地让模型自我迭代三个月、六个月后再回来检查是否超出预期。
12. 品味:科学家的品味、创始人的品味,还是 AI 自己的品味
- 主持人把问题推进到“品味”:AI 自我进化最后的坎,一个是提出问题的品味,一个是判断结果是否可信。ApplDex 押注 discovery 和 verification 两个方向,那么品味到底是谁的品味?是科学研究员的品味,还是创始人的品味?
- 嘉宾认为,现在大部分是 AI 研究员的品味,但研究员的品味又会被创始人的品味间接影响。陈天桥选择研究员时,自然会按照自己的判断和偏好选择人。不过嘉宾并不太担心,因为品味没有绝对对错,只有适合与不适合。
- 更长期看,五年之后,人的品味对模型的影响可能越来越小。AlphaGo 最初训练时很受人类棋谱影响,但 AlphaZero 出来后,就不再从人类品味中学习,而是通过自我对弈、自我推理形成自己的品味。AI 也可能通过 RSI 的递归过程形成自己的品味。人的品味只是 warm start,也就是热启动。
13. 陈天桥的角色:战略、宪法与“先思考再搜索”
- 主持人问陈天桥在工作中具体关注什么,如何保证研究焦点始终落在重要问题上。嘉宾说,陈天桥在战略方面有很多把控,经常和团队开会讨论研究、对齐战略方向。团队成员来自学术界和不同研究背景,难免把学校或学术界习惯带进公司;当研究押注偏离公司大方向时,陈天桥会跳进来指出偏离,并把方向拉回公司使命。
- 一个具体例子是 Heavy Duty Solver 的行为方式。面对一个难题时,模型应该先分解问题,再搜索和搜集相关信息,最后总结并给出答案。团队曾经为了强化搜索能力,放入很多搜索相关数据,结果模型行为变成一上来就搜索,而不是先仔细思考再搜索。陈天桥自己使用模型时能看出,这不是真正 Heavy Duty Solver 的行为,于是团队需要从数据和智能体形式上调整方向。
- 嘉宾还提到,模型“宪法”基本由陈天桥参与制定,并用于模型训练和调优。这说明创始人的品味不只是抽象口号,而会进入模型行为规范、训练目标和产品方向。
14. 马斯克与陈天桥:都强势,但关注点不同
- 主持人问,两位嘉宾过去也和马斯克共事,马斯克和陈天桥有什么不同?嘉宾认为,两人在性格上有相似之处,但看问题的方法和关注点不同。
- 马斯克也讲过类似“重型问题求解器”的话,但他说的和做的并不完全一致。马斯克非常关注聊天功能和面向用户的小功能,他经常在 X 上发内容,也会用 AI 画图或回答问题,并频繁关心 Grok 面向 X 的功能进展。
- 陈天桥则更加一致。他口头上说重视 Heavy Duty Solver,实际投入也集中在这个方向。他对聊天模型、视频生成、图片生成都没有兴趣,因为这些方向和 Heavy Duty Solver 基本正交。嘉宾认为,这种专注是 ApplDex 的重要特征。
15. 收束:AI 品味最终代表谁
- 节目结尾,主持人回到“品味”问题。Simon 提到,顶级科学家不是看发了多少论文,而是看最好那篇论文的质量有多高。这句话点出一个更大的问题:如果 AI 的品味从少数人类顶级科学家那里热启动,那么它本质上还是被少数人塑造。
- 那么未来面向更广大用户的 2C AI,到底应该代表谁的价值观?主持人说,关于 AI 的哲学思考,是这个时代急需的讨论。这也把节目从技术闭环带回社会问题:模型能不能自我进化是一回事,它以谁的标准提出问题、验证答案、形成品味,则是另一件更深的事。
(小标题为编者所加;正文依据原节目顺序整理。)
思想框架
这期节目按“能力为何出现、技术如何支撑、闭环怎样跑通、风险在哪里、组织和品味由谁塑造”一路推进。核心判断是:模型自进化不是突然冒出的概念,而是推理、代码、智能体、长程任务和验证能力共同提升后的自然结果;真正难点不只是让模型写更多代码,而是让它在可监控、可验证、低漂移的循环中改进自己。节目最后把技术问题推向价值问题:如果 AI 会形成自己的品味,我们必须追问最初热启动它的,是谁的品味。
E242|最快半年AI跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地 · 硅谷101 · ⏱️ 原节目 1 hr 11 mins
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。