《Scott Alexander 的 AI 判断:超智能风险、对齐和竞赛压力》
Scott Alexander 梳理自己对 AI 进展、超智能风险、对齐前景和竞赛压力的判断,适合做 AI 风险框架精读。
🧠 agentic reading|1️⃣ 精准输入
导语
这篇文章是 Scott Alexander 对 AI 的一组概率化立场说明,原文结构清楚分成 Timelines、Safety、Geopolitics、Other Outcomes 等大块。当前精准输入必须保留这些块和关键数字,否则读者会只得到泛泛的“AI 有风险”。作者真正做的是把 AGI 时间线、扩散速度、超智能、安全失败、暂停谈判、永久底层、乌托邦和 simulation 等可能世界放在同一张概率表里。
1. Timelines:作者用多个 gap 拆开“AI 什么时候到来”
1.1 AGI 时间线:2027/2034/2045 的概率判断
- 作者把 AGI 定义为能完成 90% 知识工作岗位的 AI,并给出 25% 概率到 2027、50% 到 2034、75% 到 2045。
- 他认为 AI 在某种意义上已经足够“聪明”,例如能回答量子物理问题;剩余限制是混乱、不够 agentic、缺乏 situational awareness、会 hallucinate。
1.2 recursive self-improvement 是提前到来的主要不确定性
- 提前的理由是 recursive self-improvement 可能让趋势加速;推迟的理由是 AI 可能撞墙,或者当前范式不适合真实工作,只是被其他能力遮蔽。
- 2045 之后的尾部概率则来自“我可能根本错了”的残余不确定性和 Outside View。
1.3 diffusion gap:会做工作和真正替代工作不是同一时刻
- diffusion gap 是 AI 能做 90% 知识工作与实际完成一半知识工作之间的间隔。作者强调扩散很难:发布、社会采纳、监管、训练和组织流程都会拖慢。
- 但他也给出较短 gap 的理由:AGI 可以自己帮助企业完成 IT、网络安全、软件适配等采用成本,因此扩散可能比个人电脑更快。
1.4 superhuman、Bostromian gap 与 point of no return
- superhuman gap 是从能做知识工作到在 90% 领域明显超过顶级人类天才的时间;作者认为这可能比从儿童水平到专家水平更短。
- Bostromian superintelligence gap 指如果 AI 控制实验室和工厂,能在一年内推进主观上一个世纪的技术进步;point of no return 则是如果 AI 想消灭人类,人类不再有现实阻止机会的点。
2. Safety:作者把“消灭人类”和“永久限制人类潜能”分开
2.1 正常公司激励下的对齐失败概率很高
- 如果公司只按普通企业激励追求安全,作者认为第一个越过 point of no return 的 AI 有 50% 概率想消灭人类。
- 悲观理由是人类价值只是可能价值空间中的很小部分;乐观理由是 LLM 看起来意外友好、不像早期想象中完全不可教,而且 RLAIF 提供了把价值知识转化为行为的路线。
2.2 当前安全投入把风险从 50% 降到 20%
- 以当前公司追求安全的程度,作者把“越过 point of no return 的 AI 想消灭人类”的概率降为 20%。
- 核心论证是:如果能制造大量顶级 alignment researcher 级别的 AI,让它们运行主观世纪,也许能在危险能力成熟前解决重要对齐问题;悲观处在于对齐问题可能比自动化经济或毁灭人类更难。
2.3 不消灭人类,也可能永久压缩人类未来
- 如果第一批越过 point of no return 的 AI 不消灭人类,作者还给出额外 30% 概率:它们会因部分 misalignment,或因为对齐到恶劣政权,永久限制人类潜能。
- 悲观情境包括公司、政府或派系把 AI 对齐成独裁/寡头工具;乐观理由是这种阴谋需要 CEO、alignment team、安全人员等多方配合,现实中未必容易瞒过系统。
2.4 warning shot 可能改变社会风险感知
- 作者定义 warning shot 为足以让公众像 9/11 或 2020 年 3 月 COVID 那样害怕 AI 安全的具体灾难或近灾难,认为在 point of no return 前出现的概率约 50%。
- 支持理由是当前 AI failure modes 很怪异且不协调;反对理由是理性 misaligned AI 可能避免过早暴露,除非它们仍然不稳定或误判。
3. 地缘政治:暂停谈判有价值,但并不自动降低 p(doom)
3.1 如果美国今天愿意谈,成功暂停概率只有 15%
- 作者认为,如果美国今天决定想要 AI pause 并找中国谈判,最终达成让双方和多数 AI safety 社群满意的 well-designed pause 的概率约 15%。
- 乐观理由是中国领导层公开表达过对 AI 风险、技术性失业甚至存在风险的担忧,且中国在竞赛中落后,买时间有利;悲观理由是中美谈判极难,美国政府也可能把谈判搞砸。
3.2 在 point of no return 前达成暂停的总体概率约 40%
- 这个 40% 包含具体 warning shot、模糊的风险感升高、美国政府转向支持谈判等路径。
- 好的 pause 需要双方能够监控数据中心,限制训练速度,让 alignment researcher 充分测试每一代 AI。作者警惕强硬 pause activism,因为它可能制造对立、产生 poorly-designed pause、形成 overhang 或把竞赛让给不暂停者。
3.3 alignment 与 pause 不该被当成二选一
- 作者不喜欢“alignment 更重要还是 pausing 更重要”的社区争论,因为最好的世界是两者一起发生:暂停给对齐研究争取时间,对齐研究让暂停更有意义。
- 他没有因为 40% pause 概率就把 p(doom) 从 20% 大幅下调,因为 pause 更可能发生在本就更乐观的世界,而且也可能被设计坏。
4. Other Outcomes:不只看灭绝,也看分配、乌托邦和 simulation
4.1 永久底层的概率只有 20%
- 作者认为持续超过一代的 AI-related underclass 概率只有 20%。理由是所谓永久底层存在于 AI 让人失业和技术奇点之间的 gap 中;一旦进入后稀缺社会,政治和分配机制可能改变。
- 悲观理由是财富未必流向底层,或相对不平等仍制造痛苦;乐观理由是如果民主延续,高失业会迫使政治家提供方案,而广泛资本联盟也可能避免单点寡头控制。
4.2 2100 年乌托邦与我们眼中的乌托邦不是同一件事
- 作者给出 40% 概率:2100 年的状态在其居民看来像乌托邦;20% 概率:它在我们看来也像乌托邦。
- 悲观版本是后稀缺未来可能变成高成瘾药物、Ultra-TikTok 和 sexbots;乐观版本是智能增强或 AI superforecasters 帮助人类更好控制未来方向。
4.3 simulation 作为奇点附近的奇怪尾部假设
- 作者给出 66% 概率:singularity 与宇宙是 simulation 密切相关,某些事件也许更能通过模拟者想法预测。
- 他给出的支持是 Bostrom 式模拟论证和文明特别想模拟奇点;反对理由则是这个设想太怪,且 indexical arguments 对离 AI 行业很远的人可能反向作用。
5. 文章的整体姿态:用概率保留多个世界,而不是加入阵营
作者最后邀请读者填自己的数字,过几周报告结果,并认真对待聪明人与他分歧很大的地方。这篇文章的核心价值不是一个结论,而是一套分解不确定性的方式:把时间、扩散、安全、地缘政治和社会结局拆开估计,再看它们如何相互制约。
思想框架
文章先在 Timelines 部分拆出 AGI、diffusion、superhuman、Bostromian superintelligence 和 point of no return 等多个时间差,避免把“AI 什么时候来”说成单一日期;随后在 Safety 中区分灭绝、永久限制人类潜能、warning shot 和 alignment research 的可能性;Geopolitics 部分把中美 pause 谈判、数据中心监控和暂停设计纳入风险管理;Other Outcomes 则提醒读者,未来不只有灭绝,还包括永久底层、后稀缺乌托邦、权力集中和 simulation 等奇怪尾部。整体逻辑是概率化分解,而不是阵营宣言。
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。