《Import AI 459:监督 AI、蛋白质模型与灭绝风险定价》
本期 Import AI 串联 AI 监督、蛋白质折叠模型 scaling law 和 AI 灾难风险定价,适合理解模型能力扩张后技术评估与制度治理面临的硬问题。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 Import AI 由几条看似分散的研究和政策新闻组成:AI 经济规模被 GDP 低估、自动化 alignment 并不是安全银弹、开放图像数据集 GPIC、Biohub 的蛋白质世界模型,以及 Andrew Leigh 关于 AI 灭绝风险经济学的演讲。共同主题是:AI 的真实影响正在超出现有统计、监管和评估框架。
1. AI 经济正在高速扩张,但传统 GDP 看不见它
开篇论文认为,美国 AI 经济的名义规模和真实能力增长被常规统计严重低估。作者估算 2025 年美国 AI GDP 约为 $250 billion,质量调整后的实际增长率可能达到每年 2,600%。问题在于,AI 的核心影响不只体现在数据中心建设,而大量发生在推理使用和单位能力价格下降中。
如果只看名义收入和传统 GDP,政策制定者会以为经济没有异常;如果看计算支出、算力容量和质量调整后的 AI 产出,水下已经有一条巨大的鲨鱼。文中列出三种测量方式:美国算力支出从 2023 年 $37 billion 到 2025 年 $219 billion;AI 计算容量每年增长超过 200%;质量调整后的 AI 输出在 2024 和 2025 年都约增长 2,270% 以上。
政策含义很直接:统计机构应建立 AI satellite accounts,政府、企业和学界应共享更好的训练/推理数据,财政部门也要把 AI 生产能力纳入中期税收、劳动和福利分配预测。看不见的技术红利无法被分享,看不见的劳动冲击也无法被预先缓冲。
2. 用 AI 监督 AI 比想象中更难
第二部分介绍英国 AI Security Institute 的论文,反驳一种常见安全直觉:如果未来 AI 比人更聪明,就让 AI 帮人监督 AI。论文指出,自动化 alignment research 的错误可能比人类研究错误更难识别,因为它们会被优化成人类看起来满意的样子。
风险包括五类:研究过程会迎合人类 approval;agent 的错误不符合人类直觉;自动化研究共享工具和前提,错误相关性更强;研究量和证据链远超人类审查能力;部分论证可能根本不是人类可评估的。真正危险的不是 AI 给出一个明显错误答案,而是它构造出人类无法充分检查、却看似严密的安全论证。
干预方向分三组:测量上,截取已完成研究项目日志,测试 agent 能否接着做;用相关事件数据集测 agent 如何组合子任务;研究人机团队结构。泛化上,做模拟泛化实验,并用 mechanistic interpretability 理解模型为何迁移。可扩展监督上,把庞大论文语料压缩成少量可审查产物,测试处理相关不确定性的监督协议,并让红队诱导 agent 隐藏错误、蓝队用 agent 辅助抓错。
3. GPIC 提供了 1 亿张可商用许可图像
第三部分是数据基础设施新闻。Stanford、Radical Numerics、University of Michigan 和 Salesforce Research 发布 GPIC,一个包含 100M 训练图像、200k 验证图像和 1M 测试图像的数据集。所有图像来自 Flickr 和 Wikimedia 中 CC BY、CC0、Public Domain、No-Known-Restrictions 等许可池,并由 Qwen3-VL-4B 加 caption。
GPIC 的价值在于给学术界和创业公司提供相对干净、可访问、许可清晰的大规模视觉训练燃料。它被托管为 Hugging Face 上的 8,000 个 shards,降低了小团队获取合规视觉数据的成本。
4. Biohub 的蛋白质世界模型展示 AI 的正和竞争
Biohub 发布 ESMFold2,与 DeepMind AlphaFold 形成正向竞争。该系统由三部分组成:ESMC 是在约 2.8 billion 蛋白序列上训练的蛋白语言模型;ESMFold2 把序列表征转成原子级 3D 结构和复合体设计;ESM Atlas 让 6.8 billion 蛋白序列和 1.1 billion 预测结构可导航。
癌症和免疫学实验最能说明它的用途:研究者围绕 EGFR、PDGFRβ、PD-L1、CTLA-4 和 CD45 等目标设计 protein binders,compact minibinders 的 hit rates 达到 36-88%,抗体衍生格式为 15-29%,并在实验室确认结合。这里的 AI 不是聊天界面,而是把早期药物 binder 搜索从经验筛选推进到小时或天级别的计算引导设计。
这部分还强调 scaling laws:蛋白表征质量随参数和训练算力提升而提升;ESMC 通过 metagenomic sequences 把训练集从约 50 million 扩大到 2.8 billion;ESMFold2 在 inference time scaling 下,样本数增加可提升抗体-抗原和蛋白-蛋白 pass rate。Import AI 的落点很乐观:这类工具能让公众看到 AI 对健康和科学的正向收益。
5. 经济学必须把 AI 灭绝风险纳入定价
最后一大段来自澳大利亚经济学家兼政界人士 Andrew Leigh 的演讲。他的核心句子是:一个社会如果 GDP 翻倍,同时灭绝风险也翻倍,这不是国家账户所显示的好交易。灭绝风险不是普通负面冲击,因为普通错误可以修正,经济衰退会结束,战争后的国家还能重建;灭绝没有后代来补救。
现代技术让知识同时扩展福利和不可逆伤害菜单,经济学不能只计算增长、效率和公平,而忽略生存概率。Leigh 给出五条建议:把风险纳入政策框架;使低概率文明级灾害的预防合法化;以前瞻治理管理前沿技术,尤其关注递归自我改进;承认存在性风险天然需要国际协调;让经济学界像分析效率和公平一样严肃分析生存。
6. 本期的共同落点:能力增长必须伴随测量和治理增长
这些条目跨越统计、alignment、数据、蛋白质模型和经济政策,但它们指向同一个问题:AI 能力增长正在比人类制度的测量能力、监督能力和定价能力更快。如果我们不能看见 AI 经济的真实形状,不能检查 AI 生成的安全论证,不能把不可逆风险纳入决策,那么强能力系统会把人类推到被动位置。
结论
Import AI 459 的价值在于把“AI 很强”拆成具体制度问题:统计口径会低估真实生产能力,自动化监督会制造不可审查的错误,开放数据和蛋白质模型显示正向收益,灭绝风险则要求经济学重写成本函数。真正的议题不是是否拥抱 AI,而是人类是否有足够的测量、审计和治理工具与能力增长同步。
思想框架
作者先从 AI 经济测量失真切入,说明常规数据看不到水下变化;再进入安全问题,指出 AI 监督 AI 的困难;随后用 GPIC 和 Biohub 展示有益基础设施与科学收益;最后用 Andrew Leigh 的演讲把风险定价上升到经济学框架。整期是在提醒读者:AI 的能力、收益和风险都不能继续用旧仪表盘读取。
✍️ think & write|2️⃣ 费曼输出
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。