《The Batch 速览:新基准、模型评测与英伟达开源竞争者》
The Batch 汇总 Claude Fable 5、软件工程新基准和英伟达开放权重模型,适合追踪 AI 模型评测、代理能力和开放生态竞争。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 The Batch 先由 Andrew Ng 讨论 Anthropic 和美国政府如何展示“控制 AI 访问权”的力量,随后展开三组新闻:Claude Fable 5 的评测困境,SWE-bench 之后的新型智能体软件工程基准,Nvidia Nemotron 3 Ultra 作为美国开放权重模型的竞争者,最后还有用提示改善强化学习探索的 POPE 方法。整期的共同线索是:AI 能力不再只看模型峰值,还要看访问稳定性、评测可得性、开放生态和训练效率。
1. Andrew Ng 来信:Anthropic 和美国政府让 AI 主权问题变得更紧迫
1.1 Anthropic 的限制让开放研究者感到不稳定
- Andrew Ng 说,过去两周美国政府和 Anthropic 都采取了重大行动,展示它们能通过限制前沿模型使用来控制他人对 AI 的访问。这种时刻一旦看见就难以忽视,会加速企业和国家寻找不会被别人终止的可靠 AI 访问路径。
- Anthropic 发布 Claude Fable 5,这是 Mythos 模型带更多护栏的版本。一些限制如黑客、生物武器等安全限制有合理性,但 Anthropic 也限制开发者用它构建竞争性大模型技术。Andrew 认为这令人担忧,因为 AI 社区包括 Anthropic 自己都受益于开放研究,Transformers 论文的开放发布也曾推动 AI 革命。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。