《The Batch 速览:新基准、模型评测与英伟达开源竞争者》
The Batch 汇总 Claude Fable 5、软件工程新基准和英伟达开放权重模型,适合追踪 AI 模型评测、代理能力和开放生态竞争。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 The Batch 先由 Andrew Ng 讨论 Anthropic 和美国政府如何展示“控制 AI 访问权”的力量,随后展开三组新闻:Claude Fable 5 的评测困境,SWE-bench 之后的新型智能体软件工程基准,Nvidia Nemotron 3 Ultra 作为美国开放权重模型的竞争者,最后还有用提示改善强化学习探索的 POPE 方法。整期的共同线索是:AI 能力不再只看模型峰值,还要看访问稳定性、评测可得性、开放生态和训练效率。
1. Andrew Ng 来信:Anthropic 和美国政府让 AI 主权问题变得更紧迫
1.1 Anthropic 的限制让开放研究者感到不稳定
- Andrew Ng 说,过去两周美国政府和 Anthropic 都采取了重大行动,展示它们能通过限制前沿模型使用来控制他人对 AI 的访问。这种时刻一旦看见就难以忽视,会加速企业和国家寻找不会被别人终止的可靠 AI 访问路径。
- Anthropic 发布 Claude Fable 5,这是 Mythos 模型带更多护栏的版本。一些限制如黑客、生物武器等安全限制有合理性,但 Anthropic 也限制开发者用它构建竞争性大模型技术。Andrew 认为这令人担忧,因为 AI 社区包括 Anthropic 自己都受益于开放研究,Transformers 论文的开放发布也曾推动 AI 革命。
- 他批评 Anthropic 曾对被检测为从事大模型研究的用户做隐形性能降级,后来在反弹后改为透明提示,但仍拒绝用最新能力帮助 AI 研究者。再加上 Fable 使用的30天数据保留政策,开发者会怀疑能否稳定地建立在单一闭源提供商之上。
1.2 出口管制把访问权上升为国家层面的主权问题
- 美国政府随后用商务部权力限制 Mythos 和 Fable 出口,要求外国国民无论在美国境内外使用都需许可证,甚至包括 Anthropic 员工,导致 Anthropic 暂停全球 Fable 访问。Andrew 不认为 Fable 像“炸弹”,也不赞成出口管制,但他指出,这让各国突然看见美国公司和政府可以迅速切断前沿模型访问。
1.3 开放替代因此从技术选择变成供应链选择
- 因此,许多国家,包括美国盟友,开始讨论 AI 主权和不中断访问。文章用半导体、稀土类比:一旦某国威胁限制关键供应,其他国家就会理性寻找替代方案。开放源码等替代路线的激励因此显著增强。
2. Claude 的基准问题:评测者到底测到了哪个模型?
2.1 护栏、回退和数据保留让评测变得不透明
- 在 Anthropic 下架最新 Claude 模型前,专业评测者也很难分辨自己拿到的是 Mythos 级模型,还是同名下较弱版本。多家独立机构报告无法完整评测 Claude Fable 5:模型会拒绝部分测试提示,或把提示路由到较弱的 Claude Opus 4.8。
- Claude Fable 5 的机制是:Anthropic 分类器在提示到达模型前筛查它。若提示被标记,就可能由较弱模型替代回答,或直接拒绝。所有用户还必须接受 Anthropic 保留提示和输出30天。
- 分类器筛查网络安全、生物与化学、AI 模型工程等问题。在 Anthropic 自家应用和一些 Claude Code 评测中,被标记提示会自动转给 Claude Opus 4.8,但切换记录在单独日志事件中,不显示在回答文本里;API 场景下,同样标记会直接拒绝,除非评测者启用回退。
2.2 不同机构得到的是峰值、混合值和实际可用值
- Artificial Analysis 在 Intelligence Index 中记录 Claude Fable 5 约8%的任务回退到 Claude Opus 4.8,多为科学问题;它把回退回答也计入评测,得到混合分数。
- Vals AI 发布两套分数:一套包含 Claude Opus 4.8 回退,一套把拒绝全部算失败。它还报告 Fable 在生物和网络安全问题上接近100%拒绝。
- Agents’ Last Exam 报告 Fable 拒绝约35%的长程智能体任务,有些科学问题被标记为网络安全或生物,并在中途切换到 Opus 4.8。ARC Prize Foundation 则拒绝运行经过验证的私有评测,因为不愿把私有测试集交给30天保留要求。
- 结果显示,Fable 5 在不回退问题上排名很高;混合回退后也常接近顶部;但如果把拒绝算失败或把两个模型分开测,名次明显下滑。比如 Artificial Analysis Intelligence Index 中,包含回退的 Fable 得64.9,比 Opus 4.8 高3.5%;Humanity’s Last Exam 中即使拒绝9%问题,仍得53%。但 Vals AI 的 GPQA Diamond 从93.18%降到55.56%,名次从第二跌到第94。
- The Batch 的判断是,Fable 5 迫使评测者问一个更实际的问题:用户实际能拿到多少能力?评测不应只报告模型峰值,还要报告开发者在实践中可依赖的能力。
3. 超越 SWE-bench:新基准测智能体软件工程真实难度
3.1 DeepSWE:更难诊断、更大代码改动
- SWE-bench 系列曾是智能体软件工程能力的核心测量,但模型已经越来越能接近满分,也可能受到训练数据污染影响。新出现的 DeepSWE、ProgramBench、ITBench-AA 试图替代它。
- DeepSWE 由 Datacurve 开发,使用人类专家审核的问题,并尽量避免训练集污染。它包含5种语言的113个问题,来自私有代码库或人工设计问题,而不是已有已解决代码。Artificial Analysis 已用它替代 SWE-Bench Pro。
- 与 SWE-Bench Pro 的详细提示不同,DeepSWE 给出简短提示,要求 mini-swe-agent 自行诊断并找到多种可能解法。解决方案所需代码行数约为 SWE-Bench Pro 的5.5倍。当前 GPT-5.5 xhigh reasoning 解决70%,Claude Opus 4.8 解决58%,Gemini 3 Flash 只有5%。
3.2 ProgramBench:从想法生成完整程序
- ProgramBench 由 Meta、Stanford、Harvard 研究者开发,测试 SWE-agent 控制的模型能否从200个想法生成可运行程序。智能体可访问控制台执行现有程序,需要通过输入输出复现程序功能。
- 基准构建过程也用智能体完成:识别候选仓库、构建可执行程序、生成测试、建立测试环境和文档。程序从简单的 entr(文件变化时运行命令)到复杂的 ffmpeg(音视频处理)不等。
- 到发表时,没有模型能通过全部测试。把门槛降到至少通过95%,Claude Opus 4.7 复现3%,Claude Opus 4.6 复现2.5%,Claude Sonnet 4.6 复现1.6%,其他模型尚未复现任何程序。
3.3 ITBench-AA:诊断现代硬件和系统栈故障
- ITBench-AA 由 IBM 和 Artificial Analysis 开发,更新自 IBM 早期 ITBench。它测试模型在 Stirrup harness 控制下,诊断软件系统出错的技术条件,例如内存耗尽或配置错误。
- 基准包含59个基于真实事件的人写 incidents,每个事件含警报、事件、错误追踪、系统指标、应用清单和根因诊断。它用 full recall 衡量:只要漏掉任何根因,该事件就是0分。
- 已测模型中,Claude Opus 4.7 max reasoning 最高,full recall 为46.7%;GPT-5.5 xhigh reasoning 为45.8%;Llama 3.3 70B 为0.6%,最高最低相差超过40个百分点。The Batch 的总结是,智能体进步很大,但还有很长路。
4. Nvidia Nemotron 3 Ultra:美国开放权重模型重新入局
4.1 模型规格和训练方式
- Nvidia 发布 Nemotron 3 Ultra,这是该公司迄今最大的模型之一,面向长程智能体任务。它基于混合 transformer-mamba 架构,是总参数5500亿、每 token 激活550亿参数的混合专家模型。
- 输入可达100万 token,输出约每秒183 token。它有三种推理模式、推理预算、工具使用能力,针对 Hermes Agent、OpenClaw 等开放智能体框架微调,并支持12种语言。
- Nvidia 公开权重、训练数据、训练配方和强化学习环境,使用 OpenMDW-1.1 许可证;可通过 Perplexity Pro 聊天,也可经 Nvidia 和其他供应商 API 使用,价格中位数约为每百万输入0.60美元、每百万输出2.60美元。
- 预训练分两阶段共20万亿文本 token:15万亿用于广泛知识,5万亿用于更高质量数据,包括1730亿 GitHub 代码 token 和法律、事实知识合成数据。模型使用 NVFP4 4位量化训练以降低内存并提高处理效率。
4.2 性能与生态意义
- Artificial Analysis 评测显示,Nemotron 3 Ultra 是美国开发者中最高分开放权重模型,但低于 DeepSeek V4 Pro 和新发布的 GLM-5.2。它在同类开放权重模型中速度很快。
- Intelligence Index 中,推荐的低精度 NVFP4 权重得47.7,全精度48.2,高于 Google Gemma 4 31B reasoning 的39.2 和 OpenAI gpt-oss-120b high reasoning 的33.3,但低于 Moonshot Kimi K2.6 的53.9。
- IFBench 中,Nemotron 3 Ultra 以81.4%排第三,低于 Grok 4.3 medium reasoning 的83.3%,以及 Grok 4.20 0309 和 MiniMax-M3 reasoning 的82.9%。Nvidia 测试中,它在100万 token Ruler 长上下文回忆测试得95%,PinchBench 智能体生产力得91%,但 Terminal-Bench 2.0 智能体编码只有54%,低于 Kimi K2.6 的67%和 Z.ai GLM 5.1 的64%。
- 背景是,Nvidia 在 Nemotron 3 Ultra 前后还发布了 Vera CPU、RTX Spark 和 Cosmos 3,分别面向智能体工作、端侧智能体和生成机器人/自动驾驶训练数据的开放世界模型。The Batch 认为,近来最强开放权重智能体模型多来自中国,Nemotron 3 Ultra 让美国开发者重新进入开放模型竞争,同时也符合 Nvidia 推动芯片生态的利益。
5. 带提示的强化学习:POPE 解决探索瓶颈
5.1 POPE 用解题开头解决强化学习探索不足
- Carnegie Mellon 的 Yuxiao Qu、Amrith Setlur、Virginia Smith、Ruslan Salakhutdinov 和 Aviral Kumar 提出 Privileged On-Policy Exploration(POPE,特权在策略探索),把 GRPO 强化学习算法与定制数据集配对。
- 关键想法是:当模型常常无法独立发现困难问题的正确步骤时,训练时给它解题开头。监督微调可能只学会特定答案,而强化学习中的解题开头可以作为提示,帮助模型发现解决路径;同时把带提示和不带提示的同一问题一起训练,模型也能学会没有提示时的早期步骤。
- 作者用三个有已知解的数学数据集,选出预训练模型128次尝试仍无法解对的问题,每次最多生成3.2万 token。然后逐步给 Qwen3-4B-Instruct-2507 更长的解题前缀,最多到解答长度四分之一,直到它能正确完成,再把前缀和继续求解指令加入训练。
5.2 结果显示方法有效,但成本来自已知答案
- 结果上,POPE 微调后的 Qwen3-4B-Instruct-2507 超过普通 GRPO 和监督微调。AIME 2025 上,POPE 达到53.1% pass@1、82.6% pass@16,高于普通 GRPO 的49.6%和81.4%。HMMT 2025 上,POPE 为37.8% pass@1、67.5% pass@16,高于普通 GRPO 的31.0%和63.8%。
5.3 它真正攻击的是困难任务中的探索瓶颈
- 限制是 POPE 需要已知答案的问题,在解答昂贵领域会继承这一成本。The Batch 认为,它攻击的是强化学习最大瓶颈之一:探索。困难问题上,普通强化学习常像“不断尝试,希望撞上成功解法”;POPE 先把模型引到正确轨道,再让强化学习更有效。
思想框架
这一期先用 Andrew Ng 的来信定调:模型访问权本身成为权力,Anthropic 的使用限制和美国出口管制推动企业、国家重新思考 AI 主权和开放替代。随后,Claude Fable 5 的评测困境把问题落到实践:护栏、回退和数据保留让评测者无法只问“模型最高能得多少分”,还要问用户实际拿到多少能力。中段转向智能体基准,DeepSWE、ProgramBench、ITBench-AA 分别测试功能实现、从想法生成程序和系统故障诊断,说明 SWE-bench 已不足以衡量新任务难度。后段通过 Nemotron 3 Ultra 展示开放权重生态竞争,最后用 POPE 说明训练方法仍在解决探索效率。整期的主线是:AI 的下一阶段竞争不只是模型能力,而是访问稳定性、评测真实性、开放生态和训练效率共同构成的系统竞争。
The Batch @ DeepLearning.AI · 17 mins
✍️ think & write|2️⃣ 费曼输出
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。