The Batch 速览:GPT-5.6、机器人奖励模型与模型协作
The Batch 汇总 GPT-5.6、Sakana 多模型协作、微软推理模型和 RoboReward 等进展,适合追踪 AI 能力从模型发布走向协作推理和机器人训练的路径。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 The Batch 的正文由多条 AI 新闻组成。这里剔除通讯页眉、Andrew Ng 来信、广告、招聘、订阅和反馈页脚,只翻译源文中完整出现的 4 个新闻块及其评论:OpenAI GPT-5.6 的受限发布、Sakana AI 的 Fugu 模型编排、Microsoft 自研 MAI-Thinking-1、以及 Stanford / UC Berkeley 的 RoboReward 机器人奖励模型。
正文翻译
1. GPT-5.6 落在限制地带
OpenAI 宣布预览 GPT-5.6 家族,其中包括一个可与 Claude 5 Mythos 相比的顶级模型,但目前它只向美国政府选定的用户开放。
新情况: OpenAI 发布了三款闭源视觉语言模型,价格和性能从最强的 GPT-5.6 Sol,依次降到中档的 GPT-5.6 Terra,以及速度更快、价格更低的 GPT-5.6 Luna。这些模型都带有安全护栏,用来拒绝访问潜在危险的生物、化学和网络安全信息。三款模型,以及安全护栏放宽的版本,都提供给美国政府批准的少数组织。公司承诺未来几周会更广泛发布。
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。