《AI HOT 0629:Grok 4.5、VibeThinker 与长期任务评测》
本期 AI HOT 汇总 Grok 4.5 私测、VibeThinker-3B 开源、工具路由、长期任务评测和游戏对局等进展,适合追踪 AI 从单次回答走向复杂任务执行的变化。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 AI HOT 汇总了模型训练、轻量推理模型、路由工具、开发者工作流和长期任务评测。它的共同线索是:AI 竞争已经不只是单次回答能力,而是基础模型、工具链、路由、睡眠管理、商业模拟和游戏执行这些环节一起推进。
1. 模型能力:Grok 4.5 和 VibeThinker-3B 分别代表大模型与小模型路线
- Grok 4.5 基于 1.5T V9 基础模型,并在补充训练中加入 Cursor 数据,目前已在 SpaceX 和 Tesla 私测。初步评估显示,它的性能接近甚至可能超过 Opus;同时,强化学习仍在持续改进模型,Grok Build 工具链也在完善。SpaceX 还计划今年每月发布完全从头训练的新模型。
- 新浪发布仅 3B 参数的 VibeThinker-3B,在 AIME26 等数学编程基准上持平 DeepSeek V3.2 等大 200 到 333 倍的模型,LiveCodeBench 超越所有 20B 以下模型,LeetCode 竞赛解决 123/128 题,超过 GPT-5.2、Kimi K2.5 等。
- VibeThinker-3B 的短板也很清楚:知识密集型 GPQA-Diamond 大幅落后。它基于阿里 Qwen2.5-Coder-3B,经 SFT、强化学习、自蒸馏等多阶段后训练,并提出“参数压缩-覆盖假说”:逻辑推理依赖少数可压缩模式,广泛世界知识仍需要大参数。模型已开源。
2. 工具链:Wayfinder Router 和 Adrafinil 都在处理 AI 工作流的边缘问题
- Wayfinder Router 通过分析提示词结构和措辞,在微秒级完成路由决策,完全离线且无需调用其他模型。它默认使用长度、标题、列表、代码等结构特征;“证明、数学、硬约束”等词汇线索因盲测未泛化,默认关闭。
- 与 RouteLLM、NotDiamond 这类依赖模型调用的路由器相比,Wayfinder Router 避免了延迟、成本和随机性。用户可以在自有数据上校准评分阈值,支持 OpenAI 兼容 API,包括 Ollama、Anthropic、Groq、vLLM 等,也可自托管,并提供终端、网页演示、基准和 FAQ。
- Adrafinil 是一款 macOS 菜单栏应用,只在 Claude Code、Codex、Cursor、Gemini CLI、Aider、Hermes、OpenCode、Cline、Pi 等 9 种 AI coding agent 持有活跃会话时阻止系统睡眠,包括合盖睡眠;没有 agent 工作时,Mac 正常睡眠。
- 它通过各 agent 的钩子系统调用 CLI,往返延迟低于 50ms,支持引用计数断言、热切出、空闲释放和进程嗅探。它需要 macOS Tahoe 26.4、Xcode 26+ 构建,并以签名公证磁盘映像提供。
3. 长期任务评测:CEO-Bench 把智能体放进 500 天经营模拟
- 普林斯顿大学推出 CEO-Bench,让 AI 智能体在模拟环境中运营订阅软件公司 NovaMind 500 天,起始资金 100 万美元。14 个测试模型中,只有 Claude Fable 5、Claude Opus 4.8 和 GPT-5.5 在最佳运行中超过起始资本。
- 具体数字很有意思:Claude Fable 5 最佳轮次盈利 4715 万美元,Claude Opus 4.8 为 2780 万美元,GPT-5.5 为 2130 万美元。一个不调用语言模型的简单规则启发式方法,靠固定定价、配额和针对性开发达到 1576 万美元,超过除上述三款外的所有模型。
- 这个基准的重点不是“AI 会不会当 CEO”,而是多数模型无法保持连贯策略,甚至在模拟结束前破产。长期战略决策要求持续感知、资源分配和策略一致性,不能只看单次推理分数。
4. 游戏智能体:文明 VI 对局暴露感知和执行短板
- 英国前首相府数据科学家 Liam Wilkinson 搭建 76 个 MCP 工具,把 Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 等四个模型放入《文明 VI》进行 23 场对局。
- 其中一个戏剧性案例是,Claude 扮演葡萄牙时,因为法国文化胜利逼近,花 50 回合研发核弹并核平图卢兹,但法国最终仍以外交胜利获胜。
- Wilkinson 的关键发现是:AI 主动检查全局状态只占 1% 到 2%,这是感知盲区;计划后 10 回合内执行率只有 48% 到 66%,这是知行差距。结论不是智商不够,而是感知与执行才是当前瓶颈。
思想框架
这一期 AI HOT 先给出两条模型能力线:Grok 4.5 代表大模型继续通过基础模型、Cursor 数据和强化学习推进,VibeThinker-3B 则说明小模型在数学和编程推理上可以通过后训练逼近大模型,但知识覆盖仍受参数规模限制;中段转向工具链,Wayfinder Router 解决低延迟路由,Adrafinil 解决 AI coding agent 长时间运行时的系统睡眠问题;后段用 CEO-Bench 和文明 VI 对局把评测拉到长期任务,说明真正困难的不是一次答对,而是持续感知、执行计划和保持策略。整组信息共同指向:AI 系统的短板正在从“会不会想”转向“能不能稳定感知、路由、执行和长期运营”。
AI HOT 0629:Grok 4.5、VibeThinker 与长期任务评测
AI HOT · 3 mins
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。