《AI HOT 0629:Grok 4.5、VibeThinker 与长期任务评测》
本期 AI HOT 汇总 Grok 4.5 私测、VibeThinker-3B 开源、工具路由、长期任务评测和游戏对局等进展,适合追踪 AI 从单次回答走向复杂任务执行的变化。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 AI HOT 汇总了模型训练、轻量推理模型、路由工具、开发者工作流和长期任务评测。它的共同线索是:AI 竞争已经不只是单次回答能力,而是基础模型、工具链、路由、睡眠管理、商业模拟和游戏执行这些环节一起推进。
1. 模型能力:Grok 4.5 和 VibeThinker-3B 分别代表大模型与小模型路线
- Grok 4.5 基于 1.5T V9 基础模型,并在补充训练中加入 Cursor 数据,目前已在 SpaceX 和 Tesla 私测。初步评估显示,它的性能接近甚至可能超过 Opus;同时,强化学习仍在持续改进模型,Grok Build 工具链也在完善。SpaceX 还计划今年每月发布完全从头训练的新模型。
- 新浪发布仅 3B 参数的 VibeThinker-3B,在 AIME26 等数学编程基准上持平 DeepSeek V3.2 等大 200 到 333 倍的模型,LiveCodeBench 超越所有 20B 以下模型,LeetCode 竞赛解决 123/128 题,超过 GPT-5.2、Kimi K2.5 等。
- VibeThinker-3B 的短板也很清楚:知识密集型 GPQA-Diamond 大幅落后。它基于阿里 Qwen2.5-Coder-3B,经 SFT、强化学习、自蒸馏等多阶段后训练,并提出“参数压缩-覆盖假说”:逻辑推理依赖少数可压缩模式,广泛世界知识仍需要大参数。模型已开源。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。