《AI HOT 速览:MolmoMotion、Grok 4.3 与多模态工具密集更新》
本期 AI HOT 汇总 MolmoMotion、Grok 4.3、Eve、HappyOyster、Claude 系列、Wolfram 15 和 Omnigent 等进展。共同线索是多模态、长上下文和智能体工具链继续扩张,同时也带来开源规范、性能优化和治理挑战。
🧠 agentic reading|1️⃣ 精准输入
导语
这是一篇 AI HOT 日报,原文本身是多条 AI 产业与技术更新的汇编。处理它的关键不是再压缩成几句趋势判断,而是把当天热点按主题全量转入:模型与多模态、智能体与开发工具、治理与企业数据、科研应用与底层推理优化、内容创作与技能工程。读者看完应能完整扫过 6 月 17 日前后的主要 AI 动作。
1. 多模态、世界模型与前沿模型继续扩张
1.1 MolmoMotion 把视频、3D 点和动作指令接到轨迹预测
- MolmoMotion 基于 Molmo 2 骨干网络,输入视频帧、物体上的 3D 点标记和文字动作指令,例如“移动并旋转桌上放水果的木碗”,预测未来数秒内这些点的 3D 轨迹。
- 它有两个变体:MolmoMotion-AR 自回归逐步预测坐标,MolmoMotion-FM 用流匹配处理多可能性运动。同时发布 MolmoMotion-1M 数据集,包含 116 万视频的 3D 点轨迹与动作描述;PointMotionBench 则包含 2700 个人工验证视频片段。模型权重、数据集和基准测试均已开源。
1.2 Grok 4.3 进入 Amazon Bedrock,主打低幻觉和长上下文
- 6 月 17 日,xAI 宣布 Grok 4.3 在 Amazon Bedrock 全面可用。该模型支持 100 万 token 上下文窗口,提供 none、low、medium、high 四档可配置推理努力,并宣称在前沿模型中达到最低幻觉率。
- 它在 Artificial Analysis Omniscience 基准排名第一,在 Tau2 Telecom 客服智能体真实工具调用评估排名第一,在 Vals AI Case Law 和 Corporate Finance 的复杂文档理解任务排名第一。定价为输入每百万 token 1.25 美元、输出每百万 token 2.50 美元,每美元智能度被称为其他前沿模型的 2 到 10 倍。
1.3 HappyOyster 1.0 把开放世界和实时导演接到音视频生成
- 6 月 17 日,阿里云发布开放式世界模型 HappyOyster 1.0。它基于原生多模态架构,支持多模态输入与音视频联合生成,并能在生成过程中持续接收用户指令、实时响应画面。
- 官网开放“实时导演”和“世界探索”两种玩法:前者支持随时叫停改写故事、与虚拟男友实时互动等;后者支持自由漫游、滑板冲刺、翼装滑翔、骑马奔驰、攻击打怪等交互。产品已在 4 月 16 日开放内测,从即日起至 7 月 17 日官网不定期掉落体验积分。
2. 智能体框架和工具链从单体走向团队协作
2.1 Vercel Eve 用文件系统组织生产级智能体
- Vercel 发布开源 AI 智能体框架 Eve,npm 包采用 Apache-2.0 许可。Eve 采用文件系统优先设计:每个智能体对应一个磁盘目录,目录结构直接映射模型、指令、工具、技能、连接、子智能体等能力,不需要额外注册代码。
- Eve 内置六大生产级能力:持久执行,每步检查点且崩溃后可恢复;沙箱计算;人机审批;安全连接,支持 MCP 和 OpenAPI;多通道,覆盖 Slack、Discord、Teams 等;追踪与评估,基于 OpenTelemetry。Vercel 内部运行了上百个智能体,包括月处理超 3 万查询的数据分析工具 d0、年费约 5000 美元且回报 32 倍的自动销售代理 Lead Agent,以及支持智能体 Vertex。
2.2 Omnigent 把 Claude Code、Codex、Cursor 和自定义智能体放进同一会话
- Omnigent 的判断是:编程的未来不是单一智能体,而是完整 AI 团队。它允许在一个实时会话中运行 Claude Code、Codex、Cursor、Pi 和用户自己的智能体。
- 该项目是面向 AI 智能体的元框架,基于 Databricks 内部开发工具构建,并已开源。它由 Matei Zaharia 和 Databricks AI 团队打造,原文特别强调 Matei 仍写大量代码,包括 Omnigent 和产品前端。
2.3 Claude Design、ARD 和 A2UI/MCP 都在补齐智能体生态接口
- 6 月 17 日,Claude Design 更新:支持跨项目统一设计系统,并与 Claude Code 同步工作流;用户可拖拽、对齐、缩放画布元素,编辑器稳定性提升。设计系统可从 GitHub、设计文件或原始上传导入,管理员可锁定标准系统。新增桌面端侧边栏入口和独立网页端 claude.ai/design,支持导出 PDF、PPT,集成 Adobe、Canva、Gamma 等工具,发布首周用户超 100 万。
- Agentic Resource Discovery,简称 ARD,是用于在 Web 上发布、发现和验证 AI 工具、技能与智能体的开放规范。组织在自有域名托管 catalog,registry 像搜索引擎一样索引 catalog 并响应发现请求;ARD 支持加密验证,让客户端连接前确认发布者身份。Google Cloud 的 Gemini Enterprise Agent Platform 已通过 Agent Registry 提供企业级支持,包括 URN 命名、出站策略、工具固定和基于 Agent Identity 的信任验证。
- Google 还分享了三种集成 A2UI 与 MCP Apps 的架构模式。A2UI 用 JSON payload 声明 UI,由宿主原生渲染,保证一致性和安全性;MCP Apps 用 iframe 和标准 Web 技术提供自定义界面,但有设计碎片、性能和安全挑战。三种模式包括通过 MCP 服务器提供 A2UI、用 MCP Resources 或 Tool 调用传递 JSON,以及静态与动态交付方案。Google 正考虑扩展 MCP 以原生支持 A2UI。
3. 基础软件、数学系统和推理优化继续演进
3.1 Wolfram 语言与 Mathematica 15 加入 AI 助手和大规模数据能力
- Mathematica 诞生近 38 年后,Wolfram 语言与 Mathematica 发布 Version 15。每个笔记本内置 AI 助手,并支持从 AI 环境中直接调用 Wolfram 技术。
- 新版加入符号音乐系统、大规模时间序列与事件序列处理、分类数据计算、模型拟合超函数 ModelFit;笔记本支持千兆字节级大小和实时查找,首次引入侧边栏、视觉主题和弃用功能样式。它还强化了表格连接、多点可视化、图形刻度、轨道运行计算、WebSocket 实时连接和 Python 交互;DSolve 在偏微分方程曲线坐标求解上获得 AI 方法辅助,并扩充矩阵分解、多元 zeta 函数、调和数和流线型部分分式分解。
3.2 SGLang-JAX 在 TPU v7x 上优化 Ling-2.6-1T 推理
- SGLang-JAX 已支持 inclusionAI 的 Ling-2.6-1T 在 TPU v7x 上高效推理。该模型是 1T 稀疏 MoE,63B 激活参数,256 路由专家,top-8 路由并带共享专家。
- 团队开发 Fused MoE V2,把 scatter、专家前馈网络和 gather 融合进 Pallas 核,通过隐藏 MoE 数据移动降低延迟:预填充从 5.16ms 降至 2.42ms,下降 53%;解码核从 0.249ms 降至 0.211ms,约降 15%。仅替换 MoE 核即让预填充吞吐提升 24.8%,解码吞吐提升 18.5% 到 35.3%。在 SGLang 解码基准中,16 块 TPU v7x 输出吞吐达到 16 块 H200 GPU 的 1.29 倍到 1.x 倍区间。
3.3 “苦涩教训”的下一步是让训练目标也进入更高效控制环
- Richard Sutton 的“苦涩教训”通常被理解为:不要在 AI 系统中过多编码人类知识,最终胜出的是能吸收更多算力和数据的一般方法。现代基础模型预训练似乎验证了这一点:通用架构、海量数据、简单自监督目标,例如语言模型预测下一个 token,视觉模型重建掩码块。
- 但原文指出,训练目标仍由人类在训练循环之外选定。人们完成一次大规模预训练后评估下游表现,再调整方案重新运行,这个控制环路非常粗糙。相关论文探讨能否让这一环路更高效。
4. 医学、化学和黑客马拉松展示模型进入专业工作流
4.1 Google AMIE 从单次诊断走向长期疾病管理
- 《自然》杂志发表的研究展示 Google 医学推理系统 AMIE,也就是 Articulate Medical Intelligence Explorer,从单次诊断对话扩展到长期疾病管理的能力。
- AMIE 利用 Gemini 模型长上下文能力,整合共情对话智能体和深度思考管理推理智能体,可交叉引用数百页临床指南。在盲测中,AMIE 与 21 名初级保健医生相比,整体管理推理匹配临床医生,并在计划精确性和指南一致性上得分显著更高。
4.2 GPT-5.4 接入 Maria,优化 Chan-Lam 偶联反应
- OpenAI 将 GPT-5.4 接入 Molecule.one 的自主化学智能体 Maria,用于优化药物化学中的 Chan-Lam 偶联反应。GPT-5.4 独立识别伯磺酰胺为高价值挑战性底物,并建议使用 TEMPO 等温和氧化剂。
- 经两轮实验,88% 的硼酸和 83% 的磺酰胺底物产率提升,平均产率从 16.6% 升至 25.2%,产率超 30% 的反应占比从 15.6% 增至 37.5%。人类化学家后续验证 14 对底物中 11 对产率提高,多数提升超过两倍。
4.3 Anthropic 黑客马拉松展示 Opus 4.8 的原型能力
- 6 月 13 日,Anthropic 在旧金山举办 12 小时黑客马拉松,310 名参与者使用 Opus 4.8 和 500 美元 credits 完成原型。
- 第一名 Tekton 输入历史建筑照片后,让 Claude 自动搜集图纸等资料,跨 339 个施工步骤重建 3D 模型,每个构件附带证据链,自纠循环反复检查直到 20 项测试全部通过。第二名 Sim Francisco 用美国人口普查数据生成 10000 名合成市民,各具独立世界观并实时对新闻投票,用于预测选举结果。第三名 Custom Universe 用手机拍摄物件照片,Opus 4.8 将其转为可拖放、实时渲染的 3D 物体,并支持文本指令重设风格。
5. 产业数据、治理组织和安全护栏显示 AI 进入制度层
5.1 Databricks、Snowflake、Salesforce 的 AI 收入对比
- Databricks 年化经常性收入达到 69 亿美元,同比增长 80%;同期 Snowflake ARR 约 53 亿美元,增速 34%。两者差距从 3 月的 4.9 亿美元扩大到 16 亿美元。
- Databricks AI 产品年化收入 17 亿美元,占总 ARR 的 25%,六个月前为 10 亿美元。Salesforce 以 36 亿美元收购 Fin,其 AI 智能体年收入 1 亿美元,同样约占 25%,同比增长 350%。Databricks 私人估值 1340 亿美元,80% 增长率超过 CrowdStrike 的 26% 和 Shopify 的 34%。
5.2 中国推动世界人工智能合作组织和全球治理行动计划
- 中国正加紧筹建世界人工智能合作组织,欢迎各方加入。2025 年 7 月 26 日,中国政府倡议成立该组织,定位为践行多边主义、推动共商共建共享全球治理的机制,目标是弥合数字和智能鸿沟,促进 AI 向善普惠发展,初步考虑总部设在上海。
- 同日,2025 世界人工智能大会发表《人工智能全球治理行动计划》,呼吁各方遵循向善为民、尊重主权、发展导向、安全可控、公平普惠、开放合作原则,共同推进全球 AI 发展与治理。
5.3 生成式 AI 安全护栏困境继续显形
- 原文最后提到,特朗普要求 Anthropic 完成“不可能任务”,暴露生成式 AI 安全护栏的根本困境。Gary Marcus 早在 2024 年 1 月就指出,任何护栏都很难在过严和过松之间取得平衡。
- 现在这一判断被用来说明:基于 next-token predictor(下一个 token 预测器)的大语言模型本质上不适合做强安全控制。选择要么是限制 LLM 直到出现更好技术,要么承受后果;这不是 Anthropic 一家公司独有的问题,而是整个生成式 AI 的挑战。
6. 内容创作、技能工程和独立分析生态也在更新
6.1 skills v1 与 baoyu-design 分别优化提示流程和视频导出
- Matt Pocock 开源 skills v1,将技能描述 token 成本降低 63%。工具包把技能分为模型可调用和用户可调用,新增 /codebase-design、/domain-modeling、/grilling,重写 /writing-great-skills,将 /diagnose 更新为 /diagnosing-bugs 并改为模型可调用,还新增 /ask-matt 路由技能,帮助 AI 判断何时触发合适工程流程。主推文评价它把 prompt 从咒语拆解为纪律性流程。
- baoyu-design 新增动画视频导出功能。其声明式动画引擎基于 f(t) 设计,任意时间点 t 都能绝对确定画面状态;导出用无头 Chromium 逐帧截图加 ffmpeg 编码,每帧等待两帧 requestAnimationFrame 确保渲染完成。截图以 2 倍 DPR,也就是 3840×2160,再缩回 1080p,95 秒 30fps 动画需要 2850 次截图循环。项目 MIT 开源,获 1.2K star,此前已支持 PPT 本地生成和导出可编辑 PPTX。
6.2 Nathan Lambert 更新 Interconnects 的定位
- Nathan Lambert 在 Interconnects 博客创办约三年后更新规划。他的三大目标是:为前沿模型演进提供清晰度,创建开放模型生态,建立支撑机构。
- 博客定位为原始、高辨识度的独立声音,避免成为全职分析平台。他披露与 Arcee AI 和 Mercor 签署咨询协议,用于深入后训练领域并推动透明评测与开放生态。订阅者突破 7 万,付费约 900 人;运营实体 Interconnects AI, LLC 已成立,但银行账户数月余额接近零,收入再投入业务,近期不打算全职运营。
思想框架
这篇 AI HOT 日报先集中呈现模型能力扩张:MolmoMotion 的 3D 轨迹预测、Grok 4.3 的长上下文和低幻觉、HappyOyster 的实时开放世界生成;随后转向智能体生态,从 Vercel Eve 的文件系统智能体、Omnigent 的多智能体团队,到 Claude Design、ARD、A2UI 和 MCP 的接口标准化;中段进入基础软件与底层性能,包括 Mathematica 15、SGLang-JAX 的 MoE 推理优化和“苦涩教训”训练目标控制环;再用 AMIE、Maria 和 Anthropic 黑客马拉松说明模型进入医学、化学和原型开发;最后落到制度与产业层:Databricks 与 Salesforce 的 AI 收入、中国全球治理组织、安全护栏困境,以及 skills v1、baoyu-design、Interconnects 这样的工具和内容生态更新。整体脉络是:AI 正从单个模型发布,扩展为智能体框架、专业工作流、治理接口和商业收入共同推进的系统性基础设施。
AI HOT · 2 mins
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。