《AI HOT 速览:实时语音模型、机器人导航与大模型工具上新》
AI HOT 汇总实时语音模型、机器人导航、多模态产品和大模型工具更新,适合快速追踪 AI 产品与工程生态。
🧠 agentic reading|1️⃣ 精准输入
导语
这期 AI HOT 是 2026-06-17 的 AI 热点汇编,主题横跨实时语音、机器人基础模型、视频生成、高考志愿、知识格式、企业智能体、支付入口、轻量化 Claw、Anthropic 企业市场、DeepSeek 融资和 OpenAI 部署仿真。固定来源规则要求尽量全量转入当天条目,因此这里按主题分组保留产品名、关键数字、发布动作和风险提示。
1. 模型与多模态能力:语音、机器人和视频都在加速
1.1 Cartesia 同时拿下实时“听”和“说”榜首
- Cartesia 推出 Sonic 3.5 和 Ink 2,形成单一实时语音栈:Sonic 3.5 负责文本转语音,Ink 2 负责语音转文字。
- Ink 2 在 Artificial Analysis 流式语音转文字排行榜第一;Sonic 3.5 在实时文本转语音中位列榜首,首音频延迟约 82ms。Cartesia 因此成为目前唯一同时拥有 #1 听与说模型的提供商。
1.2 Qwen 把视觉语言模型推进机器人操作和世界模型
- Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作 VLA 基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。它只用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,覆盖 15 种机器人形态。
- 该模型在多个 benchmark 上取得结果:LIBERO-Plus 91.4%,RoboTwin-C2R Hard 69.4%,RoboCasa365 Composite-Unseen 14.9%,EBench 45.6%,RoboTwin-IF 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。
- Qwen-RobotWorld 以语言作为统一动作接口,采用双流 Multimodal Diffusion Transformer,也就是 MMDiT 架构,并把 Qwen2.5-VL 用作动作编码器。它在 4 个 benchmark 上取得顶尖成绩,统一 20 多种机器人形态,基于 860 万跨场景训练对和 1300 多项操作技能。
- Qwen-RobotWorld 还把 500 多种动作类别标准化为语言接口,支持操作、自动驾驶、室内导航联合训练,并支持 Scene2Robot 人类到机器人转移,以及 2-4 路多视角几何一致视频生成。
1.3 Seedance 2.0 Mini 把视频生成压到更低成本
- 字节跳动火山引擎旗下火山方舟体验中心在 6 月 15 日上线 Seedance 2.0 Mini,近期计划开放 API。
- 这个视频生成模型比 Seedance 2.0 Fast 快 2 倍,输出质量相当。图生视频定价 0.023 元/千 tokens,视频生视频 0.014 元/千 tokens,720P 规格下单秒生成成本约 0.5 元,较 Seedance 2.0 标准版降低约一半。目标场景包括电商内容生产、营销素材批量生成、UGC 创作和特效玩法。
2. 具身导航与教育服务:AI 进入机器人和高考志愿场景
2.1 Qwen-RobotNav 统一五类导航任务
- Qwen 发布 Qwen-RobotNav,基于 Qwen3-VL 在 15.6M 样本上训练,统一视觉语言导航、目标导航、目标跟踪、自动驾驶和具身问答五个领域。
- 它无需改架构,就能在推理时切换任务模式和观察参数。模型结果包括 VLN-CE RxR 成功率 76.5%、HM3Dv2 目标导航 75.6%(仅 RGB)、EVT-Bench 跟踪率 90.0%、NAVSIM PDMS 91.4,以及三项 EQA 新标杆。
- 它暴露四个可调轴:视觉 token 预算、时间衰减、相机权重和帧采样模式。作为智能体系统的一部分,上层规划器 Qwen3.7-Plus 在 EXPRESS-Bench 上提升 15.4%,导航步数减少。
2.2 “阳光志愿”升级为官方 AI 志愿填报服务
- 教育部“阳光志愿”信息服务系统全新升级上线,依托招生、学籍、就业等官方数据,免费为考生和家长提供志愿填报服务。
- 系统支持 31 个省区市本专科普通批次志愿筛选;输入高考成绩、位次和个性化条件后,可生成参考方案。AI 助手“智慧小招”24 小时在线解答政策规则。平台还推出专业倾向测评和 21 项生涯测评工具。
3. 智能体知识与办公入口:从格式标准到长期运行任务
3.1 Google Cloud 用 OKF 统一组织知识上下文
- Google Cloud 发布 Open Knowledge Format v0.1,简称 OKF。它是供应商中立的 Markdown 规范,为 AI agents 提供结构化上下文知识。
- OKF 把知识表示为带 YAML 前置元数据的 markdown 文件目录,每个概念对应一个文件,通过
type、title、description等少量保留字段实现互操作。它不要求专有服务、SDK 或运行时,目录可托管在 GitHub、作为 tarball 传输,或挂载到任意文件系统。 - OKF 想解决组织内部知识碎片化:表结构、指标定义和 runbook 分散在 catalog、wiki 和厂商工具中,彼此不兼容。它选择最少意见原则,尽量只强制必要结构。
3.2 Copilot Cowork、支付宝阿宝和 MiMo Claw 都在把 AI 变成工作入口
- Copilot Cowork 全球正式可用,并支持多模型。组织可以让长期运行的 agents 处理复杂多步骤任务,并基于组织独特知识和专有技术工作。
- 支付宝开启 AI 版邀测,用户右滑进入新版界面,可通过对话框或语音给“阿宝”助手下指令。以查询公积金为例,阿宝会自动匹配小程序和服务入口,用户确认后完成操作;所有资金变动和支付环节仍需本人确认。首批放出 100 个邀请码。
- 小米推出云端轻量化 Claw 类产品 MiMo Claw 正式版,搭载 MiMo-V2.5-Pro,并与 OpenClaw 框架深度适配。模型原生兼容 MCP 工具调用协议,内置百万级超长上下文,支持单会话千次以上连续工具调用;MTP 三层解码架构让 OpenClaw 标准 Agent 工作流吞吐提升约 3 倍。
- MiMo Claw 在 ClawEval 中 Pass³ 达 63.8%,Token 消耗较同类产品降低 40%-60%。它联动金山办公生态,支持 Word、Excel、PPT、PDF 的 AI 生成、预览和在线编辑;免费用户每日单次体验时长从 1 小时升到 4 小时。
4. 公司、资本与治理:企业市场、融资和部署评估同时升温
4.1 Anthropic 企业订阅份额超过 OpenAI
- Anthropic 5 月企业 AI 订阅市场份额达 41%,首次超越 OpenAI 的 39.5%。公司刚完成 650 亿美元融资,估值 9650 亿美元,并因首次盈利季度秘密提交 IPO。
- 特朗普政府以出口管制为由,要求 Anthropic 禁止非美国人访问最新模型 Mythos 5 与 Fable 5,导致两款模型下架。Ramp 首席经济学家指出,类似争议,例如 3 月被国防部列为供应链风险,反而推动 Anthropic 企业采用量创纪录。企业支出主要流向 Claude Opus,最新为 Opus 4.8。
4.2 DeepSeek 首轮外部融资和低价策略继续加码
- 中国 AI 初创 DeepSeek 完成首轮外部融资,募资超 500 亿元人民币,约 74 亿美元,估值超 500 亿美元。
- 投资结构特殊:多数资金进入 CEO 梁文锋管理的有限合伙企业,无投票权且锁定期五年;仅国资 AI 基金直接投资并保留投票权。梁文锋个人投入约 200 亿元,腾讯和宁德时代是主要外部投资者。
- DeepSeek 表示优先基础 AI 研究与 AGI 开发,并继续开源。去年初 V3、R1 获全球关注,今年 4 月发布运行于华为芯片的最大开源权重模型 V4,并将 V4 Pro 永久折扣 75%;输入价格约为 OpenAI GPT-5.5 的 1/11,输出价格约为 1/35。
4.3 OpenAI 用 Deployment Simulation 更接近真实部署评估
- OpenAI 发布 Deployment Simulation 方法,在隐私保护下重放历史对话,用新候选模型重新生成回复,模拟上线后的实际表现。
- 在多个 GPT-5-series Thinking 部署中,这种方法比传统评估更准确估计不良行为频率,能发现新型对齐问题,并降低模型识别测试的风险,也可扩展到工具使用智能体场景。
- 传统评估存在覆盖不足、选择偏差和模型可识别测试等局限;Deployment Simulation 用真实对话分布缓解这些问题,但无法测量频率低于每 20 万条消息 1 次的行为。
- OpenAI 还用 WildChat 公开数据集模拟模型部署。WildChat 收集了 2023 年 4 月至 2024 年 5 月的 100 万条对话,用来预测 GPT-5.1、GPT-5.2、GPT-5.4 在真实生产环境中的不良行为率。与私有生产数据对比,WildChat 模拟的平均预测误差约 3 倍;但对技术性和智能体型失调的预测精度下降。这验证了公开数据集作为外部审计工具的可行性,也显示它仍有边界。
思想框架
这期 AI HOT 先从实时语音和机器人基础模型切入:Cartesia 用 Sonic 3.5 与 Ink 2 同时拿下听说榜首,Qwen 则把 Qwen-VL/Qwen3-VL 延伸到 RobotManip、RobotWorld 和 RobotNav,展示具身任务正在走向统一接口和跨形态训练。随后,条目转向应用化:Seedance 2.0 Mini 降低视频生成成本,“阳光志愿”把官方数据和 AI 助手放进高考志愿,OKF 试图用开放 markdown 目录解决组织知识碎片化,Copilot Cowork、支付宝阿宝、MiMo Claw 则把智能体嵌进办公、支付和文件生产入口。最后,资本与治理线并行推进:Anthropic 企业份额和政府冲突、DeepSeek 大额融资与低价开源、OpenAI Deployment Simulation 和 WildChat 外部审计共同说明,AI 竞争正在从模型能力扩展到价格、分发、组织知识、监管评估和真实部署安全。
AI HOT · 5 mins
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。