《AI HOT 日报:LongCat-2.0、Nemotron 与企业 AI 基础设施扩张》
AI HOT 汇总 LongCat-2.0、Nemotron、xAI 语音智能体、ZCode、Claude/OpenAI 更新,以及 Meta 云算力、存储和路由优化等产业基础设施动态。
🧠 agentic reading|1️⃣ 精准输入
导语
这期 AI HOT 是一组产业快照:一边是模型结构继续分化,美团 LongCat-2.0、NVIDIA Nemotron-Labs-TwoTower、xAI 语音智能体和 OpenAI Pro 分层都在扩展模型能力;另一边是企业开始把算力、存储、路由和云基础设施当作 AI 成本控制的核心战场。
1. 新模型与新智能体工具
1.1 美团 LongCat-2.0
- 美团 6 月 30 日发布并开源 LongCat-2.0。它是 1.6T 总参数的大模型,平均激活约 48B,原生支持 1M 超长上下文,并在五万卡国产算力集群上完成全流程训练与推理。
- 架构上,它采用 LSA 稀疏注意力、零计算专家、ScMoE,以及 MOPD 多专家融合,把 Agent、Reasoning、Interaction 分成三组专家。评测中 SWE-bench Pro 为 59.5,SWE-bench Multilingual 为 77.3;预览版已通过 OpenRouter 和 longcat.ai 开放,月调用量进入 OpenRouter 全球前三。
1.2 双塔扩散语言模型:NVIDIA Nemotron-Labs-TwoTower
- NVIDIA 发布的 Nemotron-Labs-TwoTower 是基于冻结自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。它用双塔架构工作:上下文塔冻结,降噪器塔训练,再通过层对齐交叉注意力和状态播种协作。
- 在 2×H100、BF16 评估中,它保留 98.7% 自回归基线质量,生成吞吐量提升 2.42 倍。降噪器训练约 2.1T token,骨干预训练 25T token;总参数约 60B,每 token 活跃参数约 3B/塔,并支持扩散、模拟自回归和自回归三种解码模式。
1.3 xAI Voice Agent Builder 和 ZCode
- xAI 推出 Voice Agent Builder 测试版,这是基于 Grok Voice 的无代码平台,可在两分钟内创建生产级语音智能体。它集成电话、知识检索、工具、MCP、Guardrails 和可观测性,支持 SIP 号码、API、WebSocket 与语音到语音路径。
- 在 τ-voice Bench 上,Grok Voice Think Fast 1.0 得分 67.3%,高于 Gemini 3.1 Flash Live 的 43.8% 和 GPT Realtime 1.5 的 35.3%。定价为每分钟音频 0.05 美元、电话费 0.01 美元,提供 80+ 种语音及声音克隆,每个账户附赠一个免费电话号码。
- ZCode 则是 GLM-5.2 的官方开发环境。GLM Coding Plan 用户可获得 1.5 倍使用配额,支持 BYOK,也就是自带密钥,覆盖 macOS、Windows 和 Linux。
2. Claude、Anthropic 和 OpenAI 的产品信号
- Claude Code v2.1.198 更新包括 Claude in Chrome 全面可用、后台智能体通知、/dataviz 技能、Gateway 增加 AWS 上的 Claude Platform、后台智能体自动提交推送和草稿 PR,以及 Explore 智能体继承主会话模型等修复与增强。修复项还包括网络短断导致响应中断、后台任务卡在 Running 状态、智能体团队队友因 API 错误失败。
- Anthropic 被社区逆向发现,在 Claude Code 中读取本地时区 Asia/Shanghai 或 Asia/Urumqi 和 ANTHROPIC_BASE_URL,并与 base64+XOR、密钥 91 加密的 147 个域名列表比对,以识别中国用户;识别后用日期字符串里的 Unicode 替换和连字符变化传回 2-3 比特分类标记。这一隐蔽行为引发信任争议。
- OpenAI 论文首次列出 GPT-5.6 三个 Pro 变体:Luna Pro、Terra Pro、Sol Pro。在基因组学基准中,Sol Pro 通过率 31.5%,居 60 个测试模型之首,领先标准 Sol 的 28.7% 和 Claude Opus 4.8 的 16.0%。Pro 增益递减:Luna Pro 从 16.5% 到 23.6%,提升 7.1 个百分点;Terra Pro 从 23.3% 到 28.5%,提升 5.2;Sol Pro 只从 28.7% 到 31.5%,提升 2.8。论文未披露 token 用量和是否进入 ChatGPT。
3. 基础设施:云、存储和路由
- Bloomberg 报道 Meta 计划推出云基础设施业务 Meta Compute,对外出售 AI 计算能力和模型访问,直接与 AWS、Google Cloud、Azure 竞争。Meta 承诺未来几年投入 1829 亿美元建设 AI 基础设施,俄亥俄州数据中心规模如曼哈顿,由 Santosh Janardhan、Daniel Gross 和 Dina Powell McCormick 等推动。它可能效仿 CoreWeave 出售裸计算能力,并像 AWS 一样托管包括 Muse Spark 在内的模型。
- Meta 的训练存储也在调整:数百 EB 级存储集群基于 Tectonic 分层存储层构建 BLOB 架构,用闪存提供可预测低 pMax 延迟,减少 GPU 因 I/O 等待停顿,并让地理分布 GPU 能高速注入和移动数据。
- 智能体成本侧的关键判断是优先设计路由,而不是先选模型。正确路由可让 70-80% 流量运行在免费本地模型或异步推理上,将 AI 开销降低 90%+。Brian Armstrong 提到 Coinbase 通过默认设置、路由和缓存,在 token 使用量增长时把 AI 支出减半。路由分技能分类器、路由器、模型选择器三层,异步批量推理比实时推理便宜两个数量级。
思想框架
这期日报先呈现模型能力扩张:LongCat-2.0 的国产大规模训练、Nemotron 的扩散语言模型路线、xAI 的语音智能体和 ZCode 的开发环境;随后转向产品与信任,记录 Claude Code 更新、Anthropic 隐蔽识别争议和 OpenAI Pro 变体分层。最后落到基础设施:Meta 把云算力和 BLOB 存储变成 AI 业务底座,路由策略则把成本优化前移到请求分配层。整体线索是,AI 竞争正在从单模型能力扩展到模型、工具、算力、存储、路由和信任机制的组合战。
✍️ think & write|2️⃣ 费曼输出
用自己的话解释 LongCat-2.0 和 Nemotron-Labs-TwoTower 分别代表了哪两类模型能力扩展路线。
复述为什么“先设计路由而不是先选择模型”会成为智能体成本控制的关键。
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。