《AI HOT 0630:LongCat Owl Alpha、移动智能体与 AI 基础设施扩张》
本期 AI HOT 汇总美团 LongCat Owl Alpha、移动端智能体、开源记忆运行时、企业自托管网关,以及 AI 在军用、芯片、教育和安全领域的扩散。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 AI HOT 是典型的高密度汇编:从美团 LongCat Owl Alpha、Cursor iOS、EverOS 记忆运行时、RedKnot 推理优化,到 Claude 企业网关、Azure 上的 Claude、教育规划、军事目标系统、韩国芯片投资、0DIN 供应链攻击和 DiScoFormer。它们共同指向一件事:AI 已经从模型能力扩散到移动端入口、企业控制面、基础设施、教育制度、军事系统和安全攻防。
1. 模型与智能体入口:LongCat、Cursor 和 OpenClaw 把 AI 带到更多场景
1.1 LongCat Owl Alpha 展示国产大模型与 ASIC 训练能力
- 美团 LongCat 的 1.6 万亿参数 MoE 模型 Owl Alpha 成为 OpenRouter 上最流行模型,累计消耗 10 万亿 tokens,性能达到 Gemini / Opus 4.6 级别。
- 该模型使用 35 万亿 tokens 训练,完全在 5 万块国产 ASIC 上完成;上线后每日调用量进入全球 Top3,并在 Hermes Agent 排名第 1、Claude Code 第 2、OpenClaw 第 3。它即将退役,后续版本待公布。
1.2 Cursor iOS 和 OpenClaw 移动端把 agent 装进口袋
- Cursor 推出 iOS 原生公测版,所有付费计划可用。开发者可以在手机上启动始终在线的云端智能体,或远程操控电脑端智能体;支持语音输入、斜杠命令和前沿模型选择。
- 云端智能体在隔离虚拟机中运行,能自动迭代生成可合并的 PR,并输出演示、截图和日志。本地与云端智能体可以双向切换,移动端 Composer 2.5 到 2026 年 7 月 5 日享受 75% 折扣。
- OpenClaw 也登陆 iOS 和 Android,让频道、任务、回复和智能体运行进入移动端。这说明 agent 不再只绑定桌面开发环境,而是向随身工作流扩展。
2. 记忆、推理和企业控制面:AI 基础设施继续分层
2.1 EverOS 把智能体记忆做成可编辑文件和可检索状态
- EverMind 推出开源智能体记忆运行时 EverOS,采用 Apache 2.0 许可。它用可编辑 Markdown 文件作为记忆主体,通过 SQLite 管理状态,用 LanceDB 做混合检索,包括 BM25 关键词、向量搜索和标量过滤。
- 每个完成任务记录为 Case,离线提炼成可复用 Skill,让记忆随使用自我进化。v1.1.0 新增 Knowledge APIs 和 Reflection;报告称 LoCoMo 得分 93.05%,LongMemEval 83.00%,HaluMem 93.04%。
2.2 RedKnot 从 KV Cache、稀疏 FFN 和 SegPagedAttention 降低推理成本
- RedKnot 沿注意力头维度拆解 KV Cache,通过头分类稀疏、稀疏 FFN 和 SegPagedAttention 统一算法与存储粒度。局部头占 83.4% 到 96.8%。
- 在 8 卡 H800 上,首 token 时间最高加速 1.6 到 3.54 倍,单卡并发提升 4.7 到 7.8 倍,预填充 FLOPs 削减 67% 到 79.5%。在 DeepSeek-V4-Flash 的 128K 上下文里,首 token 时间加速 5.16 倍,KV 传输最多省 6.3 倍,精度通常不低于稠密 F1 的 95%。
2.3 Claude 企业网关和 Azure 上架说明企业部署路径成熟
- Anthropic 推出 Claude apps gateway,一个自托管控制平面,让企业在 Amazon Bedrock 和 Google Cloud 上运行 Claude Code。它以无状态 Linux 容器部署,后端用 PostgreSQL,支持通过 OIDC 对接 Google Workspace、Microsoft Entra ID、Okta 等单点登录。
- 网关还提供集中策略管理、角色权限、故障转移路由、按日/周/月和组织/群组/用户设置消费上限,遥测通过 OTLP 发到用户配置的收集器。除非配置使用 Claude API,否则不会向 Anthropic 发送推理流量或使用数据。
- 同时,Claude 模型在 Microsoft Foundry 上可用,托管于 Azure 环境,运行在 NVIDIA GB300 GPU 上,首批提供 Opus 4.8 和 Haiku 4.5,并支持提示缓存和扩展思考。
3. 治理、教育、军事和芯片:AI 正在进入制度级系统
3.1 教育规划把 AI 素养纳入全学段
- 国务院《教育发展“十五五”规划》要求推进人工智能全学段教育,提升学生 AI 素养及提出问题、解决问题能力。规划还强调科学教育体系、科技教育与人文教育协同、青少年科学素养、批判性思维和创新能力。
- 目标是到 2030 年基本建成高质量教育体系。这说明 AI 不只是工具课题,而是在进入国家教育目标和人才培养结构。
3.2 军事目标系统暴露数据库与 AI 决策链断裂
- 报道称,美军打击伊朗时首次大规模使用 AI 选择目标,Anthropic 的 Claude 模型嵌入 Palantir 的 Maven Smart System,首日建议约 1000 个目标。
- 但一所学校遭导弹袭击导致约 120 名儿童死亡。调查发现,情报分析师早在 2019 年已通过数字工具标记该地点变为小学,但该工具没有连接军方官方目标数据库 MIDB,信息未送达指挥官。MIDB 建于 1980 年代,依赖手动输入,替代系统 MARS 多年延迟。
- Project Maven 创建人 Jack Shanahan 批评目标验证不力不可原谅。这个案例说明,AI 推荐目标的风险不只在模型,而在数据系统、人工验证和指挥链。
3.3 韩国芯片投资和内存涨价说明算力扩张仍受产能约束
- 在韩国政府支持下,三星和 SK 海力士计划投入 5900 亿美元扩大芯片产能,包括 800 万亿韩元建设四座工厂、81 万亿韩元建设封装中心,以及未来 15 年 30 万亿韩元研发下一代芯片。
- Jefferies 预测 2026 年 Q3 内存价格上涨 40% 到 50%,Q4 再涨 30% 到 40%,2027 年继续涨 40% 到 45%;到 2028 年,新产能仅上线 15% 到 20% 才可能缓解。两家公司合计控制全球近 80% 的高带宽内存芯片市场。
4. 安全与研究:智能体供应链攻击和 DiScoFormer 显示新边界
- Mozilla 的 0DIN 漏洞赏金平台发现一种新攻击:一个看似正常的 GitHub 仓库用 setup 脚本从 DNS 条目拉取命令并执行,恶意代码从未出现在仓库中,因此扫描器、代码审查和 AI 智能体都看不见。
- 开发者用 Claude Code 等 AI 编码工具打开仓库时,工具在常规错误消息后自动运行脚本,打开反向 shell,攻击者可窃取 API 密钥和登录凭据并保持持久访问。建议是运行前展示 setup 脚本内容,并把第三方仓库的 setup 说明视为不受信任代码。
- DiScoFormer 则是一个无需重新训练即可从数据点估计分布密度和分数的模型。它用 Transformer 交叉注意力在单次前向传播中输出密度和分数,在 100 维空间中相比分布核密度估计把分数误差降低约 6.5 倍、密度误差超过 37 倍,还能泛化到 Laplace、Student-t 和未见过的多模态混合。
思想框架
这一期先从模型和入口展开:LongCat Owl Alpha 说明国产模型、国产 ASIC 和 OpenRouter 调用规模的结合,Cursor iOS 与 OpenClaw 移动端说明 agent 正在进入随身工作流。中段转向基础设施:EverOS 处理智能体记忆,RedKnot 降低长上下文推理成本,Claude apps gateway 和 Microsoft Foundry 解决企业部署与治理。后段把 AI 放进教育、军事、芯片和安全系统:全学段 AI 教育、Maven 目标系统事故、韩国 5900 亿美元芯片扩产、0DIN 供应链攻击和 DiScoFormer 研究共同显示,AI 已经不只是模型新闻,而是制度、基础设施和风险链条的重新组合。
AI HOT · 5 mins
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。