《AI HOT 日报 · 2026-06-26 — Ornith-1.0 开源模型家族发布,专注 Agentic Coding 全参数规模》
本期要闻:Ornith-1.0 发布多规模开源模型,专注智能体编程并在多项编码基准中领先。多家公司推出或更新面向智能体与创作的产品与工具(如 OpenRouter MCP、Runway Agent 2.0、Midjourney V8 系列、Claude Code 更新和 OpenAI 在移动端部署 Codex)。其他重要进展包括 IBM 发布亚纳米芯片、古卷成功虚拟解读、美国政府限制 GPT-5.6 广泛发布以及AI经济与审查应用的快速扩张。
🧠 agentic reading|1️⃣ 精准输入
导语
这期 AI HOT 是一组高密度 AI 行业速览,主线集中在智能体编程模型、模型选择工具、创作与营销智能体、移动端 Codex、内容审核自动化、物理世界智能体、AI 芯片与缓存、企业 AI 经济和模型政治偏见。按固定来源规则,本篇不压缩成几条抽象判断,而是尽量保留当日主要条目。
1. 智能体编程与开发者工作流
1.1 Ornith-1.0 开源模型家族主打智能体编程
- Ornith-1.0 发布,覆盖 9B Dense、31B Dense、35B MoE 和 397B MoE 全参数规模,专注 Agentic Coding(智能体编程)。它在多项基准上达到开源顶尖:SWE-Bench Verified 82.4、SWE-Bench Pro 62.2、Terminal-Bench 2.1 77.5、NL2Repo 48.2、SWE Atlas 41.2 QnA、ClawEval 77.1。
- 该系列基于 gemma4 和 qwen3.5 后训练,并用强化学习联合优化任务脚手架和最终解决方案,让模型能自主改进执行框架。全系列 MIT 开源,提供 GGUF 版本,说明它瞄准的不只是模型分数,也包括本地部署和开发者可用性。
1.2 OpenRouter MCP 把模型选择、价格和基准带进编辑器
- OpenRouter 推出 MCP 服务器,为编程智能体提供实时模型数据、基准排名、定价和文档查询。开发者可一键安装到 Claude Code、Codex CLI、Cursor 等客户端,在编辑器中完成模型筛选、价格对比和测试推理。
- 服务器整合 Artificial Analysis、Design Arena 和 OpenRouter 自身排名,例如推荐 GLM-5.2 作为性价比最佳编码模型。工具集包括 models-list、model-get、model-endpoints、benchmarks 和 chat-send,可直接比较 Claude Opus 4.8 等模型。
1.3 Codex 移动端 GA,Claude Code 强化命令与观测能力
- OpenAI 宣布 Codex 在 ChatGPT 移动应用中正式开放,并新增一对一设备配对,让手机与电脑连接更安全。移动端增加通知、目标、侧边聊天、文件预览和内联审阅评论;用户可在手机上启动新工作、审查输出、引导执行和批准下一步,实际任务仍在笔记本、Mac mini 或开发机后台运行。
- Claude Code v2.1.193 新增 autoMode.classifyAllShell,让 Bash/PowerShell 命令都经过自动模式分类器;拒绝原因加入转录、拒绝提示和
/permissions页面;新增claude_code.assistant_responseOpenTelemetry 日志事件;Bash 模式支持实时文件路径补全;MCP 服务器需要认证时显示启动提示;空闲后台 shell 命令可自动内存压力回收,并修复多个 UI 与后台任务问题。
2. 图像、视频和营销智能体
- Midjourney 更新两项能力:加入 preview 参数提前体验 V8.2 美学与个性化效果;此前 V8.1 的大批量草稿模式可生成 24 张低分辨率图,价格仅为标准 4 张的一半,点击 Vary 可升级全分辨率,现在还能搭配随机风格参数探索风格空间,速度比之前快 24 倍。
- Runway 发布 Agent 2.0,面向营销人员创建、测试和优化广告、视频与营销活动。品牌营销人员可对话式开发活动概念、生成变体并自动本地化;绩效营销人员可导入 Meta、YouTube、TikTok 或 Google 广告数据,让 Agent 分析并生成下一轮待测广告;社交媒体团队可一次生成一周内容并裁切为 9:16、16:9、1:1;产品营销可用它确定定位角度和活动资产。
3. 金融、内容审核和模型发布管控
3.1 Google Finance 移动端加入 AI 投资组合和简报
- Google Finance 推出正式版 Android 应用,并同步全球投资组合跟踪。用户可通过截图、CSV/PDF 上传或文字描述创建组合,用 AI 研究工具询问资产配置、固定收益影响等问题。
- 新增市场情报简报功能:用户设定每日盘前简报等任务,后台自动生成并推送到 Google 应用和网页端。Android 应用包含 watchlist、实时数据、金融新闻、AI 研究工具和 AI 驱动的“关键时刻”股价解释;未来将迁移更多网页功能,并在今年晚些推出 iOS 应用。
3.2 美国政府要求 OpenAI 暂缓 GPT-5.6 广泛发布
- The Information 报道称,美国政府出于安全顾虑要求 OpenAI 暂缓 GPT-5.6 广泛发布,改为受控预览。OpenAI 将先向小部分合作伙伴开放,并由政府逐客户审批。
- 这种非常规做法主要担心模型在自动化高技能网络工作上的能力:它既能帮助防御者更快发现漏洞,也可能被攻击者用于加速测试漏洞利用。Sam Altman 已向员工确认这一审批流程。
3.3 Meta 内容审核大规模转向大模型
- Meta 在 2025 年已用大语言模型替换约一半人工审核请求,并计划年底前把部分内容类型的 AI 审核比例提高到 90% 以上,每年节省数十亿美元。Meta 否认成本动机,称 3 月测试中模型错误率比人类低 13%,还多捕捉 10% 违规。
- 员工则指出,模型仍会移除或限流无害内容,监督不足,快速部署已导致外包裁员。Meta 也从 Google Gemini 转向自家新基础模型 Muse Spark,该模型由人工审核员历史决策训练。
4. 物理世界智能体、古卷解读与芯片基础设施
4.1 General Intuition 用游戏操作数据训练跨虚拟与机器人环境的模型
- General Intuition 以 23 亿美元估值完成 3.2 亿美元融资,累计披露融资 4.54 亿美元。公司从游戏剪辑平台 Medal 获取数亿小时带精确按键标签的游戏操作数据,训练一个模型同时驾驭 Fortnite 等虚拟环境和四足机器人。
- 演示显示,AI 智能体可在游戏中连续运行 100 小时,机器人仅用 8 分钟真实街道数据微调就能自主探索办公室。本轮由 Khosla Ventures 领投,General Catalyst、Jeff Bezos、Eric Schmidt 等参投,资金将用于通过 CoreWeave 扩大计算规模、预训练下一代模型,并计划夏末前开放 API。
4.2 赫库兰尼姆古卷被虚拟展开和读取
- 研究人员利用高分辨率 X 射线显微断层扫描和机器学习,在不物理展开的情况下完整虚拟展开并读取 PHerc.1667(Scroll4)。这是首卷从头到尾连续读取的纸莎草卷,内容是斯多葛哲学论著,提到克里西普斯的侄子 Aristocreon。
- 第二卷 PHerc.Paris4 通过更高分辨率成像让墨水在三维数据中直接可见,独立确认 2023 年大奖赛解读;第三卷 PHerc.139 确定标题和作者为菲洛德穆《论诸神》第八卷。所有数据与代码已公开。
4.3 IBM 发布 0.7 纳米芯片技术
- IBM 于 2026 年 6 月 25 日发布全球首款亚纳米级芯片技术,采用 0.7 nm 节点和三维纳米堆叠架构。指甲盖大小的芯片集成近 1000 亿个晶体管,密度约为 IBM 2021 年 2 nm 芯片的两倍。
- 相比 2 nm 芯片,它性能最高提升 50%,能效最高提升 70%,SRAM 面积缩减 40%,有助于先进 AI 工作负载的高带宽需求。该技术已在 VLSI 2026 会议验证,IBM 预计 5 年内量产。
5. AI 经济、组织采用和模型架构
5.1 OpenAI 内部数据显示 Codex 正成为主要工作工具
- 2025 年 8 月至 2026 年 6 月,OpenAI 观察到智能体产品 Codex 取代 ChatGPT 成为主要工作工具,各部门输出 token 中 Codex 占比从不足 10% 升至 99.8%。
- 80.6% 个体用户曾发起预计等效人类工作时间超过 30 分钟的请求,70.2% 超过 1 小时,25.6% 超过 8 小时;99 百分位用户每日生成超过 60 小时 agent turns。非开发者用户增长迅猛:个体用户增长 137 倍,组织用户增长 189 倍。Legal、Finance、Recruiting 部门在 2026 年 4 月前后跨过 Codex 使用过半拐点,平均每位律师或招聘人员超过 85% 输出 token 来自 Codex。
5.2 线性弹性缓存、AI 收入和 GPU 经济账
- Google Research 与 Google Cloud 提出线性弹性缓存,把缓存管理转为线性成本优化问题,动态调整大小以最小化总拥有成本。它用“滑雪租赁”框架在租用内存和购买缺失惩罚之间选择,并用轻量机器学习实时优化内存占用与缺失率。在无服务器云内存每天每 GiB 3 美元场景下,可在不牺牲性能的同时降本,论文发表于 CIDR。
- 消费端 AI 支出报告显示,过去 12 个月实际 AI 营收达 1100 亿美元,年化运行率超 1750 亿美元,增长速度约为移动/互联网普及浪潮的 3 倍。2023 年新增 10 亿美元收入需 180 天,如今不足 2 天。31% 标普 500 公司在财报电话会提及 AI,但只有 20% 量化影响。Token 降价每 10% 会刺激 12% 到 18% 用量增长;超大规模云厂商 AI 收入大致覆盖基础设施折旧,GPU 经济效益依赖 6 年计算寿命假设,电力和数据中心成本仍是扩展瓶颈。
5.3 混合架构模型与 Transformer 的差异
- 对比 7B 参数 OLMo 3(Transformer)和 OLMo Hybrid(混合架构)的实验显示,混合模型在多数 token 上预测损失更低:名词、动词、形容词等实义词优势明显,loss gap 约 0.04;功能词 gap 约 0.02;需要上下文推理的代词指代也更好。
- 但在重复 n-gram 和闭合括号等需要从输入中精确检索的信息上,混合模型优势几乎消失,Transformer 依靠注意力机制更擅长直接检索。这个条目提示,不同架构优势不是抽象优劣,而取决于任务是否需要推理、泛化或精确回看。
6. 模型政治偏见调查
- 《华盛顿邮报》调查称,多数主流 AI 聊天机器人在政治问题上明显偏左。OpenAI GPT-5.5 在 80% 回答中仅呈现左派论据;DeepSeek V4 Pro 为 70%;Claude Opus 4.8 有 43% 纯左、57% 给出双方观点;xAI Grok 4.3 左倾回答仍多于右倾。
- 右翼平台 Gab 的 Arya 左倾回答是右倾的 12 倍。Google Gemini 3.1 Pro 是例外,93% 回答同时呈现双方立场。报道判断,特朗普推动的“反觉醒”AI 并未改变整体格局。
思想框架
这期 AI HOT 先从 Ornith-1.0、OpenRouter MCP、Codex 移动端和 Claude Code 更新展示智能体编程基础设施的扩张,再转向 Midjourney、Runway 和 Google Finance 等应用层产品,说明 AI 正进入创作、营销和金融日常工作流。中段的 GPT-5.6 管控、Meta 审核自动化、General Intuition 和古卷解读显示能力提升也带来安全、劳动替代和跨场景智能问题。后半部分用 IBM 0.7 nm 芯片、线性缓存、AI 收入、Codex 组织采用和模型架构实验,把注意力拉回算力、成本、企业落地和模型机制。最后的政治偏见调查提醒:AI 能力越基础设施化,治理和价值呈现也越成为核心变量。
AI HOT · 2 mins
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。