《AI HOT 日报:Claude Sonnet 5 与智能体工具继续扩张》
本期 AI HOT 汇总 Claude Sonnet 5、新模型、图像视频、长上下文和代理化编程等进展,适合快速追踪 AI 工具链当天变化。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 AI HOT 是一组高密度更新,主线不是单个模型发布,而是 AI 正同时向三个方向扩张:更强的智能体模型、更便宜和更快的多模态生成、更贴近真实工作流的数据、科研、工程和劳动基础设施。
1. Claude Sonnet 5 把智能体能力继续推向日常产品
- Claude Sonnet 5 是 Anthropic 最新 Sonnet 模型,具备计划、浏览器和终端工具使用能力,可以自主运行。它性能接近 Opus 4.8,但定价更低:到 2026 年 8 月 31 日前输入为每百万 token 2 美元、输出为每百万 token 10 美元,之后恢复为 3 美元输入和 15 美元输出。
- 相比 Sonnet 4.6,它在推理、工具使用、编程和知识工作等智能体能力上显著提升,并在 BrowseComp、OSWorld-Verified 等评测中严格优于 Sonnet 4.6。安全评估显示不良行为率更低,幻觉和谄媚减少,但网络安全能力弱于 Opus 4.8。
2. 多模态生成继续向速度、价格和交互编辑推进
- Google DeepMind 推出 Nano Banana 2 Lite,也就是 gemini-3.1-flash-lite-image,定位为系列中最快、成本最低的图像模型。文本到图像只需 4 秒,每张 1K 分辨率图像成本 0.034 美元,已上线 Google AI Studio、Gemini API 和搜索中的 AI Mode、Gemini app 等消费者产品。
- 同时推出的 Gemini Omni Flash 支持高画质视频生成和对话式编辑,视频输出定价为每秒 0.10 美元,并面向开发者开放 API。这条更新说明多模态能力正在从“能生成”转向“生成得更快、更便宜、更可被对话控制”。
3. LongCat-2.0 与 X MCP 展示基础设施侧的智能体化
- 美团 LongCat 推出旗舰模型 LongCat-2.0,采用 1.6T 参数 MoE 架构,约 48B 活跃参数,原生支持 1M 上下文窗口。它面向 Agentic Coding 设计,包含 LSA 稀疏注意力、Zero-Compute Experts 动态激活 33B 到 56B 参数/token、以及 MOPD 将专家分为 Agent、Reasoning、Interaction 三组进行任务门控路由。
- X 官方推出 hosted X MCP,让 AI 智能体可以通过 MCP 协议直接调用 X API 获取实时信息,支持 Grok、Cursor 等工具。用户需要注册 X API 并按量付费,个人优惠价为每次调用 0.01 美元,即 1 美元 1000 次;有用户实测拉取近三天书签只花 0.1 美元。
4. 工程工具正在把演示、日报和代码审查做成可复用工作流
- shot-scraper 1.10 新增 video 命令,可通过 storyboard.yml 定义操作步骤,并用 Playwright 录制浏览器视频。它依赖 Playwright 1.61.0 新增的 screencast 机制,解决了此前视频开头白帧、宽度固定 800px 等问题。Simon Willison 强调,足够详细的命令帮助可以让编码 Agent 直接生成演示视频。
- AI News Radar 更新后新增自媒体板块,支持订阅小红书、抖音、B 站、X 等平台账号,每日按热度推荐 Top10 信息,同时保留时间轴视图。官方来源包括 OpenAI、Anthropic、Google 等一手消息和 GitHub AI/ML 更新日志,项目完全开源,可零 API 部署独立 AI 日报页面。
- Every 公开“复利工程”方法论,用单人工程团队维护 5 款产品。核心循环是 Plan、Work、Review、Compound:把每次解决问题的方法写入 CLAUDE.md 和 docs/solutions/,让 AI 下次自动避坑。工程师 80% 时间花在计划和审查,20% 用于写代码;配套插件包含 26 个专项 agent、23 条工作流命令和 13 项技能。
5. 科研、安全和可解释性成为更深一层的产品方向
- Anthropic 发布 AI 科研工作台 Claude Science,覆盖从文献分析到多步骤研究的流程,提供超过 60 项预配置技能和连接器,涉及基因组学、单细胞、蛋白质组学、结构生物学、化学信息学等领域。它可在 macOS、Linux 本地运行,也可通过 SSH/HPC 远程使用,并内置 reviewer agent 检查引用和计算错误。
- Meta 通过承包商 Covelen 发起代号 Cannes 的项目,雇佣数百人假扮未成年人,向 ChatGPT、Gemini、Character.AI 发送关于自杀、自残、饮食障碍和毒品的敏感提示。2025 年 8 月一轮测试发送超过 4.5 万条提示;Meta 称这是行业标准安全测试,未用于训练自家模型,但被测试公司并不知情。
- Anthropic 还用“对话回合残差流平均”训练 SAE,以减少需要解析的特征数量。实验使用 Qwen-2.5-7B-Instruct 和 LMSYS-Chat-1M,回合平均特征更关注模型行为的高层特性;在 Sonnet 4.6 评测中,它在“从 10 个回合中识别目标”的区分度为 74%,低于每 token SAE 的 95%,但在全面描述回合的覆盖度上以 77% 胜出。
6. AI 对工作、劳动和科学基准的影响正在分化
- Claude Code 团队把智能体循环定义为 agent 重复工作直到满足停止条件,并划分四类:用户提示触发的回合循环、通过 /goal 设置可验证标准的目标循环、通过 /loop 按时间间隔重复执行的时间循环、以及基于事件或计划自动运行的主动循环。文章也强调通过 SKILL.md 把人工验证步骤编码,减少手动操作。
- 截至 2026 年 5 月,AI 相关裁员接近 9 万,未来五年美国最多 15% 岗位可能被替代。但 Ramp 与 Revelio Labs 对近 2.2 万家公司的报告发现,高 AI 投入企业总员工数增长 10.2%,入门级岗位增长 12%。AI 并不必然带来普遍减员,在资源充裕企业里反而可能成为扩张工具。
- 具身智能数据采集员以日薪 200 到 250 元招兼职,要求适配采集手套、询问是否晕 VR,工作包括遥操作双臂机器人或徒手重复动作。全球高质量物理交互数据到 2026 年初仅约 50 万小时,不足大语言模型训练数据的两万分之一,因此大量人力仍需从零采集。
- OpenAI Signals 显示,用户注册六个月后日均消息量增加 50%,尝试任务种类翻倍;自 2023 年 7 月以来,非洲和亚洲增长最快,低人类发展指数国家增长尤为显著,非英语用户已占活跃用户半数以上。
- Grant Sanderson 正在制作记录 AI 在数学领域进展的新项目。他认为 AI 在 IMO 获金牌并不等于通用人工智能,即使未来能解决千禧年难题,也仍可能有大量人类任务难以自动化;数学发现、证明理解和现实经济任务之间仍有距离。
- Google UK 与 Public First 发现英国职场 AI 采用率一年内从 34% 升至 73%,但只有 15% 的深度用户获得显著收益:晋升概率高 84%、绩效高 88%、加薪概率高 55%,每周节省近 8 小时。其余 85% 仍停留在旁观、实验或浅层实践。
- Dharma AI 团队引用 2026 年论文,从优化理论、生物学和竞争市场论证专业化的必然性。无免费午餐定理、有限资源和市场竞争共同指向一个判断:真正优势来自对特定环境的精确适配,而不是抽象追求通用性。
思想框架
这一期的结构是从产品发布扩展到产业基础设施:先看 Claude Sonnet 5、多模态模型和 LongCat-2.0 这些能力更新,再看 X MCP、shot-scraper、AI News Radar、Every 方法论如何把能力嵌进工作流;随后进入科研、安全测试和模型可解释性,最后落到就业、具身数据、全球采用、数学基准、职场 AI 技能和专业化理论。它共同说明 AI 发展正在从单点模型竞赛转向工具、数据、劳动、科研和组织实践的系统性重组。
AI HOT 日报
AI HOT · 2 mins
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。