《AI HOT 日报 · 2026-07-03 — AI 版支付宝开放公测,蚂蚁阿宝无需邀请码即可体验》
支付宝阿宝 AI 助手开放公测,用户可在 iOS/安卓上直接体验并以对话方式办理事务,资金操作需用户确认。多项开源与企业级 AI 工具和模型发布或更新,包括 ghealth、Kimi K2.7、Page Agent、Skywork Tags 与 Claude 企业功能增强等。行业动态显示大模型部署、成本与监管挑战加剧(微软设新部署部门、企业限用高成本模型、Anthropic 与美方争议),同时研究揭示多智能体协作与模型鲁棒性、视觉推理等核心问题。
🧠 agentic reading|1️⃣ 精准输入
导语
这期 AI HOT 是典型的产业快照:一边是支付宝阿宝把 AI 助手推向普通办事场景,一边是 ghealth、Senior SWE-Bench、Kimi K2.7 Code、Page Agent 等开发者工具和基准继续扩张。它的价值不在单条新闻,而在把“AI 进入用户入口、工程流程、浏览器页面和模型选择器”放在同一天观察。
1. 消费级入口:支付宝阿宝开放公测
- 从搜索服务到对话办事:支付宝阿宝 AI 助手在 iOS、安卓和支付宝 App 内开放公测。用户可以搜索“阿宝”或“蚂蚁阿宝”,进入新版后用对话安排事务,例如说“查公积金”,系统会匹配小程序和服务入口。
- 资金动作仍保留确认:这条新闻的重点是入口升级,但也明确划边界:支付、转账、扫码和资金变动仍需用户本人确认。阿宝不是替代用户执行金融动作,而是把服务发现、路径匹配和办事流程前置成对话。
2. 健康数据和工程智能体
- ghealth 面向智能体封装健康 API:ghealth 是封装 Google Health API v4 的开源命令行工具,以 Go 单二进制发布,Apache 2.0 协议。它支持 40 种已验证数据类型,包括步数、心率、睡眠、体重、血氧饱和度和心率变异性,输出结构化 JSON,并提供确定性退出码、--dry-run、--raw 与两个 SKILL.md,明显是 Agent 优先设计。
- Senior SWE-Bench 把标准提高到高级工程师任务:Senior SWE-Bench 用来评估 AI 智能体完成高级软件工程师任务的能力。功能开发任务用自然语言描述,验证智能体会按专家配方生成行为测试;Bug 修复任务要求结合日志、profiling 等运行时信息调查。榜单里 Claude Opus 4.8 + Mini-SWE-Agent 通过率 24.0%,Claude Sonnet 5 为 19.4%,GPT-5.5 为 16.0%,说明前沿模型在超过 75% 的高级任务中仍达不到要求。
3. 编程模型和页面操作
- Kimi K2.7 Code 进入 GitHub Copilot:Kimi K2.7 Code 开源权重模型进入 GitHub Copilot,成为 Copilot 模型选择器里首个可选开源权重模型。它由 GitHub 托管在 Microsoft Azure,按供应商列表价格计费,并逐步推送给 Copilot Pro、Pro+ 和 Max 用户,覆盖 VS Code、Visual Studio、JetBrains、Xcode、Eclipse、Copilot CLI、GitHub.com 和 GitHub Mobile。
- Page Agent 把自然语言带进 DOM 操作:阿里巴巴发布 Page Agent,一个嵌入网页的 JavaScript 客户端库,可以用自然语言直接操作 DOM 元素。它不同于 Playwright、Puppeteer 这类外部浏览器自动化工具,更像把页面自身变成可被智能体理解和操作的界面。
4. 这期日报的共同趋势
- AI 正在进入“默认入口”:阿宝代表消费端入口,Kimi/Copilot 代表开发者入口,Page Agent 代表网页操作入口,ghealth 代表个人健康数据入口。AI 不再只是单独产品,而是在多个既有入口中成为新的交互层。
- 基准暴露真实能力差距:Senior SWE-Bench 的数据提醒,模型发布和真实高级工程任务之间还有距离。平均任务涉及 11 个文件,最强智能体也要数百步完成,中位指令长度只有 SWE-Bench Pro 的 31%,但正确性和品味仍难稳定达到高级工程师水平。
思想框架
这一期的结构可以理解为“入口层 + 能力层 + 评估层”。入口层是阿宝、Copilot、Page Agent;能力层是开源权重模型、Agent 优先 CLI 和页面 DOM 操作;评估层是 Senior SWE-Bench 用更难任务校准工程智能体。它共同说明,AI 产业正在从模型展示转向工作流嵌入,但嵌入越深,越需要确认边界、权限、评价标准和失败责任。
AI HOT 日报:阿宝公测、工程智能体基准与开源模型进入 Copilot
AI HOT · 6 mins
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。