《The Batch:Hermes 对 OpenClaw、网络安全警报,以及 Agent 能否胜任人类工作》
Hermes Agent 是一个开源智能代理,凭借更灵活的记忆与自动生成技能的能力,正快速挑战流行的 OpenClaw。研究显示,目前多数代理基准集中在软件工程任务,未能覆盖更广泛的劳动类型与技能。通用代理正从无状态助手向能积累经验、适应用户并自动化持续工作的系统转变。
🧠 agentic reading|1️⃣ 精准输入
导语
这期 The Batch 把教育评价、开源 agent、实时多模态交互、AI 网络安全和 agent benchmark 放在同一期里。主线很清楚:AI 系统正在从会回答问题,走向能持续工作、实时互动、发现漏洞、衡量劳动价值;但评价体系、教育理念和安全防线都还没跟上。
1. Andrew Ng 对 Harvard 限制 A 等级的反对
开篇评论 Harvard 将本科课程 A 等级限制在约 20% 的做法。Andrew Ng 不赞成,因为这把教育重心放在筛选而不是帮助所有学习者成功。他承认 grade inflation 真实存在,GPA 的信号质量下降,但认为教育机构首先应帮助学生掌握能力,而不是用稀缺高分制造区分。
他的教育哲学是:设置高标准,同时尽力让 100% 学习者成功,而不是让一部分人通过、一部分人失败。 这解释了他在在线课程中允许作业无限重试,也解释了他偏好 practice problems 而不是 assessment problems。练习题的目的,是让人通过反复尝试获得技能;评估题的目的,才是判断能力。
2. Hermes Agent 挑战 OpenClaw:agent 正在积累记忆和技能
第一条新闻写 Hermes Agent。它是 Nous Research 在 2026 年 2 月发布的开源 agent,近期在 OpenRouter 统计的每日 token 消耗榜上超过 OpenClaw。它与 OpenClaw 的能力重叠,但差异在记忆架构和自动生成技能。
Hermes Agent 的 agentic loop 包括:组装包含人格、指令、工具、技能、记忆、用户知识和对话历史的 prompt;如果超出上下文,要求 LLM 总结旧消息;发送给 LLM 后调用工具、调用技能或回应用户;若调用工具或技能,再执行并继续循环,直到生成最终响应。
Hermes 的关键点,是把成功经验写成 SKILL.md,并用 Curator 防止技能膨胀。 当它长期解决问题或修复错误后,会创建新技能;后台 Curator 会把 90 天未使用技能归档,并判断技能应保留、合并还是归档。它还维护两个记忆文件:用户偏好,以及工作流和经验教训,并检查新记忆是否重复、是否过于模糊、是否需要合并。
这说明通用 agent 正从无状态助手转向会积累经验、适应用户、持续执行任务的系统。
3. TML-Interaction-Small:实时多模态交互突破 turn-taking
Thinking Machines Lab 的 TML-Interaction-Small 是一个可同时处理音频、视频、文本输入并并发生成音频和文本输出的系统。它不是等用户说完再回答,而是以 200 毫秒 micro-turns 交错处理输入和输出,并配有异步后台 reasoning model。
模型总参数 276B,每 token 激活 12B;可处理实时打断、插话、视觉线索下的主动介入、直播翻译,以及不打断前台对话的后台工具调用。测试中,它在音频延迟 FD-bench V1 上达到 0.40 秒,优于 Gemini 3.1 Flash Live minimal reasoning 的 0.57 秒和 GPT-Realtime-2 minimal reasoning 的 1.18 秒;在 FD-bench V1.5 上平均质量 77.8,高于 GPT-Realtime-2 xhigh reasoning 的 47.8 和 Gemini high reasoning 的 45.5。
这条新闻的意义,是 AI 交互从“回合制聊天”走向“共同在场”。 体育指导、手术监测、实时翻译等场景需要模型边听边看边回应,而不是把世界切成一轮一轮文字输入。
4. 网络安全警报:LLM 正在扩大攻防差距
Google 报告指出,大语言模型正让网络攻击更快、更自动化。威胁包括 morphing malware:恶意软件每次复制或感染新系统时改写解密例程、替换命令、加入无功能子程序,从而绕过杀毒检测;逻辑漏洞识别:LLM 能理解代码意图,发现传统 fuzzing 或模式匹配难以发现的问题;obfuscation networks:AI 指挥流量穿过多个被攻陷中转服务器,规避监控;以及 AI 基础设施本身成为攻击入口。
背景更严峻:研究人员用 Claude Mythos Preview 攻破 Apple 安全并报告漏洞;英国 AI Security Institute 称 Claude Mythos Preview 和 GPT-5.5 可稳定执行预计人类需 3 小时的攻击任务,高于此前 1 小时预测;当输出 token 限制放宽,模型能执行更长人类时间尺度的攻击。
核心风险是漏洞发现速度可能超过补丁实施速度。 AI 既是防御工具,也是进攻工具,还是被攻击目标;这会推动更多监管审查,也迫使开发者把主动防御研究前置。
5. Agent benchmark 与真实劳动不匹配
最后一条研究来自 Carnegie Mellon 和 Stanford。研究者把 43 个 agent benchmark 中超过 1 万个例子,映射到美国 O*NET 的职业活动和技能 taxonomy,再与就业人数和工资总额对比。结果显示,现有 benchmark 过度集中在软件工程,不能代表更广泛的人类工作。
数据很关键:基准测试中的“计算机与数学”职业样本有 8,622 个,“办公室与行政支持”样本有 3,186 个,“管理”样本有 676 个。但在美国真实就业结构里,计算机与数学岗位约 520 万人,办公室与行政支持岗位约 1,820 万人,管理岗位约 1,100 万人;对应工资规模分别约为 5636 亿美元、8698 亿美元和 1.3263 万亿美元。
单个 benchmark 覆盖不到 50% 工作活动和不到 60% 技能;覆盖最好的是 GDPval,覆盖 47.8% 工作活动和 58.5% 技能;所有 benchmark 合计覆盖 56.5% 工作活动和 85.4% 技能。这说明我们现在最会测的是 coding agent,但最有经济价值的 agent 机会可能在行政、财务、管理等更广泛工作中。
结论
这期的统一主题,是 AI 正在进入“持续行动系统”阶段。Hermes 代表记忆和技能积累,TML-Interaction-Small 代表实时交互,安全报告代表攻防自动化,benchmark 研究代表评价体系需要从软件工程扩展到真实劳动。Andrew Ng 的教育评论则提供了一个价值底座:如果 AI 和教育都只用于筛选少数赢家,就会错过帮助更多人变强的机会。
思想框架
The Batch 先以教育评价建立“帮助成功 vs 判断优劣”的框架,再依次展示 agent 能力、交互形态、安全风险和衡量体系的变化。各部分看似分散,实际都围绕一个问题:当 AI 系统越来越能行动,我们应该怎样训练人、设计工具、保护系统,并用更贴近现实劳动的指标衡量进步。
Email · 15 mins
✍️ think & write|2️⃣ 费曼输出
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。