正在加载文章内容,请稍候。
正在加载文章内容,请稍候。
The Batch 汇总开放模型、低价推理 API 和爬虫访问控制等多条新闻,适合追踪 AI 能力、成本与数据边界的同步变化。

精准输入
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可保存笔记、高亮、划线和批注。
一些前沿实验室试图讲述一个故事:开放模型是危险的,因为它们可以被用来发起网络攻击,而他们的“安全”专有模型有强大的护栏来保护我们。本周,相反的情况发生了:封闭模型的用户无意中发起了重大网络攻击 ;其他封闭模型则因护栏而未能抵御攻击。最终,一个不受过多护栏阻碍的开放式模型协助了防御。
所发生事件的细节仍在浮出水面,但 OpenAI 的研究人员在测试他们的一个系统时,似乎意外地允许他们的自主代理 攻击 Hugging Face 的基础设施。它成功了,并获得了对某些数据集和凭证的未经授权的访问。这次攻击的不同寻常之处在于,攻击代理精心策划了数以万计的自动化操作。
Hugging Face 获取了攻击日志,并尝试使用商业托管的 LLM 对其进行分析以用于防御目的,但 LLM 以安全为由拒绝这样做。因此,Hugging Face 最终使用开放的 GLM 5.2 模型来分析日志,以帮助他们理解和应对攻击。 Hugging Face 指出了使用 GLM 5.2 的另一个优势:它允许他们在自己的基础设施上进行分析,并且无需将任何敏感日志、攻击者数据或凭据发送给第三方提供商。
大语言模型的护栏确实有一席之地。有些要求,例如伤害自己或他人的详细指示,或者明显的犯罪行为,我们最好让模型拒绝。但与其试图让大语言模型“安全”,我宁愿我们更加重视确保其使用是负责任的,为了确保像锤子这样的工具安全,人们能做的只有这么多,它是有益还是有害,更多地取决于负责任地使用它,而不是它是如何制造的。
但人工智能安全方面的有意义的工作不再是关于安全,而是旨在激起人们的恐惧,以寻求监管捕获。正如大卫·萨克斯指出的 “没有理由限制美国模型完成中国模型可以毫无问题地处理的任务。”我们只会降低自己的竞争力。”
我相信开放权重模型以及更广泛的开放性(尽管有些公司错误地称其是危险的)可以为技术带来阳光并最终使其变得更安全。随着 GLM 5.2 的发布以及 Kimi K3 权重的即将发布,开放权重模型几乎已经赶上了专有的前沿模型。因此,专有模型提供商正在大幅加快游说努力,以限制其开放权重竞争对手。正如比尔·格利(Bill Gurley)指出,开源是一项成熟的商业策略,不是需要许可和遏制的危险。
虽然不幸的是Hugging Face被意外攻击,但我很高兴在反开放模型游说最激烈的时刻,我们有一个明确的例子来说明为什么开放模型实际上使网络防御变得更容易,从而提高了安全性。
让我们继续为开源和开放权重模型发声并捍卫它!
Moonshot 的最新型号超越了一个月前的 GLM-5.2 和许多专有竞争对手,在许多基准测试中仅落后于 GPT-5.6 Sol 和 Claude Fable 5。新动态:Moonshot AI 推出 Kimi K3,一个 2.8 万亿参数的视觉语言模型。该公司立即通过 API 提供该模型,并承诺在 7 月 27 日之前发布其权重,这将使 Kimi K3 成为迄今为止已知最大的开放权重模型。输入/输出:
文本、图像和视频输入(最多 100 万个令牌)、文本输出(最多 100 万个令牌,每秒 62.0 个令牌)架构:
专家混合变压器,包括 Kimi Delta Attention 层;总共 2.8 万亿个参数,每个token活跃 896 个专家中的 16 个(估计 500 亿个参数) 特点:
可调节推理级别(当前最大且始终开启、承诺低和高)、工具使用、结构化输出、自动上下文缓存性能:
人工智能分析智能指数第三(57),开放模型第一;在 Arena.ai 的 Code Arena WebDev 排行榜上名列第一 通过 Kimi.com、Kimi 移动应用程序、Kimi Work 应用程序和 Kimi Code CLI;每百万输入/缓存/输出token 3.00 美元/0.30 美元/15.00 美元;权重即将发布; Kimi 应用程序会员资格范围从免费套餐到每月 199 美元不等:
主动参数计数、训练数据集和方法、承诺权重的许可 工作原理:Kimi K3 融合了 Moonshot 最近发布的两项架构变化:Kimi Delta Attention,它减少了注意力在长输入上消耗的内存和计算量,以及注意力残差,它让每一层选择要调用的较早层,而不是对它们进行平均求和。 Moonshot 表示,这些变化,加上更稀疏的专家混合设计以及改进的训练和数据配方,使训练效率比其前身的训练运行效率提高了约 2.5 倍(以给定计算量的模型改进来衡量)。该公司承诺在即将发布的技术报告中提供更多细节。
该模型对每四个注意力层中的三个使用 Kimi Delta Attention (KDA)。 KDA 是一种线性注意力机制:它不是将每个新令牌与每个先前的令牌进行比较,而是维护一个固定大小的内存,该内存在读取输入时更新,并决定何时覆盖旧信息。在 2025 年发布的实验模型 Kimi Linear 中,KDA 在输入长度为 100 万个令牌时,将内存使用量减少了多达 75%,并将输出速度提高了多达 6 倍。
Kimi K3 使用注意力残差代替标准残差连接,在变压器各层之间传输信息。标准连接将每层的输出添加到具有相同权重的运行总计中,因此每层的单独贡献会随着层数的增加而稀释。注意力残差在整个深度上应用注意力,因此每一层都会学习有选择地绘制较早层的输出,就像标准注意力有选择地绘制较早的标记一样。在今年早些时候发布的实验中,Moonshot 以两种形式开发了这项技术:一个版本关注每个早期层的输出,另一个版本是 Kimi K3 使用的版本,它将层分组为块并关注这些层的输出。使用块级注意力残差的模型与具有标准残差连接的模型的性能相匹配,但训练计算量减少了 20%。
性能:Kimi K3 在智力、代理任务和编码的独立测试中优于所有开放权重模型。在大多数基准测试中,它仅落后于前几名专有模型。论Artificial Analysis——智能指数,对经济上有用的任务进行 9 项评估的综合,设置为最大推理的 Kimi K3 (57) 仅落后于设置为最大推理并回退的 Claude Fable 5 (60) 和设置为最大推理的 GPT-5.6 Sol (59)。最接近的开放权重模型是设置为最大推理 (51) 的 GLM-5.2。
在测试跨业务软件的自动化工作流程的 AutomationBench-AA 上,Kimi K3 设置为最大推理(53%)领先所有模型。在 GDPval-AA v2(针对金融、医疗保健、法律和其他经济中心领域常见任务的模型工作的头对头排名)上,设置为最大推理的 Kimi K3(1,668 Elo)仅落后于设置为最大推理并回退的 Claude Fable 5(1,760 Elo)和设置为最大推理的 GPT-5.6 Sol(1,743 Elo)。
Kimi K3 首次亮相 Arena.ai 的 Code Arena WebDev 榜首 排行榜,开发人员可以在同一前端 Web 开发任务的两个模型输出中选择更好的一个。发布时,它的初步排名为 1,679 Elo,在七个前端领域中的六个中排名第一。
Kimi K3 设置为最大推理,以每项任务 0.95 美元的价格完成Artificial Analysis的智能指数,接近 GPT-5.6 Sol 设置为最大推理(每项任务 1.04 美元),比 Claude Fable 5 设置为带后备的最大推理(每项任务 2.75 美元)便宜,高于设置为最大推理的 GLM-5.2(每项任务 0.47 美元)。
新闻背后:在过去的一年里,开放模型经常互相超越,但这是自 2024 年 Llama 3 以来最接近最先进水平的一次。 Kimi K2引入了Moonshot的万亿参数线,然后是[Kimi K2.5]然后是Kimi K2.6 每个模型都依次成为Artificial Analysis智能指数中领先的开放权重模型。比赛保持同步:上个月,Z.ai 的 GLM-5.2 处于领先地位,成本仅为同类专有型号的四分之一。 Kimi K3 发布三天后,Moonshot 的财务支持者阿里巴巴推出了 Qwen3.8-Max-Preview,这是一个 2.4 万亿参数模型的早期版本,该公司声称该模型仅落后于 Claude Fable 5,并承诺以开放权重发布。
为什么重要:Kimi K3 消除了开发人员选择模型可能默认为顶级专有模型的所有原因。它的性能与 Claude Fable 5 相差三分,每项任务的成本要低得多,而且发布后,其开放权重允许进行微调、提炼和更仔细的研究。拥有这些权重的人会制定使用政策:Claude Fable 5 拒绝的许多请求不会给 Kimi K3 用户带来摩擦。最后,如此激烈的竞争——价格、控制和性能——迫使专有开发商提供更好、更便宜的模型。
我们认为:Kimi K3 的效率提升源于 KDA 的线性注意力、重新设计的残差连接和更大的稀疏性等创新。其中两篇登月计划以带有代码的论文形式发表。当面临计算限制的实验室以架构创造力做出回应并发布它时,所有开发人员都会受益。
通过 Llama,Meta 将自己标记为 OpenAI 的开放替代品。凭借新的封闭模型,Meta 现在将自己定位为低成本、高价值的竞争对手。新消息:Meta 推出 Muse Spark 1.1,一种针对代理任务进行训练的视觉语言模型,并开放了 Meta Model API,这是该公司首次对其模型进行付费访问。输入/输出:
文本、图像、视频输入(最多 1,048,576 个令牌)、文本输出(最多 131,072 个令牌,每秒 119 个令牌)功能:
工具使用、提示缓存、可调整推理(无、最小、低、中、高、xhigh)性能:
在工具使用排行榜 MCP Atlas (Scale AI) 和 JobBench,与Artificial Analysis智能指数上的 GPT-5.6 Luna 和 GLM-5.2 并列,每个任务的成本较低 可用性/价格:
通过 Meta AI 应用程序和 meta.ai 免费,通过 Meta Model API 访问 API(公共预览版,仅限美国,候补名单,价值 20 美元的初始积分)每百万输入/缓存/输出token 1.25 美元/0.15 美元/4.25 美元,网络搜索每 1,000 个查询 2.50 美元未公开:
参数计数、架构、训练数据和方法 工作原理:Meta 披露了有关如何构建 Muse Spark 1.1 的一些细节,该版本更新了最初的 Muse Spark,自 4 月份以来一直是 Meta AI 背后的模型。该公司的训练技术强调管理环境、操作计算机和协调其他代理。
Meta 训练模型在多个代理编码工具、将模型连接到文件、工具和测试的程序中工作,支持规划和子代理编排等功能。
该公司训练了双向授权的模型。领导一项任务时,它将工作划分为多个同时运行的子代理,从而缩短了总完成时间。它在另一个代理的领导下工作,保持其被赋予的角色,并在决策超出其权限时将控制权返回给编排模型。
Meta 表示,模型本身(而不是周围的软件)在长期作业中调整其输入上下文,检索任务早期的详细信息并压缩交换,同时保留后续步骤所需的内容。
对于计算机使用,Meta 训练模型在自动化(编写脚本)和直接操作(在虚拟键盘上单击或输入文本)之间进行选择,并针对更快或更简单的技术进行优化。它还可以一次发出多个动作,而不是每回合一个动作,从而提高速度和性能。
性能:Muse Spark 1.1 在衡量代理工具使用情况的基准测试中脱颖而出,但在整体智能方面低于顶级模型。在人类盲目比较中,它的排名仅落后于领先者,但在代理编码方面却处于中间位置。它特别擅长降低每项任务的成本。论人工智能分析的智能指数 综合了对经济上有用的任务的九项评估,设置为 xhigh 推理的 Muse Spark 1.1 获得了 51 分,追平了 Z.ai 的 GLM-5.2 和 GPT-5.6 Luna(均设置为最大推理),并追平了设置为最大推理的 Claude Sonnet 5(53 分)。 Muse Spark 1.1 每个智能指数任务的成本为 0.26 美元,低于除 GPT-5.6 Luna(每个任务 0.21 美元)之外的任何其他达到或高于其分数的模型。在 Arena.ai 的 Text Arena 上 通过盲目的头对头人类比较对模型进行排名,Muse Spark 1.1 排名第六(1,490 Elo),落后于 Claude Fable 5(1,505 Elo)和四个 Claude Opus 版本,仅领先于设置为 xhigh 推理的 GPT-5.6 Sol(1,486 Elo)。
在Artificial Analysis的编码代理指数上,设置为xhigh推理的Muse Spark 1.1获得了71.3分,落后于设置为最大推理的GPT-5.6 Luna(71.4),领先于设置为中等推理的Gemini 3.5 Flash(70.1)。花费了
每个任务大约花费 1.40 美元,是相比之下最低的编码代理,尽管每个任务比其他任务花费更多的时间。 MCP Atlas、Scale AI 排行榜上 对于通过模型上下文协议服务器对软件工具的多步骤使用,Muse Spark 1.1(通过率 88.1%)领先于设置为高推理的 Gemini-3.5-Flash(83.6%)和 Claude Fable 5(83.3%)。在工作台上 在针对白领职业的专业任务测试中,Muse Spark 1.1(54.7%)排名第二,领先于 Claude Opus 4.8(48.4%),落后于 Claude Fable 5(57.4%)。
新闻背后:Muse Spark 1.1 在众多型号发布中亮相。同一天,OpenAI向公众开放了GPT-5.6家族;一天前,Grok 4.5 发布,同样强调每任务的低成本。 (两周后,Google 推出了 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。)同一周,Meta 也推出了 图像生成器 Muse Image 并发布了视频生成器 Muse Video。 Muse Spark 1.1 也是第一个通过 Meta 的新模型 API 提供的模型。
为什么重要:token 价格决定了哪些应用程序在规模上是经济的;通过 Muse Spark 1.1,Meta 改变了应用门槛。该模型的输出token成本只是其竞争对手的一小部分(Claude Opus 4.8、GPT-5.6 Sol 和 Claude Fable 5 的每百万token分别为 25 美元、30 美元和 50 美元),并且每个任务的测量证实了折扣是真实的:根据Artificial Analysis的数据,只有一个相当智能的模型 GPT-5.6 Luna 的运行成本更低。马克·扎克伯格把这一定价称为对竞争对手商业模式的攻击,称其他实验室的定价“非常极端,而且利润非常高”。 Meta 和 Google 一样,可以用广告收入补贴模型开发、训练和推理成本,这比依靠 API 利润和订阅生存的实验室具有结构性优势。如果竞争对手感到被迫捍卫市场份额,那么整个行业的智能体运行成本就会下降。
我们在想:能力不断从脚手架转移到重量上。指令遵循始于提示工程,工具的使用始于模型周围的代码;两者都成为训练目标。 Muse Spark 1.1 延续了这一模式,吸收了开发人员之前构建到脚手架中的行为,例如委派和升级给代理以及管理任务中的上下文。开发人员必须手动构建的外部工具越少,代理应用程序的传播速度就越快。
使用 Cloudflare 的网络发布商很快将能够根据 AI 机器人的行为单独控制其访问,从而允许搜索索引,同时阻止 AI 训练或代理活动。
新动态:Cloudflare 推出——覆盖近 20% 互联网的内容交付网络 新的人工智能流量控制默认阻止训练和代理机器人,同时允许搜索索引爬虫。它还宣布了一个货币化工具 这将允许客户向指定访问者(无论是人类还是机器人)收取访问网页、数据集、API 或模型上下文协议的费用。
工作原理:Cloudflare 客户可以根据机器人的用例切换爬虫的访问权限,启用或禁用爬虫的搜索、AI 训练或 AI 代理的访问权限。具有多种用途的爬虫将受到最严格的限制。例如,如果发布者选择阻止训练爬虫,那么像 Googlebot、Applebot 和 Bingbot 这样既为搜索内容建立索引又为 AI 收集训练数据的爬虫将被阻止。这些控制措施将于 9 月 15 日开始实施。
Cloudflare 将搜索机器人定义为为搜索引擎索引内容的机器人;出版商历来欢迎这些机器人,因为它们增加了其网站内容出现在搜索结果中的可能性,从而增加了流量。代理机器人是代表用户在网站上执行任务(例如,获取数据或进行购买)的机器人,训练机器人则收集数据来训练人工智能模型。
对于每个类别,客户有三种选择:阻止所有页面、仅阻止带有广告的页面或允许机器人。默认情况下,显示广告的页面将阻止训练和代理机器人(或多用途爬虫,例如来自 Google、Apple 和 Bing 的爬虫),但继续允许仅搜索爬虫。 Cloudflare 还推出了 BotBase,已知机器人和代理的公共数据库,按行为对它们进行分类并跟踪它们如何使用网站内容。 Cloudflare 的“已验证”标签表示机器人操作员已通过身份验证,如其所声明的那样,遵守 robots.txt 指令,并且不会尝试规避发布商限制。发布商仍然控制是否允许该机器人类别,例如搜索或训练,但这允许更细化的限制,例如阻止来自特定公司的搜索、训练或代理,同时允许其他类别。
Cloudflare 的货币化系统允许发布商向 AI 代理收取按请求访问在线数据的费用。当 AI 代理请求受保护的网页或 API 时,Cloudflare 会在将请求转发给发布者之前要求付款,并在网络级别处理付款验证。该工具尚未发布,但客户可以加入等待名单来使用它。新闻背后:人工智能机器人所占份额不断增长
网络流量; Cloudflare 表示,现在所有 HTTP 请求的一半以上 (57.5%) 来自自动化系统而不是人。搜索流量的价值已经被严重侵蚀,以至于一些发布商甚至选择退出 Google 搜索 部分原因是他们不希望谷歌的代理绕过他们的展示广告或对其内容进行训练。 Cloudflare 的新框架试图保留搜索的优势,同时让发布商更好地控制其他形式的人工智能爬行。它还奖励像 OpenAI 这样将搜索和训练爬虫分开的公司,并惩罚那些不这样做的公司,比如谷歌、苹果和微软。
重要性:获取高质量网络数据对于开发和改进 AI 模型仍然至关重要,但 Cloudflare 等发布商和合作伙伴越来越多地限制数据的收集方式。这种摩擦会带来技术和金钱成本。这些成本可能会对规模较小和较新的人工智能开发人员产生巨大影响,他们缺乏与出版商达成协议的资源,并且在获取大公司已经纳入其数据集中的在线知识方面面临更大的障碍。
我们在想:Cloudflare 认为人工智能公司和在线出版商之间可以达成协议,公司扮演收费员的角色。但这违背了大多数人工智能公司所坚持的一个基本原则,即公共网络数据的训练应该被合理使用。 Cloudflare 是否有足够的影响力来实施这样的收费,以及它的定义或大多数人工智能公司对“公平”的定义是否会占上风,还有待观察。
大型语言模型经常被用来收集新闻。在这项任务中,研究人员发现,他们查找相关报告的能力是最薄弱的环节。
新鲜事:Mirac Suzgun 和斯坦福大学的同事以及云平台 Together AI 进行了测试 六位受欢迎的大语言模型配备网络搜索工具来回答有关每日新闻的问题。大语言模型通常回答准确,特别是当问题本身包含准确信息并以英语提出时。当他们回答不准确时,通常是因为他们检索到了无用的文章。
关键见解:大语言模型回答其训练数据中未解决的事实问题的能力至少取决于三个步骤:(i)接收结构良好的问题,(ii)检索相关文档,以及(iii)从中提取事实。损害任何这些步骤都会降低输出。例如,包含不正确事实(例如错误的名字)的问题将使大语言模型很难正确回答。同样,检索不包含必要事实的文档更有可能得到错误的答案。如果大语言模型没有接受过文档语言方面的良好训练,那么它就无法从检索到的文档中提取事实。构建高性能新闻报道系统需要掌握所有三个步骤。
工作原理:作者在 2026 年 2 月 9 日至 22 日期间每天进行测试。他们根据 BBC 新闻提出问题 以六种语言(阿拉伯语、英语、法语、印地语、俄语和土耳其语)进行报告。他们测试了 Google 的 Gemini 3 Flash 和 Pro、xAI 的 Grok 4、Anthropic 的 Claude 4.5 Sonnet 和 OpenAI 的 GPT?和 GPT'o mini,都带有网络搜索工具。
Gemini 3 Flash 每天根据时事新闻为每种语言生成 25 道多项选择题(总共 150 道)。每个问题都以时间背景开始,例如“今天是 2026 年 2 月 10 日”,并提供了五个可能的答案。正确的答案是可验证的细节,例如数字、位置或报价。
作者对大语言模型进行了测试:(a) 五选项、多项选择题,(b) 引入一个错误前提(例如不正确的参与者、时间线或细节)的更改,并添加了潜在答案“没有足够的信息来回答”,以及 (c) 没有潜在答案的原始问题。
他们使用 Claude Opus 4.7、GPT-5.4 和 Gemini 3 Pro 的多数票,将错误输出的原因分为八类,例如检索失败、检索到的相关来源包含与构成问题的细节不同的细节、理解不足以及时间线错误。
结果:模型在解决结构良好的英语问题时通常具有很高的准确率。然而,(i)它们在其他语言中表现不佳,尤其是印地语,(ii)大多数错误源于检索而不是智力,(iii)当问题包含错误前提时它们表现不佳。
在回答原始的、未更改的多项选择题时,前四名的准确率超过了 90%:Gemini 3 Flash(95.6%)、Grok 4(95.0%)、Gemini 3 Pro(93.7%)和 Claude 4.5 Sonnet(90.4%)。 GPT-5 达到了 85%,GPT-4o mini 达到了 69%。 (对于自由回答问题,模型保持了相对排名,但准确度下降了 11 到 22 个百分点。)
在回答未改变的多项选择题时,当问题采用印地语时,每个模型都表现出最差的表现(平均 79.3%)。即使用其他语言(尤其是印地语)提出问题,模型也经常引用英语来源(例如英语维基百科)。
最常见的错误原因是检索失败(38.8%)。 第二个最常见的原因是检索了主题相关的来源,其中包含“聪明但错误”的细节,无法正确回答具体问题(32.7%)。
鉴于包含错误前提的更改问题,Grok 4(准确率 70%)比其他模型至少高出 15%。 GPT-5 (准确率 19%)的表现仅略高于六个潜在答案的随机机会。
为什么重要:配备网络搜索的大语言模型非常适合查找事实信息,但其表现取决于接收事实输入、查找相关文档以及正确提取事实。由于大多数错误都出现在检索中,因此改进检索可能会比缩放模型参数带来更大的性能提升(至少在响应涉及及时信息的查询时)。作者提出了三种改进检索的方法:(i) 更好的索引覆盖范围(搜索中包含哪些文档或网页),(ii) 更好的源排名(检索到的文档呈现给模型的顺序),以及 (iii) 更好地处理英语以外的语言的查询。
我们在想:为代理而非人类使用而构建的网络搜索引擎已经成为一个令人兴奋且快速增长的类别。看来还有足够的空间来为智能体建立更好的网络搜索!
五部分共同展示开放与控制之间的拉扯:模型开放能提升透明度和本地防御能力,低价 API 改变应用经济性;与此同时,网站开始细分爬虫用途、建立收费闸门,而联网模型仍受制于检索质量。能力、成本、数据访问和安全治理必须放在同一条产业链上理解。
费曼输出