《The Batch 速览:Claude Fable 5 修复、Gemini 视频引擎与 DeepSeek 解码提速》
The Batch 汇总模型修复、多媒体生成与猜测式解码进展,适合追踪 AI 模型在速度、成本和部署效率上的最新变化。
🧠 agentic reading|1️⃣ 精准输入
导语
本期先由吴恩达讨论如何用廉价的 AI 生成换取昂贵的人类判断:尽早让编码智能体做出原型,再把反馈写回规格与测试。随后四条新闻依次涉及模型出口管制、Google 多媒体生成管线、DeepSeek 推测解码,以及非侵入式脑机接口,主题虽分散,却都在回答同一个问题:怎样把模型能力变成可控、可部署的系统。
正文翻译
1. 让原型帮助人反复打磨规格
代理编码循环的关键思想是让代理继续工作,直到满足条件,例如达到产品规格。对于许多人工智能系统来说,提出规范、评估或测试集是最困难的任务之一,也是注入人类知识的关键地方。一旦有了明确的规范,实现它的路径(例如让编码代理进行迭代)就会变得更加清晰。我想分享构建产品规范的有用实践,这些规范可在快速构建 0 到 1 应用程序时驱动编码循环。正如我将在下面解释的,我使用的一个组织原则是:AI token很便宜;人类 token是金子。 (是的,我知道人类并没有真正意义上的token化,但我经常使用token,以至于我现在认为自己是在向我的计算机提供token!)
当构建一个大型、复杂的系统时,花时间很好地构建它是值得的。例如,这涉及决定您要使用什么数据库?如何分解不同服务的工作负载?您将自己锁定在哪些第三方依赖项中?前端和后端之间的 API 界限是什么?提前思考这些问题有助于避免陷入难以改变的错误决定。
但是,当在我不熟悉的领域构建快速的 0 到 1 原型或应用程序时,我通常会更快且不那么深思熟虑。我发现快速跳转到指导编码代理开始构建很方便,这样我就可以检查它所构建的内容,以便做出下一组决策。当人工智能代理花费 20 分钟构建一个简单的原型时,无需花费一个小时的时间来思考设计规范;我宁愿花 10 分钟编写一个较差的规范,看看代理构建了什么,检查其假设,然后完善规范并重复该过程。 “规范驱动开发”不会成为一个新的瀑布流程,其中编写规范是进一步进步的大门,这使我能够更加迭代地完善规范。
例如,我原型化的许多应用程序的第一个版本都有令人困惑的 UI 设计,我修改了规范来修复这些问题,而且我花多少时间调整初始规范都不会让我提前意识到需要这些更改。我自己想出这些人类 token的成本太高了。更容易(也更便宜)地发现出了什么问题,以便解释如何做正确的事情。
随着软件项目的成熟,编码代理将工作更长的时间(可能是几个小时)来构建更复杂的规范,但在这个早期阶段,扔掉整个代码库并从头开始就可以了,所以没有什么是很难改变的。所有这些代码在人力时间和token成本方面都很便宜。我们从测试中学到的东西更有价值。
此外,拥有一个实现来做出反应(或者有时我会要求代理提供一些不同的设计)可以为您提供一种有效的方式来获取反馈(人类token)来完善规范以帮助推动以后的迭代。如果您正在构建一个 0 到 1 的产品,我鼓励您让编码代理投入工作,甚至可能比您感觉舒服的时间更早,看看它会产生什么结果,并将其作为起点。然后记录你的反应并不断迭代。
在这里,您也可以让代理完成大部分工作。开发人员感到沮丧的一个常见原因是,当我们告诉编码代理一些事情,然后(可能是在内存压缩之后)它忘记了所说的内容。我希望未来的编码工具改进能够改善这个问题,但现在,当我做出关键决策时,我经常引导代理在某个地方记住该决策,比如在 SPEC.md 文件中。在构建项目的过程中,编码代理可能会生成数百万个token——远远多于人类开发人员输入的数量。因此,如果一个代理发现了某些东西,后来又忘记了它,就会有成本,因为它可能会燃烧更多的token来重新发现它——但这还不算太糟糕。但如果它忘记了你告诉它的事情,那就更令人沮丧了,因为你最终不得不再次告诉它:更多的宝贵的人类 token会付诸东流。
由于模型的进步,编码智能体在过去几个月里变得不那么健忘了,但他们仍然偶尔会忘记。当我在原型中发现一些我不满意的地方时,我通常会告诉代理不仅要修复它,还要更新规范(也许还有测试计划),因此代理将来的停止标准需要检查该问题不会再次发生。这是确保它将人类 token视为黄金的一种方法。
2. Claude Fable 5 恢复服务后的余波
在 Anthropic 由于美国商务部的出口管制指令而暂停这些模型三周后,Claude Fable 5 和更强大的 Claude Mythos 5 又回来了。
新消息:Anthropic 于 7 月 1 日恢复了客户通过 Claude API、Claude Code 和其他 Anthropic 控制的平台访问 Claude Fable 5 的权限。作为与美国政府协议的一部分,Anthropic 在模型中添加了额外的护栏,阻止一些网络安全查询并将其路由到功能较弱的 Claude Opus 4.8。
发生了什么:Claude Fable 5和Claude Mythos 5的重新部署解决了今年迄今为止美国政府与一家人工智能公司之间最引人注目的冲突。然而,这场纠纷不仅涉及Anthropic,还涉及亚马逊、谷歌、微软和OpenAI。 (披露:安德鲁在亚马逊董事会任职。)以下是这些模型发布时间以及它们被暂停和恢复的原因的时间表。
Anthropic 于 4 月份为选定的政府和技术合作伙伴推出了 Claude Mythos Preview。该模型仅发布给维护关键基础设施的公司,以便他们识别安全漏洞并修补它们。
两个月后,即 6 月 9 日,Anthropic 向全球客户发布了Claude Fable 5。它的护栏阻止了某些与网络安全和生物研究相关的询问;该模型还引起争议地降低了其对如何构建强大人工智能模型的反应。
亚马逊研究人员使用Claude Fable 5获取有关如何进行网络攻击的信息,从而制定了该指令。 Anthropic 认为,任何足够强大的模型,包括其自己的 Claude Opus 4.8 和其他提供商的模型,都可以识别相同的漏洞并产生漏洞利用。
6 月 12 日,美国政府发布了一项出口管制指令,以国家安全为由,暂停任何外国人访问Claude Fable 5和Claude Mythos 5,无论他们居住在哪里。同一天,Anthropic 禁止全球所有用户访问这些模型。
美国政府于 6 月 26 日告诉 Anthropic,它可以为选定的政府组织重新部署 Claude Mythos 5。美国商务部长霍华德·卢特尼克在给该公司的一封信中表示,与 Anthropic 几周的谈判取得了“重大进展”,人工智能开发商致力于与政府合作制定人工智能模型安全评估的协议和标准。
在 Anthropic 实施新的安全防护措施以解决亚马逊研究人员发现的网络安全风险后,Claude Mythos 5和Claude Fable 5的出口管制于 6 月 30 日取消。该公司宣布 Claude Fable 5 将从 7 月 1 日开始向全球用户开放。AWS、Google Cloud 和 Microsoft Foundry 客户随后也可以使用。
Claude Fable 5回归几天后,一些用户报告说,该模型的性能自早期发布以来有所下降,生物科学中的基本问题受到审查,编码任务受到更多限制。 Anthropic 在 X 帖子中表示,一些常规编码任务将退回到 Opus 4.8,但该公司将在未来几周内尝试“更好地区分真正的滥用与合法请求”。
其他用户抱怨说,该模型很快只能用于订阅者 50% 的使用积分,并且用户必须按积分付费才能获得更多访问权限。 Anthropic 最终将付费订阅者对Claude Fable 5的完整访问权限延长至 7 月 12 日。
新闻背后:在 2 月份早些时候的一场高风险纠纷中,五角大楼将 Anthropic 贴上了“供应链风险”的标签,因为这家人工智能开发商拒绝向美国政府提供没有护栏的模型版本,阻止其用于大规模监视或自主武器。这一相应的指定意味着国防部及其合作伙伴不能再使用 Anthropic 的产品。然而,6月份的出口管制令是首次因政府干预而导致车型通用准入暂停。 OpenAI 最近在 GPT-5.6 系列中推出了三款功能强大的新模型,在此之前,政府还要求在 7 月份广泛发布该技术之前对其功能进行预览。
重要性:美国政府对 Anthropic 和 OpenAI 顶级模型的审查标志着人工智能行业的关键时刻,这一时刻可能会影响未来模型的发布。出口禁令表明,各国政府越来越愿意在广泛部署最先进的人工智能系统之前对其功能进行审查,这引发了有关模型应如何推出以及谁应该有权使用的问题。它还可能影响各国如何保持技术领先地位。看到美国政府限制对顶级模型的访问的国家有强烈的动机开发自己的前沿模型,或者转向限制较少的合作伙伴,以保护其人工智能主权。
我们在想:如果政府决定干预人工智能模型的推出——鉴于监管捕获的风险导致少数模型通过,我们质疑这种做法是否明智——它至少应该通过一个可预测的过程。公司需要知道将产品推向市场需要满足哪些标准。任何管理模型发布的框架都需要公平、稳定、透明和合理允许,以减少不确定性、鼓励投资并避免可能延迟创新和削弱公众信任的临时决策。
3. Google 把低成本图像模型与视频 API 接起来
Google 为从事媒体工作的开发人员构建了一个低成本、高吞吐量的管道,将 Gemini 最快的图像模型与类似快速的多模态模型相结合,该模型可以将图像转换为具有同步声音的视频。
最新进展:
Google 发布了 Nano Banana 2 Lite(以前称为 Gemini 3.1 Flash Lite Image),这是该公司速度最快、成本最低的图像模型,旨在替代原来的 Nano Banana。该公司还通过其 API 平台向开发人员提供了最新的视频模型 Gemini Omni Flash,六周后,该模型首次通过 Google 应用程序到达消费者手中。谷歌的声明将这两个功能称为潜在的双重功能,允许用户使用图像模型生成廉价的静态图像(或一百张),然后通过相同的对话界面将最好的图像转换为视频。
输入与输出:
Nano Banana 2 Lite – 文本和图像输入到图像(最大分辨率 1k)和文本输出。 Gemini Omni Flash – 文本、图像和视频输入至 720p 视频,并带有同步音频输出,每个剪辑长达 10 秒
可用渠道:
这两种模型都可以通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform,以及 Gemini 应用程序和 Google Flow 获得。 Nano Banana 2 Lite 还可通过搜索、NotebookLM、Google Photos、Stitch 和 Google Ads 中的 AI 模式使用; Gemini Omni Flash 也可通过 YouTube Shorts 使用
价格:
Nano Banana 2 Lite 每 1K 分辨率图像 0.034 美元; Gemini Omni Flash 720p 视频每秒 0.10 美元
性能:
:Nano Banana 2 Lite – Image Arena 的 Elo 第五名; Gemini Omni Flash – Elo 中第一个用于 Video Arena 上的视频生成(第二个用于编辑)
速度:
Nano Banana 2 Lite 在大约四秒内生成图像; Gemini Omni Flash 世代时间未公开
未披露信息:
两个模型的参数计数和训练数据
工作原理:
谷歌为每个版本发布了一张模型卡,给出了基本架构和已知限制,但保留了参数计数和训练数据细节。
Nano Banana 2 Lite 是一款经过文本和图像训练的多模态转换器,在 Gemini 3.1 Flash-Lite(Google 经济高效的多模态基本模式)上运行。 Gemini Omni Flash 是一款经过文本、图像、音频和视频训练的多模式转换器。
Gemini Omni Flash 通过文本提示、起始图像或参考图像返回带有本机音频的 720p 剪辑。它的编辑是对话式的:当通过 Google 的交互 API 进行处理时,该模型会保留会话历史记录,因此每条指令都会修改先前的剪辑而不是重新生成它,最多可进行三个连续编辑。
图像到视频模式是两者协同工作的方式:通过相同的 Gemini API(或在 Google AI Studio Web 界面中以对话方式),Nano Banana 2 Lite 图像可以传递到 Gemini Omni Flash 作为起始帧。
性能:
谷歌报告称,这两种模型都获得了良好的人工评分结果,并且都在 Arena.ai 的群众投票板上名列前茅。谷歌的大部分数据来自其自己对内部基准的比较,因此独立确认仍然有限。
在文本到图像方面,Nano Banana 2 Lite 在 Arena.ai 的群众投票板上以 1,250 Elo 排名第五,尽管每 1k 图像的成本低了 10 美分,但还是击败了价格更高的 Nano Banana Pro(1,245 Elo); OpenAI 的 GPT-Image-2 以 1,386 Elo 领先。
在视频方面,Gemini Omni Flash 以 1,527 Elo 领先一代,并以 1,347 Elo 在视频编辑板上排名第二,仅次于字节跳动的 Seedance 2.0(1,377 Elo)。
在 Google 自己的人工评分者比较中,Gemini Omni Flash 在视频编辑(504 个示例)和 Meta 的公共 MovieGenBench(1,003 个提示)上的整体偏好和指令遵循方面排名第一,并在 VBench I2V(355 个图像文本对)上与 Grok-Imagine-Video 和 Kling 并列第一。
背景:
谷歌流行的“Nano Banana”绰号最初是在原始型号 Gemini 2.5 Flash Image 于 2025 年 8 月上线之前作为占位符代号。此后,谷歌通过限定词扩展了该系列——2025 年 11 月的 Nano Banana Pro、2026 年 2 月的 Nano Banana 2——以及现在的 Nano Banana 2 Lite。 Gemini Omni Flash 首次亮相于 5 月 19 日的 Google I/O 大会上,仅适用于 Gemini 应用订阅者、Google Flow 和 YouTube Shorts。
为何重要:
媒体生成现在既便宜又快,足以在运行时在应用程序内运行,而不是作为一个缓慢的、精心策划的生产步骤,这标志着其单位经济学的转变。十秒的剪辑可以链接成更长的片段,开发人员现在可以直接在自己的应用程序中自动生成这些片段。除其他用例外,这满足了大容量数字广告商和社交媒体生产商的需求。例如,据报道,Meta 正在构建一个系统,根据产品图像和预算生成广告创意,包括视频。
编辑观点:
将图像和视频生成视为一个市场是错误的。 Nano Banana 2 Lite 和 Gemini Omni Flash 的分辨率不足以满足好莱坞的需求,而且它们的速度和成本改进可能对业余用户来说没有多大意义。但正如我们在文本和音频中看到的那样,通过添加自动化、交互、个性化和代理工作流程,多媒体可以释放更多价值。这是释放你的想象力的好时机!
4. DeepSeek 用 DSpark 提高推测解码速度
DeepSeek 构建了一个推测性解码模块,可在不牺牲准确性的情况下将其生产模型的文本生成速度提高 50% 以上,然后将其技术开源。
新动态:北京大学和 DeepSeek 的程鑫及其同事介绍了 DSpark,这是一种推测性解码方法,其中小型模型(称为起草模块)为大型语言模型生成token,以便在单次传递中进行验证。该团队将 DSpark 应用于其 DeepSeek-V4 模型,随后发布了检查点 DeepSeek-V4-Pro-DSpark 和 DeepSeek-V4-Flash-DSpark ,将起草模块添加到 DeepSeek-V4-Pro 和 DeepSeek-V4-Flash 未更改的预览权重中。修改后的 DeepSeek 模型可以在商业许可的 MIT 许可下从 Hugging Face 免费下载。
关键见解:在推测性解码(DSpark 构建的技术)中,一个小型起草模块提出一个token块,而它所服务的大型模型一次性检查整个块。该过程同时计算大型模型在每个起草位置的下一个token选择,因此它保留了与这些选择匹配的最长的起草token。这加快了文本生成速度,同时验证步骤保持了文本质量。作者确定了影响速度的三个因素:起草token的成本、有多少起草的token通过了检查,以及大型模型做了多少检查。早期的起草者将前两个相互交换,而不管服务器负载如何,第三个都保持不变。 DSpark 适用于所有三个,但其主要贡献是动态调整第三个,在轻服务器负载下验证更多,在服务器重负载下验证更少。
工作原理:DSpark 起草模块连接到较大的目标模型,该模型保持冻结状态。 DeepSeek 仅训练了该模块的三个部分:起草主干、小型顺序组件和置信头,因为该模块借用了目标的嵌入层和输出头。在离线实验中,团队将来自开放数据集 Open-PerfectBlend 的提示输入目标模型,并根据目标模型的响应对起草器进行培训。训练促使起草者匹配目标模型的token概率分布,并教会置信头估计每个token的接受几率。
作者采用了来自另一个团队的早期起草者 DFlash 的 DSpark 骨干。与 DFlash 一样,DSpark 在一次传递中为块中的每个位置提议token。无论区块有多长,一次传递的成本都是相同的,因此并行起草者可以比逐个token起草者承担更多的层数,从而使其早期的猜测更加有力。但由于起草者独立预测每个位置,因此它可以在有效的延续之间进行混合和匹配;在作者的例子中,上下文可以继续“当然”或“没问题”,它可能会拼接在一起“有问题”。接近块末尾时,准确性急剧下降,浪费了计算量。
为了解决这个问题,作者添加了一个顺序组件,这是一种作者称之为马尔可夫头的紧凑查找,它仅根据之前起草的标记来调整每个位置的标记概率。例如,在起草者选择“of”之后,可能性就会从“问题”转向“路线”。该步骤逐个token运行,但非常小,与未修改的 DFlash 主干相比,将草稿从 4 个token延长到 16 个token只会使每轮延迟增加 0.2% 到 1.3%。
对于每个起草的token,置信头会估计该token在验证中幸存下来的概率,前提是该块中所有早期token都幸存下来。这种估计过于自信,选择要验证的token数量需要它们的真实大小,而不仅仅是强和弱token的排名。作者添加了一个校准步骤,逐个位置地重新调整估计值,直到它们的链与在保留数据上观察到的接受率相匹配。
在服务时,调度程序将每个token的置信度估计值相乘,因为只有在草稿之前的每个token都生存下来的情况下,草稿才会生存到给定的长度,从而产生每个可能的草稿长度的生存概率。然后,调度程序设置每个请求的验证长度,以最大化用户的预期总输出,并查阅每个负载级别的系统速度概况(在启动时测量一次)。在交通畅通的情况下,它会验证长草稿以减少等待时间;在流量大的情况下,它会丢弃接受几率较低的起草token,以释放其他用户的容量。
结果:DeepSeek 在开放权重模型上对照其自己重新训练的早期起草者版本离线评估 DSpark,并对照其之前的服务设置在生产中评估 DSpark。在所有情况下,DSpark 都优于竞争草案模块。
DSpark 提高了每轮验证接受的平均token数量,这是草稿质量的衡量标准。与顺序起草器 EAGLE-3 相比,Qwen3-4B、Qwen3-8B 和 Qwen3-14B 的效率分别提高了 30.9%、26.7% 和 30.0%。与平行起草器 DFlash 相比,同型号的性能分别提高了 16.3%、18.4% 和 18.3%。 Gemma4-12B(一个独立于 Qwen3 的模型系列)所取得的优势表明,这种优势并不特定于某个谱系。
在生产中,与 DeepSeek 之前的生产起草程序 MTP-1(建议每个周期生成一个token)相比,DSpark 使 DeepSeek-V4-Flash 为每个用户生成token的速度提高了 60% 到 85%,而 DeepSeek-V4-Pro 的速度提高了 57% 到 78%。
DeepSeek 在不同的硬件速度下将 DSpark 与其现有的起草模块进行了比较。 DeepSeek-V4-Flash 每用户每秒 80 个token,DeepSeek-V4-Pro 每用户每秒 35 个token,DSpark 将所有用户每秒生成的token总数分别提高了 51% 和 52%。对于各自的模型,在每个用户每秒保证 120 个token和每秒每个用户 50 个token的情况下,收益分别达到 661% 和 406%。实际上,这相当于将每个用户的生成速度提高了 60% 到 85%。 DeepSeek 的旧起草器在更高的速度下几乎失败,因此作者将这些数字视为标记新的可行操作点,而不仅仅是加速。
消息背后:谷歌研究中心的作者于 2022 年首次描述了推测性解码。此后,该技术已在生产服务中变得普遍,并且token起草模块的设计也成倍增加。早期的起草者是连续的,一次生成一个草案标记:EAGLE-3(与 DSpark 进行比较的起草者)以这种方式工作,使用目标模型的多个层的特征来预测每个新标记。然后,并行起草者通过一次起草整个token块来打破顺序瓶颈:为 DSpark 的主干提供支持的 DFlash 使用小型扩散模型来实现这一点。其作者报告称,其速度比 EAGLE-3 提高了 2.5 倍,Nvidia 表示,该产品在该公司 Blackwell GPU 上的推理能力提高了 15 倍。 DSpark 保持起草器的并行速度和顺序起草器的连贯性。 DeepSeek 从 DeepSeek-V3 开始一直使用简单的顺序起草器,直到 DSpark 结合了顺序起草器和并行起草器的优点,在 DeepSeek-V4 预览版推出两周后取代了它。
为什么重要:部署的模型输出的每个token都会花费其提供商的钱并让用户等待,这两者都限制了开发人员可以构建的内容。常见的补救措施(例如使用较小或量化的模型)会牺牲准确性。 DSpark 在不影响模型权重或降低输出的情况下削减了成本和时间:总体来看,这些收益转化为更便宜的token和更快的响应。
我们在想:DeepSeek 因以低廉的成本训练强大的模型并通过公开论文分享基于强化学习的推理模型等技术而闻名。我们很高兴它还优化了模型服务并共享结果和代码供任何人使用。
5. 不用打字:Brain2Qwerty v2 从脑波生成文本
想象一下您正在输入一个句子。但你头部周围的设备不是键盘、操纵杆或眼动仪,而是读取你的意图并在屏幕上生成该句子
最新进展:
研究人员推出了 Brain2Qwerty v2,这是他们之前系统的更新版本,可以将脑电波翻译成文本。该团队包括来自 Meta、法国国家科学研究中心、阿道夫·罗斯柴尔德医院基金会、巴斯克认知、大脑和语言中心、巴黎西岱大学以及法国计算机科学与自动化研究所的贡献者。
工作原理:
:Brain2Qwerty v2 首先 (i) 使用编码器将大脑活动分解为字符,然后 (ii) 使用作者称为对齐器的模型将字符嵌入转换为单词嵌入,最后 (iii) 使用微调的语言模型 (Qwen3-4B) 纠正这些单词。为了训练该系统,作者记录了 9 名受试者用英语输入句子的大脑活动,总计 90 小时或 22000 个示例。他们使用脑磁图(MEG)机器记录了它,这是一种记录大脑磁活动的非侵入性设备。
给定大脑活动记录,由卷积神经网络 (CNN) 和 CNN/变压器混合体(称为一致器)组成的编码器生成字符嵌入,并将大脑活动分类为字符。编码器通过最小化生成的字符序列和实际字符序列之间的差异来学习。
考虑到字符嵌入,对齐器使用普通神经网络来重新嵌入它们。对齐器按单词对这些嵌入进行分组(根据生成的字符序列中的空格进行预测),并对单词进行平均以生成单词嵌入。对齐器学会了增加单词嵌入与真实单词的 Qwen3 嵌入的相似度(如果生成的单词是正确的),并降低其与其他单词嵌入的相似度。
给定字符序列和单词嵌入,经过微调的 Qwen3-4B 纠正了该序列。作者使用 LoRA 适配器对每个受试者的 Qwen3-4B 进行微调,以生成正确的句子,并对所有受试者的适配器进行平均。
结果:
:Brain2Qwerty v2 的性能优于其前身。作者还观察到,增加训练数据可以提高系统在数据集上的性能。
Brain2Qwerty v2 的单词错误率(猜错单词的百分比)为 39%,而 v1 的单词错误率为 43%。
随着数据量的增加,系统编码器的字符错误率(猜错的字符百分比)下降。例如,在 20 小时的训练数据中,他们的编码器实现了大约 50% 的字符错误率,而在 90 小时的训练数据中,它实现了大约 25% 的字符错误率。在数据耗尽之前,作者并未观察到性能达到稳定状态。
比较每个受试者的表现,对每个受试者单独训练系统的表现明显比作者的方法差。例如,对于9 名受试者的平均表现,仅针对该个体进行训练的单词错误率为 66.5%,而使用其组合方法进行训练的单词错误率为 47.8%。
背景:
:第一个 Brain2Qwerty 研究计划将 MEG 记录与 EEG(脑电图)进行比较,发现 MEG 读数可以更准确地预测文本。 Brain2Qwerty v2 仅包含 MEG,更新了架构,并使用了比 v1 更多的训练数据。研究人员还开源了两个版本的训练代码,并发布了v1的数据。
为何重要:
:增加数据可以提高性能,这并不奇怪。但令人惊讶的是,对多个受试者的大脑活动进行训练可以提高表现,甚至与对单个个体进行训练相比也是如此。毕竟,从历史上看,在脑机假体中,模型通常是针对单个用户进行训练的。建立一个可以解释任何个人独特的大脑活动、学习常见模式并不断利用数据进行改进的系统表明,从脑电波中识别文本的模型应该能够利用来自更多受试者的更多数据来提高性能,就像大语言模型(LLM)在过去几年中利用更多数据进行改进一样。
编辑观点:
:通过手术在大脑中植入电极等侵入性手术使以前的患者能够以个位数的错误率进行交流。虽然作者报告的数字与这些手术的数字尚不相符,但每一个百分点的下降都代表着未来患者无需冒险接受脑部手术的进步。
(部分小标题为编者所加)
思想框架
全文由一段产品开发方法论和四条技术新闻组成。开场用“AI token 便宜、人类 token 珍贵”解释原型—反馈—规格循环;Fable 5 事件展示能力开放与政府管制的冲突;Google 把图像和视频模型组合为运行时媒体管线;DSpark 从起草、校准与动态验证长度三处提高服务效率;Brain2Qwerty v2 则用多受试者数据改善脑波到文本的泛化。共同落点是:真正的进步不只来自更强模型,也来自规格、治理、推理调度和数据组织。
The Batch @ DeepLearning.AI · 18 mins
✍️ think & write|2️⃣ 费曼输出
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。