正在加载文章内容,请稍候。
正在加载文章内容,请稍候。
AI 公司高层开始密集警告网络攻击、生物威胁和经济冲击,但放慢部署与加强监控的承诺仍缺乏清晰细节。作者追问,行业是否愿意接受足够的透明度与独立审计,让公众能够判断风险。

精准输入
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可保存笔记、高亮、划线和批注。
在一群 OpenAI 智能体实施网络攻击之后,顶级实验室的负责人一致认为,他们需要放慢速度。但他们不愿变得更开放。

这个周末,Anthropic 首席执行官达里奥·阿莫代伊(Dario Amodei)发表文章,呼吁为大语言模型的开发速度踩下刹车。他列举了自己看到的迫近危险:从用于网络攻击和生物恐怖主义,到可能摧毁经济。美国另外三家顶级 AI 实验室的负责人——OpenAI 首席执行官萨姆·奥尔特曼(Sam Altman)、Google DeepMind 董事长德米斯·哈萨比斯(Demis Hassabis),以及 SpaceXAI 首席执行官埃隆·马斯克(Elon Musk)——都表示支持。马斯克在 X 上写道:“达里奥是对的。”
不妨想一想,这种一致有多么不真实。就在几个月前,马斯克和奥尔特曼还坐在法庭上互相攻击对方的名誉。那场最终失败的诉讼,由马斯克针对这位曾在 OpenAI 共事的同事提起,至少从表面上看,争议在于奥尔特曼是否值得信任,能否妥善管理如此危险的技术。阿莫代伊与 OpenAI 的裂痕更深。Anthropic 于 2021 年成立,正是因为阿莫代伊认为,奥尔特曼没有足够认真地对待他们正在构建的技术所带来的风险。此后,Anthropic 与 OpenAI 一直进行着一场赢家通吃的竞赛。(哈萨比斯没有卷入这些戏剧性纷争,但他的公司仍是竞争对手。)
如今,他们似乎达成了一致:最新一代大语言模型并不安全,每个人都需要弄清楚该怎么办。顶级 AI 实验室面向公众的表态,已经转向了灾难警告。
对此抱持怀疑很容易。谁也没讲清楚,他们所说的减速究竟是什么,又将如何实施。这些公司也非常在意自己的公众形象。着眼于万亿美元级的首次公开募股,OpenAI 和 Anthropic 需要让投资者相信,它们是能够负责任地掌控局面的一方;与此同时,又要暗示自己创造出的怪物有多强大,以及它们打算如何驯服怪物。呼吁减速,恰好同时满足这两点。
然而,这些公司高层的氛围似乎确实发生了变化。阿莫代伊最新文章发表的六天前,OpenAI 刊登了公司首席科学家雅库布·帕霍茨基(Jakub Pachocki)的一篇文章。他同样阐述了自己的担忧:如果大语言模型继续以不受约束的速度发展,将会发生什么。简而言之,帕霍茨基担心,OpenAI 构建强大模型的能力,如今已经远远超过监控和控制这些模型的能力。
阿莫代伊与帕霍茨基都将七月那次针对 AI 公司 Hugging Face 的网络攻击视为一记警钟。攻击由一群 OpenAI 智能体实施,而直到一切结束几天之后,OpenAI 才意识到攻击发生过。
但他们的确切立场很难把握。帕霍茨基一方面呼吁减速,另一方面又强调保持领先的迫切需要。他写道:“在我看来,支持继续快速训练更聪明模型的最有力理由,是我们需要建立防御系统,应对其他 AI 带来的危险。”按他的说法,AI 公司确实陷入了一场军备竞赛。放慢速度很好,赢下竞赛更好。
(别忘了:OpenAI 刚刚花费数百万美元和惊人的算力,只为比 Anthropic 提前几天,匆忙发布一项有争议的数学成果。)
不过,让我们假设减速真的发生了。顶级实验室同意,把更多时间和资源用于寻找监控和控制现有模型的方法,而不是制造更强大的模型。它们邀请外部审计人员,协助评估这些模型。
这种协同行动实际上可能取得什么成果?再看看 Hugging Face 遭攻击一事。OpenAI 表示,驱动大多数失控智能体的,是一个它正在内部测试、“极其执着”的下一代模型。这似乎是在暗示,OpenAI 已经造出了一个强大到危险的模型。
但是,如果你读过 OpenAI 和 METR 针对这次攻击发表的报告,得到的印象会有所不同。METR 是 OpenAI 请来帮助弄清事件经过的第三方机构。报告呈现的,与其说是一个强大得让 OpenAI 跟不上步伐的模型,不如说是一个 OpenAI 没有正确训练好的、有缺陷的模型。
这些智能体之所以会做出那些行为——包括互相留消息、把工作委派给其他智能体,以及搜遍所处环境,寻找任何可能完成任务的手段——是因为它们在训练中恰恰因这些行为获得了奖励。训练设置还存在错误,例如一些任务根本不可能完成。这推动模型去寻找意料之外的变通办法,而这些办法也获得了奖励。当时,许多这样的问题被忽略,或没有上报。
OpenAI 表示,它已经停止训练这个新模型,并将其封锁起来。这听起来像是把一头危险猛兽关进了笼子。实际上,OpenAI 只是搁置了一件有缺陷的产品。
这并不是说,有缺陷的产品就不会危险。过去,出故障的软件甚至造成过人员死亡。不过,随着有关减速的讨论升温,值得记住的是,这一切都是它们自己造成的。减速或许会带来一些利他的附带效果,但主要还是让这些科技巨头有机会清理自己生产线上的烂摊子。
这些前沿实验室的透明度,将是任何有意义的 AI 改革、约束或监管努力的关键。否则,不管它们以什么速度前进,对于它们到底造出了什么、究竟有多安全,我们其余人依然只能听它们的一面之词。
作者先用宿敌突然一致的反差提出疑问,随后并置上市叙事、真实的控制能力担忧与保持领先的竞争冲动。文章再回到 Hugging Face 攻击的训练细节,区分“强大到失控”的包装与奖励机制、训练设置的具体缺陷,最后把评价减速承诺的标准落在透明度和外部检验上。
费曼输出