正在加载文章内容,请稍候。
正在加载文章内容,请稍候。
研究人员发现大型语言模型有一个根本性缺陷:它们无法可靠区分谁在下指令,因而极易被伪造“思路”或角色的文本欺骗。攻击者只需模仿模型内部的写作风格就能绕过防护,逼模型泄露被禁止的信息或执行危险建议。因为这一缺陷源自模型工作方式,本质上难以通过训练完全修复,带来重大安全风险。

精准输入
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可保存笔记、高亮、划线和批注。
大型语言模型依靠“角色”区分系统、用户、工具和自身思考中的文字,现有安全训练也以此为基础。但一项研究发现,模型识别角色时更相信文字风格而非标签;攻击者只要模仿某种角色的语气,就可能让模型误认指令来源。这个缺陷若无法由训练根除,关键系统就必须按“模型终将被攻破”来设计防线。

这项缺陷让人很容易诱骗模型去做不该做的事,例如告诉你如何破坏飞机导航系统。
一组研究人员本月在顶级 AI 会议国际机器学习大会(ICML)发表论文,主张大型语言模型的工作机制存在一个根本缺陷,因此不可能让它们完全免受黑客攻击。这一判断对技术安全影响巨大,因为大模型正被用于越来越多的场景,从政府和军事系统,到在线购物与医疗保健。
Free Trial
首次登录后可完整阅读 7 天;之后可联系作者开通阅读权限。