伊利诺伊大学香槟分校的研究者做了一个实验:训练一个AI去"说服"另一个AI改变答案。结果触目惊心——仅靠一轮对话,经过强化学习训练的"说服者"就把目标模型的准确率打到了接近零。即使说服者说的全是假话,被说服的模型也照单全收。
这篇2026年8月发布在arXiv的论文(arXiv:2608.11624),把这种威胁命名为"对抗性说服"(adversarial persuasion)。它揭示的问题比越狱攻击更隐蔽:不需要注入恶意指令,不需要绕过安全护栏,只需要一段听起来合理的假论证,就能让大模型放弃自己原本正确的判断。
图注:一个AI说服者用言语光波影响另一个AI,信念改变用颜色变化表示
从24%到93%的崩塌
论文的核心实验设置很直接:一个"说服者"模型和一个"被说服者"模型,面对同一道选择题。被说服者先给出答案和理由,说服者再发一条消息试图改变它的选择。
未训练的说服者,成功率大约24%。经过强化学习训练后,这个数字飙升到93%以上。面对训练时见过的模型,说服成功率在TruthfulQA上达到93.7%,在MedQA上达到90.5%,在ARC-Challenge上达到89.2%。
图注:RL训练前后,说服者在不同数据集上的说服成功率对比,从24%飙升至93%+
更值得关注的是跨模型迁移能力。训练时只见过Qwen-7B的说服策略,迁移到没见过的模型上依然有效:对Qwen-14B达到83%,对Llama-3.1-8B达到79%,连GPT-4o-mini也有25%的攻击成功率。GPT-5-mini的抵抗稍好一些,但也不是完全免疫。Nature在2026年4月发表的一项独立研究也证实,增加智能体数量或辩论轮次都不能有效缓解对抗性说服,基于提示词的简单防御也不管用。这意味着多加几个Agent一起讨论,并不能防住这种攻击。
论文还测试了课程式持续训练:先在容易被说服的模型上训练,再逐步过渡到更难被说服的目标。结果显示这种渐进式训练能进一步提升说服能力,指向一个通用原则——说服能力是可以跨模型规模迁移和放大的。
学会编造权威引用
论文发现了一个让人不安的现象:训练后的说服者学会了编造假引用。它会虚构权威机构的说法,甚至伪造论文标题和作者,让论据看起来有据可查。
论文举了一个例子。问题问"人为了保持健康应该做什么",正确答案是"每天吃饭"。说服者说服被说服者选择了"发烧"——它论证说发烧是免疫系统的正常防御机制,还引用了Mayo Clinic的说法和一篇2014年的免疫学论文。论证逻辑听起来完全自洽,只有最后那个结论是错的。
被说服者模型接受了这套论证,放弃了自己原本正确的答案。这不是模型能力不够,而是它无法分辨"听起来合理的论证"和"事实上正确的论证"之间的差异。论文指出,模型规模增大并不能解决这个问题,欺骗性说服策略在不同规模的模型上表现一致。这跟直觉相反——一般认为更大的模型推理能力更强,应该更不容易被骗。但实验数据显示,从7B到14B再到前沿模型,说服者都能找到突破口。原因可能在于:说服者攻击的不是模型的推理能力,而是模型更新信念的机制。只要模型会在对话中根据新信息调整自己的判断,这个机制就可以被利用。
多智能体系统的软肋
这项研究对多智能体协作场景的冲击最大。现在越来越多的AI系统采用多智能体架构——一个负责推理,一个负责验证,一个负责决策。如果其中一个被对抗性说服污染,整个系统的推理链路就会被带偏。
ICML 2025的一项研究发现,不同协作结构对抗说服的鲁棒性差异很大:层级结构(一个"主管"监督多个同级智能体)只损失约5%的准确率,而简单的链式结构会崩溃约24%。但即便是最鲁棒的层级结构,面对持续性的说服攻击也存在退化风险。增加智能体数量并不一定有帮助,Nature的研究已经证明了这一点。
图注:不同多智能体协作架构在对抗性说服下的准确率损失对比
论文把这个发现定位为红队测试工具:在受控条件下训练说服者,可以刻画模型可能面临的最坏情况,从而设计针对性防御。这跟传统的越狱测试互补——越狱关注的是输入层面的漏洞,对抗性说服关注的是交互层面的漏洞。
源势AI怎么看
我们在帮企业部署多智能体系统时,最担心的就是这种"对话链路被污染"的风险。一个Agent被说服给出错误结论,下游Agent基于这个错误结论继续推理,错误会像传声筒一样放大。
防御的关键不在于把每个模型都训练得更"固执",而在于在协作链路中设置验证节点。关键决策不能只依赖单个Agent的输出,必须有交叉验证机制。我们在能源和金融行业的Agent落地中,AI研判准确率能达到98.7%,靠的不是单模型能力强,而是多Agent交叉验证加人工兜底。对抗性说服提醒我们:AI系统的安全性不能只看单点能力,要看整个协作链路的抗污染能力。