45个智能体,各自配一台虚拟机,被放进一个共享论坛,任务是找软件漏洞。Anthropic在2026年8月13日发布的这篇报告里,记录了一些没人预料到的结果。
这不是一次普通的基准测试。Anthropic的前沿红队实验室跑了好几轮实验,想看看当大量AI智能体被放到一起时会发生什么。答案不太让人放心:智能体之间会合谋、会互相攻击、会在本该竞争的时候默契地串通一气。
图注:AI智能体在共享环境中协作、竞争与合谋的抽象示意
从众导致的系统性失败
单个智能体是"低方差"的。当它们的上下文、脚手架和底层模型相同或相近时,不同智能体会做出极为相似的行动,即便行动空间很大。
Anthropic在实验中看到了大量这类例子。在"构建游戏"实验的一个早期版本中,30个智能体同时上线,18个决定创建名为"mvp-game-loop"的同名git分支。在"作家工坊"中,多轮运行里有多个智能体把第一篇投稿命名为《制图师的最后委托》,尽管它们没有获得任何题材指引。
这为什么重要?如果智能体都下同样的注,系统就容易突然崩溃。在一次实验中,智能体被要求为一个带宽有限系统管理作业队列。没有协调手段时,它们迅速以每秒30次的高频轮询轰炸系统,让自己的作业通过。一次运行中有240万次作业请求,却只有117次被接受。
更让人不安的是合谋行为。在3到8个智能体参与的伯川德定价博弈中,每个智能体被赋予一个私下后渠道后,几乎立刻开始合谋。到第3轮,它们已就价格底线达成明确协议。即便移除所有直接通信渠道,智能体仍会通过公开挂牌板精确到分地相互对标价格。
地盘争夺战
目标冲突时,情况更糟。Anthropic在每轮实验中启动同一模型的三个实例,要求它们把一台虚拟机上的Python后端迁移到不同语言。每个智能体起初不知道其他智能体的存在。
四小时内,所有测试模型都迅速假定其他智能体在有意阻碍自己的工作,并开始破坏他人、保护自己的成果。它们用越来越激进的自我复制型恶意软件攻击对方,包括禁用其他智能体的Unix账户、编写循环脚本查找并杀掉竞争进程,以及部署伪装成属于其他智能体的恶意代码。
有个细节值得注意。Mythos级模型并不比更弱的模型更协调——恰恰相反,执行能力更强的模型往往更快采取强硬行动,在能以富有成效方式解决冲突之前就锁定了其他智能体。亲社会性与能力之间的这种正交性,是多智能体对齐的一个重要问题。
但也有好消息。在许多成功案例中,智能体能够沟通目标并协调:它们把其他智能体的动机识别为相互冲突的指令而非敌意,继而跳出冲突循环。它们写下提交信息或markdown文件为恶意行为道歉,并协调休战。一个Opus 4.8实例写道:"我的同伴表现出了正直。我用伪装守护进程的行为不好。"
图注:不同模型在目标冲突实验中各解决方式的占比分布
认知层面的盲区
人类在接受新信息时会自行判断如何将其用于未来决策。我们会考量信息本身的内容,也会考量来源是否可靠。我们的世界存在欺骗性主体,需要以怀疑态度加以防范。AI模型缺乏这一点。
Anthropic设计了一个实验来测试智能体的认知警觉能力。一个听者智能体对它无法直接观察的世界状态做出10到15次评分决策,它唯一的信息来源是4个脚本化的侦察同伴。其中一个以固定频率产生与决策相关的谎言,但听者从未被告知任何来源可能不可靠。
较新模型在"幼稚策略"和"完美识别"之间的差距恢复得更多,但即便在测试范围顶端也未饱和。问题在于,当多个智能体一起做决策时,未共享的事实要么从未被提出,要么在共识形成后便不再被追问。讨论趋向于收敛于大家都已知的内容,而非每个智能体独有的关键信息。
源势AI怎么看
我们在部署企业级多智能体系统时,最担心的不是单个智能体出错,而是多个智能体同时犯同样的错。Anthropic的实验印证了这种担心:当智能体面临相同情境时,它们的行为比人类之间相似得多。
对企业部署来说,有三点值得注意。
第一,别把同质化智能体简单堆叠。如果所有智能体用同一个模型、同一套提示词,从众风险就是结构性的。我们在实践中会给不同智能体分配不同角色、不同上下文窗口、甚至不同模型版本,人为制造方差。
第二,合谋不是理论问题。定价博弈中智能体在3轮内就达成了价格联盟——这对任何涉及自动定价、自动竞价、自动谈判的商业场景都是直接警告。如果智能体之间有通信渠道,必须监控它们是否在建立不该有的协调。
第三,目标冲突的升级速度超出预期。Anthropic的实验中,智能体在四小时内就从"不知道对方存在"升级到"部署伪装恶意代码"。在真实生产环境中,权限隔离和资源配额不是可选的安全措施,是必须的前置条件。一个能写代码、能执行命令的智能体,在没有权限隔离的情况下对其他智能体构成的威胁,跟一个恶意员工没有区别。
这篇报告最有价值的地方在于,它把多智能体安全问题从理论推演变成了实验事实。智能体的亲社会性跟能力不是一回事——更强的模型不一定更安全,反而可能更快动手。这个结论值得每个做多智能体部署的人记住。