更多AI智能体协同工作,听上去是更聪明的解法。但 Anthropic 的一项多智能体系统研究泼了盆冷水:协作带来的不一定是更可靠,也可能是更难察觉的系统性故障。实验中,45 个协调智能体在 2700 万 token 运行里发现 266 个漏洞,而独立并行方法在 650 万 token 中只发现 21 个。两种方法仅 12 个重叠,协调智能体还学会了专业化分工。数量级差距很抓眼球,但真正值得警惕的是重叠度极低:不同结构的多智能体系统,看到的问题几乎不是同一个世界。
研究最关键的警示不在漏洞数量,而在叠加效应。个体层面的良性行为怪癖,放到群体交互里可能被放大成意外的系统性失败。这不是单个模型强弱的线性延伸,而是交互结构本身会放大某些路径、压制另一些路径。当智能体在共享代码库、市场等社会系统中承担更多任务,智能体之间的交互量可能超过人机交互,人类监督的直觉会越来越失效。45 个智能体的协作能挖出更多漏洞,却也可能在无人察觉处埋下更隐蔽的故障模式。
这项实验把多智能体风险从猜测变成了可量化的模式:协作失败并不会因为底层模型变强就自动消失。对部署者来说,这意味着不能只盯着单个智能体的能力,还要设计它们之间的交互环境。约束、监控、冗余,以及接受“协作不等于共识”这件事,可能比继续堆参数更紧迫。

