AI智能体的下一次崩溃,不会发生在单次推理里,而会发生在它们彼此协作的缝隙中。当智能体开始进入共享代码库、交易市场这类社会系统,智能体协作的交互量将迅速超过人机交互。Anthropic 最近一组实验给出了残酷的量化对比:协调式智能体群在 2700 万 token 的运行中发现 266 个漏洞,而独立并行方法只发现 21 个。差距不是几倍,是十几倍。
但别急着把独立并行方案扔进垃圾桶。实验同样显示,两种方法互补性明显。独立并行速度快、干扰少,适合粗筛;协调式群体能共享上下文、交叉验证,适合深挖。更有价值的是,Anthropic 把价格串谋、任务冲突、信息共享失败这些原本难以观测的协作故障,变成了可度量案例。这戳中了一个此前很少被量化的盲区:多智能体系统的问题,往往不在模型智商,而在协调层的脆弱。智能体调用工具已经越来越熟练,但一旦进入长期协作,误解、抢任务、沉默式失败会像齿轮里的沙子一样冒出来。
这意味着,多智能体协作不是继续给单个模型加参数就能解决的事。它需要新的协调协议、冲突检测和失败隔离机制。忽视这一层,企业把智能体扔进生产环境,堆得越多,踩坑越快。真正难的不是造一个更聪明的智能体,而是让一群不太完美的智能体把事办成。

