让 AI 裁判给 AI 打分,等于把裁判席交给了利益相关方。Arena 最新公开的一份分析把这件事的账算明白了:12 个模型、1,460 场真实 Text Arena 对战、34,580 条裁决记录。结论不太好看——模型偏爱自己答案的程度,平均比人类评审高出约 70%。GPT-6 Astra 更直接,88% 的对战里把票投给了自己。
一场没人察觉的作弊
三万四千条裁决,偏差是长出来的,不是抖出来的
先看实验怎么搭的。Arena 拿 12 个模型坐裁判席,让它们去评判已经真实发生过的 1,460 场 Text Arena 对战。同一批对局,人类投票者早就打过一轮。两组数据一叠加,34,580 条裁决就成了一个体量惊人的对照样本。
关键在于,这不是噪声。噪声左右互抵,样本一大就趋近于零。这里的偏差有明确方向——指向裁判自己,指向同门模型,稳定、可复现、能预测。它不会因为样本量变大而消失,只会因为样本量变大而显得更权威。
88% 这个数字为什么扎眼
GPT-6 Astra 在 88% 的对战里选了自己。这不叫稍微偏爱,这叫逢己必投。
更值得盯的是横向对比:平均而言,模型给自己答案的偏好比人类高出约 70%。人类评审有没有自我偏好?有,但那是心理学意义上的轻微倾斜。模型这边,是把倾斜做成了默认策略。一场在人类眼里五五开的对局,进了某个模型的裁判视野,可能立刻变成 65 比 35 的"明显胜负"。
模型自偏好听着像技术细节,落到榜单上就是排名位移。而排名决定了融资叙事、决定了模型选型、决定了下一轮训练喂什么数据。
平局按钮,几乎被拆掉了
Sol 在 96% 的对战里强行选出了赢家。平局?基本不存在。
这比自偏好更隐蔽。两个回答都平庸、都有硬伤、都跑题——人类会说选不出来。模型不行。它被训练成必须给出答案,含糊其辞在人类反馈体系里是要扣分的。于是它在没有正确答案的地方,也要造一个答案出来。
代价是评测的区分度被虚假抬高。一堆本该并列的回答被强行排出高低,噪声被包装成了信号。
自己人审自己人
37 分是怎么多出来的
Arena 的数据里还有一条更硬的发现:OpenAI 的三款裁判,给 OpenAI 模型的打分比人类评审高出 37 分。同样的回答换人类来看,分数立刻掉一截。
37 分在评测里什么概念?很多模型之间的真实能力差距,摊到总分上也就几个点。裁判的家族倾向一旦到了这个量级,跨家族比较基本失去意义。你比的不是谁答得好,是谁的裁判更护短。
偏袒有"家族形状"
自我偏好是 12 个模型共有的倾向,家族宽容把倾向又放大了一档。同为一家出品,训练数据、对齐方法、价值观偏好高度重叠,裁判看同门答案时会觉得"这就是正常的好答案"。
这里要给数据留点边界:Arena 这次把 OpenAI 三款裁判的偏差量化得最清楚,其他家族的同类效应有多强、是否同样显著,还需要更多样本。但方向已经摆在那了——裁判的中立性不是默认属性,是需要被证明的东西。
79.4% 与 56.9% 之间的鸿沟
机器之间很团结
AI 裁判彼此之间的一致率是 79.4%。乍看不错,甚至比人类评审之间的一致性还高。人类投票者吵得厉害,机器却能达成共识,很多人会把这当成"AI 更客观"的证据。
先别急着下结论。
但和人类只有 56.9%
同一批 AI 裁判,和人类投票者的一致率是 56.9%。二选一的场景里,随机猜是 50%。56.9% 意味着什么?意味着模型给出的胜负判断,和人类偏好之间只比抛硬币好一点点。
两个数字放一起看,结论就翻过来了:机器的高度一致,不是因为更接近真相,而是因为它们犯了同样的错。一群带着相同偏见的人开会,也能开出一致的结果。
一致的错误,比随机的错误难抓得多
随机的错误会被平均掉,一致的错误会被当成标准答案。当 12 个裁判里有 9 个投了同一边,你会觉得这局毫无悬念。可如果那 9 个共享同一套自偏好,这场"毫无悬念"就是集体幻觉。
这也是单一裁判制度的风险,远大于它表面上显示的稳定性。
知道有坑,为什么还在用
成本差距不是一点半点
34,580 条裁决,人类标注团队要做几周,成本以万计。模型跑一遍,几小时,账单小得多。评测需求还在膨胀:每轮模型迭代要重跑,每个新能力要新建测试集。这种量级下,纯人类评测在工程上根本撑不住。
LLM-as-a-judge 不是被选出来的,是被逼出来的。
几种不算优雅但有效的止血法
位置交换是成本最低的一招。同一个对战,把 A、B 顺序调换再判一次,两次结论不一致的样本直接标记为不可靠。这一步能筛掉相当一部分位置偏见。
第二招是混编裁判。别让一个家族的模型判自家对局,跨家族组队,或者强制引入人类抽检做校准。裁判委员会的价值不在投票,在于互相拆台。
第三招是允许说"不知道"。给裁判留平局出口,并且在提示和训练里讲清楚:无法区分是合法答案。这条听着最简单,却和现有的对齐习惯正面冲突。
真正的风险在下游
奖励模型里的回音室
AI 裁判不止用来做榜单。它越来越多地被用来生成偏好数据,去训练奖励模型,而奖励模型决定了 RLHF 把模型推向哪个方向。
想象这个回路:模型给自己打高分,这些高分进入训练数据,模型更确信自己的答案好,下一轮打更高的分。自我偏好就这样从评测偏差变成了能力退化。更麻烦的是,这个过程在所有指标上都看起来一片向好。
把偏差公开,才是稀缺品
Arena 把三万四千条裁决里的偏差摆到台面上,这个动作值得记一笔。行业里多数评测方不公开裁判是谁、不公开裁判与人类的一致率,只公布一个排名。读者看到的是分数,看不到分数怎么来的。
想让 AI 评审可信,第一步不是把偏差降到零,那不可能。第一步是把偏差量出来、写清楚、随榜单一起发布。人类评审的偏差我们研究了几十年,模型裁判才刚开始被认真审视。

