AI大模型的评测已经多到让人头晕。LMSYS Arena、HumanEval、各类学术基准——榜单互不相让,同一个模型在不同地方的排名能差出几十位。把一堆含金量悬殊的分数直接揉在一起求平均,等于混淆了不同赛道的胜负分量。LatentRank这个新上线的聚合排行榜,从第一天就没走这条偷懒的老路。
它把问题彻底转了个向。开发者没用简单算术,而是引入了一个Bradley-Terry模型,将各家评测视为多个独立的“比赛”,把每个榜单上的位次重新解构成两两成对比较的结果。更狠的一步是加上了先验限制:对于那些在某些评测中只露过一两次面、样本量严重不足的模型,算法会主动给它一个保守的先验估计,不让小样本带来的极端分扯歪全局排名。这样的处理,让你的每一次“模型领先”背后都有概率意义,而不是碰运气的数字游戏。
作者总共花了54小时,把若干家公信力靠得住的榜单喂进这套框架,做成了一个完全免费开放的综合榜单。最终排出的前五里,Opus 5压过此前在多个单一榜上光芒四射的Fable 5,挤进第一梯队。这背后不是偶然换座,而是不同评估维度在用统计方法投票——一个更加立体的模型能力画像终于开始浮现。对那些看腻了孤证式排行的从业者来说,总算多了个值得一比的参照系。

