Arena 把 OpenAI 的 GPT-6 Sol (Max) 放进了 Agent Arena,成绩单不花哨:排名第六,净改进 +7.7%,单任务中位成本 0.75 美元,样本是四千多场真实智能体会话。后一个数字比排名有意思得多。
先说成本。0.75 美元的中位价,意味着一个中等复杂度的任务跑完,账单不到一杯便利店咖啡。在智能体这个还靠"一次尝试烧掉多少 token"衡量勇气的阶段,Arena 把成本与得分并排摆出来,本身就是一种态度——只盯榜单排名,会漏掉一半故事。第六名当然不是榜首,但如果前五名的单任务开销是它的三倍,那这个第六名的含金量就完全是另一回事。榜单没替你做这个判断,它只是把两个数放在一起,剩下的交给掏钱的人自己算。
再说样本。四千多场真实会话,不是实验室里那套固定题集。智能体评测长期的尴尬在于公开基准和真实工作负载之间隔着一层雾:跑分漂亮,一上生产就露馅。真实会话的分布脏、乱、长尾重,能在这里拿到 +7.7% 的净改进,至少说明优化方向没跑偏。当然,"净改进"具体怎么拆——是完成率抬了,还是重试和返工少了——直接决定这 7.7% 值多少钱。这个问题 Arena 没答,OpenAI 大概也不会主动答。

