Arena 更新了 Agent Arena 榜单,OpenAI 的 GPT-6.1 Sol (Max) 拿下第五,成绩提升 11.23%,中位任务成本 0.56 美元。三个数字,一句话说完。但真正值得琢磨的不是名次,是 Arena 用了"重塑 Pareto 前沿"这个说法——在评测圈,这几乎等于宣告:旧的那条性价比曲线,作废了。
第五名,有时候比第一名更有信息量
+11.23% 在 Agent 榜单上意味着什么
Agent Arena 这类评测里,头部选手的分数通常挤成一团,一两个百分点就能换两三个名次。11.23% 的跃升,等于一步跨过一整段能力台阶。更关键的是计分方式:Agent 任务和单轮问答完全不是一回事。模型要拆解目标、挑工具、读返回值、判断该不该重试、最后交出可验收的结果。这条链上任何一环断掉,整个任务就是零分。所以这类提升很少来自"模型突然变聪明",多半来自失败率被压下去了——它少犯了几次低级错误,分数自然就上来。
0.56 美元的中位成本,比它看起来更有分量
中位数是个被严重低估的指标。平均数会被几个跑了几十美元的超长任务拉偏,中位数告诉你的是:一半的任务,花的钱不到这个数。0.56 美元,一次完整的多步 Agent 执行,低于大多数城市一杯咖啡的价格。这个量级一旦成立,采购讨论的性质就变了。以前的问题是"这条流程值不值得上 AI",现在的问题变成"为什么还不上"。
Pareto 前沿被"重画",是句重话
Pareto 前沿描述的是一条边界:站在边界上,你想在某个维度变好,就必须在另一个维度让步。榜单上大部分模型活在这条线内侧——要便宜就得忍受更低的成功率,要成功率就得掏更多钱。有模型把这条线往外推,意味着同样一美元能买到的能力上限抬高了。Arena 说的"重塑",指的是线的形状变了,而不是某个单点分数变高了。这两者的区别,决定了它是新闻,还是历史。
便宜和划算之间,隔着一整个工程现实
单次成本从来不是账单上的那个数
0.56 美元一次,听起来很干净。企业算的是另一本账。失败任务的重试、人工兜底、结果复核、轨迹日志、评测基建——这些都不进榜单,但都进预算表。一个便宜但成功率偏低的 Agent,实际单位成本很可能高于贵三倍却一次做对的对手。榜单给你的是分子,分母得你自己填,而分母往往才是决定项目生死的那部分。
只看中位数,会漏掉尾部
榜单给中位数,不给分布。可真实部署里,体验恰恰由尾部决定。设想两个 Agent:A 有 95% 的任务花 0.2 美元、5% 花 8 美元;B 稳定在 0.56 美元。中位数上 A 更便宜,但 A 需要预算弹性、需要限流、需要有人盯着异常任务跑飞。B 可以按人头直接摊进部门成本。选哪个,取决于你的财务结构和运维能力,不取决于榜单。
同样的钱,买到的稳定性未必一样
Agent 的隐性开销里,最贵的是"不确定性"。一个成本波动大的模型,会逼着团队做两件事:写重试逻辑,和养一套人工兜底流程。这两样东西的开发和维护成本,通常远超模型调用费本身。所以当一款模型把中位成本压到 0.56 美元、同时把成绩拉高 11 个百分点,它真正卖的其实是"可预测性"。这在企业内部推 Agent 落地时,比多几个点的准确率值钱得多。
看榜的方式,也该跟着改
从"谁最强"挪到"这个价位谁最强"
榜单前几名长期被同一批名字占着,边际信息量越来越低——反正你知道它们都很强。真正有决策价值的,是特定预算下的最优解。0.5 美元档谁最能打,2 美元档谁最能打,这种切法比总排名有用,因为它直接对应采购预算线。GPT-6.1 Sol (Max) 排第五这件事,本身不重要;重要的是它站在 0.56 美元这个位置上排第五。
(Max) 这个后缀,本身就是个信号
同一个底座模型,挂上 (Max) 之后名次和成本都会动。这说明"模型能力"越来越不是一个固定值,而是调用方式的函数:思考预算给多少、工具集开多大、允许多少轮自我修正。评测对象正在从"模型"漂移到"配置"。对企业来说这反而是好消息——同一个模型可以按任务难度分层配置,最贵的那档只留给真正难的活,日常任务走轻量配置。
下一次更新,盯三个数就够
第一,排名稳不稳。单次跃升可能是版本红利,连续两三次才叫能力。第二,成本会不会反弹。能力上去了价格往往跟着上去,如果 0.56 美元能守住两三个版本,那才是真正的信号。第三,前沿往哪个方向移——往更便宜移,说明它在抢下沉市场;往更强移,说明它要正面硬刚高端。这三种走向对应完全不同的采购策略,也对应完全不同的竞争格局。榜单每更新一次,行业就多一次重新洗牌的机会窗口,而 0.56 美元这个数字,已经把窗口推开了一条缝。

