第八名。Gemini 4 Argon 在 Agent Arena 上第一次亮相,排在第 8 位,净提升 +7.92%,每任务成本 0.62 美元。单看名次,这算不上什么大新闻;但把三个数字摆在一起,味道就变了——它讲的不是「最强模型」的故事,而是「一美元能买到多少智能增量」的故事。
后者才是 Agent 竞赛接下来的主战场。顺带记住一个细节:这次上榜的是 Argon 的 High 档,也就是推理预算拉满的那一版。这个前提决定了这份成绩该怎么读。
数字比名次更值得琢磨
+7.92% 量的是增量,不是上限
Agent Arena 里「净提升」这个说法容易让人误读成绝对能力。它衡量的其实是相对某个起点的改善幅度:一个任务交出去,Agent 最终交付的状态比初始状态好了多少。+7.92% 意味着在多数任务里,Argon High 确实把局面往正确方向推了一截,而不是原地打转,更不是越搞越乱。
这个指标的好处是抗刷分。传统评测里,模型在训练集边缘蹭几道题就能把分数拱上去;Agent 场景链条长、状态多、中间步骤互相牵连,靠背诵几乎不可能通关。坏处也直白:分母怎么定、基线从哪算,不同口径下的数字根本不能横着比。看到 +7.92%,第一反应应该是问「基线是什么」,而不是「比谁强多少」。
0.62 美元,一单生意的成本底线
真正卡住 Agent 落地的,从来不是能力天花板,是账单。一个任务跑完,要调多少次模型、检索多少轮、失败重试几次,每一步都在烧钱。0.62 美元换算成业务语言是这样的:一家公司每天跑一万个 Agent 任务,日成本 6200 美元,一年 220 万美元。这时候每压下去 0.1 美元,省的是真金白银,比多两三个百分点的准确率实在得多。
而且 High 档能压到 0.62,说明单位推理效率上有东西。同一条任务,有的模型要把上下文翻来覆去嚼上七八遍,有的两三遍就收工——能力差距有时候就藏在这里,只是它不写在分数上,写在发票上。
榜单的算法,正在悄悄换一套
从「答对没有」到「办成没有」
过去几年评测的默认前提是:模型是个答题机器。给输入、出答案,对错由标准答案裁决,干脆利落。Agent 把这条链子拉长了——它要读文件、调接口、写代码、失败之后重试,最后交付一个真实的状态改变。评测的难点随之从「判断答案对不对」变成「判断这件事办成没有」,而后者的自动判定本身就是一道硬题。
Arena 这类平台的取舍很清楚:把任务做成可复现的环境,让 Agent 在里面真的干活,再从净提升、成本、成功率几个切面去看。这套做法不完美,但比让模型做一百道选择题更接近现实。所以第八名放在这个坐标系里,含金量比放在选择题榜单里的第八名高出一截。
High 档是加分项,也是成本陷阱
Argon High 这个后缀得单独说。推理强度拉高,模型想得更久、试得更多,分数通常更好看——但每一次「想得更久」都对应着 token 账单。同一家模型放 High 和 Low 两档,排名可能差好几个位次,成本能差出两三倍。
所以采购方真正该问的不是「你排第几」,而是「你在什么档位上排第几」。一个在 Low 档拿到第 8 的模型,价值可能高于在 High 档拿到第 5 的模型——前提是任务量足够大。厂商公布跑分默认用最漂亮的那一档,这是行业惯例,读榜的人得自己把这个折扣补回去。
第八名的位置,微妙但有用
第一名和第二名之间,往往只隔几周时间;第八名和第二名之间,隔的是「能不能上生产」。排在头部意味着聚光灯和预算都盯着你,也意味着任何一次版本回退都会被放大成事故。第八名反而舒服:性能足够进候选名单,价格还没被头部溢价吃掉,工程团队乐意拿它开灰度。
对 Gemini 这条产品线来说,Argon 更像是把「能用」这件事做实的一步,而不是冲榜的一步。这种定位在商业上通常更健康——榜单是用来被超越的,生产系统是用来被续约的。
谁会认真读这张榜
采购方只算一道应用题
现在跟 CTO 汇报 Agent 选型,最没说服力的说法是「它在某某榜排第二」。有说服力的说法是:拿我们自己那 50 个典型任务跑一遍,单次成本多少、成功率多少、失败的时候能不能重试捞回来。净提升 +7.92% 和 0.62 美元之所以值得看,正因为它们恰好对应这道应用题里的两个变量。
公开榜单的价值就在这里:它不替你做决策,但能把候选范围从三十个压到五个。剩下的活儿,只能自己跑。
模型团队盯的是异常点
做模型的人看榜单,眼睛不会停在名次上,会停在反常的地方:哪一类任务净提升明显偏低,哪一类任务成本突然飙高。Agent 的失败往往是有结构的——多轮工具调用的稳定性、长上下文里的记忆保持、出错之后的恢复策略,这些问题在不同任务类型上暴露程度差别很大。榜单只给一个总分,附带的细分数据才是下一版迭代的输入。
写应用的人,终于肯谈钱了
对真正要写 Agent 应用的人来说,这份排名最大的价值,是它把成本摆上了台面。过去两年我们习惯只按「能力」给模型排队,把账单当成尾部的意外。如今 0.62 美元直接印在排行榜上,等于整个行业公开承认了一件事:Agent 的经济性,和能力一样重要。
第八名不是终点,甚至不太像起点。它更像一次公开的定价声明。

