58 分。Artificial Analysis 给出的这个数字,把 Claude Opus 5.5 送上了 Intelligence Index 榜首,也是这家第三方评测机构至今测到的最高分。同一份结果里还压着两条对掏钱的人更实在的信息:Terminal-Bench 4.0 上,它和 GPT-6 Astra 打成 59.6% 的平手;官方定价下调 20%,完成同等任务的成本比 Opus 5 压低了 40%。登顶、咬死、跳水,三件事同时发生,得拆开看。
榜首这个位置,坐得稳吗
58 分是怎么被算出来的
Artificial Analysis Intelligence Index 是一把综合尺子。它把散落在推理、知识、编程、数学等一批基准上的结果,折算成一个可以横向比较的单一分数。这种做法的价值很朴素——当十几个榜单各说各话时,你总得有个地方先看一眼,决定先试哪个模型。
代价也很明显:综合分会抹平细节。一个模型在长链推理上强得离谱、在代码上只是中游,折算完可能就是 58 分里那几个小数点后的差别。榜单解决的问题是"从哪里开始",不解决"到底聪不聪明"。
真正的看点,在那 0.0 的差距上
Terminal-Bench 4.0 测的不是问答,是在终端环境里连续执行多步操作。装依赖、看日志、改配置、跑测试、根据报错回头改——这类任务没有标准答案,只有"跑通了"和"卡住了"。Claude Opus 5.5 拿到 59.6%,GPT-6 Astra 也是 59.6%。
分数完全重合,说明两家的能力包络在前沿位置上已经高度重叠。对使用者而言,这是好消息:切换成本在下降。以前换模型意味着重写提示词、重新调参、重新建立信任;现在两个头部选手在同一档位,迁移的摩擦小得多。竞争的重心自然会滑向价格、延迟、上下文长度、工具生态——那些跑分不太体现的地方。
别把榜单当成能力本身
任何单一分数都有边界。题目是否被训练数据污染、提示词怎么写、单次运行还是多次取平均、评测方有没有公开方法论,这些都会左右最终结果。Artificial Analysis 的可取之处在于流程相对透明、结果可复现,但透明不等于全面。
更现实的一点是:公开基准上的高分和你在自己业务里的体感,经常对不上。你的任务分布、你的工具链、你的容错要求,才是最终裁判。
降价 20%,账本的另一面
标价和实账,压根不是一回事
官方价格下调 20%,这是挂牌价。成本降低 40%,这是实账。两个数字差了一倍,差额藏在执行细节里:输出 token 的数量、缓存命中的比例、工具调用的往返次数、失败重试的浪费率。
推理效率的改进往往比标价更能省钱。同样一个问题,模型如果少绕两步、少输出一段没用的解释、少调用一次工具,账单就会明显不一样。Anthropic 报出 40% 这个数字,说明优化发生在推理链路内部,而不是单纯把每百万 token 的单价砍一刀。
Agent 把成本问题放大了十倍
聊天场景里,一次对话几千 token 就结束了。Agent 场景完全不同:跑一个任务,模型要读文件、调工具、看返回、再决策,一轮下来几十万 token 很常见。这种量级下,单价的小数点变化会被放大成真金白银。
更要命的是失败成本。一次成功的 agent 运行很便宜,一次失败的运行可能烧掉同样的钱,还什么都不产出。所以评估模型时真正该问的问题是:完成这个任务平均要花多少 token,成功率是多少,失败后的重试代价有多大。这三个数乘起来,才是实际的单位成本。
便宜不会自动省钱
单价低的模型如果在多步任务里频繁跑偏,重试几轮下来总账反而更贵。这也是为什么"成本效率"正在取代"调用价格"成为采购讨论的核心词汇——前者包含了完成率,后者只反映计费表。
终端里的那场考试,才是硬仗
Terminal-Bench 到底在考什么
它把模型丢进一个真实的命令行环境,给一个目标,看它能不能自己走完。中途会遇到报错、遇到路径不对、遇到依赖冲突,模型得自己判断哪里出了问题,然后动手修。这已经不是在考"知不知道",是在考"能不能撑住"。
长上下文管理、工具调用的准确性、错误恢复策略、对当前状态的跟踪——任何一环掉链子,任务就停在那里。59.6% 的意思是,大约每十个任务里有六个能完整跑通。剩下的四个,卡点各不相同。
失败往往不是智力问题
观察终端类任务的表现,失败模式高度集中:模型在某一步做了合理但错误的假设,之后的所有动作都建立在这个假设上,越走越偏。或者它清楚问题在哪,却没有回头修改的意愿,硬着头皮往下推。
这类毛病不会出现在单轮问答的评分里,却直接决定了 agent 能不能真正交付工作。Claude Opus 5.5 和 GPT-6 Astra 在这个维度上打平,说明两家都摸到了同一堵墙——剩下的差距,靠堆参数堆不上去。
从对话框搬进终端
过去两年,模型的战场在聊天窗口;接下来两年,战场在 shell、在 IDE、在 CI 流水线里。这些地方的共同点是:用户不看过程,只看结果。跑通了就是跑通了,没跑通,解释得再漂亮也没用。
这个转变对模型厂商的要求完全不同。回答得好已经不够,得在没人监督的情况下连续做对十几个决定。降价 20% 也好,指数登顶也好,最终都要落到"它能不能在无人值守的情况下把活干完"这一个问题上。
这一轮,谁最难受
被夹在中间的梯队
头部两家在能力上贴得这么近,价格又同时往下走,最直接的压力落在中间层。比头部差一档、价格却没有明显优势的模型,处境会变得尴尬——用户要么加钱上头部,要么省钱用更便宜的开源方案,中间那块地不好守。
采购方的牌变多了
一年前,选模型有点像押注:选错了要付迁移成本。现在情况变了。两家头部能力重叠、价格可谈、迁移摩擦下降,采购方第一次真正拥有了议价空间。多模型并行、按任务分流的架构也从"架构洁癖"变成了实际可行的省钱手段。
所以别急着用榜单第一名做决定。拿你自己的任务集跑一遍,把成功率、token 消耗、失败重试的代价都记下来,算出一个属于你的数字。那份结果,比 58 分更接近真相。

