Claude Opus 5.5 (High) 在 Agent Arena 排名第 2 并重塑 Pareto 前沿

发布时间: 2026-09-29 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

榜单第二,价格却比自家上一代便宜将近一半。Arena 官方放出的新数据里,Claude Opus 5.5 (High) 在 Agent Arena 上拿到净改进分 +12.15%,坐稳第二,前面只剩 Fable 5.1 (Max)。真正有嚼头的不是名次,是名次旁边那行数字:中位价格每任务 $1.31,比 Opus 5 (High) 低 40%,比 Opus 5 (Max) 低 56%。分数往上走,账单往下走——这两件事同时发生,才值得拿出来说。

榜眼位置,和它旁边那张价签

12.15% 的净改进有多大分量

Agent Arena 的净改进分不是单一正确率,而是把任务完成度、过程质量、执行代价折进同一个口径之后的综合结果。在这个口径下拿到两位数的正增长,通常意味着换代级别的变化,而非一次参数微调。Opus 5.5 (High) 相对前代拉出 +12.15%,最关键的一点藏在后面:省下来的推理开销并没有换来能力倒退。便宜往往是有代价的,这一次代价似乎没出现在分数上。

第二名的位置也有讲究。它排在 Fable 5.1 (Max) 之后,而这份公布里没有给出两者的分差。Agent 类评测的方差本来就大,一步之差很可能落进噪声区间。把"第二"读成"差距明显",是过度解读;读成"同一梯队里的先后手",更接近实情。

1.31 美元,比排名更刺眼

中位数 1.31 美元的意思是:有一半的任务花得比这更少。单轮问答里这个数字毫无手感,可 agent 任务的成本结构完全是另一回事——一次任务可能包含几十次工具调用、好几轮自我纠错,以及若干段本可以避免的重复劳动。成本按次数乘上去,价格就成了能不能上线的开关。

顺手把另外两个价格反推出来:Opus 5 (High) 的中位成本约 $2.18,Opus 5 (Max) 约 $2.98。Opus 5.5 (High) 把这条线压到 $1.31。每任务省下八毛到一块六,看着不多,跑一万次够养一个人。所以盯着这行数字的通常不是研究员,是做预算的那位。

Steerability 拿了第一,比总分更有信息量

什么叫"可操控性"

它衡量的是指令的服从质量。你告诉模型别碰某个工具,它听不听;你要求换输出格式、换语气、换执行路径,它跟不跟得上;中途改需求,它会不会把前面半小时的工作整个推翻重来。这些在单轮任务里是锦上添花,在跑几十步的 agent 流程里却是主要故障源。模型并非不会做,而是做偏了还不回头,一路偏到底。

+14.50% 最后会落到谁的账上

产品团队的账本里,一个不可控的模型要配一堆护栏:输出校验、工具白名单、重试逻辑、人工兜底。这些开销不进 token 账单,进的是人力和延迟。可操控性往上抬一个台阶,等于把一部分工程防御变成模型的自觉,省下的是工程复杂度本身。对做长链路自动化的团队来说,这种提升的吸引力比多答对几道题大得多——毕竟答对一道题没人发奖金,少一次兜底能少加一个班。

同一个模型,High 和 Max 被切成两种商品

Opus 5.5 (High) 凭什么便宜四成

High 与 Max 的差别不在参数量,在推理预算:Max 会让模型想得更久、试更多路径、做更多自我检查,单位任务烧掉的 token 自然更多。Opus 5.5 (High) 比 Opus 5 的同档位便宜四成,说明省下来的是效率而不是能力——同样的活,用更少的思考完成。这个方向比"堆算力换分数"难得多,也值钱得多,因为它动的是分母。

推理预算正在变成定价档位

过去的定价逻辑看模型大小,现在看模型愿意想多久。这条线一旦确立,厂商就能把同一份权重拆成几个价位同时卖:高预算档去冲榜单,低预算档去抢采购。Opus 5.5 (High) 的处境正是如此——综合排名第二,成本端大幅让利,一套权重打出两套战绩。买家拿到的不是"降级版",而是同一个脑子配上不同的思考时长。

Agent 榜单开始算钱了

成本进了指标,说明市场换了阶段

评测机构把价格塞进核心指标,理由通常只有一个:客户在问。榜单过去回答"谁最强",现在要回答"谁用得划算"。这个转向和 agent 的落地节奏对得上——试点期看能力上限,铺开期看单位经济。当日调用量上到十万级,分数差一个百分点和成本差四成,哪个更影响决策,不用想。

便宜之后,比的会是什么

成本曲线压下来,瓶颈就换位置。接下来被追问的是可靠性:失败任务的分布长什么样,重试几次能收敛,尾部延迟有多长,出问题时能不能解释清楚。Steerability 排到第一,某种意义上就是这个方向的前哨——可控性直接决定故障能不能被定位、能不能被收敛。

还有一个榜单没回答的问题

$1.31 是中位数,而中位数天生掩盖尾部:最难的那批任务到底贵多少,失败重试的成本算不算进去,长任务的开销会不会指数级膨胀。对预算敏感的人来说,最坏情况比中位数重要得多。这块信息目前的榜单还没量化,可它恰恰决定了一套 agent 系统能不能真正跑在生产线而不是演示视频里。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 86

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线