旗舰和中端只差 2 分的时候,定价表就先慌了。Anthropic 把 Claude Sonnet 5.5 摆上台面,Artificial Analysis Intelligence Index 给了它 56 分——同一套评测口径下,Opus 5.5 在 max effort 下拉出的成绩是 58 分。那个贵出一大截的顶级型号,眼下只领先两个身位。更扎眼的是另一半数据:在 max effort 设置下,Sonnet 5.5 比上一代 Sonnet 5 高出了整整 18 分。
两个身位的领先,撑不起一条产品线
2 分在统计上不算小,在商业上很小
Artificial Analysis 的综合指数不是单一跑分,它把推理、代码、数学、智能体任务等多个维度的结果汇总成一个可比的数字。在这个量级上,2 分当然不是噪声——它通常对应着某一类任务上肉眼可见的差距。但问题在于,这 2 分要换来的是价格、延迟和调用成本上的一整档跨越。当分差落在个位数、价差落在倍数级,采购决策的天平会往哪边倒,其实不难猜。
这把尺子真正在量什么
很多人只看那个总分,忽略了 Artificial Analysis 同时记录的另一组数字:完成同样的任务消耗多少 token、折合多少美元、跑了多长时间。对一个要把模型塞进生产环境的团队来说,这组数字比总分更接近真相。一个 56 分的模型如果只花掉旗舰三分之一的开销,它在真实业务里的“智力性价比”就不是 56 比 58,而是接近三倍。榜单排的是能力,账本算的是兑换率,两件事从来不是一回事。
18 分的跳升说明什么
从 Sonnet 5 到 Sonnet 5.5,在 max effort 下多出 18 分,这个幅度放在半代升级里相当激进。它可能来自更强的基座,也可能来自推理链路上更有效的扩展策略,或者两者叠加。但有一点值得注意:这 18 分是挂在“max effort”这个前提下的。换句话说,提升被锁在了一个高算力档位里,而不是默认就能拿到的白送能力。这个细节后面还会咬人。
Anthropic 在挤压自己的产品线
Opus 剩下的护城河有多宽
Opus 一直是那条“不计成本也要最强”的产品线,卖的就是绝对能力的上限。当 Sonnet 5.5 把差距压到 2 分,Opus 的定价就必须回答一个新问题:多花的钱到底买到了什么。答案可能是更复杂任务上的稳定性、长上下文里的持续一致性、或者是那些综合指数测不出来的边缘场景表现——都是真实存在的价值,但都很难写进采购提案的第一页。中端型号向上顶,旗舰型号就必须给出更明确的理由,否则它就从“默认选择”退化成“特殊场景备选”。
max effort 不是免费的午餐
那个 18 分的跃升有个容易被忽略的代价。max effort 意味着模型在回答前展开更长的思考、生成更多的中间 token,延迟和成本都会跟着抬上去。所以真正该问的不是“Sonnet 5.5 到底有多强”,而是“在什么档位下它有多强”。如果满分成绩只在 max effort 下出现,那它对应的其实是一个更贵的虚拟型号。厂商喜欢把最好看的数字放在标题里,工程师得自己去翻设置项。
开发者用脚投票的速度比榜单快
榜单发布是一天的事,模型迁移是几个月的事。当一个更便宜的型号在常用任务上做到接近旗舰的效果,团队会先在小流量上试,再逐步放大,最后把旗舰留在少数几个关键调用上。这个过程不需要谁宣布什么,它是从成本报表里自然长出来的。Anthropic 应该清楚这一点:Sonnet 卖得越好,Opus 的调用占比就越难看,而这两条线最后都进同一张收入表。
分数之外,还有几件事没被量出来
推理预算成了新的规格参数
过去挑模型看参数规模、看跑分、看价格。现在得先看 effort 设置——同一张权重,低档和高档之间可能隔着十几分。这等于把一部分能力控制权交回给了调用方:你愿意为每个请求多烧多少算力,就换回多少分数。这种“可调智力”的设计有利有弊,好处是能按任务分层,坏处是所有横向比较都得多加一行前提。以后看到任何一个跑分,第一反应应该是问:这是在哪个档位下测的。
竞争对手会怎么接
中端逼近旗舰,不只发生在 Anthropic 一家。整个行业的成本曲线都在往下压,半年前需要旗舰才算得动的任务,现在中端型号已经能吃下。这意味着下一次发布季,大家的叙事会从“我们的旗舰有多强”转向“我们的中端有多便宜地接近旗舰”。谁先在性价比上做出可验证的优势,谁就能拿到那些对价格最敏感、又体量最大的客户。Anthropic 这次等于主动把战场推到了这个位置。
没人测的那部分
综合指数测的是可标准化的任务。它测不出模型在被反复追问时会不会崩、在多轮工具调用里会不会丢状态、在模糊指令下是追问还是硬猜。这些恰恰是生产环境里最容易出事故的地方,也是旗舰型号至今仍被保留的原因之一。2 分的差距可能真的不重要,但在那 2 分背后藏着的失败模式差异,值得每个准备迁移的团队自己跑一遍回归测试。榜单给你一个起点,你自己的流量给你答案。
Sonnet 5.5 的 56 分不是终点,它是一个信号:中端和旗舰之间那条曾经清晰的分界线,正在被推理预算和单位成本重新画一遍。真正的问题从来不是谁比谁高几分,而是每一分能力,你愿意付多少钱。

