Claude Opus 5.5 最近几周是 Anthropic 的 Boris Cherny 手上的日常主力模型。他做了一次正面对撞:让 Opus 5.5 和 Fable 5.1 各自把 HAProxy 从 C 移植到 Rust。两边的结果都是"通过了几乎所有测试",但一个用了 9.5 小时,另一个 12 小时,账单差出 51%。这不是发布会上的漂亮话,是一个工程师拿真实代码库跑出来的两组数字,也因此比任何跑分榜都更值得看一眼。
九个半小时,一整个 C 代码库搬了家
HAProxy 是什么量级的活
HAProxy 属于那种你平时想不起来、但线上离不开的基础设施:反向代理、负载均衡,C 语言写了十几年,手工管理内存,指针和生命周期散落在每一处回调里。把它搬成 Rust,不是找个翻译器逐行替换那么轻巧。Rust 的所有权模型会逼着人把数据流重画一遍——哪个结构体持有谁,生命周期的边界划在哪儿,并发路径上的共享状态怎么表达,这些决定做错一个,编译器第一关就过不去。
更麻烦的是体量。这不是写个两百行的小工具,而是让模型在几个小时里持续持有对同一份代码库的理解,中途不能走神,不能把三小时前定下的抽象推翻重来。
都过了测试,路径长度却不在一个档上
9.5 小时对 12 小时,看着只差四分之一;成本低 51%,说明内部消耗差得远。长时程任务最怕的从来不是"不会做",而是"做着做着忘了自己在干嘛"——反复读同一个文件,改回去又改回来,卡在失败的测试里绕圈。这些动作每一步都在烧 token,最后同样能换来一个能编译的结果,账却完全是两回事。
换句话说,耗时和成本是两条不同的曲线。推理速度更快能压缩前者,但省不了后者。真正决定成本的,是模型在长任务里有没有自己给自己挖坑。
"几乎全过"后面那点尾巴最贵
这个说法值得停一下。剩下没过的测试是什么,没人讲。在代码迁移里,那通常是最值钱的部分:边界条件、极端并发、长时间运行之后的内存行为。能编译、能过掉九成五的用例,跟能不能上生产之间,隔着一整个团队几个月的验证。
便宜 51%,比快 2.5 小时更扎人
小时数会骗人,账单不会
2.5 小时的时间差听起来很温和,一个下午而已。成本差 51% 就完全不是这个味道了——在同样的任务上,另一个模型干的事情多出一半。多出来的那部分,可能是无效探索,可能是冗余上下文,也可能是反反复复的自我纠正。时间可以被更快的推理速度掩盖,账单不会,你为走错的每一步都付了钱。
官方那句"比 Opus 5 低 40%"
Anthropic 自己的说法是:Opus 5.5 是 Claude 5.5 家族发布的第一个模型,多数任务上达到了 Fable 5.1 的水平,运行成本比 Opus 5 低 40%。把两组数字摆在一起看,事情就有点意思了:对上一代降 40%,对这次实测的对手低 51%。官方口径和第三方实测指向同一个方向,降价是真的,幅度甚至比发布会上说的还大。
省下的钱,可能被验收吃掉
但选型时,token 账单只是成本的一半。模型跑完 9.5 小时,交给你一个能过测试的 Rust 版本,接下来谁来看?C 到 Rust 的移植里,编译通过不代表语义等价,测试通过不代表负载特征没变。审查这种体量的改动,人时开销很容易超过模型调用本身。省 51% 的前提,是你有办法低成本地判断它做得对不对;没有这个前提,便宜只是把风险往后挪了几周。
评测的口味变了:从刷题到接活
短跑成绩测不出长跑能力
当下的模型榜单大多在测短跑:一道算法题、一个函数、一次报错修复。这些测试有价值,但和真实工程的距离在被越拉越远。真实任务要求几小时不下线,上下文窗口反复填满,还得记住三小时前自己定下的接口约定。Cherny 这种"直接接一个真活"的对比,比刷题榜更能说明工程现场的实际体感。
迁移是照妖镜
为什么偏偏是迁移?因为它同时考三件事:读懂旧代码的真实意图、理解新语言的硬约束、保住原有的行为契约。这三项没有一项能靠模式匹配糊过去。一个模型如果只停留在"看起来对"的层面,代码写到一半就会自相矛盾,然后在测试失败里越陷越深。
别忘了这只是 n=1
泼一盆冷水:一个人的一次实验,一个代码库,两个模型的组合,样本量是一。HAProxy 的代码风格、测试覆盖、模块切分都是特定条件,换个项目结果完全可能翻过来。这条情报的价值不在于"Opus 5.5 一定更强",而在于它给出了一套可复现的比较思路——你可以拿自己手头的活去验证,而不是等着别人给结论。
真要选型,先别打开榜单
你的任务有多长
如果只是补个函数、改个报错,各家模型的差距小到可以忽略,挑顺手的就行。分水岭出现在任务时长跨过某个阈值之后——一小时、三小时、半天。越过这道门槛,模型之间的差距不再体现在"会不会写",而体现在"能不能撑住"。撑不住的表现不是崩溃,是悄悄地开始绕路。
把通过率和账单放进同一张表
单位任务的真实成本大致是:调用成本,加人工审查成本,加返工成本。第一项平台上就有数字,后两项得自己估。很多人选型只算第一项,然后纳闷总成本为什么降不下来。更稳妥的做法是先限定一个可接受的质量门槛,再在这个门槛之上比价格——顺序反过来,省下的钱往往会在验收环节吐回去。
留一条回退的路
无论最后选谁,都别把一次大迁移整包扔给模型然后干等结果。切成阶段,每段结束跑一次真实负载,关键路径上留人工检查点。9.5 小时听起来很爽,但它同时意味着这 9.5 小时里你没法中途叫停,也没有中间产物可以复用。细粒度的任务拆解,通常比换一个更聪明的模型更省钱。

