Claude Sonnet 5.5 发布,Terminal-Bench 4.0 得分 70.6% 且价格不变

发布时间: 2026-09-29 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

70.6% 对 10.3%。Anthropic 新出的 Claude Sonnet 5.5 在 Terminal-Bench 4.0 上拿到 70.6%,同一张考卷上,上一代 Sonnet 5 只有 10.3%。而价格一个字没改——每百万 token 输入 2 美元,输出 10 美元。三个数字摆在一起,比一场发布会管用得多。

需要先说明,我手上只有这几个数。完整的评测方法、任务明细、有没有做多次采样取平均,都还没铺开。所以下面有些判断属于推测。但就凭这几个数字,已经足够聊一阵了。

七倍的差距,先别急着鼓掌

这个基准考的不是"会不会聊"

Terminal-Bench 的题面朴素到有点枯燥:给你一个终端,扔一个任务,看模型能不能自己把命令敲对、把报错读懂、把文件改利索,最后回头验证结果对不对。它不奖励漂亮的解释,只记录一件事——活干完没有。这种评测对耐心、上下文管理、自我纠错的要求都极高,因为第一步走歪,后面喂进去的全是垃圾输入。模型在聊天框里可以含糊其辞蒙混过去,在终端里不行,shell 会把每一句谎话原样打回来。

分数暴涨,通常有两个来源

一个是模型本身变强了。工具调用的准确率、长上下文里对关键信息的抓取、遭遇失败信号时的反应速度,这些都是能练出来的硬功夫。另一个是训练方式变了。当训练数据里塞进足够多的真实终端轨迹,模型见过成千上万次"报错 → 修改 → 再试"的循环,行为会变得很像一个干了十年的老运维。

这两者的含金量不一样。前者是能力上限被抬高,后者更像熟练度堆出来的稳定发挥。对使用者来说结论其实差不多,但如果你是做模型的人,得知道自己在哪一条路上。

跨版本比分数,是件危险的事

Terminal-Bench 4.0 不是 3.0 加了几道题那么轻巧。基准迭代一般会重排任务分布、调整难度梯度、收紧或放宽判定标准——判定标准这一项尤其要命,一个"是否算通过"的措辞变化,就能让整体分数上下浮动十几个百分点。把跨版本的分数直接相减,学术上很难站得住。

所以那 60 个百分点的鸿沟里,有多少属于模型,有多少属于考卷,现在没人能拆干净。这不代表进步是假的,只代表它没法被这一个数字精确度量。

真正值得琢磨的,是那张价目表

两美元和十美元,一动不动

按常理,能力上一个台阶,价格总要跟着动一动。涨是信号,降也是信号。Anthropic 选择原地不动,大概率同时打两份算盘:技术上,推理效率的提升已经能覆盖更强的模型,边际成本被吃掉了;商业上,一个能力接近旗舰、价格停在中档的模型,是拿来卡竞争对手脖子的。前者是工程师的账,后者是 CFO 的账,这家公司两边都算得很清楚。

智能体的账单,长得跟聊天不一样

这一点经常被忽略。一次终端任务,模型可能要跑几十轮工具调用。每一轮都要把之前的完整上下文重新读一遍,输入 token 会随着轮数滚雪球。真正烧钱的地方在输入侧,不在输出侧。

也就是说,$2 的输入价,对写代码、跑运维、做自动化测试这类场景来说,是一个功能能不能天天挂在那儿跑的总开关。输出贵一点没关系,反正生成量小;输入贵一点,很多本来成立的用例会瞬间算不过账。

难受的是谁

那些一边用旗舰价讲故事、一边只能干中端活的产品。当有人把"能干活"和"便宜"绑在同一个 SKU 上卖,靠参数规模和榜单排名撑溢价的套路就开始失灵了。过去一年,旗舰模型每百万输出 token 长期停在两位数美元,很多团队是靠"贵有贵的道理"说服自己掏钱的。现在这道理由被削掉了一角。

Anthropic 盯上的是"干活"这门生意

聊天窗口已经装不下它的野心

订阅制的天花板很清楚:一个人一个月能问多少问题,是有限的。但一个智能体一天能跑多少个任务,几乎没有上限。这两种消耗模型对应的是完全不同的收入曲线。把终端能力做扎实,等于把产品从"陪人聊天"推进到"替人上班",客单价的想象空间一下子打开了。

5.5 这个小数点,是写给企业看的

版本号不是随手取的。叫 5.5 而不是 6,传递的信息很明确:这是同一条产品线上的稳定迭代,API 兼容,行为可预期,你不需要重写 prompt、不需要重做回归测试。对企业采购来说,可预期比惊艳值钱得多。一次"模型换代导致线上流程集体崩掉"的事故,够让一个技术负责人丢掉饭碗。

采购桌上那页纸,写的都是笨功夫

稳定性、可审计、可回滚、价格锁定、能不能签长约。这些词一个都不性感,却决定了合同签不签。Anthropic 这次的定价策略,本质上是在给企业客户的财务模型提供一个确定项——能力涨了,预算不用跟着涨,明年做规划的时候少一个变量。

开发者现在该做哪几件事

别拿别人的跑分替自己做决定

从你自己的代码库里抽五十个真实任务,跑两遍,一遍旧模型一遍新模型。看的不是通过率,是通过率和返工率之间的差。有些模型一次做对的概率高,但做错的时候错得离谱,把半个仓库搅乱;另一些第一次磕磕绊绊,多试两轮反而能收敛。这两种性格,在跑分上看不出区别,在你的 CI 流水线里是天壤之别。

先算账,再谈能力

把过去一个月智能体消耗的 token 拉出来,按新价格重算一遍。重点看输入侧——如果一次任务的输入 token 是输出的二十倍,那输入价就是你的主要成本项。算完之后再问一句:能力提升 60 个百分点,能不能换来同等比例的成本节省或产出增长?如果答案是能,那就没什么好犹豫的。

留一条退路

把 prompt、工具协议、评测脚本和具体厂商解耦。这话说了两年,真正做到的团队不多。但当模型迭代以季度为单位推进,切换成本就是你的议价能力。谁把业务逻辑焊死在单一 API 上,谁就只能接受对方下一轮定价。

跑分公布的那天,所有人都在看 70.6%。真正决定这个数字能变成多少钱的,是价目表上那两个没变的数字。技术新闻里,最安静的那一行,往往才是重点。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 79

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线