Arena 的排行榜上马上就要多出两个新名字:OpenAI 的 GPT-6 Sol 和 GPT-6 Luna。评分还没正式公布,平台已经先放出话来——请用户自己去实测,在真实智能体任务上投票,用票数把榜单撑起来。这个顺序本身就值得琢磨:不是先给分数再让人信,而是先让人上手,再让分数长出来。
分数还没落地,讨论已经跑起来了
一张榜单的分量,取决于谁在填它
Arena 这类平台的玩法一直很朴素:模型两两对上,人类投票,胜率累积成排名。它被反复引用,不是因为算法多精巧,而是因为它把"谁更好用"这个问题交回给每天真正在敲提示词的人。这次 Sol 与 Luna 的评分公布之所以被盯着看,是因为在此之前 Arena 的头名已经换过好几轮,而每一次换人,厂商的发布会话术就跟着换一次。
一个人用同一道题,跑了两代模型
比榜单更早流传的,是一组对照数据。Peter 拿相同的提示词、相同的 max reasoning 设置,把 GPT-6 Sol 和上一代的 GPT-5.6 Sol 摆在一起跑,记下三样东西:输出内容、token 用量、响应时延。实验不复杂,甚至有点笨,但它恰好戳中了发布季最容易被糊弄的地方。厂商台上讲的是"能力提升",工程师心里算的是:同样一件活儿,新一代要多花多少 token,要多等多久。
票投出去之前,先让子弹飞一会儿
Arena 邀请用户前往实测并投票,意义不在于多出几千张票,而在于样本来自真实任务,而不是合成基准。真实智能体任务往往又长又碎,中间夹着工具调用、状态回滚、格式纠错,跑一次可能十几轮。这种场景下,模型的每一点退化都会被放大成肉眼可见的失败。换句话说,投票投的是耐心,不是印象分。
智能体的考卷,比聊天窗口难出得多
一道题跑二十分钟,谁来打这个分
单轮问答的打分很简单:答对答错,一目了然。智能体任务不是。它可能要求模型读一堆文件、改几处配置、再回头验证结果,中间任何一步走歪,最终答案就不可信。评审者看到的是一条长长的轨迹,得判断"从哪里开始错的",这比判断"对不对"难上几个量级。Arena 把投票权开放给用户,某种程度是把这道难题分摊出去,用规模换准确度。
token 用量:那张没人愿意公开的账单
输出质量是面子,token 用量是里子。同一道任务,一个模型用 8000 token 收敛,另一个烧掉 30000 token 才勉强收尾,放在演示视频里看不出差别,落在账单上差出四倍。Peter 把 token 用量单独拎出来做对比,说明的正是这件事:推理模型的竞争,已经从"能不能做对"滑向"做对要花多少钱"。
时延不是体验问题,是流水线问题
聊天窗口里,慢两秒只是烦;在智能体流水线里,慢两秒乘以几十步,就变成分钟级的干等。时延高的模型很难塞进需要快速迭代的场景——代码修复、客服分派、批量数据处理,全都卡在这上面。所以当有人把时延和输出、token 并列成三项指标时,他给出的其实是一份采购清单该看的东西。
价格曲线正在逼着所有人重新算账
降价 50% 不是促销,是结构变化
已公布的信息里,GPT-6 Sol 和 GPT-6 Luna 的 API 价格比 GPT-5.6 低了约 50%。这个数字单看不算夸张,放进成本模型就很不客气:原先因为太贵而只能跑一次的任务,现在可以跑两次做交叉验证;原先只敢用在关键路径上的模型,可以考虑铺到全流程。价格腰斩通常不会带来性能讨论,却会直接改写架构选择。
Anthropic 在同一方向上踩了油门
差不多同一时间,Claude Opus 5.5 把成本压到 Opus 5 的六成左右。两家头部实验室在不同节点做出方向一致的动作,说明单位智能的价格正在被系统性重估,而不是某一家为了抢份额临时放的价。对开发者来说,问题已经不是"选哪家",而是"要不要把过去因为成本而砍掉的功能捡回来"。
每季度 47%,这个斜率比任何发布会都狠
Epoch AI 的研究给出了更冷的视角:达到同等 AI 性能的成本,大约每个季度下降 47%。这条曲线如果继续,两年后的价格会和今天完全不在一个量级。它同时给榜单加了注脚——今天排在前面的模型,明天的优势可能不是能力,而是被更便宜的后继者追上。看评分的时候,最好把时间轴一起摊开看。
分数公布那天,别只盯着第一名
综合分是平均值,你的任务是异常值
榜单给出的是平均表现,真实业务里没有谁是平均的。有些团队的任务高度依赖长上下文,有些卡在工具调用的稳定性上,有些只在乎首 token 时延。同一个综合分,对这几种场景意味着完全不同的东西。与其盯着排名先后,不如把 Arena 上智能体任务的投票分布翻出来,看看和自己的负载像不像。
想影响榜单,最好的方式是去跑自己的活
Arena 这次把用户实测和投票直接绑在一起,逻辑很直白:谁用得多,谁的话最算数。听上去有点民主得过头,但对一个没有标准答案的领域来说,这可能是目前最不坏的办法。与其等评分公布后转发评论,不如把自己的任务丢进去跑一轮——顺手投一票,顺手拿到一份比发布会更贴近实际的对照数据。

