阶跃星辰把 Step 5 Preview 递到 Artificial Analysis 手里,测出来是 44 分。这个位置很微妙:它跟 Kimi K3(max)肩并肩,抬眼就能看见 GLM-5.3(max)和 Qwen3.8 Max,那两家各拿 45 分,只高出一分。真正拉开距离的是另一栏——每任务成本约 0.72 美元,同分段选手普遍在 2 美元上下,差着 2.8 倍。跑得快不快看分数,跑这一趟要烧多少钱看这行数字,两件事得分开算。
44 分,挤在中间的那一档
跟 Kimi K3(max)打平手,含金量有多少
Artificial Analysis Intelligence Index 是把一堆能力维度揉成一个综合分。44 分意味着 Step 5 Preview 已经站在前沿模型的门口,但脚还没跨进去。和 Kimi K3(max)同分,说明这两家在当前这一代产品上的综合能力高度接近——训练数据、后训练配方、推理算力这几个变量,最后收敛到了相近区间。
同分不等于同质。综合指数是平均值游戏,两个模型总分一样,子项分布可能完全不同:一个靠推理硬拉,一个靠知识面撑着,落到具体任务上是两种体验。
领先一分的那两家,别当成一个档次
GLM-5.3(max)和 Qwen3.8 Max 拿 45 分,比 Step 5 Preview 高一分。一分在榜单上几乎等于噪声——单次评测的波动、题目采样、推理配置的细微差别,都可能吃掉这一分。把 45 和 44 说成"两个梯队",是过度解读。
但也不能说这一分没有信息量。它至少说明:在国内这几家头部选手里,Step 5 Preview 眼下没有拿到明显领先的位置,它站在第一梯队的下沿,不是上沿。
榜单之外还有几个问号
综合分是入场券,不是判决书。读这份评测时,有三处配置需要自己补上:推理链跑了多长、有没有开工具调用、采样温度设在哪里。这些参数不同,同一个模型的分数能差出好几个点。
Artificial Analysis 的框架相对统一,这正是它的价值;统一也意味着它测的是标准工况,不是你的工况。
每任务 0.72 美元,这张牌得会算
2.8 倍价差,不是小数
同分段模型每任务大约 2 美元,Step 5 Preview 只要 0.72 美元。粗看是省钱,细看是产品定位问题:能力接近的前提下,成本直接决定了这个模型能被塞进多少场景。一次调用差 1.28 美元,一天十万次调用,差额就是十二万美元级别。
很多人把每任务成本当成促销参数,其实它是架构参数。模型参数量、激活的专家数、推理链长度、缓存命中率共同决定这个数字,改不动,只能重新训练或者重新设计服务架构。
便宜的代价,通常藏在长任务里
单元任务便宜,不等于整体便宜。智能体场景下一个任务会被拆成十几步甚至几十步,每一步都要重新喂上下文,token 消耗呈非线性增长。如果 Step 5 Preview 在多步任务上需要更多轮次才收敛,单步省下来的钱会被步数吃掉。
这也是每任务成本比每百万 token 价格更有参考价值的原因——它已经顺手把"要跑几步"算进去了。
价格优势兑现了才算优势
0.72 美元的前提是你真的用它。智能体能力跟不上,团队最后还是得切回更贵的模型,那这 2.8 倍价差就只活在评测报告里。
智能体这块短板,藏不住
推理分数好看,活未必干得漂亮
这份评测里,Step 5 Preview 的智能体表现被直接点名。不奇怪。推理考的是想得对不对,智能体考的是做得对不对——工具调用格式、错误恢复、长上下文里的信息保持、什么时候该停下来问人,训练这些能力喂的数据完全是另一套。
多步任务才是真正的考场
一个模型在单轮问答里拿高分,扔进需要连续调 API、读文件、写代码、再验证的流程里,走到第三第四步就开始漂移。这类失败不会体现在综合指数上,但会在你的生产日志里反复出现。
对阶跃星辰来说,这个短板反而是个清晰信号:底座够用了,接下来要补的是工具使用、长程规划和自我纠错这几个方向的后训练功课。
要证明的东西还很多
Preview 这个名字本身就说明问题——阶跃星辰自己也没把它当终版。44 分是个及格的起点,成本优势是真实的筹码,这两样东西能不能换成一个稳定的智能体产品,得看正式版。
同一个分档里,选型怎么落地
先看你的任务链条有多长
单轮问答、内容生成、结构化抽取这类短链条任务,44 分和 45 分没有实际区别,直接比价格。做跨系统自动化流程的团队,先去实测智能体能力,名次帮不上忙。
再算你能扛住多大的账单
2.8 倍价差在规模化之后会变成生死问题。月调用量在十万级别以下,这点差价可以忽略;上了千万级别,模型选型就从技术决策变成了财务决策。
别把鸡蛋放在一个模型上
国内几家头部模型分数咬得这么紧,本身就说明格局没定。GLM-5.3、Qwen3.8 Max、Kimi K3、Step 5 Preview 全在 44 到 45 分之间晃,任何一家下一次更新都可能改写排序。工程上做一层模型抽象,比押注某一家某一次评测稳妥得多。

