Artificial Analysis 评测 Step 5 Preview: Intelligence Index 得 44 分,成本约为同级模型 1/2.8

发布时间: 2026-09-22 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

阶跃星辰把 Step 5 Preview 递到 Artificial Analysis 手里,测出来是 44 分。这个位置很微妙:它跟 Kimi K3(max)肩并肩,抬眼就能看见 GLM-5.3(max)和 Qwen3.8 Max,那两家各拿 45 分,只高出一分。真正拉开距离的是另一栏——每任务成本约 0.72 美元,同分段选手普遍在 2 美元上下,差着 2.8 倍。跑得快不快看分数,跑这一趟要烧多少钱看这行数字,两件事得分开算。

44 分,挤在中间的那一档

跟 Kimi K3(max)打平手,含金量有多少

Artificial Analysis Intelligence Index 是把一堆能力维度揉成一个综合分。44 分意味着 Step 5 Preview 已经站在前沿模型的门口,但脚还没跨进去。和 Kimi K3(max)同分,说明这两家在当前这一代产品上的综合能力高度接近——训练数据、后训练配方、推理算力这几个变量,最后收敛到了相近区间。

同分不等于同质。综合指数是平均值游戏,两个模型总分一样,子项分布可能完全不同:一个靠推理硬拉,一个靠知识面撑着,落到具体任务上是两种体验。

领先一分的那两家,别当成一个档次

GLM-5.3(max)和 Qwen3.8 Max 拿 45 分,比 Step 5 Preview 高一分。一分在榜单上几乎等于噪声——单次评测的波动、题目采样、推理配置的细微差别,都可能吃掉这一分。把 45 和 44 说成"两个梯队",是过度解读。

但也不能说这一分没有信息量。它至少说明:在国内这几家头部选手里,Step 5 Preview 眼下没有拿到明显领先的位置,它站在第一梯队的下沿,不是上沿。

榜单之外还有几个问号

综合分是入场券,不是判决书。读这份评测时,有三处配置需要自己补上:推理链跑了多长、有没有开工具调用、采样温度设在哪里。这些参数不同,同一个模型的分数能差出好几个点。

Artificial Analysis 的框架相对统一,这正是它的价值;统一也意味着它测的是标准工况,不是你的工况。

每任务 0.72 美元,这张牌得会算

2.8 倍价差,不是小数

同分段模型每任务大约 2 美元,Step 5 Preview 只要 0.72 美元。粗看是省钱,细看是产品定位问题:能力接近的前提下,成本直接决定了这个模型能被塞进多少场景。一次调用差 1.28 美元,一天十万次调用,差额就是十二万美元级别。

很多人把每任务成本当成促销参数,其实它是架构参数。模型参数量、激活的专家数、推理链长度、缓存命中率共同决定这个数字,改不动,只能重新训练或者重新设计服务架构。

便宜的代价,通常藏在长任务里

单元任务便宜,不等于整体便宜。智能体场景下一个任务会被拆成十几步甚至几十步,每一步都要重新喂上下文,token 消耗呈非线性增长。如果 Step 5 Preview 在多步任务上需要更多轮次才收敛,单步省下来的钱会被步数吃掉。

这也是每任务成本比每百万 token 价格更有参考价值的原因——它已经顺手把"要跑几步"算进去了。

价格优势兑现了才算优势

0.72 美元的前提是你真的用它。智能体能力跟不上,团队最后还是得切回更贵的模型,那这 2.8 倍价差就只活在评测报告里。

智能体这块短板,藏不住

推理分数好看,活未必干得漂亮

这份评测里,Step 5 Preview 的智能体表现被直接点名。不奇怪。推理考的是想得对不对,智能体考的是做得对不对——工具调用格式、错误恢复、长上下文里的信息保持、什么时候该停下来问人,训练这些能力喂的数据完全是另一套。

多步任务才是真正的考场

一个模型在单轮问答里拿高分,扔进需要连续调 API、读文件、写代码、再验证的流程里,走到第三第四步就开始漂移。这类失败不会体现在综合指数上,但会在你的生产日志里反复出现。

对阶跃星辰来说,这个短板反而是个清晰信号:底座够用了,接下来要补的是工具使用、长程规划和自我纠错这几个方向的后训练功课。

要证明的东西还很多

Preview 这个名字本身就说明问题——阶跃星辰自己也没把它当终版。44 分是个及格的起点,成本优势是真实的筹码,这两样东西能不能换成一个稳定的智能体产品,得看正式版。

同一个分档里,选型怎么落地

先看你的任务链条有多长

单轮问答、内容生成、结构化抽取这类短链条任务,44 分和 45 分没有实际区别,直接比价格。做跨系统自动化流程的团队,先去实测智能体能力,名次帮不上忙。

再算你能扛住多大的账单

2.8 倍价差在规模化之后会变成生死问题。月调用量在十万级别以下,这点差价可以忽略;上了千万级别,模型选型就从技术决策变成了财务决策。

别把鸡蛋放在一个模型上

国内几家头部模型分数咬得这么紧,本身就说明格局没定。GLM-5.3、Qwen3.8 Max、Kimi K3、Step 5 Preview 全在 44 到 45 分之间晃,任何一家下一次更新都可能改写排序。工程上做一层模型抽象,比押注某一家某一次评测稳妥得多。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 50

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线