阶跃星辰把 Step 5 Preview 的底牌摊开了:总参数 600B,激活 27B,100 万 Token 上下文,文本加视觉双输入,Artificial Analysis 智能指数 44 分,官方口径是全球开源模型前三,单任务成本是 Claude Opus 5 的八分之一。数字一多,反而容易看花眼。真正该停一下的,是 27B 激活这个量和八分之一这个价。
稀疏 MoE:省下的算力,和没省下的显存
27B 激活,等于给推理账单打了折
600B 是仓库面积,27B 是每天真正进出的货量。稀疏 MoE 把前馈层拆成几十上百个专家,每个 token 只被路由进其中一小撮,剩下的在同一时刻完全闲置。模型装了多少知识,按 600B 算;一次前向传播要烧多少算力,按 27B 算。这个比例大约二十二比一,它直接落到两个地方:生成速度,和每百万 Token 的报价。
但权重得实打实躺在显存里
别急着说便宜。稀疏激活省的是计算,不是存储。600B 参数即使按 FP8 精度存放,也是接近 600GB 的体量,单机八卡未必宽松,何况实际部署还得给 KV Cache 留空间。想自己把这台机器开起来,门槛一点没降。MoE 降低的是调用成本,不是部署成本——这两个词经常被混着用,采购的时候会出人命。
开源阵营押注 MoE 的底层逻辑
从 DeepSeek 到后来的几批开源旗舰,MoE 基本成了默认选项。原因不复杂:同样的显存预算里,稀疏模型能塞进更多参数,榜单上就更好看;同样的算力预算里,它跑得更快,报价就更有竞争力。对使用者来说,这条路线兑现成一句话——你按 27B 的价格付钱,拿接近 600B 的能力。前提是路由训练到位,专家之间别互相打架,否则激活的那 27B 里有一半在摸鱼。
100 万 Token 上下文,难的从来不是数字
长上下文不该再当发布会装饰品看
过去两年“支持多少万 Token”被念到麻木,因为宣称和可用之间隔着一整个推理框架。100 万 Token 是另一个量级:一整套中等规模的代码仓库、几本技术手册、一个季度的会议纪要,能一次性塞进去,不用切片、不用召回、不用赌检索质量。对 Agent 来说,这等于把“先找资料再干活”压缩成“边看边干”。
注意力计算才是真正的账单
标准注意力的计算量随序列长度平方增长,百万级序列不是加根内存条能解决的。工程上靠分块、稀疏化、KV Cache 压缩各种手段往下压,压到现在能跑,但离免费还差得远。长上下文的隐性成本藏在延迟曲线里:上下文从十万涨到一百万,首 Token 时间会变成什么样,比“支持不支持”更值得在选型时追问。
文本配视觉,输入侧复杂度翻倍
Step 5 Preview 同时接受文本和视觉输入。单独看这件事不新鲜,叠在百万上下文上就不一样了——报错截图、设计稿、扫描合同、UI 原型,这些原本要靠 OCR 或人工转述的素材,现在可以直接进上下文。很多 Agent 任务失败的原因,不是推理不够聪明,是它压根没看到足够原始的现场。
44 分,一个必须放回坐标系里读的数字
Artificial Analysis 的指数在测什么
这个指数把若干推理、编码、知识类基准折算成一个综合分,方便横向摆放。代价是维度被抹平:一个在代码上很强、常识上偏弱的模型,和一个各项均衡的模型,可能拿到同一个分数。44 分说明它稳稳站在第一梯队,但具体到你的任务上强不强,得回到你自己的评测集里找答案。
“全球开源前三”的限定词是开源
官方的说法是全球开源模型前三,这句话成立,前提是把“开源”两个字读进去。闭源第一梯队的头部模型依然占据更高位置,差距没有被抹平,只是被缩窄了。开源阵营内部的排序也相当拥挤,第一梯队几家的分差已经小到一次版本更新就能翻转的程度,谁先发谁占座。
八分之一的成本,比 44 分更能改变决策
真正有杀伤力的是那个成本数字:单任务成本为 Claude Opus 5 的八分之一。同一类工作负载,价格差八倍,计算性质就变了。原本要精挑细选、只敢在关键路径上调用的模型,现在可以无脑全量跑一遍——日志巡检、工单分类、文档字段抽取、测试用例生成。单价落到阈值以下,用法会从“省着用”自动切换到“铺开用”,这个切换往往比榜单上多两分带来的影响大得多。
权重开放之后,价格锚点会往哪走
公布权重时间表,比公布参数更重要
参数表是给评测者看的,权重时间表是给工程团队看的。前者决定讨论热度,后者决定排期。企业评估一个开源模型,第一件事是问什么时候能拿到权重、许可证怎么写、微调后的产物能不能商用。这些答案决定了它能不能进生产环境,也决定了它是不是真的“开源”。
编码和 Agent 会最先吃掉这批产能
官方给的标签里,编码、Agent、推理三个词指向同一类工作负载:调用密集、步骤多、结果可自动验证。这类任务最适合先用便宜模型铺一遍,再由昂贵模型兜底。模型能不能自己跑测试、读报错、改代码再跑一遍,是这条流水线的分水岭;能闭环,成本优势才会真的兑现。
开源每压一次价,闭源的定价空间就窄一分
开源模型持续把单任务成本往下拽,闭源厂商靠什么维持溢价?答案是那些开源暂时接不住的任务:超长链条的复杂推理、高风险决策、对稳定性要求近乎苛刻的场景。对使用方来说,选型问题已经悄悄换了形式——不是“用哪个模型”,而是“哪些任务非贵不可”。Step 5 Preview 把这道题的价格参数又调低了一档。

