阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重

发布时间: 2026-09-20 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

阶跃星辰把 Step 5 Preview 的底牌摊开了:总参数 600B,激活 27B,100 万 Token 上下文,文本加视觉双输入,Artificial Analysis 智能指数 44 分,官方口径是全球开源模型前三,单任务成本是 Claude Opus 5 的八分之一。数字一多,反而容易看花眼。真正该停一下的,是 27B 激活这个量和八分之一这个价。

稀疏 MoE:省下的算力,和没省下的显存

27B 激活,等于给推理账单打了折

600B 是仓库面积,27B 是每天真正进出的货量。稀疏 MoE 把前馈层拆成几十上百个专家,每个 token 只被路由进其中一小撮,剩下的在同一时刻完全闲置。模型装了多少知识,按 600B 算;一次前向传播要烧多少算力,按 27B 算。这个比例大约二十二比一,它直接落到两个地方:生成速度,和每百万 Token 的报价。

但权重得实打实躺在显存里

别急着说便宜。稀疏激活省的是计算,不是存储。600B 参数即使按 FP8 精度存放,也是接近 600GB 的体量,单机八卡未必宽松,何况实际部署还得给 KV Cache 留空间。想自己把这台机器开起来,门槛一点没降。MoE 降低的是调用成本,不是部署成本——这两个词经常被混着用,采购的时候会出人命。

开源阵营押注 MoE 的底层逻辑

从 DeepSeek 到后来的几批开源旗舰,MoE 基本成了默认选项。原因不复杂:同样的显存预算里,稀疏模型能塞进更多参数,榜单上就更好看;同样的算力预算里,它跑得更快,报价就更有竞争力。对使用者来说,这条路线兑现成一句话——你按 27B 的价格付钱,拿接近 600B 的能力。前提是路由训练到位,专家之间别互相打架,否则激活的那 27B 里有一半在摸鱼。

100 万 Token 上下文,难的从来不是数字

长上下文不该再当发布会装饰品看

过去两年“支持多少万 Token”被念到麻木,因为宣称和可用之间隔着一整个推理框架。100 万 Token 是另一个量级:一整套中等规模的代码仓库、几本技术手册、一个季度的会议纪要,能一次性塞进去,不用切片、不用召回、不用赌检索质量。对 Agent 来说,这等于把“先找资料再干活”压缩成“边看边干”。

注意力计算才是真正的账单

标准注意力的计算量随序列长度平方增长,百万级序列不是加根内存条能解决的。工程上靠分块、稀疏化、KV Cache 压缩各种手段往下压,压到现在能跑,但离免费还差得远。长上下文的隐性成本藏在延迟曲线里:上下文从十万涨到一百万,首 Token 时间会变成什么样,比“支持不支持”更值得在选型时追问。

文本配视觉,输入侧复杂度翻倍

Step 5 Preview 同时接受文本和视觉输入。单独看这件事不新鲜,叠在百万上下文上就不一样了——报错截图、设计稿、扫描合同、UI 原型,这些原本要靠 OCR 或人工转述的素材,现在可以直接进上下文。很多 Agent 任务失败的原因,不是推理不够聪明,是它压根没看到足够原始的现场。

44 分,一个必须放回坐标系里读的数字

Artificial Analysis 的指数在测什么

这个指数把若干推理、编码、知识类基准折算成一个综合分,方便横向摆放。代价是维度被抹平:一个在代码上很强、常识上偏弱的模型,和一个各项均衡的模型,可能拿到同一个分数。44 分说明它稳稳站在第一梯队,但具体到你的任务上强不强,得回到你自己的评测集里找答案。

“全球开源前三”的限定词是开源

官方的说法是全球开源模型前三,这句话成立,前提是把“开源”两个字读进去。闭源第一梯队的头部模型依然占据更高位置,差距没有被抹平,只是被缩窄了。开源阵营内部的排序也相当拥挤,第一梯队几家的分差已经小到一次版本更新就能翻转的程度,谁先发谁占座。

八分之一的成本,比 44 分更能改变决策

真正有杀伤力的是那个成本数字:单任务成本为 Claude Opus 5 的八分之一。同一类工作负载,价格差八倍,计算性质就变了。原本要精挑细选、只敢在关键路径上调用的模型,现在可以无脑全量跑一遍——日志巡检、工单分类、文档字段抽取、测试用例生成。单价落到阈值以下,用法会从“省着用”自动切换到“铺开用”,这个切换往往比榜单上多两分带来的影响大得多。

权重开放之后,价格锚点会往哪走

公布权重时间表,比公布参数更重要

参数表是给评测者看的,权重时间表是给工程团队看的。前者决定讨论热度,后者决定排期。企业评估一个开源模型,第一件事是问什么时候能拿到权重、许可证怎么写、微调后的产物能不能商用。这些答案决定了它能不能进生产环境,也决定了它是不是真的“开源”。

编码和 Agent 会最先吃掉这批产能

官方给的标签里,编码、Agent、推理三个词指向同一类工作负载:调用密集、步骤多、结果可自动验证。这类任务最适合先用便宜模型铺一遍,再由昂贵模型兜底。模型能不能自己跑测试、读报错、改代码再跑一遍,是这条流水线的分水岭;能闭环,成本优势才会真的兑现。

开源每压一次价,闭源的定价空间就窄一分

开源模型持续把单任务成本往下拽,闭源厂商靠什么维持溢价?答案是那些开源暂时接不住的任务:超长链条的复杂推理、高风险决策、对稳定性要求近乎苛刻的场景。对使用方来说,选型问题已经悄悄换了形式——不是“用哪个模型”,而是“哪些任务非贵不可”。Step 5 Preview 把这道题的价格参数又调低了一档。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 56

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线