硅基流动上线开源模型 Hy4 preview,770B 总参数、1M 上下文

发布时间: 2026-09-15 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

硅基流动把 Hy4 preview 挂上自家平台,同时放开了 Apache 2.0 的门。770B 总参数,每个 token 只激活 49B,上下文给到 1M,价格表直接摊在台面上:输入每百万 token 0.834 美元,输出 2.501 美元,缓存命中 0.042 美元。数字干净,态度也清楚——它没打算做一尊供人仰望的旗舰,它想被塞进你现有的工具链里。

770B 是库存,49B 才是出手的力气

参数表上最容易被误读的两个数字,恰好就是这两行。谁把它们混着读,谁的预算就会失控。

激活比例压到 6%,这件事有多难

稀疏激活这套玩法,业内早就不陌生。分水岭在比例:49 除以 770,约等于 6.4%。这个数决定了推理时到底要为多少权重准备显存带宽,也决定了同样一批卡能扛住多大的并发。对使用者来说,770B 提供的知识容量和 49B 决定的单 token 成本,是必须分开看的两个账本。厂商习惯把总参数写在最前面,工程团队只关心激活参数——前者是营销位,后者是账单。真正要打问号的地方在路由:专家切得越细,调度和批处理越难做稳,长会话下偶尔的抖动会被放大成体感问题。

1M 窗口,考验的从来不是长度上限

把窗口开到 1M,听着像是能把整个仓库塞进去。决定体验的却不是上限,而是有效召回:模型在上百万 token 里能不能准确找到那几行关键代码,能不能在几十轮 agent 循环之后还记得最初那句话。长上下文还有一笔隐性账——KV cache 的体积和带宽开销随长度线性上涨,没有缓存复用的话,长窗口就是奢侈品。定价表里那个 0.042 美元的缓存价,某种程度上已经回答了这个问题:他们预期你会反复喂同一段前缀。

Apache 2.0 才是这次最响的一句话

权重能下载、能改、能商用——对有数据合规压力的团队而言,私有化部署和只能调 API 是两种完全不同的采购决策,中间隔着一整轮安全评审。放到硅基流动身上看更有意思:它本身做的是推理托管与部署,把权重彻底放开,等于把模型送出去,把推理这门生意留在自己手里。闭源模型卖使用权,开源权重卖基础设施,这套逻辑在全球已经被验证过很多轮。协议选 Apache 2.0 而不是各种带附加条款的开放许可,说明他们要的是扩散速度,不是围墙。

价格表比参数表更值得逐行读

定价是最不撒谎的产品说明。

输入 0.834、输出 2.501,账单重心在哪一侧

两者大约三倍差。这个比例放进 Agent 场景里就变得微妙:编码类 agent 会反复注入大段上下文——系统提示、工具定义、仓库骨架、历史轨迹——真正新生成的内容反而不多。也就是说,账单的重量压在输入侧。对高频、长会话的团队而言,单价低不低是次要问题,输入侧能不能被缓存命中才是主要问题。判断一个模型贵不贵,先看你自己的输入输出比,而不是看官方那张表的第一行。

缓存价 0.042,是给长会话写的

这个数字大约只有输入价的二十分之一。潜台词很明确:同一段前缀反复出现时,别重复付费。Cursor 这类工具每次请求都带着相似的系统提示和文件上下文,Claude Code 那样的循环更是同一条前缀走几十遍。缓存命中率一旦上去,1M 窗口的经济性才成立;反过来,如果你的用法天然缺乏可复用前缀,这个价格对你就是一行装饰。真正该做的测算很简单——把过去一周的实际 token 结构拉出来,看看有多少能落到缓存里。

不换工具,才算真正的低门槛

官方点名的接入对象是 Claude Code、Codex、Cursor,全是用户已经在用的东西。这一点比参数更值得留意。模型能力的差距在缩小,迁移成本却一直是硬的:换个 IDE、重写一遍 agent 编排、重新调一轮提示词,这些隐性开销经常比省下的 token 费更贵。直接挂到现有工作流后面,是这次发布里最务实的一句话。模型竞争的下一阶段,接入成本本身就是产品力的一部分。

平台方自己做开源,图的是什么

发布方是推理平台,不是模型实验室。这个身份决定了动机的形状。

权重送出去,调用量留下来

把 Hy4 preview 挂上自家平台,同时开放权重,乍看像把最好的东西往外送。换个角度就通了:模型越容易被部署,跑在硅基流动上的推理服务就越有存在感。开放权重从来不是慈善,它是入口。被争夺的是托管、扩容、稳定性、企业级交付这些东西,权重文件带不走它们。这套打法和过去两年海外几家的路径高度相似,区别只在于这次的参数和价格是同一时间公布的。

编码与分析,当下最实在的两块需求

官方列的方向是编码、分析、研究、复杂实际工作。四个词里,编码最实在:需求明确、结果可衡量、付费意愿强,而且已经长出了成熟的工具链和用户习惯。研究型任务低频且难评估,分析型任务边界模糊,复杂实际工作更是没法量化。编码不一样,跑一轮就知道行不行。把资源押在这个赛道上,是把筹码放在一个已经被验证过的市场里,而不是赌一个还没成形的场景。

剩下的三件事,只能自己跑出来

价格、协议、参数都已经摆在明面上,接下来值得盯的是三件事。真实评测而非精选 demo——SWE 类任务上的通过率、长文件编辑的准确度,这些才是日常工作里的分水岭。1M 上下文在真实仓库里的有效深度,窗口多大和能用多远是两回事。还有工具调用在多轮循环中的稳定性,49B 激活的模型,路由偶尔抽一次风就够毁掉一整条 agent 轨迹。这些没有官方数字能替代。接入、跑一遍、看账单,比读任何一份发布稿都管用。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 17

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线