硅基流动把 Hy4 preview 挂上自家平台,同时放开了 Apache 2.0 的门。770B 总参数,每个 token 只激活 49B,上下文给到 1M,价格表直接摊在台面上:输入每百万 token 0.834 美元,输出 2.501 美元,缓存命中 0.042 美元。数字干净,态度也清楚——它没打算做一尊供人仰望的旗舰,它想被塞进你现有的工具链里。
770B 是库存,49B 才是出手的力气
参数表上最容易被误读的两个数字,恰好就是这两行。谁把它们混着读,谁的预算就会失控。
激活比例压到 6%,这件事有多难
稀疏激活这套玩法,业内早就不陌生。分水岭在比例:49 除以 770,约等于 6.4%。这个数决定了推理时到底要为多少权重准备显存带宽,也决定了同样一批卡能扛住多大的并发。对使用者来说,770B 提供的知识容量和 49B 决定的单 token 成本,是必须分开看的两个账本。厂商习惯把总参数写在最前面,工程团队只关心激活参数——前者是营销位,后者是账单。真正要打问号的地方在路由:专家切得越细,调度和批处理越难做稳,长会话下偶尔的抖动会被放大成体感问题。
1M 窗口,考验的从来不是长度上限
把窗口开到 1M,听着像是能把整个仓库塞进去。决定体验的却不是上限,而是有效召回:模型在上百万 token 里能不能准确找到那几行关键代码,能不能在几十轮 agent 循环之后还记得最初那句话。长上下文还有一笔隐性账——KV cache 的体积和带宽开销随长度线性上涨,没有缓存复用的话,长窗口就是奢侈品。定价表里那个 0.042 美元的缓存价,某种程度上已经回答了这个问题:他们预期你会反复喂同一段前缀。
Apache 2.0 才是这次最响的一句话
权重能下载、能改、能商用——对有数据合规压力的团队而言,私有化部署和只能调 API 是两种完全不同的采购决策,中间隔着一整轮安全评审。放到硅基流动身上看更有意思:它本身做的是推理托管与部署,把权重彻底放开,等于把模型送出去,把推理这门生意留在自己手里。闭源模型卖使用权,开源权重卖基础设施,这套逻辑在全球已经被验证过很多轮。协议选 Apache 2.0 而不是各种带附加条款的开放许可,说明他们要的是扩散速度,不是围墙。
价格表比参数表更值得逐行读
定价是最不撒谎的产品说明。
输入 0.834、输出 2.501,账单重心在哪一侧
两者大约三倍差。这个比例放进 Agent 场景里就变得微妙:编码类 agent 会反复注入大段上下文——系统提示、工具定义、仓库骨架、历史轨迹——真正新生成的内容反而不多。也就是说,账单的重量压在输入侧。对高频、长会话的团队而言,单价低不低是次要问题,输入侧能不能被缓存命中才是主要问题。判断一个模型贵不贵,先看你自己的输入输出比,而不是看官方那张表的第一行。
缓存价 0.042,是给长会话写的
这个数字大约只有输入价的二十分之一。潜台词很明确:同一段前缀反复出现时,别重复付费。Cursor 这类工具每次请求都带着相似的系统提示和文件上下文,Claude Code 那样的循环更是同一条前缀走几十遍。缓存命中率一旦上去,1M 窗口的经济性才成立;反过来,如果你的用法天然缺乏可复用前缀,这个价格对你就是一行装饰。真正该做的测算很简单——把过去一周的实际 token 结构拉出来,看看有多少能落到缓存里。
不换工具,才算真正的低门槛
官方点名的接入对象是 Claude Code、Codex、Cursor,全是用户已经在用的东西。这一点比参数更值得留意。模型能力的差距在缩小,迁移成本却一直是硬的:换个 IDE、重写一遍 agent 编排、重新调一轮提示词,这些隐性开销经常比省下的 token 费更贵。直接挂到现有工作流后面,是这次发布里最务实的一句话。模型竞争的下一阶段,接入成本本身就是产品力的一部分。
平台方自己做开源,图的是什么
发布方是推理平台,不是模型实验室。这个身份决定了动机的形状。
权重送出去,调用量留下来
把 Hy4 preview 挂上自家平台,同时开放权重,乍看像把最好的东西往外送。换个角度就通了:模型越容易被部署,跑在硅基流动上的推理服务就越有存在感。开放权重从来不是慈善,它是入口。被争夺的是托管、扩容、稳定性、企业级交付这些东西,权重文件带不走它们。这套打法和过去两年海外几家的路径高度相似,区别只在于这次的参数和价格是同一时间公布的。
编码与分析,当下最实在的两块需求
官方列的方向是编码、分析、研究、复杂实际工作。四个词里,编码最实在:需求明确、结果可衡量、付费意愿强,而且已经长出了成熟的工具链和用户习惯。研究型任务低频且难评估,分析型任务边界模糊,复杂实际工作更是没法量化。编码不一样,跑一轮就知道行不行。把资源押在这个赛道上,是把筹码放在一个已经被验证过的市场里,而不是赌一个还没成形的场景。
剩下的三件事,只能自己跑出来
价格、协议、参数都已经摆在明面上,接下来值得盯的是三件事。真实评测而非精选 demo——SWE 类任务上的通过率、长文件编辑的准确度,这些才是日常工作里的分水岭。1M 上下文在真实仓库里的有效深度,窗口多大和能用多远是两回事。还有工具调用在多轮循环中的稳定性,49B 激活的模型,路由偶尔抽一次风就够毁掉一整条 agent 轨迹。这些没有官方数字能替代。接入、跑一遍、看账单,比读任何一份发布稿都管用。

