训练一个千亿参数的MoE模型,GPU有一半时间在摸鱼——这不是夸张,是过去两年业内的公开秘密。直到小红书与北大联合甩出的UltraEP,才第一次把“实时精准的负载均衡”真正带进了生产系统。它不靠事后补救的辅助损失,也不靠静态的容量因子,而是盯着每一次microbatch、每一层Transformer的路由结果,当场算出谁是热点专家,立刻复制副本把请求摊开。方案落到Qwen3-235B上,训练吞吐直接冲到理想上限的94.6%,比Megatron-LM高出整整42%;推理端更夸张,prefill吞吐直接反超SGLang 1.56倍。能用一行行工程代码把GPU利用率从一半拖到近乎满分,这背后是一整套全新思路的调度哲学。
为什么大模型专家的“赋闲”比996还严重
路由天生就不公平
MoE之所以香,是因为它用一个路由网络把token分配给少数几个专家,而不是让大几千亿参数全体出动。但路由网络从来不懂什么叫公平。热门专家被疯狂塞满,冷门专家几乎空转,导致大量GPU算力在等——等那个最忙的专家干完活,大家一起往下走。更糟的是,这种不均衡不是偶然,而是训练出来的路由分布本身就带有强烈的偏好。你以为你买了一张A100,实际上它有一半时间在喝茶,算下来成本直接翻倍。
辅助损失治标不治本
业界当然不傻,Megatron-LM、DeepSpeed-MoE都用辅助损失函数逼着路由均匀些。问题是,辅助损失是一把钝刀。它只在反向传播时给路由网络一点惩罚,根本不知道下一秒哪个专家会炸。容量因子(capacity factor)也是常见解:给每个专家设个最大token数,超了就丢弃。丢掉的token怎么办?只能用残差连接混过去,模型精度直接被吃掉一块。这些方法本质都是在猜,猜下一个step的负载分布,猜一个静态的容量,而MoE训练进程中的负载波动远比想象中剧烈。
UltraEP解题没那么多花活:盯着路由,当场复制
每个microbatch都是一次全新的调度决策
UltraEP的核心逻辑简单到让人拍大腿:别猜了,路由网络自己已经把答案写脸上了。每一层前向传播时,路由网络会给每个token分配专家排名,这些排名就是最精确的负载预报。UltraEP在每个microbatch开始前,直接读取这些精确路由信息,实时统计哪些专家会超载,然后立刻启动动态复制——把热点专家的参数多复制几份到空闲GPU上,让多个副本并行服务。这一步不依赖任何统计数据、不调任何超参,完全是基于当前这一把的即时路况做决策。
逐层复制,比特么张量并行还聪明
更绝的是,复制不是全局搞一次,而是逐层进行。Transformer每一层的热点专家可能完全不同:第二层的专家3忙得飞起,第三层可能换成了专家7和9。UltraEP在每一层重新读取路由、重新计算副本数、重新分配GPU,热点专家被逐层动态复制到最适合的空闲单元上。相比传统的张量并行把专家像个铁板一样切开了分,逐层复制更像是给拥堵车道临时加开匝道——哪里堵了疏哪里,不堵的路一分一毫资源都不浪费。这也就解释了为什么它能做到训练和推理场景通吃。
训练94.6%理想线、推理反超SGLang,这组数据太硬了
训练场:把Megatron-LM甩开42个点
在小红书内部的实际生产环境中,UltraEP被部署到千亿级的Qwen3-235B上做训练压力测试。理论上的“理想性能”,指的是所有专家负载完全一致、没有一丝空等的完美吞吐量。以往能跑到六七成就烧高香了。UltraEP上阵后,平均训练吞吐达到理想性能的94.6%,几乎把GPU利用率榨干。对比上一代广泛使用的Megatron-LM,训练吞吐提升了42%——这不是实验室小batch跑出来的噱头,是大规模分布式训练跑出来的生产数字。
推理场:prefill吞吐比SGLang高出1.56倍
推理侧,UltraEP的重点放在prefill阶段,这一阶段请求密集、计算量大,恰好是负载不均的重灾区。SGLang作为推理加速的优秀方案,一直被当作基线。而UltraEP用同样的动态复制策略,直接在prefill吞吐上跑出1.56倍的领先。这意味着同样的硬件,同样的模型,响应延迟更低,并发处理能力更强。对于需要快速打出首token的场景,这1.56倍几乎等于凭空多出一堆GPU。
开源的不只是代码,是整套可嫁接到你业务的调度思路
论文和仓库就摆在那里,别找借口了
小红书和北大这次不仅发了论文,还把代码彻底开源了。仓库里不仅有实现细节,还有对接主流框架的适配层。做大规模分布式训练的团队,完全可以拿着这套东西去替换现有调度逻辑。它不绑定特定的并行策略,也不要求你重写模型代码,本质上是给当前训练框架加了一套“实时交通指挥系统”。这种低侵入式的工程方案,对已经跑着生产业务的团队来说简直是救命稻草。
UltraEP背后是一种新范式:数据驱动的即时调度
比代码更值钱的是思路。UltraEP证明了一件事:实时、细粒度的调度决策,完全可以用已有的路由信号做出最优解。这种即时数据驱动的调度范式,不只能在MoE专家负载上开花,未来放到流水线并行、数据并行、甚至跨集群的任务分发上,都有极强的想象空间。那些还在通过调参勉强调和负载的团队,该重新审视一下底层调度逻辑了。UltraEP把一条更直接的路画了出来,剩下的就看谁先动手。

