强化学习训练一直在精度与吞吐之间走钢丝。Miles团队这回直接亮出底牌——在Blackwell架构上跑通了两种原生低精度强化学习方案,不是仿真,不是模拟,是端到端可复现的完整流程。第一种是端到端MXFP8,把训练和推理全链路压到8位微缩放浮点;第二种更狠,对MoE专家权重施以逐token的NVFP4,在每次前向里动态裁切精度。这两种方案都被塞进8块B200 GPU,用Qwen3-30B-A3B做消融靶场,一次性扫过BF16以及另外五种低精度配置。
结果比许多人想象的更干脆。所有低精度路线的原始奖励曲线几乎与BF16参考线完全重合,没有任何肉眼可辨的乖离。换句话说,从MXFP8到NVFP4,Blackwell芯片原生支持的这些精简数值格式没有吃掉训练信号,反而把推理阶段的时间往下压了一截。报告里没有遮遮掩掩,量化合约的切分策略、每tensor缩放因子、甚至MoE路由时token级别的取舍逻辑都摊在桌上,整套配置精准到可以直接抄作业。对于正在苦等计算预算的大规模RL团队,这等于给了两条硬桥硬马的降本路径:要么全链路沉入MXFP8,要么在专家权重上启用NVFP4,两条路都不牺牲收敛质量。
这当然不是免费的午餐。NVFP4的逐token切换对访存模式有苛刻要求,MXFP8也要求整个管线严格对齐Blackwell的Tensor Core指令集。但Miles团队已经证明,当硬件原生支持你不必再用模拟精度自欺欺人,Blackwell上低精度强化学习的账,终于有人算清楚了。

