把一个12B的扩散模型塞进2.5B的骨架里,而且它们连内部结构、VAE和噪声调度都截然不同——这听起来像是模型压缩领域的自杀式任务。但 Any-OPD 不仅做成了,还顺手证明了直接拿潜在空间做回归训练只会彻底失败。核心做法出奇地克制:不碰任何模型的权重,也不要求架构对齐,只引入一个冻结的 DINOv2 视觉编码器作为表示空间,把教师和学生的输出都投射进去比较。
这就是 Any-OPD 提出的首个支持任意异构流匹配生成器对的同策略蒸馏框架。它本质上把异构蒸馏转化成了一个在独立视觉空间中求解固定点的问题,配合噪声级对齐机制,绕开了不同模型间 VAE 潜空间不兼容、架构不匹配等死结。实验将 FLUX.1-dev 作为教师、SD3.5-Medium 作为学生,两者完全异质,却无需任何共享模块。结果令人印象深刻:学生的 PickScore 与 HPSv3 大幅提升,以教师五分之一参数量逼近其生成质量——在人类偏好指标上几乎平起平坐。而作为对照的直接潜在回归训练,整个过程中模型几乎学不到任何有意义的东西。
这个框架从根上改变了模型蒸馏的游戏规则。过去想用大模型教小模型,要么强迫两家用同一套 VAE,要么费劲对齐架构和调度器。现在这些前置条件全部被打破,冻结的视觉特征空间成了唯一的中介。Any-OPD 展示了一条极简路径:你不再需要相似的模型血脉才能继承能力,一个足够鲁棒的表示空间就足够。对于还在苦苦平衡质量与部署成本的团队来说,这种跨架构的自由蒸馏可能比任何新模型都更有吸引力。

