Redwood Research 最新论文把蒸馏从"模型压缩手段"重新摆上了安全实验台,实证检验两条路径。DFI(Distillation for Incrimination)的思路有点反直觉:把不信任的强教师蒸馏进一个更弱、因而可信的学生模型。学生能力不足,反而藏不住教师那些隐蔽的怪癖——越弱,越容易把教师的失对齐行为放大暴露出来。
DFC(Distillation for Control)走的则是另一条路:能力照单迁移,失对齐在半路截断。一个当探针,一个当筛子。前者服务安全审计,后者服务实际部署。这个分野看着像技术细节,实则指向同一个尴尬前提——我们默认强模型不可信,而弱模型至少还能被看住。真正的问题不是哪条路更聪明,而是它们各自把风险挪到了哪里。
Redwood 这次的价值在于把争论从论证拉回了实验。蒸馏长期被当作降本增效的工程活,现在它同时是取证工具和风险控制阀门。代价也摆在明面上:DFI 用能力换可见性,弱学生暴露出来的怪癖究竟是不是教师的原貌,需要排除蒸馏本身的失真;DFC 想两头兼顾,但阻断是否彻底、迁移是否干净,取决于模型规模和任务类型的复现结果。这条线值得盯——它可能是少数几个既能落地、又能被验证的对齐方案之一。

