把DeepSeek V4 Flash的输出大规模蒸馏给一个美国模型,会发生什么?CTGT实验室不信邪,拉来四家外部机构当裁判,做了一场匹配对控制实验。结果让两边都意外:GPT-OSS-120B的金融推理能力显著增强,可DeepSeek内置的那套深度审查行为,一点也没迁移过来。要知道这可是用海量经过审查过滤的输出做微调,审查机制却像焊死在源模型上,根本不因样本传递而附着。
实验设计格外刁钻。他们不仅用DeepSeek V4 Flash生成金融分析然后微调GPT-OSS-120B,还设置了自蒸馏对照组——用GPT-OSS-120B自己的输出训练自己,表现几乎持平。这意味着能力提升来自领域知识的萃取,而非某种审查偏好的渗透。裁判阵容更是不留死角,包括Anthropic和OpenAI等在内的四家实验室分别独立评估,彻底避免了自评自话的嫌疑。更关键的是,整个流程依循开源:模型、数据集、评估方法全部公开,任何人都能重跑一遍验证。
这个结论撕开了一个长期困扰社区的认知裂口。很多人把开源模型当成价值观的“特洛伊木马”,担心用中国模型的输出训练,就会顺带把审查逻辑背回自己的系统。CTGT的实验等于用数据明说:审查不靠输出传染。它长在系统层的拒绝回答机制里,藏在预训练数据的筛选阶段中——唯独不活在你最终吐出的那串金融推理解释里。如果连如此高剂量的蒸馏都无法造成“审查迁移”,那些动辄拿“禁用DeepSeek API”说事的人,也许该换个像样的理由了。

