预训练这两年最大的未解之谜,不是“模型能不能更大”,而是“同样的算力,为什么效果持续在涨”?Dwarkesh Patel 用一组对照实验给出了一个令人意外的答案:数据改进贡献了 12.0x 的算力效率,模型改进只有 3.7x。换句话说,2019 年到 2025 年预训练进步中,数据的力量是模型的 3.24 倍。这个结论不是宏大叙事,而是在最高 1e19 FLOPs 算力预算下,把各年度代表性配方与语料混搭训练后得出来的硬数字。
有意思的是,模型改进的 3.7x 依然是可观的——毕竟架构、初始化、优化器的迭代没有停下。但数据侧的回报远超想象:更干净的语料、更合理的配比、更精细的过滤与去重,这些“看不见的工程”直接压平了 Scaling Law 的代价曲线。当你把 2025 年的语料喂给 2019 年的模型,它照样能跑出远超当年的效率;反过来,把老数据塞进新架构,提升就明显乏力。数据成了新的“芯片制程”,只是它不在台积电的工厂里,而在每一个数据管道的决策中。
当然,这个结论有其边界。1e19 FLOPs 之下的规律未必能线性外推到更大的训练集群——毕竟当算力再暴涨几个数量级,模型规模与数据需求的关系会发生质变。但至少它提醒了行业一件事:别总盯着参数和架构的炫技,欠高质量语料的债,最终会加倍让你的算力白烧。真正决定预训练天花板的,可能一直是那些最不性感的数据清洗流程。

