OpenAI 把一批由内部前沿模型产出的数学成果直接扔进了 GitHub,没走期刊那条路。仓库里除了结论,还有论文修订记录和一份引用协议,其中大量证明用 Lean 做了形式化,机器可以逐行检查它们成不成立。这事的分量不在于"AI 又能解题了",而在于验证这个动作,第一次被大规模地从人手里分了出去。
先看仓库,再看结论
为什么走 GitHub 而不是投稿
数学论文的传统路径是投稿、同行评审、见刊,一圈走完,一年算快的。改成仓库形态,等于把评审权当场交出去:谁都能立刻拉下来翻,谁都能在第一时间挑刺。这是一种把压力前置的打法。与其等两轮匿名意见,不如让所有人同时看,看完再说。
引用协议不是行政细节
附引用协议这件事最容易被当成技术性尾巴略过。它的潜台词其实很直白:这批东西默认会被别人拿去用、拿去引、拿去当后续研究的起点。没有这份协议,成果只是一堆托管在云端的文件;有了它,才算拿到进入学术引用链条的门票。把模型产出往学术共同体里塞,这是绕不开的一步。
修订记录比终稿更诚实
论文改了什么、什么时候改、为什么改,往往比定稿更能说明模型的真实水位。一次写对的证明,和反复修剪才站住的证明,指向两种完全不同的能力边界。仓库把这些过程留在明面上,也就把判断权留给了外面的人。
Lean 让"对不对"变成一件可以执行的事
从读着没毛病,到编译通过
过去几百年,证明的检验靠人眼。审稿人通读一遍,觉得逻辑链闭合,签字放行。这套机制够用,前提是产出速度和人类阅读速度大致匹配。Lean 改的是节奏本身——证明被写成代码,编译器逐行核对,几分钟出结果。人从此不必再判断"这一步推得对不对",只剩一个更锋利的问题:这个命题值不值得证。
形式化兜得住什么,兜不住什么
得泼一盆冷水。形式化保证的是:在命题写对了的前提下,证明没错。它不保证命题写对了,更不保证命题有意义。把定理陈述翻译成 Lean 代码这一步是人做的,也是错误最容易钻进去的地方。一个被机器验证得滴水不漏的平凡结论,仍然是平凡的。
"许多证明"这四个字值得琢磨
是"许多",不是"全部"。剩下的那些,可能篇幅过长,可能依赖了尚未形式化的前置结果,也可能只是没人去做。无论原因是什么,形式化覆盖率本身就是一份藏起来的能力报告,懂行的人扫一眼就能读出水位。
研究级数学的门槛,究竟卡在哪
竞赛题和研究问题之间隔着一整条海峡
解题能力好测。国际数学奥林匹克的题目有标准答案,评分客观,模型刷分刷得飞快。研究级问题完全是另一回事:问题本身可能都没被清晰地陈述出来,正确性标准模糊,甚至连"什么算进展"都要靠圈内人吵上几年才能定。模型在这里面对的不是难度的提升,是规则本身变了。
审稿人正变成最窄的那个瓶颈
人类数学界一年能消化的论文数量是有上限的。当模型开始批量产出看起来像样的证明,评审系统的压力不是线性增长,而是指数级的。Lean 在这里的价值就显出来了——它把机器能承担的那部分验证工作接了过去,让人类审稿人腾出手来做真正需要判断力的事。
数学界的反应正在分裂
一部分人觉得这是工具,和计算器、和计算机辅助证明没有本质区别,用就好了。另一部分人担心的是更根本的东西:如果证明的生成和验证都能自动化,数学家的核心价值到底锚在哪里。这种分裂不会因为一次发布就分出胜负,它会持续很多年。
真正被动摇的,是评价体系
署名、贡献与责任的归属
一篇由模型产出的数学结果,作者栏写谁?算力提供方、模型设计者、提出问题的人,还是跑实验的人?传统学术规范里没有现成答案。引用协议能解决"怎么引",解决不了"谁负责"。一个被形式化验证过的证明,如果后来发现命题陈述有歧义,责任落在哪一环,现在没人说得清。
知识生产线被搬进了实验室内部
更长远的变化在这里。过去,实验室产出模型能力,数学界产出数学知识,两者之间有明确的分工和延迟。现在这条链被压缩进了同一栋楼:模型生成、Lean 验证、仓库发布,几步之内走完。学术共同体过去扮演的过滤器和信用背书角色,正在被技术手段部分替代。
信任要靠什么重新建立起来
形式化验证解决的是"证明无误",不解决"该不该信这个结论重要"。后一种信任,历史上是靠时间、靠反复引用、靠后来者真的用上了它才慢慢攒出来的。仓库和协议能加速分发,加速不了沉淀。OpenAI 这一步打开的是分发速度,至于学术信用怎么在机器产出上重建,还是个空白题。

