Meta 放出了六篇数学论文,作者栏的构成比结果本身更值得看。数学家坐在 meta.ai 的普通聊天界面里,跟 Muse Spark 1.1 和 Muse Spark 1.2 的 Thinking Mode 一句一句往下推,把论文给推出来了。题目不是习题集里挑的,是开放数学问题——没有现成解法能查,没有标准答案可对,也没人给他们搭一套专门的研究脚手架。看点不在"AI 又参与发论文了",而在它是以什么身份、什么方式介入的。
先把"脚手架"这个词掰开说
外挂一装,结论就贬值
AI 辅助数学研究这几年有个固定套路:检索增强负责翻文献,形式化证明器负责验步骤,符号计算后端负责算不动的部分,外面再套一层证明搜索框架把结果串起来。流程一装,模型就变成流水线上的一颗螺丝——它能贡献多少,取决于工程师给它配了多少外挂。这次 Meta 把外挂全撤了。接口就是聊天框,插件、专用工具链、为数学特调的流程一概不涉及。模型会什么就写什么,不会什么,论文里就缺什么。这种"裸奔"状态暴露的是真实水位,而不是工程堆料之后合成的漂亮数字。
Thinking Mode 在这里意味着什么
Muse Spark 1.2 的 Thinking Mode 被单独点名,不是顺手一提。开放数学问题几乎没有"看一眼就知道怎么走"的时候,第一步往往就是试错、驳回、换路子。普通对话模式倾向于给一个像样的答案然后收工,思考模式则允许模型在中间过程里绕圈、自我否定、重建假设。六篇论文里 AI 主笔的段落能不能站住,很大程度上取决于这种"绕圈"的质量。数学不怕慢,怕的是编。
六篇论文的证据结构
段落级署名,不是客套话
这六篇论文最特别的地方是标注粒度。哪些段落由人类数学家执笔,哪些由 AI 主笔,全部标出来。常见的 AI 参与研究往往笼统写一句"人机协作",读者根本没法判断哪部分是模型的功劳,哪部分是人给兜的底。段落级标注把这个模糊地带切开了——出了问题能定位,出了彩也能定位。协作的透明度,本身就是可检验性的一部分。
前辈的账要算清
论文署明了依赖哪些前人的工作。数学是累积性极强的学科,一个结论站得住,一半靠自己的推理,另一半靠它踩在谁的肩上。AI 参与写作时最容易出岔子的地方恰好在这里:可能记错定理的名字,可能把两个相似但不同的结果混为一谈,也可能"重新发明"一个几十年前就有的引理。把来源交代清楚,相当于把这部分风险摊到明面上接受检验,而不是藏在参考文献的夹缝里。
第二组审稿人,还有被致谢的同行
每篇论文都有第二组数学家审阅。听着像常规操作,放在 AI 参与的语境里却不那么常规——审稿人面对的不只是结论,还有"这段到底是谁写的"这个额外变量。更值得注意的是,Meta 对独立公布同类解法的其他团队一并致谢。开放问题被两个团队同时拿下,在数学史上不新鲜;主动承认这件事,说明他们没打算把"首次"这个标签攥在手里当卖点。
说明白了什么,又回避了什么
裸模型路线的一次阶段表态
撤掉脚手架,本质上是把赌注押在模型自身的推理深度上。这条路走通,意味着通用对话模型已经能承担一部分真实研究工作;走不通,则说明专用工具仍是必需品。六篇论文算一个存在性证明——它能做到。但样本量还小,题目难度的分布也没公开。别急着下"AI 能独立做数学研究了"的结论,那还差得远。
数学家为什么肯署名
这是整件事里最不该被略过的一环。数学家的声誉成本极高,名字挂在一篇站不住的论文上,代价是长期的。他们愿意署,说明至少在审阅范围内,这些结果经得起同行推敲。反过来讲,假如六篇里有一篇被挑出硬伤,整个叙事都会跟着塌。现在的信任建立在前置审稿上,真正的压力测试还在后头。
聊天框本身就是一种声明
最后一点常被跳过:界面形态也是表态。没有 IDE,没有工作流面板,没有项目管理工具,就是一个聊天框。meta.ai 在暗示一种定位——它面对的不是拿它当生产力套件的团队,而是愿意坐下来跟模型对话的个体研究者。这个姿态能不能立住,取决于对话质量,而不是产品功能表有多长。
接下来该盯什么
外部检验这一关
审稿是内部的,声明是自己发的。真正的考验是数学界有多少人愿意去读、去验、去引用。半年之后回头再看这六篇论文的下场,比现在盯着发布消息有意义得多。公开的开放问题有个好处:任何人都能上手验,也任何人都能挑错。
下一批题目往哪走
开放问题也有难度梯度。这六篇选的是什么量级,明面上没说。如果下一批开始碰更硬的问题,那才说明这条路真的在往前挪;如果停在同一档反复刷,六篇就是天花板。判断标准很朴素:看它敢不敢碰那些连人类专家都要坐下来啃几个月的东西。
标注体系会不会被学走
段落级署名这件事,价值可能比六篇论文本身更持久。它给"人机协作"提供了一个可操作的模板:谁写的标清楚,依赖谁写清楚,谁审的写清楚。这套模板一旦被别的实验室沿用,AI 参与学术生产的责任划分就有了公共参照。学术圈缺的从来不是能力展示,是能落地的问责结构。

