一千多美元,一次九圈振幅计算。Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Claude Science(版本号 Fable 5.1)把平面 N=4 超对称 Yang-Mills 理论中的六粒子散射振幅推到了九圈,花的钱大约一两千美元。物理学家 Matt von Hippel 专门写了一篇复盘,态度比标题党冷静,也比"AI 又赢了"有嚼头。
这道题到底难在哪
圈数是个指数级的诅咒
量子场论里算散射概率,常规做法是把结果按耦合常数展开,一圈对应一项。麻烦在于每加一圈,要处理的数学对象就膨胀一轮。到了九圈,靠人力枚举费曼图已经是笑话——图的数目早就是天文数字,而且中间几乎每一项都带发散,整理起来比算起来还累。
真正管用的从来不是费曼图
高阶振幅计算的现实路径叫 bootstrap。先推测最终结果该活在哪一类函数空间里,用所谓的 symbol 和字母表来刻画它;再把各种物理极限当成约束,共线极限、软极限、Steinmann 关系,一条条压上去;剩下的自由度用已知的低阶数据钉死。整个过程更像解一个巨大的数独,靠的是约束,不是蛮力。
Claude 交出的,是一条完整流水线
Fitzpatrick 和 Mishra-Sharma 让模型干的,是这套流程的编排工作:生成代码、组织函数空间、调度海量中间结果、在约束条件里反复试错,直到线性方程组可以解出。von Hippel 的评价很实在——方法都是现成的,算力也谈不上奢侈,真正新鲜的是执行这些事的不再是人。
账单背后,买的到底是什么
便宜的是试错次数,不是算力
一两千美元买不到什么超级算力,但买得到成千上万次失败的尝试。一个研究生做同类工作,最贵的成本从来不是机时,而是一次尝试要花掉几周甚至几个月。当单次试错的边际成本被压到几美分,整个计算的性价比曲线就换了一条。
瓶颈从手速换成了品味
写代码、跑数值、整理中间结果——这些曾经是博士生头两年的主要训练内容,现在模型做得比多数人快。剩下的难题是判断:该引入哪条约束,哪个异常结果是真信号而不是 bug,哪条路走不通要趁早放弃。这种判断力短期内还是人的活儿。
一个没写出新物理的结果,凭什么值得说
肯定会有人说:九圈算什么,方法都是旧的,物理结论一条新的都没有。这话不算错。但科研推进本来就有两种,一种把边界往未知处推,另一种把已知方法推到更远的地方,看它在哪里断掉。后者同样提供数据点——它告诉你这套自动化流程的极限位置。
别急着给理论物理开追悼会
字母表是别人给的
这次计算依赖的函数空间和字母表,是过去十几年里由人一点点猜出来、验证过的。Claude 没有发明新字母,也没有发现新的对称结构,它是在一张已经画好的地图上把路修得更远。把地图往前延伸一公里和重新测绘一片大陆,是两回事。
错误会以最无聊的方式出现
高阶计算里的 AI 幻觉不会表现成天花乱坠的胡说,而是更枯燥的形式:解错一个线性方程组、漏掉一个边界条件、给出看起来合理但数值不对的中间结果。这类错误最难查,因为流程长、环节多,而单步输出看上去都挺对。
验证,才是真正的天花板
更关键的是它没法自己给结果盖章。要让这个九圈振幅被同行接受,需要一致性检验、低阶极限回归、独立方法的交叉验证。生成变便宜之后,验证反而成了最贵的一环,而这一段恰恰是大部分 AI for science 叙事里被悄悄跳过的部分。
那么接下来拼什么
提问能力比解题能力稀缺
当执行变得廉价,稀缺资源就转移到提出一个可被约束、可被验证、值得算的问题上。哪个理论值得做 bootstrap,哪条极限里藏着新结构,这些问题没有标准答案,也很难靠自动搜索解决。谁的品味好,谁就先走一步。
署名、信任与责任
一篇主体计算由模型跑完的论文,作者栏该怎么写?谁对结果负责?出问题时,责任落在按下回车的人身上,还是落在训练模型的公司身上?现在没有共识,但随着这类工作变多,这些问题迟早得有人回答。
年轻人该高兴还是该紧张
对做振幅计算的年轻研究者来说,坏消息是纯执行型的技术活会迅速贬值;好消息是,一个三五人的小组现在能碰的问题,体量比以前大得多。von Hippel 那篇复盘本质上是在做预期校准:别把这次当成奇点,也别装作没看见——它属于那种会悄悄改掉日常节奏的进展。

