Anthropic 放出一条消息:Claude 在自家的 Claude Science 系统里,只拿到一条提示词,没人盯着,自己连跑了几天,把平面 N=4 超杨-米尔斯理论中六粒子散射振幅算到了九圈。这个位置上原来的纪录是八圈,由 Lance Dixon 团队在 2023 年创下。总账单几千美元,其中走"直接自举"那条路的 Python 运行成本,大约一百美元。一百美元。这个数字会让不少做微扰计算的博士生沉默两秒。
先弄明白:九圈是个什么量级的事
一个描述不了真实世界的理论,却是最好的靶子
N=4 超杨-米尔斯理论不是现实世界的理论。它没有夸克禁闭,没有手征对称性破缺,连跑动耦合常数都没有——耦合常数压根不跑。物理学家偏爱它,恰恰因为它干净:在平面极限下,散射振幅表现出双共形对称性和 Yangian 不变性,计算结果能写成一套极其规整的符号字母表,看上去更像数学而不像物理。它是一块压力测试板,任何新方法先在它身上试,试得过去,才有资格谈 QCD。
费曼图这条路,早就被走死了
六粒子八圈,费曼图的数量已经膨胀到天文级别,逐个积分既算不完也写不下。所以这个圈子过去二十年做的其实是另一件事:不画图,从解析性质反推答案。振幅的支切结构、符号字母表、Steinmann 关系、低圈已知结果,把这些约束一股脑堆上去,假设答案藏在某个巨大的线性空间里,然后解方程组定系数。这就是自举法(bootstrap)。符号字母表本身不大,六粒子情形下只有九个字母,但允许的组合随权重往上叠,指数级地涨。约束收得越紧,空间压得越小,最后答案唯一。
八圈,是 2023 年的天花板
Dixon 那批人做这件事做了十几年。从五粒子到六粒子,从四圈到六圈,每加一圈都要重新设计整套计算框架,还要跟不断膨胀的中间表达式近身搏斗。2023 年的八圈结果,是"六边形函数"自举计划的阶段性高点。从八圈到九圈看起来只多一圈,真正要跨过去的是复杂度的一道墙。
真正值得说的,不是九圈,是"没人管"
一条提示词跑几天,变量在这里
圈数纪录本身会过时。让人后背发凉的是运行方式:没有人类逐步引导,没有"这里算错了你重来"的即时反馈,模型在好几天里自己规划、试错、回滚、再试。科研自动化喊了这么多年,多数成果的本质还是人把任务拆好、机器照着执行。这回不一样的地方在于,任务拆解这一步也交给了模型。几天不崩,意味着长程自主性和自我纠错已经摸到了某个门槛。
一百美元那条路径,暴露了瓶颈在哪
总成本几千美元,自举那部分才一百。这个比例很说明问题。如果这件事拼的是算力,账单应该反过来写。真实情况是,绝大部分开销花在模型反复试探、走错路、退回来。钱花在"想"上,不是花在"算"上。高能物理计算里最贵的从来不是浮点运算,是知道下一步该试什么。人类用十几年攒够了判断"该试什么"的经验,然后把它写成了机器能读懂的形式。
它没比人类聪明,它只是不睡觉
把这件事讲成"AI 超越物理学家"是一种偷懒的叙事。更准确的说法是:自举法这套方法论早已被人类打磨成可以机械化执行的流程,剩下的活是海量的、枯燥的、极其考验耐心的系数求解与一致性检查——恰好是机器的强项。人搭好了脚手架,机器在上面爬完了最后那段。所以真正要追问的是另一个问题:这一回,它有没有自己动了脚手架?
验货:一个九圈结果靠什么取信于人
物理里没有"跑通测试"这回事
软件可以写单元测试,物理不行。九圈振幅没有实验能对照,谁也没法把加速器开起来去测一个超对称玩具理论。验证只能靠内部一致性:符号字母表对不对,Steinmann 关系满不满足,取特定极限能不能退回低圈已知结果,发散结构是否符合预期。这些全过了,也只能说"大概率没错"。数学上足够漂亮,是这里唯一有效的背书。
公司公告和物理学结论之间,还隔着一段路
到目前为止,这是一则公告。要让物理学界真正认账,至少得备齐三样东西:完整可复现的中间数据,清晰的验证清单,还有独立团队用不同方法算出同一批系数。第二条尤其要命——如果验证清单本身也是模型写的,那这场审判就没有法官了。Dixon 团队的八圈结果之所以站得住,是因为有人一个字母一个字母地核对过。
假设它站得住,接下来会怎样
先变的是工具,不是人
短期内,这类系统会变成理论物理学家的提案机:你给约束条件,它还你一堆候选的符号表达式,人负责挑选和验证。真正被挤压的是中间层——那些靠熟练度和耐心吃饭、高度可自动化的工作。培养一个博士要五年,其中三年在练的手艺,可能正在被重新定价。
下一个靶子在哪
七粒子振幅,非平面修正,更一般的量子场论,甚至数学那边的猜想检验。只要一个领域满足三个条件——问题能被形式化成搜索,答案有硬性的一致性判据,搜索空间大到人力吃不下——它就迟早会被这类系统敲一遍门。九圈六粒子只是开场,而且很可能不是最硬的那块骨头。

