一个物理学家给 Claude 出了道题,然后走开了。几天之后回来,屏幕上是一份平面 N=4 超杨-米尔斯模型中九圈散射振幅的计算结果,账单大约几千美元。整件事由 Anthropic 在自家科学博客上披露:挑战由物理学家 @4gravitons 发起,Claude 依靠单个提示词、在近乎无人监督的状态下连续运行数天。这不像精心编排的演示,倒更像有人把一台机器推进实验室,关上门,看它能不能自己找到路。
先搞清楚这道题有多硬
出题的人,本身就不太信 AI
4gravitons 是长期写物理博客的人,属于那种会把论文里的推导亲手重做一遍的类型。他出题不太可能是为了证明 AI 行,更像是想看看它究竟会在哪一步露馅。规则也够狠:只给一个提示词,之后不介入、不纠正、不喂线索,中间没有任何人告诉它"这一步该用哪个技巧"。
九圈不是"多算几层"那么简单
散射振幅是量子场论里最基础、也最昂贵的对象之一。圈数每往上加一圈,中间态的复杂度就往上跳一个量级,计算量不是线性叠加,而是爆炸式增长。想把它算出来,得靠对称性、递推关系、符号化简、积分处理一整套组合拳。任何一步选错路子,都会在几天后变成一堆无意义的表达式。这也是为什么高圈计算长期以来是少数人才能碰的活。
为什么偏偏挑平面 N=4 超杨-米尔斯
这个理论的对称性极高,圈内常被称作理论物理的沙盒。它结构干净、可积性强,已知方法多,正适合做"到底行不行"的试验田。选它并不是降低难度,而是让难度可被检验——因为在这套框架里,什么算对、什么算错,判起来相对清楚。
一个提示词之后,人就走开了
几天里它究竟在干什么
Claude 拿到的是任务描述,不是操作手册。它得自己决定先做什么、卡住了换哪条路、结果不对时回头改哪一段。这和日常"你问一句它答一句"的交互完全是两码事。几天时间里,绝大多数动作发生在没有人看的地方,没有人在旁边说"这步不对,退回去"。
几千美元的账,明细比数字更重要
成本约几千美元。相对一次真正的九圈计算,这个数字算不上贵。更值得看的是钱花在了哪里:很大一部分烧在了反复试错上,而不是一次成功的推理。也就是说,它自己走了弯路,又自己绕了回来。这恰恰是研究工作的真实形状——没有人一次写对。
结果不能自己给自己打分
Anthropic 提到,结果经过了独立验证。这一点比计算本身更关键。理论物理里的九圈结果是可以交叉检查的:换一条完全不同的路径得到同一个表达式,或者看它在已知极限下退化成什么样子。不过话要说清楚,独立验证证明的是这个结果成立,而不是这套流程换到别的问题上照样成立。
"无监督"三个字才是重点
长任务卡住的从来不是算力
算力现在基本可以外置,买得到、等得起。真正难的是长时间跨度上的稳定性。一个要跑几小时甚至几天的任务,中间任何一点小偏差都会被后续步骤无限放大,最后输出一份看起来很像样、实际上全错的东西。
没人盯着,错误会怎么滚雪球
有人在旁边时,异常通常十分钟内就会被发现。没人在时,模型只能靠自己的判断力察觉不对。它需要具备一种"这个中间结果不对劲"的敏感——这种自我怀疑的能力,比解题能力更稀缺,也更难训练。
Agent 的甜区在哪儿
翻回来看,这类任务能成,靠的是几个条件叠加:成败信号明确、步骤可分解、错了有硬反馈。符号计算正好符合——算错了会发散、会不自洽,机器能自己感觉到疼。反过来,那些没有清晰对错、需要和人反复对齐意图的事情,放它自己跑几天,只会把偏差越跑越远。
这类结果对理论物理的日常意味着什么
从计算器到同事,中间隔着一层信任
现阶段的定位更像一个能自己加班的计算实习生。问题由人提出,审美和判断由人给,验证由人做,决定权还牢牢在人手上。但一个能连续工作几天不掉线的实习生,已经足够改变课题的组织方式:有些过去因为"太贵太慢"被搁置的方向,可以重新排进队列。
几千美元把"值不值得算"的门槛挪了位置
几千美元是什么概念?一个博士生啃九圈,可能要好几个月,人力成本远远超过这个数。这不等于 AI 更聪明,但它确实把一道老问题的答案往前推了一格。研究里大量项目不是想不出来,而是算不动、不敢开口要资源。门槛一旦降低,被放弃的想法就会重新浮上来。
没被回答的问题还有一堆
单个成功案例说明不了规模化能力。成本会不会随难度指数上升?错误率在高圈数下是否仍然可控?最要命的是,人怎么在一个跑了几天的黑箱过程里保持真正的理解,而不是只看最终答案对不对。这些问题现在都还敞着口。
这道题被解出来了,题目本身没有。

