搞个大新闻最容易的方式,是让AI去解黎曼猜想。Anthropic没搞成。他们让Claude冲了一次,没撞开那扇门,却顺手在门上凿出一道新的裂缝——把满足黎曼猜想的zeta函数零点比例下界,从41.6%一把拉到了67.2%。这个数字既没有刷满媒体头条所需要的戏剧性,也没有那种“AI碾压人类”的叙事张力。但它恰恰是今天最值得被认真写一写的东西。
没解出来,才是最有价值的诚实
那个从41.6%到67.2%的数字,到底在说什么
黎曼猜想问的是一句极尖锐的话:zeta函数所有非平凡零点的实部,是不是恰好都是1/2?这条横在复数平面上的临界线,百年过去,没人能给出一个彻底的是或否。那退一步,人们开始问另一个问题——无论你能不能全部证明,至少你能不能告诉我,有多大比例的零点确实乖乖躺在这条线上?下界,就是已经证明“必定在临界线上”的零点最低占比。此前最好的结果是41.6%,这次Anthropic团队直接把下界推到了67.2%,提幅超过25个百分点。这不是靠蛮力穷举算出来的,而是一种理论上的收紧。他们用了一个未发布的研究版Claude,在特定的形式化环境中,组合现有技术、生成并检验证明思路,最终把一堵已知的墙往前推了一大截。你没听错,AI在这里做的不是计算,而是参与构造证明剧本。
刷点比刷榜难一万倍
在很多人用大模型刷数学竞赛题刷得不亦乐乎的时候,拿AI去攻黎曼猜想,有点像用一把刚磨好的瑞士军刀去拆核反应堆。竞赛题有标准答案、有套路、有巨量相似训练数据。而黎曼猜想相关的零点下界问题,能参考的文献薄薄一叠,每一步都需要对复分析、解析数论有结构性的理解,出一个新结果往往意味着发明一小块新数学。Anthropic团队选择了一个尊重事实的叙事框架:他们没宣称Claude自己证明了什么,而是把模型定位成探索证明空间的助手,人能借助它快速遍历一些可能的构造路径、组合已有定理,甚至发现人容易忽略的中间引理。下界的提升是人机协作的产出,而不是神谕的降临。这种定位,比绝大多数“AI解出某数学难题”的新闻稿诚实得多。
为什么不是算力堆砌
一个自然冒出来的疑问是:把下界从41.6%干到67.2%,是不是因为Anthropic烧了更多GPU?从已公布的信息来看,几乎不是。零点下界的提升依靠的是分析学证明策略的选取,而非海量验算。过去几十年,这个数字每往上顶一个百分点,往往需要数学家引入新的不等式工具或巧妙的分解方法。Claude的角色更接近于一个不知疲倦的猜想生成器和结构匹配引擎——它在非常狭窄的数学定义域内,快速投影出各种定理组合的可能效果,由人来把关、修正、精细化。这解释了为什么成果没停留在“模型输出一段看着像证明的文本”,而是最终形成了严格意义上的数学贡献。算力是必要条件,但远不是充分条件。
语言模型开始触碰数学的硬核,姿势很重要
他们可能怎么让Claude介入的
Anthropic这次放出的信息刻意保持克制,没有大篇幅透露协作细节,但根据他们一贯的研究偏好,几乎可以肯定一点:这绝不是简单地把问题丢进对话框,然后等待奇迹。一个合理的想象是,团队搭建了一套交互循环——Claude负责生成可能的引理路径和部分证明草图,形式化验证工具(如Lean或同类系统)即时检验每一步的正确性,研究人员再对卡住的地方进行干预,注入高阶策略或切换探索方向。这种循环把模型的发散性生成,锁在数学严谨性的笼子里。一旦某条路径被证明走不通,Claude能快速根据失败反馈调整后续生成,而不是在错误里打转。真正关键的,是模型在高受限语义空间内保持创造力的能力,这件事比写出莎士比亚风格的十四行诗难得多。
从“发现”到“证伪”之间的那根线
数学界对AI的期待一直劈成两半:一半希望它能像拉马努金那样,凭空扔出惊人的猜想;另一半希望它能像最严谨的裁判,一根刺都不放过地检查证明是否完美。现实是,大语言模型目前最擅长卡在中间位置——制造大量的候选猜想,其中绝大多数是错的,但少数正确的那些可能藏在不显眼处,需要人来甄别。Anthropic这次把零点下界提升到67.2%,很可能是借助了这种“猜测-过滤”机制。它在传统数学家根本不会去试的路径上踩下了脚印,而其中一个脚印恰好踏到了实处。这不是发现了新大陆,而是在已知海域里找到了此前被忽略的暗礁排列方式,从而把航行范围又向外扩了一点点。这种推进,才更像是AI今后真正在基础科学里的工作方式,而不是忽然甩出一份改变历史的论文。
谦逊的突破,傲慢的寂静
一个下界数字里藏着的工程哲学
把41.6%变成67.2%,本质上是一次对“已知未知”的系统性压缩。下界越高,意味着我们能确定性地断言“临界线上零点够多”的疆域越大,留给可能出现反例的灰色地带就越小。这件事的工程学隐喻厚到可以掰开——在很多复杂系统中,我们无法证实完美的假设,但我们可以一步步提高已知正确部分的下界。AI在这里扮演的角色,是把有限的人类推理密度,用机器级的并行和持久性拉高,从而在同样数量的定理原料里榨出更多确定性。这个数字变动背后,是一种完全不同于“AI觉醒”叙事的冷静态度:工具在慢慢变强,边界在缓缓外移,人依然掌控着意义和方向。
别再等一个神谕式的回答
每次有AI涉足纯数学,总有人马上问:能不能解黎曼猜想?能不能证哥德巴赫?提问方式本身就带着一种对“神谕”的期盼——仿佛模型足够大之后,答案就会自己从参数里飘出来。但数学不是预言,证明不是占卜。Anthropic这次的公开显得格外聪明,他们给出的不是一个看似漂亮的、模棱两可的短文本声称,而是一个具体得有点乏味的数字进步,并清楚地标明了这个进步在学术坐标系里的确切位置。没有新闻稿式的“改写历史”,没有暗示通用人工智能就在转角。这种克制本身就是一种成熟的产品品位和研究品位——知道一个工具能做什么,比夸耀它看起来像能做什么,重要太多。
这一步将把争论带向哪里
人机协作的“可复制性”考验
这次结果发布后,真正值得盯的不是那个67.2%,而是这套协作方法能不能迁移到其他悬而未决的难题上。如果类似的方法可以在数论的不同角落复现,比如迪利克雷L函数相关猜想、或者某些组合数论问题,那它就不再是一次孤立的表演,而是一套被初步验证的科学方法。科学方法的标志不是单次成功,是可重复、可迁移、可被同行检验。Anthropic没有公布具体模型,也没有放出所有交互脚本,这会让学术界保持合理的怀疑。但方向是对的——越是难的问题,越需要坦白地承认AI只是在协助人类扩大搜索半径,而不是替代人类做出判断。
当语言模型学会“不明白”的价值
很多使用大模型的人最讨厌的场景之一,是模型在完全不懂的领域强行输出一堆流畅的废话。但在数学研究里,一个能诚实地识别“这里我卡住了”“这条路径看似合理但隐含一个矛盾”的模型,反而会更有用。Anthropic内部可能已经在对齐性之外,开始重视一种更隐蔽的能力:模型的自我不确定性估计。处理黎曼零点问题需要极窄的动态精度,一步踏错整条证明报废。如果Claude能够在探索过程中标记出高风险步骤,甚至主动建议人为介入审视,那它将不再是一个输出文本的生产线,而变成一个真正意义上的思考伙伴。这种转变,比任何单次下界提升都更值得追踪。
下界之上,还有更广阔的未知
67.2%距离100%还远。那条把全世界最聪明大脑绊倒的临界线上,还有大片未被照亮的区域。但这次尝试至少给出一个信号:用AI辅助做出来的数学结果,可以既是严肃的,也是诚实的,更可以是不需要道歉的。它没有解决黎曼猜想,但解决了一个黎曼猜想边上实实在在的硬问题,而且解决得漂亮。科技圈太容易把注意力集中在“终极答案”上,却忽略了通往神域的唯一道路,是由无数这样不性感、不梦幻、毫不惊天动地的微小推进铺成的。能沉下心来做这种推进的团队,无论在数学界还是产业界,都少得令人不安。Anthropic这次做的事,谈不上炫酷,但足够结实。这团扎实感,可能就是未来十年AI与基础科学之间最健康关系的基本色调。

