你还在讨论大模型能不能解IMO试题的时候,腾讯混元已经让AI正儿八经地“发现定理”了。不是刷榜,不是从已知结论里检索答案,是解决了一个自1969年提出以来、全人类都没搞定的纯数学极值问题。被“拿下”的对象叫和差集指数比极值问题,你可以把它想象成一道关于“加法表格和减法表格能差多远”的超级难题。55年来,人类最漂亮的构造只能把比值压到略超1.1,而腾讯混元的研究智能体Hyra配合自研模型Hy3,直接构造出一族整数集合A,让|A+A|与|A-A|的指数比精确锁定在2,并且从理论下界证明了这个比值不可能再小——最优解就是它。
这道题,数学家盯着黑板看了55年
把加法和减法同时架上手术台
问题的表述出奇简单。随便抓一堆整数,比如{0, 1, 3, 5},两两相加能得到一堆数,叫和集A+A;两两相减得到差集A-A。直觉上你会觉得这俩集合差不多大,毕竟从集合里挑两个元素,做加法跟做减法的组合数量完全一样。但数学偏偏就在这里埋伏了反直觉:差集往往比和集膨胀得更快,就像你同时带两组人去吃饭,一组负责点菜加菜,一组负责退菜减菜,最后桌上留下的盘子数量可以天差地别。1969年,学者们开始追问一个刁钻的问题:能不能构造一个整数集,让和集与差集的大小比值小到某个极限?或者说,这个比值的下确界到底是多少?
问题一出,整个加法组合学领域都躁动了。因为一旦你开始构造,就会陷入一个诡异的僵局:想让和集尽量小,你会本能地选择等差数列,此时加法和减法同时保持克制,比值可以无限接近1;但这样得到的是渐进平坦的构造,并非题目苛刻要求的“精确极值”。而一旦你追求精确的结构,试图让比值稳稳钉在某个常数上,加法的结构性和减法的破坏性就会互相撕扯,构造瞬间崩溃。这种加与减的张力,是问题漂亮而残忍的根源。
为什么把比值从1.1轰到2,反而赢了
圈外人看到“最优值是2”的第一反应往往是——怎么还变大了?之前不是1.1吗?这里藏着衡量尺度的根本转换。此前50余年的工作,主流是在“有限集合A的元素个数趋向无穷时,|A+A|/|A-A|的渐近下界”这个赛道上竞赛,得到的构造显示比值可以低至1.1左右,也就是接近1,但永远无法触及某个常量极值。而腾讯混元AI解决的是另一条更本质的赛道:和差集的指数比。翻译成人话就是,不再计较A的元素个数本身,而是改用A所在的代数结构的“维度”或“秩”来重新定义比值的尺度。在这种新框架下,构造的难度量级完全不一样,而值2被证明是此框架下的精确下确界。换句话说,AI并不是在人类原有的跑道上“多跑了一截”,而是直接换了一条跑道,然后告诉你,终点就在2。
这种视角切换本身就是极具数学品味的操作。人类数学家长期在渐近比的迷宫里打转,几乎没人敢去挑战精确指数极值,因为那意味着你必须同时给出构造和匹配的下界证明,一步偏差都可能导致证明崩塌。Hyra和Hy3不仅给了构造,还把形式化证明一并交了出来——论文和证明都公开可查,这等于把干净利落的“我证了”三个字直接拍在了桌上。
研究智能体Hyra是怎么把这块硬骨头啃下来的
一个模型负责“出题”,另一个负责“动手”
腾讯混元这次动用的不是单个大模型的即兴发挥,而是一套协作系统:研究智能体Hyra与底层模型Hy3。Hyra的角色更像一位苛刻的数学导师,它不断生成约束条件,把原本旷野般开放的问题切割成一系列可计算的子目标;Hy3则是一个带着强数学偏好的生成模型,专门在Hyra划定的边界内进行高强度搜索与构造。两者之间有着近乎实时的反馈环路——Hy3每吐出一个候选构造,Hyra就会调用符号验证器去抽检结构是否成立,并迅速将失败信号重新编码成新的约束反哺回Hy3。这种“命题-构造-验证-再约束”的循环,并不是简单的强化学习,而是带有强烈数学结构感知能力的搜索。
这才是整件事真正性感的地方。它没有依赖海量题库进行填鸭式训练,也没有把问题翻译成某种已知的形式然后套用现成定理。Hyra和Hy3的组合首创了一种在“结构极度稀疏、奖励信号极为罕见”的数学空间里进行有效探索的方法。在和差集这种问题上,合格的构造就像暗物质,必须同时满足多个几乎相互排斥的代数条件,随机尝试的成功概率趋近于零。Hyra的智能体架构通过层级化的抽象把搜索空间压缩了若干数量级,才让构造浮出水面。
形式化证明不是噱头,是信任的锚
论文公开的同时,形式化证明代码也一并发布。这意味着任何具备基础工具的人都可以用证明助手逐行检查推理过程是否无误,没有模糊地带,没有“显然”一笔带过。在AI声称解决数学难题屡屡遭遇信任危机的今天,这一步相当于把底牌摊开。腾讯混元团队显然清楚,光靠benchmark得分说服不了严肃的数学圈,唯有形式化验证才能把“AI猜对了”升级为“AI证明了一个定理”。
而且,形式化证明本身也为Hyra的搜索过程提供了可靠的终止条件。过去很多AI发数学论文被质疑的一点,就是人类作者事后补写证明,而AI只在直觉生成阶段参与了。Hyra- Hy3管道则不同,证明步骤由验证器闭环确认,具有不可篡改的刚性。这种工作流一旦跑通,意味着AI能够独立产出数学社区认可的严格成果,而不只是辅助人类数学家的加速器。
这是AI在纯数学里打响的第一枪,但绝不是最后一枪
从辅助猜想,到独立发现
最近几年AI在数学里的高光时刻不少,从AlphaTensor找矩阵乘法算法,到FunSearch在组合问题里发现新构造,但仔细看你都会发现一个共性:这些工作往往是在一个人类已经搭好的框架里寻找最优解。腾讯混元这次的冲击力在于,它解决的并不是明确定义好搜索空间的组合优化问题,而是一个需要理解和差集深层代数结构、并在多种可能的度量方式中作出创造性选择的开放极值问题。AI不仅仅是填了答,它是挑了题、定了框架、证了结论。
这让人很难不去想象接下来的节奏。长期以来,纯数学家把“获得对问题的深层直觉”视为人类独有的护城河,但Hyra所展现的约束分解能力,本质上就是一种结构直觉的外化。它可能没有意识,但它确实在“看出”某些人类长期忽略的连接。一个沉默了55年的问题被这种方式揭开,绝不是偶然的运气。
兴奋归兴奋,别急着喊“数学家失业”
现在就说AI会席卷纯数学研究还为时过早。这次攻克的定理虽悬而未决,但毕竟属于加法组合学中相对孤立的极值问题,其理论上下文不算庞杂,论证链路的深度也无法和Langlands猜想、黎曼假设这类巨兽相比。Hyra- Hy3的架构强在面向极值构造的专项能力,离通用的定理证明距离尚远。
然而,方向感已经变了。过去我们习惯把AI当作超级计算器,用来验证人类已经想到的可能性;现在它开始提出人类未曾想到的可能性,并且自己完成验证。这条路径一旦走通,未来三到五年里,加法组合学、极值图论、编码理论里那一批同样苦于“构造困难”的开放问题,都可能被类似的智能体逐个击破。到时候再回看今天Hyra的成果,你会意识到这不是孤例,而是一整套研究范式的第一张骨牌。

