42分,全对。六道题没留一个死角。小红书 dots 团队捎进来的 dots-note 3.0,在第 67 届 IMO 上把所有题目啃了下来,全球只有 7 个顶尖人类大脑达到了同样的完美度。这不是 AI 又一次在棋盘上碾压人类的老戏码。真正让人停住目光的,是它解题的方式:不靠形式化语言做中转,直接读取原始 LaTeX 题目,然后靠一套递归自我批判的回路,从第一行推理写到最后一盖章,全程端到端。没有外挂验证器,没有事后补丁。扔给它一团乱线般的符号,它给你织出一块无瑕的证明。而且,这款模型是 dots3 家族里最轻的,团队还放话说要开源。
满分的背面,一场方法论的暗战
不用形式化这根拐杖
过去几年,但凡在数学竞赛上拿高分的 AI,背后几乎都拽着一根形式化验证的拐杖。题目先被翻译成严格的形式语言,再喂给符号引擎或者神经符号混合系统,证明的每个步骤由外部检查器卡口。这当然能出成绩,但也把天花板锁死了——模型一直在别人搭好的脚手架里攀爬,从未真正“读懂”原始问题的数学肌理。dots-note 3.0 直接斩断了那根绳索。它吞进去的就是 IMO 卷面上的 LaTeX 源码,那些公式、符号、自然语言混杂的粗糙文本。然后,它给出证明。不是可选路径,而是唯一路径。这种端到端推理迫使模型必须在内部构建更深层的语义理解,不能指望任何外部净化器来兜底。
人类的7张满分与模型的1张
IMO 2026 的领奖台上,连着粉红色的脉搏站着 7 个满贯少年。现在多了一个——藏在服务器里的轻量级模型。这件事的意义不在取代,而在对照。这 7 位人类选手的草稿纸上,涂满了直觉跳跃、错误尝试与闪电般的自我修正。dots-note 3.0 的“草稿”则是隐藏层里无数次自我批评的翻滚。它和那些冠军少年在思维方式上出现了奇异的平行:碰到一道硬骨头,先抛出几条可能的路,然后自己当最刻薄的裁判,挑出逻辑裂缝,再补上。区别只是,模型在一瞬间做完了几百轮这样的内心争吵。人类用了数十年才培养出的数学品味,模型在一次次自我批判中烧结出了替身。
递归自我批判,推理的升维引擎
它的内心独白,不是辅助程序
把递归自我批判仅仅看作“模型会后复盘”就太轻了。传统的自我修正,多半是生成一个结果,再调用另一个组件去评分的双段式流程。dots-note 3.0 把批判焊进了生成主干本身,变成一种持续的内心独白。设想它在证一道组合数论题:第一步给出一个看似合理的拆分,紧接着内部机制就开始解剖这个拆分是否存在隐性假设。发现局部不闭合,立刻推倒局部推理,重新熔炼。这种切割与重组不是事后补救,而是思考的原始形态。就像数学家一边写推导一边划掉几行,却不留下划痕。递归的层次可以很深,模型会针对修正后的修正再做审视,直到整条论证链具备一种近乎洁癖的严密性。
从“赌一次”到“反复审视”的范式转身
过去的语言模型解数学题,本质是在高维空间里赌一个最像标准答案的序列。概率高不高,全看训练数据里有没有类似的题。而递归自我批判把生成过程改造成了多重审视的流水线的。模型不再满足于吐出一串看起来有道理的符号,它要求自己生成的每一段推理都能扛住内部模拟的拷问。这相当于给预测机装上了校验器,并且打通了二者之间的梯度回路。于是,模型的输出不是一次采样的结果,而是反复验证后的沉积物。这个转变带来了一个恐怖的副产品:证明的可解释性自然浮现出来,因为每一行都经过内部逻辑审计,不再需要费尽口舌去猜模型“为什么会这么想”。
戳破数学推理旧天花板的那根针
许多做推理的团队一直在形式化验证与纯神经网络之间画地为牢。前者保证正确但笨重僵硬;后者灵活却容易产生隐蔽的逻辑幻觉。dots-note 3.0 这种原生的递归批判能力,像一根针,戳破了两者之间那层看似结实的膜。它用端到端的方式逼近了形式化验证的可靠性,却保留了自然语言推理的柔韧度。IOI 满分不是故事的终局,而是一个起点信号:当模型能够在自己脑海里建立起稳固的数学公理直觉而不靠外部规约,数学发现的自动化就不再是科幻小说的素材。六道满分题背后,是一个推理模型学会了在符号游戏中遵守无形规则的底层逻辑。
轻得不合理,也开得敞亮
最轻量级的远行
dots-note 3.0 在 dots3 系列里是参数量最小的那个。团队故意把身材压得很薄,却在 IMO 上撑开了全场。这反过来衬出一种可怕的可能性:数学推理的突破,未必需要海量参数的堆砌,而更依赖认知架构的重组。轻量级意味着推理时延急剧缩短,意味着它可以作为某种大脑插件,被科学家、工程师实时调用。当别人还在用巨型模型在形式化迷宫里绕弯,一个轻量级的竞争者已经靠内部批判走完了直线,并且功耗低得多。这次满分,可以说是对“模型越大,推理越强”这种肌肉崇拜的一记优雅反击。
开源:刺破黑箱的那根刺
团队预期开源,这可能是比满分更值得圈点的决定。当下最顶尖的推理模型,多数被包裹在付费接口和私密权重里,外界只能远远地看个热闹。dots-note 3.0 一旦把整个递归自我批判的流水线摆到桌面上,研究者就能掀开引擎盖,看清那些内部争吵的权重是如何演化的。数学教育界可以拿着它给学生当思维伙伴,小公司能在它身上嫁接金融、法律等需要严密推演的垂直场景。开源不只是放出一堆文件,而是把推理技术的下一个演进方向公开标定出来。刺破黑箱之后,真正的竞争才刚开始。

