NVIDIA Nemotron 团队干了一件挺硬的事:基于 Nemotron 3,他们用监督微调、强化学习、反馈驱动推演三条路线,分别做出在 IOI 2026 和 IMO 2026 上达到金牌水平的系统。注意,不是一套模型包打天下,而是针对不同赛制各练一套拳。IOI 考限时代码与算法,IMO 考多步证明与构造,金牌线卡在人类顶尖选手那一档,能摸到这条线,说明底座模型的推理深度已经不是玩具级别。
三种方法各司其职。SFT 把题解格式、代码风格和证明套路灌进去,让模型先学会像选手一样写字;RL 在可验证的奖励信号上反复试错,专攻正确率;反馈驱动推理则让模型在长链条里自我检查、回退、重推,把中间步骤的坑一个个填掉。Nemotron 3 提供通用推理能力,三种后训练策略像三把不同的刻刀,把同一个底座削成竞赛型选手。这套组合拳的真正价值不在奖牌本身,而在配方可复现——别人能照着走。
当然,得给热度泼点冷水。“达到金牌水平”通常指在对应年份的题集上按分数线折算,不等于真去赛场和人类同场交卷。评测环境、提示工程、采样预算都会影响结果,换一套题、换一个评分口径,数字可能就变。但方向已经很清楚:开放权重模型正在逼近最难的推理任务。对做 Agent、做代码生成、做数学工具的团队来说,Nemotron 这套 SFT 加 RL 加反馈推理的路线,比一块虚拟金牌更值得抄作业。

