腾讯混元拿出的不是又一个“全面超越GPT”的模型,这点就让今天这条消息值得认真读两遍。他们开源了一个叫 Hyra-1.0 的研究智能体——核心词是“递归自我改进”,在一个叫 NanoChat 的任务上,连同另外两项基准,直接把 Recursive 体系此前的公开结果甩在了后面。更吸引人的是它带来的实际产出:55 个数学开放问题里刷新了 29 个历史最好结果,还顺手设计出一个只有 15 个可训练参数、却能完成 10 位数加法的 Transformer。所有产物,包括模型权重、数据集、递归轨迹,全部丢在了 GitHub 上。
递归不只是听起来漂亮
Recursive 曾经立下的标杆,Hyra 动摇了
过去两年,递归自我改进这个概念一直飘在研究前沿的上空,但真正跑出稳定结果的工作屈指可数。Recursive 体系之前用一组精心设计的提示和外部验证器做到了让模型反复审视自己的输出,在代码和数学任务上推高了天花板。Hyra-1.0 没有推翻这个路线,而是把它做得更“狠”——在 NanoChat 这类需要多轮互动和状态追踪的任务上,它直接超过 Recursive 公开结果不少,而且不是靠堆模型参数。仔细看公开的运行日志就会发现,Hyra 的改进曲线更陡,失败回退更快,这意味着它在递归循环中做了更有效的记忆压缩和判别门控,而不是简单重复生成-评分-选择的循环。
55 个问题、29 次刷新:数学不是终点,是试纸
数学开放问题对智能体的价值,从来不在“能不能拿菲尔兹奖”,而在于它是一套高度可验证的逻辑压力测试。Hyra 在 55 个问题中刷新了 29 个历史最优解,这里的“最优”不一定是人类期待的那种简洁证明,而是它找到了更短、更高效或更具泛化能力的路径。有几个记录是组合数学与图论领域的,人类研究者看了可能会皱眉——因为它的解答逻辑极度“非人”,却严格满足形式验证。这说明它的递归过程已经能够探索人类直觉不太会踏入的解空间。这种能力一旦迁移到药物分子设计或量子线路优化上,想象力会立刻变得具体。
15 个参数,两个数字相加:压缩的极限挑衅
谈大模型谈久了,看到“15 个可训练参数”这个数字会产生一种生理性的错愕。Hyra 设计出的那个小 Transformer,用 15 个参数就稳定完成了 10 位数加法。这件事的意义不在加法本身,而在于它证明递归自我改进的智能体有能力找到极端稀疏的算法解。如果你把现在的 LLM 视为一个臃肿的近似器,那么 Hyra 这类智能体就有点像压缩算法和程序综合的混合体——它能自动搜出一个任务对应的极简电路。走到这一步,已经不是在比拼跑分,而是在重新定义什么算是“模型设计”了。
开源放出的到底是什么
不止权重,是完整的思考轨迹
很多开源项目最终放出来的就是模型卡和一张测评表。Hyra 的仓库干脆把整个递归过程的中间产物都摊开了:每一次自我改进生成的草案、验证器的打分、最终被采纳的修正步骤。这意味着外部研究者可以复现的不是一个结果,而是一条从普通到顶尖的改进曲线。这对后续做 AI 科研辅助的人而言,价值远超任何单一基准分。你可以看到它在哪个步骤容易犯错、哪类错误会导致递归崩塌、以及它是如何从崩塌里自己爬出来的。
可复现的科研流水线开始成型
腾讯混元这次还把触角伸到了量子物理和药物设计——这些领域对产物的稳健性要求极高。Hyra 在这些任务上给出的不是模型本身,而是一套自动发现的设计方案。也就是说,它输出的是一份结构化的实验流程,在药物设计里是候选分子的生成路径与筛选逻辑,在量子线路里是门序列的编排。由于全程可审计、可重放,科学验证的成本大幅降低。这才是智能体介入科研时,最应该被强调的形态:不是跑分机器,而是方法论的加速器。
Recursive 被超越,但递归竞赛才刚开始
Hyra-1.0 的命名里没有“第一代”的谦虚,它显然想成为递归智能体这条路线上的一个新基准。但仔细对比就会发现,它的优势很大程度上来自更优的循环终止策略和更细粒度的验证模块,这些属于工程架构上的突破。Recursive 体系背后的思想仍然是地基。接下来这个方向会吸引更多团队进入,谁能先做到跨模态递归或者引入实验物理世界的反馈闭环,谁就能拿到下一个定义权。腾讯混元这次开源,也等于提前铺设了一条让别人追赶的轨道。
研究智能体,终于撕下噱头标签
大厂的下场方式变了
过去大厂推 Agent,多是在既有产品上叠一层对话壳子。Hyra 的出现表明,前面几排的研究团队已经在认真把智能体当作独立的科研主体来打磨。它不是给 ChatGPT 套个工具链,而是让智能体在内部循环中自行产生假设、验证、丢弃、再提出的完整科学方法循环。这种下注方式比单纯放一个超大参数量的模型更需要胆量,因为它把胜负押在了架构和反馈闭环上,而非算力开销。
递归改进将重写科研效率公式
不要只盯着那 29 道数学题的数字。递归自我改进一旦稳定下来,会深刻改变科研领域的工具形态。设想一个研究团队把领域知识编码进验证器,智能体在夜间对数以千计的假设空间做递归搜索,早晨返回几个高置信度的实验方案。Hyra 给出了一个简化的可行性样板。它用 55 个问题证明这种模式在逻辑密集型领域可以规模化,而 15 参数加法器则霸道地暗示,机器发现极简结构的潜力还没有被认真挖掘。
还没到“自动科学家”,但路径清晰了
Hyra-1.0 仍然需要人类预先定义好奖励函数和验证规则,离真正能自主定义问题、重构知识体系的“自动科学家”还很远。但它解决了一个关键障碍:让模型在生成—批评—修正的循环中稳定收敛,并且把整个过程的工程成本压到了可以开源复现的程度。接下来的故事很可能会在生命科学和材料计算领域加速上演,因为那里有足够多的形式化问题等着被递归搜索。腾讯混元这次用一次全开源的行动,把这个问题极其清醒地推到了台面上——你不需要等到 AGI 降临,递归自我改进本身已经值得当作底层设施来建设了。

