砸了几千美金 API 费用,换来两封干脆的拒绝信。普林斯顿大学的研究团队搞了一次“影子评估”——让前沿 AI 智能体 面对两篇已经完成但尚未发表的真实论文,限时六天,调用庞大算力和 API 额度,去回答原作者当初最核心的 开放式研究 问题。结果?两位原作者读完智能体的回答,拒绝得毫不含糊。这不是聊天机器人答错几道题,而是 AI 在需要长期规划、判断力和资源意识的真实科研任务上,狠狠摔了一跤。
团队把智能体的输出和决策过程分析得很细。最大的短板不是知识不足,而是 研究判断力 缺失:智能体会在无关枝节上浪费大量预算,面对作者给出的具体指令却频繁跑偏,完全缺乏应有的 资源意识。遇到创造性反馈时,它们不会灵活调整,反而机械推进原有方案,也几乎没有有效的 回溯 能力——一旦走进死胡同,很难自己退回来重新找路。这些缺陷叠加在一起,让一个刚入门的研究生都能完成的“跟随线索走”式任务,变成了前沿模型的滑铁卢。
研究团队自己也说,结论还只是初步的。样本量小,场景也是为测试故意设计的,离完全真实的开放式研究还有距离。但它揭示了当前对 AI 递归自我改进的评估缺了关键一环:不是让模型在封闭基准上刷分,而是扔进需要持续判断、预算分配和犯错回收的长链路任务里。真正的科研从来不是一口气跑到终点,更像在迷雾里咬着牙一次次回头重走。AI 智能体现在还跑不出这条路的第一个弯。

