OpenAI终于用数字说话了。其研究组织每投入1个人工工作日,就运行了3.1个agent工作日——这家公司据此宣称,已经达到“自动化研究实习生”的里程碑,即在人类监督下完成那些需要熟练研究员数天的明确任务。
这个比值衡量的只是运行时长,而非等效生产力,但它透露出的趋势远比数字本身更具冲击力:AI智能体已不再是实验室里的演示品,而是开始嵌入OpenAI自己的日常研究流程。更值得咀嚼的是内部员工的观察——递归自我改进可能成为未来几年AI能力跃升的关键。当模型能够辅助研究如何改进模型本身,飞轮效应便会显现,这也解释了OpenAI为何主动亮出这组数据。
自我评估数据天然带有美化倾向,但OpenAI迈出的这一步依然值得肯定。真正的问题在于,整个行业眼下只看到这一家公司的单方面披露,外界无法判断多智能体系统在更大范围内的真实渗透程度。OpenAI此次表态是一种姿态,也是一次催促——其他AI实验室若真有底气,就该把类似指标也摆到桌面上来。毕竟,衡量进步的第一步,是承认数字的局限,然后用透明的数据去填补它。

