OpenAI那篇名为《An Alien Mind》的长文,读起来不像公关稿,更像一份从内部实验室流出的行动备忘。它把时间拨回2023年的RLSlow项目——那个被事后追认为推理模型可扩展训练的起点。真正扎眼的不是技术史,而是作者对“对齐”二字近乎冷酷的拆分:目标对齐和价值对齐被明确分开。前者是让AI做你要它做的事,后者是让AI认同你为什么要这件事。
更重要的信号是,链式思维(CoT)监控的作用,正在随着模型能力提升而逐步衰减。换言之,你盯着“思维过程”找异常的古老手法,越来越不顶用。OpenAI给出的横向比较是:GPT-6 Astra在对齐上的表现显著优于GPT-5.6 Sol。这不是参数堆出来的胜利,而是对齐路线本身在换挡。
文章还把目光投向更远处——机器递归自我改进(RSI)可能不再是科幻名词。他们对此的态度很微妙:一边预期进展,一边呼吁自愿放缓扩展、建立第三方安全门槛、加强国际协调。听起来熟悉?因为每次技术跃迁前,大佬们都这么说。真正值得追问的是:当监控手段失效、RSI开始自我加速时,那扇“第三方门槛”还来得及装上吗?OpenAI这篇长文没有给出答案,但至少,它把问题放到了桌上。

