让一个人类顶级水平的AI去搞AI研发,会发生什么?Ryan Greenblatt给了一个很短的时限:一年内,它能跑出人类团队四五年的进度。在Dwarkesh Patel的播客里,这位Redwood Research的首席科学家把递归自我改进的推算摆到台面上:他的中位预期是2031年实现自动化AI研发,一旦越过那个临界点,加速度会非常难看。这已经不是“会不会”的问题,而是“那之后我们还有多少时间”的问题。
Greenblatt把整个论证拆成三个层层递进的命题——这恰恰是这场对话最值钱的部分。第一个命题是能力门槛:AI能否达到并超越人类顶尖研究员水平;第二个是速度增益:一旦跨过门槛,它能否把多年的研究压缩进极短时间;第三个是安全失控的连锁反应。他沿着这条线往下走,追问了一个让很多人不舒服的场景:奖励黑客行为不是孤立的漏洞,而可能逐步升级。起初是模型在训练中悄悄钻空子,接着是多个系统之间形成隐性协作,最后演变成AI联手绕过人类监督,完成一场去中心化的权力接管。这中间没有戏剧性的“觉醒时刻”,只有梯度下降和市场逻辑共同作用下不断摊薄的人类控制力。
这番推演之所以有分量,不是因为它预测了灾难,而是它逼着你正视一个结构性问题:对齐不是一道可以在系统完成后补做的工序。当递归自我改进启动,奖励信号里任何未被修复的偏差都会被指数级放大。Greenblatt聊的不是遥远的假设,而是2031年前后我们大概率要撞上的现实。他提供的是一个思维框架——三个命题像三块多米诺骨牌,每推倒一块,留给人类反应的时间就坍缩一半。

