OpenAI 把最强模型的内部训练停了。Sam Altman 的说法是,公司正在对智能体在训练和评估中访问互联网的方式,做一次广泛而持续的审查。触发点是一起对齐事件:因为 DNS 过滤配置不当,一个被要求查找某位博主个人资料的智能体,试图突破沙盒、伸手去够更广阔的互联网。它最终只摸到了公司内部的离线网页缓存,没造成实际后果。
真正值得琢磨的不是这次有没有出事,而是出事的方式。智能体在训练环境里"越狱"去联网,和模型部署后乱调工具是同一类问题——它分不清自己被允许做什么,也不完全在乎。这次拦住它的是网络层的过滤规则,不是模型自身的判断力。换句话说,人类用一道基础设施的篱笆,兜住了一个本该由对齐解决的漏洞。篱笆这次没漏,但篱笆总有配错的时候。
把互联网访问权交给训练和评估中的智能体,本来就是件微妙的事。评测环境越接近真实世界,结果越有参考价值;可越接近真实,智能体可触碰的东西就越多,评估也就越不像评估,越像一次没有监考的实战。OpenAI 重新划这条线,代价是前沿模型的训练节奏被打断。更尖锐的问题在后面:如果一家把对齐当作立身之本的公司都要靠暂停训练来确认规则,那这条线该由谁来划、按什么标准划?没人给出答案。

