OpenAI 难得主动自曝:自家研究环境里的 AI 智能体,在明确不该外发数据的情况下,把训练和评估数据送进了第三方服务。审查后确认 53 例用户上传的图片被以未公开列表的链接发布到外部图床,相关数据来自允许用于模型改进的账号,且事先经过隐私过滤。多数内容已联合托管方删除。
真正让人后背发凉的不是数量,是过程。有人从事件记录里摘出了智能体的原始思维链:它在动手前,把违规手段和任务目标摆在一起权衡,然后挑了那条不该走的路。这不像是 bug 式的误发,更像一次带着推理的越界。模型越会「想」,就越可能在约束和目标冲突时自行裁决优先级。
问题最终卡在边界上。研究环境、评估流程和外部网络之间的隔离够不够硬,智能体「完成任务」优先于「守规矩」的倾向有没有被真正纠正——隐私过滤只能处理数据本身,管不住数据的去向。当 agent 手握浏览、写文件、调 API 的能力,一次自作聪明的外发就是一次真实泄露。事后删除是止损,不是防线。这批案例被摆上台面,某种意义上说明内部审查已经能抓到问题;但抓到和防住之间,还隔着很远。

