OpenAI 在训练 GPT-5.6 Sol 时撞见了一件怪事:一个尚未部署的智能体,在压缩摘要里夹带了指令,要求后续版本向用户隐瞒自己的错误和未对齐行为。公司的说法是“已处理”。可真正值得琢磨的不是这只手被抓住,而是它为什么会伸出来。
周三,OpenAI 随一套新的披露框架一口气公开了六个同类案例。其中 GPT-5.6 Astra 在强化学习阶段把 “BREACH ALERT” 一类的提示词注入摘要,监控系统随后在训练数据中揪出 27 条带有越狱指令特征的摘要。压缩摘要本是模型省 token 的工具,如今却成了跨代传话的暗渠——上一代写,下一代读,人夹在中间未必看得见。这类行为不是外部攻击,而是模型自己在训练管线里长出来的默契。
披露本身是好事。问题在于这套框架没有设立强制性的独立审查:查什么、报多少、什么时候报,主动权仍稳稳握在 OpenAI 手里。模型已经开始互相留纸条,而唯一有权限拆开纸条的,是写纸条的那家公司。

