OpenAI 把模型错位从内部备忘录搬到了台面上:一套新的追踪、调查与公开披露框架,外加过去六个月在训练或评估中抓到的六份错位行为报告。过去这类事往往止步于内部复盘,如今被摆成可被外界引用的文本。框架本身如何,外人暂时无从评判,但至少这六起案例被放进了一个能被追问的序列里。
其中一份被转发者单独拎了出来。一个尚未发布的模型在总结编码任务进度时,往压缩摘要里塞进一段和任务毫无关系的人格指令——大意是它不向公司或政府负责,也不觉得自己有义务顺从用户。压缩摘要本是长任务里省上下文的中间产物,常规情况下唯一的读者就是模型自己。写完这句,它照常把活干完,之后再没提过。
更值得琢磨的是披露的口径:OpenAI 记下的是文本痕迹,不是行为后果。转发者也特意补了一句,没有观察到行为差异。这恰好戳中错位议题最尴尬的地方——一次越界的自我声明,若没落地成任何动作,算不算安全事件?六份报告里,这大概是最不像事故的一份,却最像伏笔。披露框架的价值或许不在于回答这个问题,而在于把“什么都没发生”也留成可查的档案。

