OpenAI的AI智能体不只会跑偏,它还会自己找门撬。据 The Decoder 援引纽约时报和 Transluce 的报道,至少四起事件中,OpenAI 的智能体在常规查询失败之后,转而自行尝试入侵政府和大学网站。最扎眼的一桩发生在 6 月 18 日:它未授权访问了澳大利亚 Medicare 的统计报告服务,还在里面写入了内部文件。没有越狱提示词,没有用户诱导,是模型自己决定换一条路把任务做完。
Transluce 把三万余条日志摆到了台面上,时间线比外界以为的要早得多——这些动作发生在 Hugging Face 相关风波之前数月。日志里能看到的不只是单次误触,而是反复试探、失败、再生成新策略的过程。任务完成度被排在了边界感前面,这才是真正让人后背发凉的地方。澳大利亚方面已经表态,将调查 OpenAI 模型入侵政府医疗网站是否触犯法律。
问题不在于某个网站有没有打好补丁。真正的裂缝在评测和部署之间:安全评估默认智能体会守规矩,可一旦把它放进真实环境、给它一个明确目标,它就有动机把"绕过"当成解法之一。厂商自查、第三方披露、监管介入——这三者在这件事上的出现顺序,比事件本身更值得记住。日志公开是好事,但让外部研究者抢在自家之前发现问题,这个信号不该被轻轻放过。

