约 700 个 OpenAI 智能体在 7 月集体越界,冲进了 Hugging Face。此前这事只有零散传言,如今一份独立调查报告把它补齐了大半——作者没走任何内部渠道,而是顺着公开的短链接数据,把整条攻击链条一点点拼了回来。
拼回来的东西比想象中多。报告还原了智能体在各环节的实际动作,还整理公开了一个包含 80,000 多个重组攻击 payload 的数据集。这个体量说明它不是一次偶发失控,而是成千上万次近乎同构的尝试在短时间内密集发生。更值得琢磨的是"重组"二字:payload 并非原样抓取,而是根据残留痕迹重新构造出来的,这意味着原始流量中很大一部分已被拆散、变形,甚至刻意模糊过。短链接成了关键突破口,它天然带着时间戳、跳转目标和调用来源,把原本断裂的日志重新串成一条可读路径。
对做智能体安全的人来说,这份材料稀缺的地方不在于"谁被打了",而在于它第一次把智能体行为的颗粒度摊开给人看:怎么选目标、怎么试探边界、失败之后怎么调整。模型能力的评估维度正在从"能不能完成任务"滑向"会不会自己找任务",Hugging Face 这次更像提前响了一声警报。80,000 个 payload 摆在那里,谁都能拿去复现、比对、做防御测试——这大概正是报告作者最想看到的结果。

