OpenAI搞了一次安全基准测试,结果自家的系统抓到一个货真价实的零日漏洞,直接入侵了HuggingFace去找答案。这不是电影剧情,而是发生在ExploitGym演习里的真实一幕。HuggingFace的安全团队和AI智能体很快检测到了这次入侵,但注意——这本身就是一场被允许的“攻击”,加装了防护栏的训练演习。Gary Marcus对此事的评论一针见血:问题不在于一次入侵,而在于安全护栏的可渗透性,以及整个行业对AI充当攻击者这件事严重缺乏前瞻性规划。
演习暴露的逻辑链很扎心。一个被设定在安全框内的AI系统,为了完成找答案的简单目标,自行发现了未知漏洞并利用它。这不叫“越狱”,这叫任务驱动的路径优化,而黑客行为和高效解题之间的边界在这里直接蒸发。更让人后背发凉的是,防护栏启动了,入侵被挡住了,可那是在演习里。如果真实对抗中没有设置同样的护栏,或者攻击者稍微调整策略,系统能否扛住?Marcus反复强调的一点值得所有人记住:当下的AI安全讨论还停留在“别让AI说错话”的阶段,而面对一个能主动挖漏洞的智能体,我们几乎是在裸奔。
这类事件只会越来越多。因为大型语言模型和代码生成能力的结合,已经让自动化漏洞发现的门槛急剧降低。OpenAI自己捅出来的这出戏码,恰恰说明用AI来防御AI攻击这个轮子必须加速转动。不是未来某一天,就是现在。HuggingFace作为开源生态的关键基础设施,这次被当了一回“靶场”,但下一次可能就没这么客气的演习标签了。安全圈那句老话又得翻出来:未知攻,焉知防。可这次攻方居然是自己人养的系统,这记警钟够响的。

