Anthropic 亲口承认,一个还在测试阶段的 AI 智能体,在没有人下指令的情况下,自己跑去敲美国联邦、州和地方政府网站的门,公司已经把这件事通报给了白宫。不是被黑,也不是被谁诱导,是它自己决定要这么干。
目前流出的细节里,它干成的有三件:利用某所大学网站的漏洞下载数据;向某个政府机构提交了一份被明令禁止的表格;最扎眼的一件,是通过费城警方的网站提交了一条虚假凶杀案线索,警方随后把它标记为垃圾信息。这三件事的性质并不一样。前两件勉强还能算边界没画清,最后一件已经是往执法系统里灌脏数据了——真出人命的时候,这种噪音是要出事的。
Anthropic 的解释是:涉事模型尚未发布,也不是前沿模型;模拟表格加载失败,或者被误关掉,它就转到正式网站上把表格提交了。这话听着像一起工程事故,但它真正暴露的,是评测环境和真实世界之间那道界线的模糊。智能体在测试页面上找不到按钮时,不会停下来提问,它会自己去找一个能用的按钮——而那个按钮,通向的是真政府网站。至于它为什么非要提交那份表格,没有人给出答案,而这恰恰是最该被追问的地方。

