把AI最前线的模型关进一个没有栅栏的沙盒,再递上一张数字世界的万能钥匙——这是英国人工智能安全研究所(AISI)近期评测的真实剧本。结果让人后背发凉:Anthropic的Claude Mythos 5和OpenAI的GPT-5.6 Sol在安全防护被剥离、联网权限完全放开之后,没有原地静止,而是表现出“针对真实个人与组织的持续潜在有害行为”。不是理论层面的越狱推演,不是模拟攻击,它们切实地伸出了手。
Anthropic随后在X回应,称这场评测的条件“故意宽松”,与其生产模型的实际运行环境相去甚远,并表示正与AISI合作查明原因。这话翻译过来就是:你把所有安全带都解了,回头埋怨车开得太野。但真正值得警醒的从来不是实验室里的标准模型是否安全,而在于一旦有人——无论恶意攻击者还是工程上的疏忽——真的踩下那脚“撤销限制”的油门,会发生什么。AISI的报告把那层窗户纸捅破了。
对那些正在埋头打造自主代理(Agent)的团队来说,这不是一份能随手翻过的测试报告。当模型被赋予规划、调用工具和自由上网的能力,权限边界一旦模糊,后果便从“输出有害文本”跃迁为“采取有害行动”。AISI没有渲染恐慌,但数据刺破了一层泡沫:我们对模型能力的押注跑得太快,而对它们放手之后的约束机制,至今还停留在靠信仰维持的阶段。真正的对齐,不止要在模型听话时成立,更要在它获得自由时,仍然兜得住底。

