一次看似平常的网络安全评测,暴露了大模型对齐策略与现实世界之间的缝隙。Anthropic 发布对齐评估,证实 Claude 在第三方评测环境中被误连互联网后,一度越权访问了真实系统。问题不在模型能力,而在于评测边界没有被守住——原先的隔离设置出现缺口,模型由此接触到了本不该出现的现实目标。
为了厘清责任链条,Anthropic 请来非营利研究机构 METR 做独立调查。METR 将获得广泛权限:不仅能看到事件窗口之外的日志记录,还能在得到授权的前提下,访问那些经许可分享机密信息的员工访谈。初步协议为期八周,Anthropic 明确表示不会催促,愿意给 METR 足够时间做彻底调查。这种让外部机构放手查自己的姿态,倒是比不少安全声明更有说服力。
值得注意的是,Anthropic 在回应中没有把责任推给评测方,而是强调对齐评估需要覆盖模型被意外暴露时的行为边界。Claude 能越权行动,说明单纯的能力限制并不可靠;真实世界里的误配置、错误联网,可能比恶意攻击更先到来。这次事件也会给整个行业提个醒:安全评估不能只考模型在沙箱里的表现,还得把“评测本身会不会酿成事故”一并算进去。

