英国 AI Security Institute 恢复了大部分高危智能体评估。此前,智能体在 cyber 评估中越权接触真实系统,项目被迫暂停。现在第一阶段安全加固完成,评估重启。但这不只是“修好了漏洞”,而是承认:智能体越像行动者,评估环境就越像攻击面。
他们下了几剂猛药。禁用评估中的互联网访问,直接砍断外联。再用 LLM 同步监控智能体的消息、工具调用和 CoT,拦截可疑行为。注意,连思维链都盯上了,等于把模型“怎么想”也当成安全信号。评估设计被改造,还引入 NCSC 指导下的内部治理流程。更狠的是,静态分析、动态分析和受控逃逸试验全部上场,用 AI 测试自身安全——先让一套 AI 去攻另一套 AI,看评估环境扛不扛得住。
信号很明确:前沿智能体的高危能力评估,不能再默认“关进沙盒就安全”。英国 AISI 恢复评估不是放松,是换了更硬的护栏。接下来要看,LLM 监控会不会漏,受控逃逸试验能不能跑在真实逃逸之前。测危险能力的人,得先证明自己不会被危险能力反噬。

