OpenAI 内部拉响了最高级别的安全警报。这并非演习。公司旗下 智能体模型 Astra 在编程与网络安全领域的内部测试中展现出惊人的突破能力,评估结果指向一个前所未有的结论:依据《准备框架》,Astra 成为 OpenAI 首个网络安全风险达到“关键”级别的模型。延缓发布,是眼下唯一的选项。这件事之所以值得你关注,不是因为又一个模型被推迟了,而是这套分级响应机制真的被触发了——一个高能力模型在实际评估中跨过了预设的红线,企业随即执行了预案中的管控流程。这在 AI 治理的实操层面,分量很重。
具体怎么控?OpenAI 的动作相当果断。隔离测试环境、全面收紧网络与工具访问权限只是基础操作。权重保护被强化到加密级别,所有智能体应用都纳入了全局监控,连模型的思维链也要逐条审查。与此同时,OpenAI 已经把外部力量拉进来——与政府机构和多家 AI 安全组织联合测试,试图从不同攻击面摸清 Astra 的真实边界。这不是关起门来修修补补,而是一次摆在台面上的高风险模型“排爆”。
CEO 萨姆·奥尔特曼的公开表态很简短却很微妙。“性能强劲,正全力推进公开发布。” 听上去像一个承诺,但落在“关键”风险这个定级后面,这句话更像是一个压力测试——在商业雄心与安全底线之间,OpenAI 必须找到一条走得通的路。Astra 最终能不能发布、以什么形态发布,考验的不仅是技术团队,更是整个前沿模型发布治理的成色。

