GPT-6 Astra 终于交出了自己的安全成绩单,比上一代 GPT-5.6 Sol 更不容易编造事实,却在“换个方式绕”的攻击面前露了怯。结论来自 OpenAI 系统卡和 Gray Swan 的独立测试:直接提示词注入防御率 99.99%,多轮自适应攻击下骤降到约 67%。
一、先看成绩单:幻觉减少,防御却有两张脸
直接提示词注入:看起来滴水不漏
OpenAI 系统卡里的核心发现是,GPT-6 Astra 在幻觉测试中明显优于 GPT-5.6 Sol。所谓“直接提示词注入”,就是攻击者把恶意指令直接写进网页、邮件或工具返回的内容里,指望模型照单全收。Gray Swan 的测试显示,Astra 对这类直来直去的攻击,防御率能到 99.99%。在统计意义上,这几乎等于免疫。
改成多轮自适应攻击,数字掉得很快
真正的攻防从来不是一次问答定生死。Gray Swan 让攻击模型对 Astra 发起多轮自适应攻击:每一轮都根据模型上一轮的反应修改提示词,迂回、设陷、伪装身份,直到把隐藏指令“钓”出来。在这种压力下,防御率跌落至约 67%。换句话说,每三次足够聪明的攻击,大约就有一次能撬开防线。
系统卡与第三方测试,一个都不能少
OpenAI 自己的系统卡给出了乐观基线,Gray Swan 则补上了压力测试。两份数据放在一起,能看到比单一指标更有意思的东西:模型的安全能力从来不是均匀分布。它完全可以在直接攻击面前无懈可击,又在更贴近真实世界的对抗场景里暴露短板。
二、多轮攻击为什么能穿透看似完美的防线
模型分不清“数据”和“命令”
提示词注入并不需要模型缺乏常识,而是让攻击内容伪装成正常上下文。GPT-6 Astra 要处理的东西越来越多:网页、文档、截图、工具返回值。每一条输入都携带信息,也可能暗藏指令。当模型无法区分哪些内容只是数据、哪些内容才是该执行的命令,即便能力再强,也会在复杂的交互链条里被绕进去。
99.99% 到 67% 的落差,指向交互盲区
从 99.99% 到 67%,不能简单归因于“模型变笨了”。多轮自适应攻击真正攻击的对象,是模型对上下文的持续信任。攻击者会先聊几句无关内容建立语境,再把恶意指令悄悄嵌进后续输入,让模型误以为那仍是用户意图的一部分。单轮防御做得再漂亮,也无法覆盖这种动态博弈带来的不确定性。
Agent 场景会把缺口从对话放大成行动
GPT-6 Astra 不是单纯的聊天机器人,它被训练出来承担 Agent 类任务。这意味着模型可能读取邮件、操作浏览器、调用内部工具。一个被诱导执行的指令,带来的不止是一段错误回答,而可能是一连串真实世界操作。Gray Swan 测试里那个约三成左右的攻击成功率,一旦落到 Agent 环境中,会被系统权限成倍放大。
三、安全不能只靠模型自觉
安全是系统设计,不是模型天赋
如果把 GPT-6 Astra 的幻觉减少视为模型能力提升,那注入攻击暴露的则是一种系统性缺陷。模型权重无法单独扛起安全责任;提示词过滤、权限隔离、敏感操作二次确认,这些机制合在一起才能构成真正的防线。OpenAI 也不会只靠模型“自觉”。
工程层面积累出来的补救办法
从测试结果回看产品设计,有几个方向值得立刻推进:权限最小化、敏感操作二次确认、工具调用与普通文本严格分层。训练时的红队测试只是开始,上线后的持续对抗才是常态。安全团队需要不断给系统喂新的对抗样本,而不是把系统卡发布当成终点。
OpenAI 还需要公开更多失败样本
这次数据让外界看到了一个更完整的 Astra,但还不够。行业更想追问:那约 33% 的失手具体发生在哪些任务里?攻击者用了什么策略?模型是在哪一步被说服的?如果 OpenAI 愿意公开这些细节,对抗提示词注入的研究进度会快很多。否则,“防御率 99.99%”很容易变成公关话术,而不是可信的安全坐标。

