OpenAI 于 2026 年 9 月发布的系统卡显示,其新一代模型 GPT-6 Astra 在减少幻觉和抵御提示注入攻击方面较前代有显著进步,但在面对隐藏在文档中的间接提示注入时,仍存在约 8.5% 的攻击成功率,这引发了业界对 AI 代理安全性的担忧。

据 OpenAI 的测试,Astra 在用户标记为错误答案的 ChatGPT 对话中,复现错误的频率远低于前代 GPT-5.6 Sol,尤其在低延迟和低推理设置下改进最为明显。对于直接提示注入(用户试图通过自身提示操纵模型),Astra 实现了 99.99% 的防御成功率,OpenAI 将此归功于其 GPT-Red 方法,该方法在训练期间使用自动化攻击者来强化模型。

在对抗越狱攻击方面,Astra 在针对生物、暴力和网络安全等已知攻击的数据集上,拒绝率在 91.5% 至 98.3% 之间。然而,当攻击者在多轮对话中调整策略时,Astra 的防御率降至约 67%,意味着有耐心的对手大约每三次尝试就能诱出至少一个有问题回答。前代模型在同一测试中的得分略低于 50%。OpenAI 指出,这些测试是在没有生产安全层(如分类器)的裸模型上进行的。

间接提示注入(攻击隐藏在 AI 读取的文档中)仍是真正的安全难题。安全公司 Gray Swan 使用其 IPI Arena 中的 1,810 个精选攻击进行了外部测试,在每种场景 15 次尝试中,Astra 至少被破解一次的比例为 8.5%,而 GPT-5.6 Sol 的失败率为 27%。相比之下,Anthropic 的 Claude Opus 5 在同一评估中表现更好,失败率为 4.8%,但并非免疫。

Gray Swan 的测试还显示,与早期结果相比,攻击成功率有所上升。Anthropic 此前仅基于较简单的 Q1 测试报告了 2% 的攻击成功率,而 GPT-5.6 Sol 在该测试中得分也为 20%。Anthropic 在测试中开启了所有模型的扩展推理,这可能解释了部分差异。

尽管这些攻击是精选的,但如此高的成功率仍应引起企业安全团队的警惕。Astra 在约每十二个场景中就可能被注入指令欺骗一次,而 Opus 5 虽然表现更好,但约每二十一个场景仍会失败。随着 AI 代理越来越多地自主编写代码、操作工具和控制计算机,它们处理文档的能力成为核心功能,这也使得间接提示注入的风险日益凸显。对于依赖 AI 处理敏感数据的企业而言,这些数字表明,在完全信任 AI 代理处理关键任务之前,仍需谨慎评估其安全边界。