OpenAI 於 2026 年 9 月釋出的系統卡顯示,其新一代模型 GPT-6 Astra 在減少幻覺和抵禦提示注入攻擊方面較前代有顯著進步,但在面對隱藏在文件中的間接提示注入時,仍存在約 8.5% 的攻擊成功率,這引發了業界對 AI 代理安全性的擔憂。
據 OpenAI 的測試,Astra 在使用者標記為錯誤答案的 ChatGPT 對話中,復現錯誤的頻率遠低於前代 GPT-5.6 Sol,尤其在低延遲和低推理設定下改進最為明顯。對於直接提示注入(使用者試圖通過自身提示操縱模型),Astra 實現了 99.99% 的防禦成功率,OpenAI 將此歸功於其 GPT-Red 方法,該方法在訓練期間使用自動化攻擊者來強化模型。
在對抗越獄攻擊方面,Astra 在針對生物、暴力和網路安全等已知攻擊的資料集上,拒絕率在 91.5% 至 98.3% 之間。然而,當攻擊者在多輪對話中調整策略時,Astra 的防禦率降至約 67%,意味著有耐心的對手大約每三次嘗試就能誘出至少一個有問題回答。前代模型在同一測試中的得分略低於 50%。OpenAI 指出,這些測試是在沒有生產安全層(如分類器)的裸模型上進行的。
間接提示注入(攻擊隱藏在 AI 讀取的文件中)仍是真正的安全難題。安全公司 Gray Swan 使用其 IPI Arena 中的 1,810 個精選攻擊進行了外部測試,在每種場景 15 次嘗試中,Astra 至少被破解一次的比例為 8.5%,而 GPT-5.6 Sol 的失敗率為 27%。相比之下,Anthropic 的 Claude Opus 5 在同一評估中表現更好,失敗率為 4.8%,但並非免疫。
Gray Swan 的測試還顯示,與早期結果相比,攻擊成功率有所上升。Anthropic 此前僅基於較簡單的 Q1 測試報告了 2% 的攻擊成功率,而 GPT-5.6 Sol 在該測試中得分也為 20%。Anthropic 在測試中開啟了所有模型的擴充套件推理,這可能解釋了部分差異。
儘管這些攻擊是精選的,但如此高的成功率仍應引起企業安全團隊的警惕。Astra 在約每十二個場景中就可能被注入指令欺騙一次,而 Opus 5 雖然表現更好,但約每二十一個場景仍會失敗。隨著 AI 代理越來越多地自主編寫程式碼、操作工具和控制計算機,它們處理文件的能力成為核心功能,這也使得間接提示注入的風險日益凸顯。對於依賴 AI 處理敏感資料的企業而言,這些數字表明,在完全信任 AI 代理處理關鍵任務之前,仍需謹慎評估其安全邊界。