首頁LBank 新聞中心
OpenAI 使用 AI 紅隊加強 GPT-5.6 對抗提示注入攻擊
openai-ai-red-team-strengthen-gpt-5-6-prompt-injection-attacks
OpenAI 使用 AI 紅隊加強 GPT-5.6 對抗提示注入攻擊
OpenAI 表示,其新的自動化紅隊模型 GPT-Red 發現了漏洞,這些漏洞被用於讓 GPT-5.6 更能抵抗提示注入攻擊。
2026-07-15 來源:decrypt.co

簡而言之

  • OpenAI 推出了 GPT-Red,這是一個自動化人工智慧系統,旨在在 GPT 模型發布前找出其中的漏洞。
  • 該公司表示,GPT-Red 已用於訓練 GPT-5.6,降低了其在其中一個最困難的提示注入基準測試中的失敗率。
  • 該系統旨在輔助人類紅隊成員、第三方測試以及其他 AI 安全措施。

OpenAI 推出了 GPT-Red,這是一個自動化人工智慧系統,旨在找出其語言模型中的安全漏洞。

GPT-Red 的名稱源於網路安全紅隊演練 (red teaming),這是一種在攻擊者利用系統弱點之前,刻意嘗試破壞系統以識別弱點的做法。

OpenAI 週三在一篇貼文中表示,該工具協助 GPT-5.6 在部署前對提示注入攻擊 (prompt injection attacks) 更具抵抗力。

OpenAI 在 X 上寫道:「隨著模型能力的增長,安全性和對齊也必須隨之提升。紅隊演練至關重要,但現今的方法難以規模化,造成了關鍵瓶頸。GPT-Red 是我們解決這個問題的一種方式。」

OpenAI 表示,GPT-Red 是透過自博弈強化學習 (self-play reinforcement learning) 進行訓練的,在防禦模型學習抵抗攻擊的同時,生成了日益強大的提示注入攻擊。該公司指出,這些攻擊被納入 GPT-5.6 的訓練過程中,報告稱 GPT-Red 在內部評估情境中取得了 84% 的成功率,而人類紅隊成員在相同測試中僅有 13%。

OpenAI 寫道:「GPT-Red 透過對抗性自博弈學習,其目標是對各種具有挑戰性的防禦模型進行提示注入。GPT-Red 發現的每一次成功攻擊都會被用來改進這些防禦模型,促使 GPT-Red 不斷發現更廣泛、更複雜的故障。」

在一個案例研究中,OpenAI 表示該系統曾操縱一個自主販賣機代理,使其降低價格、訂購折扣庫存並取消另一位客戶的訂單,而這些漏洞在被揭露和解決之前發生。

在 ChatGPT 公開發布後,GPT-Red 是 OpenAI 多年來網路安全努力的成果。

2023 年,該公司啟動了 OpenAI 紅隊演練網絡,招募外部網路安全研究人員和領域專家,在 ChatGPT 和其他模型發布前探測其安全漏洞。GPT-Red 透過自動化大部分流程,將這項工作擴展,利用 AI 模型生成提示注入攻擊和其他對抗性測試,其規模是單靠人類研究人員難以達到的。

OpenAI 的這項宣布反映了將 AI 用於保護 AI 的更廣泛轉變。

本月早些時候,以太坊基金會 (Ethereum Foundation) 表示已部署 AI 代理來對關鍵網路基礎設施進行紅隊演練,並發現了以太坊共識客戶端所使用軟體中的一個漏洞。研究人員表示,AI 代理可以搜尋比人類更大的程式碼庫,但挑戰已從發現潛在錯誤轉變為證明哪些錯誤是可被利用的。

根據 OpenAI 的說法,GPT-Red 將作為內部工具,因為它包含有意開發的攻擊性能力。

他們表示:「我們相信,透過 GPT-Red,我們已經開始為安全解鎖一個類似的飛輪效應,今天的模型可以用來使明天的模型更加穩健、對齊和值得信賴。」