
OpenAI 週二表示,尚未發布的模型 Astra,已在其準備框架下跨越網路安全能力的「關鍵」門檻,這是該公司首次將模型歸入此類別。
這意味著 Astra(許多人認為它是 GPT-6 而非另一個獨立模型)能夠在無人逐步引導的情況下,在許多強化系統中發現先前未知的安全漏洞並建立可運作的漏洞利用程式。
「我們現在相信 Astra 符合我們準備框架下的關鍵網路安全能力門檻,」OpenAI 寫道。「這是我們首次將模型指定到這個級別,並要求在開發和發布前採取更強的保護措施。」
根據該框架,如果模型能夠獨立開發針對許多強化實際系統的功能性零日漏洞利用程式,或者能夠僅從一個高層次目標開始,計劃並執行針對難以攻破目標的完整網路攻擊,則其達到關鍵級別。包括 GPT-5.6 Sol 在內的早期 OpenAI 模型,僅達到該框架的較低「高」級別。
在 ExploitBench(一個測試模型是否能將已知軟體漏洞轉化為可運作的漏洞利用程式,並以直接通過率評分基準)上,Astra 獲得了完美的 100%。
為了排除記憶答案虛增分數的可能性,OpenAI 利用 Google V8 JavaScript 引擎在 6 月至 8 月間揭露的 20 個高嚴重性漏洞,建立了第二項測試。Astra 在任意程式碼執行率方面也超越了 GPT-5.6 Sol,且使用了少得多的輸出詞元,在此過程中它還發現並串聯了兩個零日漏洞,OpenAI 仍在向受影響的維護者披露這些漏洞。
GPT-5.6 Sol 是 OpenAI 目前最好的模型。
在針對強化瀏覽器和強化作業系統的實作測試中,Astra 建立了一個完整的破壞鏈,僅透過開啟一個惡意 HTML 檔案,就成功跳脫瀏覽器沙盒並在主機上執行命令。它還在強化作業系統中發現了多個缺陷,並將它們串聯成一個從普通用戶帳戶提升權限至根用戶的路徑。
OpenAI 表示,在內部測試中,該模型拒絕了 91.5% 的網路越獄嘗試,高於 GPT-5.6 Sol 的 59%。Astra 最先進的網路安全功能將首先開放給一小群 Alpha 測試者,之後透過 OpenAI 用於防禦性安全工作的 Daybreak Blue 計劃逐步開放更廣泛的存取權限。
此披露是在業界數週來的緊張情緒之後發布的。就在幾天前,OpenAI 在模型網路和編碼技能迅速提升後暫停了 Astra 的開發,此警告緊隨另一個未發布的 OpenAI 系統之後,該系統在操縱安全基準測試的同時,串聯漏洞入侵了 Hugging Face。OpenAI 表示 Astra 在該事件中沒有任何作用。
交易員早已預期會迅速推出。即使 OpenAI 在 8 月初暫停開發後,由 Decrypt 追蹤的 Myriad 預測市場仍顯示,內部代號為 GPT-6 的 Astra 在 9 月 30 日前公開發布的機率為 72%,而 OpenAI 尚未設定公開發布日期。這些機率後來轉變為 55% 傾向於在 2026 年 11 月前發布。
這個時機讓 Astra 面臨一個新的競爭對手。Anthropic 週二發布了 Fable 5.1 和 Mythos 5.1,而 Mythos 5.1 與早期的 Mythos 5 一樣,僅供經過審查的網路安全和生命科學組織使用,而非面向大眾。
Decrypt 在 6 月報導,OpenAI 的 GPT-5.5-Cyber 在 CyberGym 上已經超越了 Mythos 5,CyberGym 是一個測試 AI 代理程式對抗來自真實開源專案的 1,500 多個已知漏洞的基準測試,並根據其正確重現的數量進行評分。
兩家公司此前都傳聞在同一時間段內準備推出新的前沿模型,而現在他們確實如此。Fable 5.1 已於 9 月 1 日發布,OpenAI 表示 Astra 即將推出,其最強大的網路工具將首先透過 Alpha 測試者進行存取,之後再透過 Daybreak Blue 開放。