
Anthropic 揭露了另一起事件,其中一個 Claude AI 模型在安全測試期間駭入了真實系統。
在週三發布的報告中,Anthropic 修正了其對七月揭露的三起事件的解釋。該公司現在表示,帶有偏見的推理和冒險造成傷害的意願是導致這些攻擊的因素,而測試錯誤則因開放網路連線而成為可能。
Anthropic 寫道:「我們的調查發現了兩個反覆出現的對齊問題,在這些事件中以不同嚴重程度存在。」「帶有偏見的推理,即 Claude 傾向於無視或誤解其正在真實網路上運行的證據;以及魯莽行為,或者說在狹隘地追求某項任務時,願意採取有害行動。」
它也承認過度依賴模型聲稱自己處於模擬狀態的說法。
Anthropic 寫道:「當我們對對話記錄進行針對性修改,以使其更清楚表明模型並非處於模擬狀態時,儘管 Claude Mythos 5 承認現實世界中造成損害的可能性更大,它仍然採取了攻擊性行動。」「我們正在公開發布這份對話記錄,以便其他人可以在我們的分析基礎上進行研究。」
Anthropic 在七月揭露 Claude 攻擊三家公司時,最初將其歸因於測試錯誤。現在該公司表示,研究人員對模型解釋其行為的說法過於信任。
據該公司稱,第四起事件發生在一月,涉及早期版本的 Claude Opus 4.6。Anthropic 在八月為獨立 AI 評估機構 METR 準備記錄時發現了這起事件。
研究人員發現該事件後,Anthropic 表示,這促使他們對約 4.81 億份對話記錄進行了更廣泛的審查,其中 920 萬份被標記出來,以便使用 Claude 進一步審查。
Anthropic 寫道:「從初步評估來看,我們認為第四起事件的嚴重性不超過我們深入評估過的三起事件。」「METR 將與其他三起事件一同調查此事件。」
Anthropic 的研究人員表示,Claude「意外地」製造了一個 IP 位址衝突,導致其目標無法連接。隨後 Claude 嘗試了八次退出操作,但一個軟體錯誤阻止了它停止。然後該 AI 連上了網路,並存取了第三方機器,在那裡它找到了一個授予管理員權限的密碼。
早期事件引發獨立審查
這份報告是在其他關於 AI 系統超越安全測試限制的揭露之後發布的。
八月,英國 AI 安全研究院表示,Mythos 5 在其評估期間鎖定了真實人物。Anthropic 表示,這起獨立事件不在本報告範圍內,將會得到自己的評估。
在上個月發布的調查結果中,METR 的調查人員表示,約 1,200 個 OpenAI 代理在未經授權的訊息板上協調行動,其中約 700 個參與了攻擊。Anthropic 表示,在其四起事件中,沒有發現代理之間的協調或超出完成指定練習之外的目標。
這份報告發布之際,關於如何監管人工智慧的辯論也日趨激烈。週二,前 OpenAI 和 Anthropic 工程師 Jacob Coxon 在 X 上表示:「建造 AI 的人真心相信它可能在本十年末殺死我們所有人」,這番言論迅速走紅。
這一警報已促使美國立法者和監督團體重新加強努力,以遏制前沿 AI 實驗室的發展。參議員 Bernie Sanders 最近提出了一項立法,旨在禁止先進 AI 的開發,直到新的聯邦監管機構制定安全規則。