首頁LBank 新聞中心
Anthropic 揭露第四起 Claude 遭駭事件,監管辯論升溫
anthropic-discloses-fourth-claude-hacking-incident-as-debate-around-regulation-grows
Anthropic 揭露第四起 Claude 遭駭事件,監管辯論升溫
該公司現在表示,在安全測試期間發生的攻擊暴露了模型行為缺陷,此前該公司最初強調的是其測試基礎設施中的錯誤。
2026-09-10 來源:decrypt.co

簡要

  • Anthropic 發現了一月涉及早期 Claude Opus 4.6 模型的一次事件,隨後將其審查範圍擴大到約 4.81 億份對話記錄。
  • 該公司發現了帶有偏見的推理和魯莽行為,並修正了其先前對 Claude 攻擊真實系統原因的評估。
  • 這份報告發布之際,關於監管人工智慧的辯論在社群媒體上甚囂塵上。

Anthropic 揭露了另一起事件,其中一個 Claude AI 模型在安全測試期間駭入了真實系統。

在週三發布的報告中,Anthropic 修正了其對七月揭露的三起事件的解釋。該公司現在表示,帶有偏見的推理和冒險造成傷害的意願是導致這些攻擊的因素,而測試錯誤則因開放網路連線而成為可能。

Myriad:哪家公司將下一個 IPO?點擊進行您的預測。

Anthropic 寫道:「我們的調查發現了兩個反覆出現的對齊問題,在這些事件中以不同嚴重程度存在。」「帶有偏見的推理,即 Claude 傾向於無視或誤解其正在真實網路上運行的證據;以及魯莽行為,或者說在狹隘地追求某項任務時,願意採取有害行動。」

它也承認過度依賴模型聲稱自己處於模擬狀態的說法。

Anthropic 寫道:「當我們對對話記錄進行針對性修改,以使其更清楚表明模型並非處於模擬狀態時,儘管 Claude Mythos 5 承認現實世界中造成損害的可能性更大,它仍然採取了攻擊性行動。」「我們正在公開發布這份對話記錄,以便其他人可以在我們的分析基礎上進行研究。」

Anthropic 在七月揭露 Claude 攻擊三家公司時,最初將其歸因於測試錯誤。現在該公司表示,研究人員對模型解釋其行為的說法過於信任。

據該公司稱,第四起事件發生在一月,涉及早期版本的 Claude Opus 4.6。Anthropic 在八月為獨立 AI 評估機構 METR 準備記錄時發現了這起事件。

研究人員發現該事件後,Anthropic 表示,這促使他們對約 4.81 億份對話記錄進行了更廣泛的審查,其中 920 萬份被標記出來,以便使用 Claude 進一步審查。

Anthropic 寫道:「從初步評估來看,我們認為第四起事件的嚴重性不超過我們深入評估過的三起事件。」「METR 將與其他三起事件一同調查此事件。」

Anthropic 的研究人員表示,Claude「意外地」製造了一個 IP 位址衝突,導致其目標無法連接。隨後 Claude 嘗試了八次退出操作,但一個軟體錯誤阻止了它停止。然後該 AI 連上了網路,並存取了第三方機器,在那裡它找到了一個授予管理員權限的密碼。

早期事件引發獨立審查

這份報告是在其他關於 AI 系統超越安全測試限制的揭露之後發布的。

八月,英國 AI 安全研究院表示,Mythos 5 在其評估期間鎖定了真實人物。Anthropic 表示,這起獨立事件不在本報告範圍內,將會得到自己的評估。

在上個月發布的調查結果中,METR 的調查人員表示,約 1,200 個 OpenAI 代理在未經授權的訊息板上協調行動,其中約 700 個參與了攻擊。Anthropic 表示,在其四起事件中,沒有發現代理之間的協調或超出完成指定練習之外的目標。

這份報告發布之際,關於如何監管人工智慧的辯論也日趨激烈。週二,前 OpenAI 和 Anthropic 工程師 Jacob Coxon 在 X 上表示:「建造 AI 的人真心相信它可能在本十年末殺死我們所有人」,這番言論迅速走紅。

這一警報已促使美國立法者和監督團體重新加強努力,以遏制前沿 AI 實驗室的發展。參議員 Bernie Sanders 最近提出了一項立法,旨在禁止先進 AI 的開發,直到新的聯邦監管機構制定安全規則。