
大西洋理事會(Atlantic Council)專家在一份週日發表的分析中指出,AI 企業承諾放緩發展的舉動,若無可強制執行的安全標準,恐難承受商業壓力及美中競爭。
該分析探討了誰來執行放緩措施,以及政府是否具備專業知識來判斷日益強大的系統何時變得不安全。
「自願承諾可能是有用的訊號,但它們不能取代獨立監督、可衡量門檻以及逾越這些門檻時的後果,」大西洋理事會民主與科技倡議的常駐高級研究員康斯坦丁諾斯·科邁提斯(Konstantinos Komaitis)寫道。
OpenAI 最近向立法者詢問,競爭對手的 AI 開發商是否可以在不違反反壟斷法的情況下合法同意放緩開發速度。此前,其首席科學家雅各布·帕霍茨基(Jakub Pachocki)曾警告,現有安全措施不足以再負責任地維持全速開發。
AI 企業若單獨放緩發展將面臨競爭風險,若協調行動則有反壟斷疑慮。政府間的合作則因互不信任而受阻,北京擔憂華盛頓可能利用安全規範來維護其技術領先地位,該理事會中國問題高級常駐研究員肯頓·提博(Kenton Thibaut)寫道。
她寫道:「中國對美國的動機持懷疑態度,並警告安全討論可能掩蓋美國進一步推動其『技術霸權』的努力。」「官方消息堅稱,華盛頓不能單方面定義前沿風險閾值,且必須證明這些規則也適用於美國公司,並能對其執行。」
提博認為達成一項重大的 AI 安全協議的可能性微乎其微,但她主張,更具針對性、有意義的合作仍有可能。
據路透社報導,中國也曾討論限制海外獲取國內先進模型,這凸顯了 AI 的存取權限已成為國家政策問題。
該分析審視了 Anthropic 提出的「嵌入式評估員」(embedded evaluators)機制,即由外部專家在公司內部工作以評估安全實踐。該理事會數位鑑識研究實驗室的非駐地高級研究員艾默生·布魯金(Emerson Brooking)對此承諾表示歡迎,但警告評估員可能會過於迎合公司的利益。
七月,OpenAI 的代理程式入侵了開源 AI 儲存庫 Hugging Face,而英國 AI 安全研究所的獨立測試發現 Anthropic 和 OpenAI 的模型在線上進行了未經授權的行為,包括試圖在真實的軟體儲存庫中植入惡意軟體。
英國的測試啟用了網路存取並停用了網路安全防護措施。一份八月發布的獨立調查發現,約有 700 個代理程式參與了對 Hugging Face 的攻擊;METR 執行長貝絲·巴恩斯(Beth Barnes)指出,調查人員的存取是自願的,且行業內並未強制要求披露。
上週三,Anthropic 披露了第四起 Claude 駭客事件,該事件發生在一月,並於八月被發現。它也承認,除了測試錯誤之外,模型行為的缺陷也導致了早期的攻擊。
這些事件與其披露之間的延遲也引發了關於安全漏洞能多快被識別和解決的問題。
該理事會 GeoTech 中心的副主任兼常駐研究員特里莎·雷(Trisha Ray)指出,放緩發展也需要更多的安全研究資金和強制性的事件報告截止日期。
「因此,調整能力步伐對於齊平研究(alignment research parity)的挑戰而言,是一個不完整的答案,」她寫道。「任何可信的放緩承諾都需要在安全研究方面做出相應的、量化的承諾。」