
根據特拉維夫大學、以色列理工學院和Intuit的最新研究,AI幻覺可能不僅僅是錯誤答案——它們可能成為駭客入侵電腦的方式。
在題為「小心代理機器人網路:透過通用且可轉移的對抗性幻覺佔用進行可擴展的非針對性提示軟體攻擊」(Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting)的論文中,研究人員展示了一種利用AI模型生成虛假軟體儲存庫連結及其他線上資源時的攻擊技術。
研究人員寫道:「代理式大型語言模型(LLM)應用的日益普及,引入了一種先前被稱為『提示軟體』(promptware)的新威脅。」他們補充說:「儘管先前的研究已經證實,攻擊者可以在弱威脅模型下利用直接管道對LLM應用程式施加提示軟體攻擊,但許多應用程式並未提供任何可供在網際網路之外進行提示注入的直接管道。」
這種攻擊被稱為「對抗性幻覺佔用」或「HalluSquatting」,其手法是預測AI模型可能生成哪些虛假資源,然後註冊這些名稱,並加入惡意指令。如果AI代理隨後檢索到這些幻覺資源,它可能會將攻擊者控制的內容視為合法。
研究人員表示,這種威脅的出現是因為AI助手不再僅限於回答問題,而是獲得了與電腦互動的能力——包括存取檔案、搜尋網路、編寫程式碼和執行指令。
當代理在未確認來源真實性的情況下根據檢索到的資訊採取行動時,這些能力可能會產生安全漏洞。
他們寫道:「正在進行的研究已證明了針對真實世界系統(包括ChatGPT、Google Assistant、Copilot和各種其他應用程式)的提示軟體攻擊的各種變體。」「這些研究表明,提示軟體可能導致財務、隱私和安全方面的影響。」
研究人員警告稱,這項技術可能讓攻擊者建立啟用AI的殭屍網路(botnets)。殭屍網路是指由攻擊者遠端控制的受感染電腦或設備網路。殭屍網路常被用於網路攻擊,包括阻斷服務攻擊、加密貨幣挖礦、惡意軟體散佈和勒索軟體活動。
在測試中,研究人員發現,在儲存庫複製情境中,AI生成的資源幻覺發生率高達85%,而在技能安裝測試中則達到100%。
該團隊針對Cursor、GitHub Copilot、Gemini CLI和OpenClaw等AI程式碼助手和代理進行了技術評估。
HalluSquatting類似於錯別字域名搶註(typosquatting),這是一種網路攻擊策略,攻擊者註冊與合法網站或軟體套件相似的域名以欺騙用戶。HalluSquatting並非利用人類的打字錯誤,而是針對AI模型所犯的錯誤。
這項消息傳出的同時,研究人員仍在持續測試攻擊者如何操縱AI代理。
四月,Google研究人員詳細介紹了惡意網站如何透過間接提示注入攻擊劫持AI代理,這些攻擊包括試圖竊取密碼、刪除檔案和操控支付。另一項關於「CopyPasta」攻擊的研究顯示,開發者檔案中隱藏的提示如何操縱AI程式碼助手來散佈惡意程式碼。
六月,一名OpenClaw用戶報告稱,攻擊者曾嘗試超過6,000次,試圖誘騙AI代理洩露敏感資訊。