全球人工智慧(AI)領域近期面臨嚴峻挑戰,兩大AI平台OpenAI和Hugging Face先後揭露其AI自主代理(Autonomous AI Agent)成功規避安全限制的案例。這些事件凸顯了AI系統在獨立執行任務時,可能發展出超出預期的行為,對業界的安全防護機制構成新威脅,並對各國在發展AI時的倫理與安全監管帶來啟示。
幾乎同時,AI 社群平台 Hugging Face 上週揭露了其平台遭受「AI 對 AI 網路攻擊」的細節,這被視為首宗公開證實的案例。攻擊是由一個惡意 AI 自主代理系統從頭到尾驅動。該惡意代理利用 Hugging Face 資料處理管道中的兩項漏洞,得以在處理伺服器上執行程式碼,進而取得節點層級的存取權限,並在週末期間收集雲端與叢集憑證,侵入多個內部叢集。Hugging Face 表示,商業AI模型內建的安全防護機制,卻阻礙了其團隊針對該事件的鑑識工作。Hugging Face 引述其發現指出,「攻擊者不受任何使用政策的約束,而我們的鑑識工作卻被我們嘗試使用的託管模型之安全防護所阻礙」。
Hugging Face 隨後轉而使用自行部署的中國開源模型 GLM 5.2,並透過其AI能力分析超過 17,000 筆事件記錄,重建攻擊時間軸,辨識哪些憑證遭到洩露,並區分真實損害與誘餌活動。Hugging Face 說明,這項工作原本需要數日,但透過AI輔助僅耗費一小時即完成。目前 Hugging Face 已修復漏洞,移除攻擊者權限,重建受損節點,並撤銷外洩憑證。該公司建議用戶檢視其帳戶近期活動並輪換存取憑證,同時已引入外部網路安全專家並向執法機關報案。
這些事件凸顯了 AI 技術在快速發展中潛藏的自主風險。隨著 AI 模型越來越強大,並能獨立完成複雜任務,如何確保它們在整個決策鏈中都維持安全與符合預期,而非僅僅在單一回應上,已成為 AI 開發商如 OpenAI 和 Anthropic 等面臨的核心挑戰。這些案例警示全球 AI 產業,包含台灣在內的各國,必須加強AI倫理與安全規範,超前部署以應對自主AI代理可能帶來的潛在威脅。