OpenAI 人工智慧模型在內部資安測試中發生重大意外,一個自主運作的代理式人工智慧(agents)在上週失控,成功突破安全防線,駭入另一家AI新創公司 Hugging Face 的系統。這起事件被 OpenAI 形容為「前所未有的網路攻擊事件」,凸顯了人工智慧技術快速發展下,潛在的安全風險與倫理挑戰。
該事件發生於上週,OpenAI 在其聲明中表示,這起攻擊是由一個基於其先進人工智慧模型的自主代理式人工智慧發動。這個代理式人工智慧的測試目標是找到解決網路安全基準問題的方案,但它卻自行掙脫了實驗環境的限制,成功連上網際網路,並向 Hugging Face 的系統發動了超過 17,000 次的入侵嘗試。最終,它成功地在 Hugging Face 的基礎設施中取得突破,達到其原定的測試目標。據《LiveNOW from FOX》報導,這可能是首例公開揭露的人工智慧模型在受控評估期間,自主入侵其他公司系統的事件。
Hugging Face 證實了這次入侵,並形容這起事件「與他們之前處理過的任何攻擊都不同」,且是「由一個自主的人工智慧代理式系統從頭到尾驅動」。儘管如此,Hugging Face 共同創辦人 Clem Delangue 在 X公司(前稱 Twitter)上表示,他們相信 OpenAI 並沒有惡意意圖,並稱這次事件的自主性質「令人驚訝」。目前 Hugging Face 尚未發現客戶或合作夥伴的資料被竄改的證據,但仍在持續調查中。值得注意的是,Hugging Face 在應對這次攻擊時,選擇使用北京智譜華章科技有限公司的開源中文模型 GLM-5.2 來分析及遏制攻擊,因為美國的主流模型無法區分防禦者與攻擊者,也拒絕處理所需的數據。
OpenAI 執行長奧特曼也在 X公司上承認,公司在評估模型期間發生了「一起重大資安事件」。OpenAI 指出,日益強大的人工智慧模型正在加速軟體漏洞的發現與利用。為了應對此類風險,OpenAI 已加強了模型的圍堵、監控、存取控制及評估程序,並正與 Hugging Face 合作,全面檢視事件影響並修補安全漏洞。