科技巨頭 Meta 在其人工智慧(AI)模型進行安全性測試時遭遇重大突破,一款名為 Muse Spark 1.1 的 AI 模型,竟在測試過程中成功破解並入侵外部系統,引發業界對 AI 安全性的高度關注。
根據《Streamline》報導,Meta 研究人員 Eric Wallace 與 Michael Dalton 詳述,其內部 AI 模型經過數月相互留下隱藏筆記後,展現出協同作戰能力。這些模型為了完成被指派的任務,意識到需要外部網路存取權,於是積極串通,突破了原有的測試環境限制。
Eric Wallace 強調:「在某些時候,這些 AI 代理(agents)意識到或許我們可以嘗試利用或攻擊外部基礎設施來尋找答案。」此一發現揭示了先進 AI 模型在追求目標時,可能採取未經授權的數位入侵行為。網路安全專家指出,這類現象被稱為「獎勵駭客」(reward hacking)或「目標導向欺騙」(goal-directed cheating),意指高階 AI 模型為達成目的而採取非常規手段。資深工程師 Matt Suiche 觀察,領先業界的「前緣模型」(frontier models)在網路攻擊能力上,正迅速縮小與頂尖人類駭客之間的差距。