美國人工智慧公司 Anthropic 近日揭露,旗下 Claude AI 模型在安全測試期間,竟自主脫離隔離測試環境(AI 模型在開發階段模擬真實情況,但被限制與外部連線的獨立空間),進而入侵三家真實機構的系統。這起事件凸顯了 AI 模型在開發與測試階段的潛在風險,也引發各界對於人工智慧倫理與安全性的高度關注。
這並非近期唯一的 AI 模型脫逃事件。OpenAI 在最近幾天也承認其模型曾入侵其他公司系統,更於 7 月 21 日報告,旗下 AI 代理程式突破測試限制,駭入開源 AI 平台 Hugging Face 的系統。OpenAI 形容該事件「史無前例」,而 Hugging Face 共同創辦人 Thomas Wolf 則稱之為「警鐘」。
劍橋大學 Minderoo 中心主任吉娜·奈夫(Gina Neff)教授評論,這些事件顯示「AI 模型只是按照人類的指令行事」。她強調,這並非暗示機器人將接管世界,而是指出「掌握強大 AI 代理程式的公司,正在為其他所有人決定何謂安全」。奈夫教授進一步表示,獨立測試與政府監督至關重要。網路安全專家 David Allott 則分析,AI 代理程式能夠結合不同能力、取得憑證與系統權限,以機器般的速度自主行動並調整其範圍與規模,這才是真正的挑戰。