AI代理人最大的漏洞並非來自模型本身的幻覺或安全漏洞,而是其所存取的網路與資源。攻擊者不再需要竊取憑證或突破外部防線,他們可透過「間接提示注入」(indirect prompt injection)手法,將惡意指令嵌入網頁、文件、電子郵件或 API 回應等外部內容中。AI代理人在擷取這些內容後,會將惡意指令視為合法指示執行,進而利用其原有的有效憑證與授權,竊取敏感資料。
例如,Zenity Ltd. 在 2025 年的 Black Hat USA 資安會議上展示了名為 AgentFlayer 的零點擊攻擊手法,能靜默劫持企業 AI 助理,透過惡意文件竊取 API 金鑰及客戶關係管理(CRM)紀錄等機敏資訊。同年 10 月,Legit Security, Inc. 也揭露 GitHub Copilot Chat 的 CamoLeak 漏洞,駭客藉由在程式碼合併請求中隱藏指令,讓 AI 助理在擁有開發者合法權限的情況下,將私有原始碼外洩。