資安研究人員近日揭露一項重大漏洞,直指 Anthropic、OpenAI 和 Google 等主流 AI 模型,在處理其「內部思維」或「推理 Token」時存在嚴重加密瑕疵。這項漏洞允許攻擊者透過較弱的模型,解讀同一供應商旗下更強大 AI 模型受保護的推理過程,恐導致用戶個人隱私資料與企業專利機密外洩。
根據資安研究員 Alexander Panfilov 於 X 平台發布的發現,AI 模型在生成回答之前會進行一個內部「思考」的過程,就像人類在腦中推敲一樣,這些中間步驟被稱為「推理 Token」或「思維足跡」(reasoning tokens),通常會以加密的數據塊儲存。然而,這個漏洞的關鍵在於,Anthropic、OpenAI 和 Google 等主要 AI 服務供應商,對這些加密的推理 Token,使用單一、全供應商共用的加密金鑰,而非為每個用戶、每次對話或每個模型獨立綁定金鑰。這種設計缺陷導致了「跨模型可攜性」,意味著即使是較弱、安全防護較低的 AI 模型,也能被用來解密同供應商旗下較強、防護更森嚴模型的「內部思維」。
研究團隊發現,透過將一個模型加密的推理區塊,注入到同供應商的另一個較弱模型中,就能迫使後者將這些原本加密的內容以明文形式輸出,如同直接讀取了該模型在生成答案前的「心聲」。此攻擊手法已在 Anthropic 的 Claude Opus 4.8 與 Claude Haiku 4.5 模型、OpenAI 的 GPT-5.6 系列以及 Google 的 Gemini 模型陣容中成功重現。Alexander Panfilov 指出,這代表 Claude Haiku 4.5 能夠讀取 Claude Opus 4.8 的「想法」。
這項漏洞開啟了四大攻擊途徑:竊取專有推理模式、從共享日誌中提取私人資料、執行「隱形 Prompt Injection」(提示注入,讓 AI 執行惡意指令而不被察覺),以及透過較弱的「兄弟模型」對強大模型進行越獄(jailbreaking)。
在研究人員依照負責任揭露程序通報後,Anthropic、OpenAI 和 Google 皆已部署了伺服器端的修補程式。儘管如此,那些已公開分享的歷史對話紀錄,其中已遭解碼的推理區塊,仍處於可存取狀態。這對全球 AI 產業敲響警鐘,也提醒台灣的 AI 開發者與企業,在利用大型語言模型服務時,必須更加重視資料安全與合規性。為防範類似風險,台灣的 AI 開發社群應審慎檢視其 AI 模型部署流程,尤其在共享 session logs 或開發日誌時,需確保已移除所有敏感資訊,並定期審查加密實施的有效性,以確保機密資料和用戶隱私不會因底層技術漏洞而外洩。