隨著人工智慧(AI)應用日益普及,開發者在建構 AI Agent(自主執行任務的智慧程式)時面臨新的挑戰,過去軟體工程師常說的「在我機器上能運行」,如今卻成了「在我的提示下能運行」。這種現象導致 AI Agent 在不同情境下(例如程式碼版本更新、輸入資料改變或執行流程拉長)可能產生不一致的行為,即使輸出結果看似合理,內部執行過程也可能潛藏錯誤。
例如,一個客服 AI Agent 可能在尚未檢索公司政策前就生成答案、重複呼叫工具,甚至錯誤地使用未經批准的備用方案。這種「答案正確性」與「內部執行軌跡」之間脫鉤的問題,在生產級軟體中尤其關鍵。專家指出,AI Agent 的正確性應涵蓋三個層面:答案的實用性與準確性(Answer Correctness)、工具使用順序與完成度(Trajectory Correctness),以及對執行過程的可檢視性(Evidence Correctness)。然而,多數測試目前仍偏重答案正確性,忽略了後兩者。
傳統的日誌記錄(logs)只能提供事件串流,不足以完整追溯 AI Agent 的執行軌跡,因為軌跡中包含了關鍵的順序、父子關係、重複步驟及遺漏環節等資訊。為解決此問題,OpenTelemetry(一個開源資料流處理平台)的追蹤(traces)機制提供了更強大的基礎,能以具有父子關係的跨度圖來呈現 AI Agent 的執行流程。透過這種追蹤,每次 AI Agent 的運行都能轉化為可供審查的「證據產物」(reviewable artifact),此產物會經歷擷取、標準化、檢視、檢查、編輯敏感資訊、打包與驗證的生命週期。