最新研究指出,儘管人工智慧(AI)技術發展迅速,但前沿 AI 模型在實際職場任務中的表現仍遠不及預期。一項由柏克萊加州大學發布的報告揭露,即使是頂尖的 AI 工具,在涵蓋多種職業的測驗中,最高整體通過率也僅有 24%。
這項研究來自柏克萊加州大學的 Center for Responsible, Decentralized Intelligence,旨在評估前沿 AI 工具在各種職場任務上的「就業準備度」。研究人員設計了一套名為「代理人最終考試」(Agents’ Last Exam,簡稱 ALE)的評估工具,其中包含超過 1,500 項由專家制定的任務,涵蓋 55 種不同職業。這些任務不僅包括軟體工程與平面設計等常見的 AI 應用領域,也擴及海事工程、農業、音訊製作及公共衛生營運等。
研究人員指出,儘管目前的 AI 代理已能解決相當部分的專業任務,但對於需要持續推理、深厚領域專業知識以及長期可靠執行的困難任務,其表現仍與人類水準相去甚遠。柏克萊電腦科學研究員宋曉冬(Dawn Song)表示,即使目前的通過率相對較低,那些由例行性、明確定義程序主導的職業,仍可能率先受到 AI 的衝擊,而需要大量決策的角色則能維持較長時間的韌性。她強調:「關鍵因素不在於產業本身,而在於工作的性質。」
這項研究表明,儘管 AI 產業迄今已投入 1.6 兆美元,但要讓前沿 AI 模型在複雜的現實職場任務中達到人類水準的表現,仍有漫長的路要走。對於台灣企業而言,這項研究結果提供了重要啟示:導入 AI 應著重於自動化例行性工作,而對於需要高度判斷與專業的任務,仍需輔以人類智慧,避免過度期待。