根據《AI Insider》報導,IBM、Hugging Face 與慕尼黑工業大學的研究人員已指出,AI基準測試的可靠性並不高。模型評測結果受資料集、提示詞、使用工具、嘗試次數及評分方法等諸多因素影響,這些測試常未經監管,且重複使用靜態題目,導致模型可能只是記憶而非真正理解。IBM研究員Leshem Choshen表示:「業界的評估決策多憑直覺,因為基礎數據過於分散,難以嚴謹比較。」
目前市面上有超過二十多種用於執行和評分模型的「harnesses」(執行與評分模型程式碼的工具),其計分方式各異。Hugging Face 的研究便曾發現,即使是相同的Llama模型,在MMLU基準測試上,由於評估工具的差異,其結果竟出現矛盾。報導顯示,僅因執行方式不同,相同測試的分數差距可高達20個百分點。此外,「數據污染」(Contamination)是一個主要問題,即基準測試題目已出現在模型的訓練資料中,導致模型是「回憶」而非「推理」。
MMLU (Massive Multitask Language Understanding) 衡量模型在57個學術領域的知識廣度,但頂尖模型已趨於飽和,因此催生了MMLU-Pro,增加更多推理題及選項。HellaSwag用於判斷常識,而TruthfulQA則評估模型提供準確回答而非重複錯誤資訊的能力,這在健康、金融等敏感領域尤其關鍵。針對程式碼能力,HumanEval測試模型從程式碼說明(docstring)撰寫Python函式的能力,而SWE-bench則更進一步,使用真實的GitHub問題。然而,SWE-bench本身也面臨品質問題,OpenAI 曾估計,在其一項審核中,約30%的任務有瑕疵或評估不公。