現今大語言模型的評測其實充滿了侷限與爭議。以現存公開的評測資料集來說,例如 MMLU、ARC 等,因為長期被公開使用,愈來愈容易被模型「學會」或間接接觸到相關內容。這導致許多模型在排行榜上不斷刷新紀錄(圖1),看起來能力持續提升,但實際上很難真的確定這些分數是否能真實反映模型的推理能力與理解力。換句話說,公開測試愈普及,模型的高分就愈不具備說服力,而這種評測方式愈來愈難回答最核心的問題:模型是否真的能在未知情境下展現足夠的可靠性?

圖 1:模型在公開的評測資料集上表現得越來越好
資料來源:https://arcprize.org/blog/3-month-update
有研究發現,當這些公開的題目實例做了些許變動後來進行重新測試,這時模型表現大幅降低。在 GSM-Symbolic 測試中,將原來 GSM8K 的題目做了些微的變動,再來看看模型的回應。發現到即使邏輯步驟一樣,模型在這些變體上的正確率通常會比在原 GSM8K 測試題上的分數低很多。
這說明了模型在 GSM8K 上的好成績,可能一部分是因為「見過類似的數字結構、類似的題型、類似的詞句」。換句話說,它之所以能答對,可能是依賴資料集裡的模式而不是對題目結構或背後邏輯的正確理解。所以當僅改變一些看似小的參數(例如把 5 改成 17 或把「男孩」改為「女孩」等),它就可能會回答失敗。這就是「只是記住」或「模式‐匹配」,而不是真正的理解。
而另一種方法則是去查驗模型是否真的理解意義來回應,也就是加入無關但看似相關的詞句(No-Op clauses),來看看對模型是否造成影響。GSM-NoOp 是在題目中加上一些似乎有用但實際上對解題沒有幫助的陳述。雖然這些外加的陳述不影響解答過程,但模型卻常常被誤導,將它們當作要處理的部分,最後造成操作錯誤或解題錯誤。加入這些無關資訊後,模型的準確率往往大幅下降,有些模型的正確率下降甚至超過 60% (圖2)。

圖2:原來 GSM8K 的題目做了些微的變動便造成正確率的下降
資料來源:Mirzadeh, I., Alizadeh, K., Shahrokhi, H., Tuzel, O., Bengio, S., & Farajtabar, M. (2024). Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models. arXiv preprint arXiv:2410.05229.
這也很明顯凸顯了模型不是真正理解哪些資訊是必要的、哪些只是噪音。模型並沒有穩健地判斷或過濾無關訊息,只是把所有看起來「可能重要」的訊息套進去計算或操作。
因此,對於公開的評測資料集,模型可能在不經意間記住問答的內容而取得很好的分數,但沒有正確學習到真實的樣態反映,所以在實際場域上線之後,仍然沒辦法產生符合預期的反應。也造成公開資料集的評測也逐漸不具代表性。
除此之外,當我們建置大語言模型應用服務時,模型的表現只是其中一個部分。要把一個應用成功推向上線,背後還包含了許多技術與設計。例如檢索增強生成(RAG)讓模型能即時結合外部知識,避免憑空捏造;提示設計與調整則會深刻影響輸出的準確度與完整性。換句話說,一個應用是否成功,不能只看模型在基準測試中的分數,而必須檢視整體系統在真實情境下的效能。
正因如此,業界逐漸探索新的評測方式,試圖補足傳統評測基線(Benchmark)的不足。例如在不同產業裡,逐步建立專屬的任務導向測試,用來模擬醫療、金融或客服的實際場景,這種做法比單純的問答更能揭露模型在特定領域的適用性。同時,人類主觀體驗的引入,也成為不可或缺的一環,因為使用者在意的不只是模型是否答對,而是輸出的流暢度、可信度與解釋性。
持續評測可避免系統偏差
此外,由於模型與檢索資料庫都會隨時間不斷更新,持續評測也變得愈來愈重要,避免系統在演進過程中出現退化或新的偏差。
展望未來,大語言模型應用的評測方向將不再停留在模型層面的單點分數,而是逐步走向系統化與場景化。所謂系統化,就是同時把模型、檢索、提示工程與基礎設施納入一體化的評測框架;而場景化則是針對不同產業與實際應用,建立更貼近真實需求的測試案例。
隨著這些方法逐漸成熟,人機結合的混合評估方式,也會發揮更大的價值,讓自動化指標與上線服務後審查互相補足。最終,評測的重心將從追逐排行榜名次,轉向檢驗整體服務品質,這才是能真正推動大語言模型應用服務持續進化的關鍵。
封面圖片來源:本文作者以GPT-5生成
參考資料來源:
- https://arcprize.org/blog/3-month-update
- https://arxiv.org/abs/2410.05229