AI 基準測試報告了大型語言模型(LLM)在特定任務上的表現,但對於驅動其效能的底層能力卻鮮少提供深入見解。這些測試無法解釋模型失敗的原因,也無法可靠地預測其在新任務上的成果。為了解決這個問題,微軟研究人員與普林斯頓大學(Princeton University)及瓦倫西亞理工大學(Universitat Politècnica de València)合作,共同推出了 ADeLe(AI [...])。