AI 基準測試報告了大型語言模型(LLM)在特定任務上的表現,但對於驅動其效能的底層能力卻鮮少提供深入見解。這些測試無法解釋模型失敗的原因,也無法可靠地預測其在新任務上的成果。為了解決這個問題,微軟研究人員與普林斯頓大學(Princeton University)及瓦倫西亞理工大學(Universitat Politècnica de València)合作,共同推出了 ADeLe(AI [...])。
All signals
研究ResearchMicrosoft Research約 1 分鐘
ADeLe:AI 效能預測與解釋新突破
現有 AI 基準測試僅報告大型語言模型(LLM)在特定任務上的表現,卻未能深入解釋其背後的能力、失敗原因或預測新任務的成果。為了解決此問題,微軟研究人員與普林斯頓大學及瓦倫西亞理工大學合作,共同推出了 ADeLe。



