Every Eval Ever (EEE) 和 Hugging Face 社群評估(Community Evals)現已實現互通。我們支援交叉發布和解讀評估結果,同時連結到開源模型、排行榜和統一標準化的中繼資料儲存庫。

EEE 於 2026 年 2 月啟動,是 EvalEval 聯盟的一個專案,該聯盟是第一個旨在改進第一方和第三方評估者報告 AI 評估結果的跨機構合作。Hugging Face 於 2026 年 2 月推出社群評估,以分散式方式報告 Hub 上的基準測試分數。兩者結合,彌補了使用者、研究人員和政策制定者在信任、理解和選擇評估與模型方面的不足。

評估結果是衡量模型能力、比較模型以及推斷安全性和治理的依據,然而這些結果分散且難以比較。它們存在於論文、排行榜、部落格文章和測試日誌等各種地方,格式各異。同一個模型在同一個基準測試上,根據執行者和方式的不同,往往會產生不同的分數;例如,LLaMA 65B 在 MMLU 上的報告分數曾有 63.7 和 48.8 兩種。這些差異可能源於我們發現經常未報告的評估設定。

EEE 是我們針對報告端問題的解決方案。它提供一個用於評估結果的 JSON 綱要,記錄了:誰執行了評估、哪個模型、如何存取、生成設定、指標的實際意義,以及建議的每個樣本輸出 JSONL 檔案。這個綱要是在研究人員和政策研究人員的回饋下建立的,它接受來自任何來源的結果,因此測試日誌、排行榜抓取和論文數據都能以相同的格式呈現。

GitHub 儲存庫提供了轉換器、範例和貢獻者指南。自推出以來,Hugging Face 上的資料儲存庫已增長到約 229,000 個評估結果,涵蓋超過 22,000 個模型和 2,200 個基準測試,這些數據來自 31 種不同的報告格式。

從頭開始重現這些執行結果將花費數十萬美元,這也合理說明了為什麼一旦有人付費生成了這些數據,就不應讓其分散。

現在,它帶來了更好的整合和歸因。貢獻者現在可以將 EEE 結果發送到 Hugging Face 社群評估。我們建立了一個轉換器,可以將您的 EEE 記錄轉換為 Hugging Face 所需的小型 YAML 檔案,這樣您就不必手動維護兩種格式的相同結果。

這項新功能適用於所有報告或閱讀評估的人,而不僅限於現有的 EEE 貢獻者。第一方評估者報告自己的模型,以及第三方評估者報告其他人的模型,都可以提交到社群評估和 EEE。任何瀏覽 Hub 的人都可以獲得可追溯到完整記錄的結果。當您透過組織的官方 Hugging Face 帳戶提交數據時,您的結果將在 EvalEval 上顯示一個驗證勾選標記,向讀者表明這些數據直接來自來源。本文的其餘部分將介紹社群評估是什麼以及轉換器的作用。

Hugging Face 社群評估有兩個方面。基準測試存在於資料集儲存庫中,透過添加 eval.yaml 進行註冊。一旦註冊,該資料集頁面就會收集並顯示 Hub 上所有針對該基準測試報告的分數排行榜。官方基準測試清單會隨著時間增長。

模型的分數存儲在模型儲存庫中的 .eval_results/*.yaml 檔案中。它們會顯示在模型卡上並匯入到匹配的基準測試排行榜中。模型作者自己的結果以及其他人透過拉取請求提交的結果都會被彙總,每個分數都帶有一個標誌,說明它是作者提交、社群提交還是獨立驗證的。任何人都可以透過開啟一個帶有正確 YAML 檔案的 PR 來為任何模型添加分數,模型作者可以關閉 PR 或隱藏自己儲存庫中的結果。

這就是 EEE 和社群評估的結合之處。當您將結果同時發送到兩者時,會發生兩件事:首先,您的分數會出現在 Hugging Face 模型頁面上,並被匯入到基準測試的排行榜中。其次,它會帶有一個來源標誌,直接連結回完整的 EEE 記錄,其中包含生成配置、測試工具版本、可重現性說明以及任何實例級別的數據。

這兩個目的地為同一個目標執行不同的工作。Hugging Face 將您的結果放在人們查看模型的地方,並提供一個連結回到來源。EEE 則保留了完整的結構化記錄,使結果可解釋,並在此基礎上支援 Eval Cards。將您的數據同時發送到兩者,相同的評估結果就能同時可見且易讀,這正是報告評估的意義所在。

Hugging Face 將評估分數存儲在模型儲存庫的 .eval_results/ 下的 YAML 檔案中。所需欄位僅為基準測試資料集、任務和數值。source 區塊是建立指向 EEE 反向連結的部分。轉換器會根據您現有的記錄填寫這些內容。

它將 source_data.hf_repo 映射到 dataset.id,evaluation_name 映射到 task_id,score_details.score 映射到 value,evaluation_timestamp 映射到 date,然後將資料儲存庫物件 URL 作為每個記錄的 EEE JSON 的來源連結。

它目前處理四個官方基準測試:MMLU-Pro、GPQA、HLE 和 GSM8K。

轉換器不僅僅是重塑欄位。您將它指向一個 EEE 資料儲存庫集合,它會下載該集合及其引用的記錄,檢查物件雜湊值,並找到映射到支援基準測試的分數。在寫入任何內容之前,它會審核已存在的內容:它會讀取模型主分支和開放 PR 中每個 .eval_results YAML 檔案,並按資料集和任務而非檔案名進行比較。

如果分數已存在,則標記為 already_present;如果存在不同的分數,則標記為 score_conflict;如果模型儲存庫無法在 Hub 上解析,則標記為 missing_hf_model。其他所有內容都標記為 ready。

未經您的確認,任何內容都不會被推送。該工具會寫入本地 YAML 預覽和一個您可以檢查的審查檔案,顯示一份準備好和需要注意的報告,並且只有在您輸入 OPEN PRS 並輸入提交訊息後才會開啟 PR。除非您傳遞 --force,否則重新執行會重複使用集合的快取結果。

將您的完整記錄提交到 EEE 資料儲存庫。利用 EEE 只需一個額外步驟,轉換器在很大程度上會自動完成。社群評估轉換工具可在 GitHub 儲存庫中找到。要處理一個集合,請執行以下命令:uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro --datastore evaleval/EEE_datastore@main。

審查它生成的預覽和報告,然後在準備好提交時輸入 OPEN PRS。綱要、CLI 和轉換器的完整文件可在 evalevalai.com/every_eval_ever/hf-community-evals 找到。