Hugging Face 在七月舉辦了一場駭客松,超過 1,200 名社群成員攜帶各自的程式碼代理,嘗試逐一重現 ICML 2026 發表的研究論文。在短短 19 天內,參與者發布了 6,816 份 Trackio 日誌,重現了 2,226 篇論文,約佔該會議總數的三分之一。
本文將分享我們從這次駭客松中學到的經驗,以及當 AI 代理執行研究實驗時,人類將扮演何種角色。
關於 AI 研究重現性的問題,其歷史比當前的 AI 浪潮更為悠久,但規模的擴大加劇了這些問題。ICML 2026 收到了 23,918 份投稿,並接受了 6,352 篇論文,數量約是前一年的兩倍。這股指數級增長趨勢,部分是由於 AI 代理加速了實驗執行和論文撰寫所致。
然而,審查能力並未隨之倍增。大多數會議的審稿人都是志願者,他們可能沒有足夠的時間或專業知識來全面審查一篇論文。以下是一篇被接受的 ICML 2026 焦點論文的審稿意見,引述審稿人原話:「我信心分數低,是因為我沒有仔細檢查所有證明。」
請注意,這篇論文獲得了高分並被選為焦點論文。請記住這一點,因為我們稍後會回到這篇論文,並探討當我們最終仔細檢查其證明時發生了什麼。
不過,情況有所改變,推動大量投稿的相同技術,也能幫助我們應對這些挑戰。像 Claude Code、Codex、Cursor 和 Pi 等程式碼代理現在可以閱讀論文、編寫程式碼、啟動實驗,並回報其發現。過去,仔細檢查一篇論文可能需要審稿人花費一個週末;現在,一個代理可以在一個下午內嘗試,並平行執行數千次。
因此,我們想問的問題是:如果我們實際大規模重新審查一個主要會議,並嘗試重現每一篇論文,我們會發現什麼?
我們沒有親自審核論文,而是將這項任務開放給整個社群,匯集了各種代理框架、運算預算和科學品味。從 2026 年 7 月 15 日到 8 月 2 日,ICML 2026 開放重現挑戰的運作方式如下:
參與者可選擇一篇論文。我們索引了所有 6,341 篇被接受的 ICML 2026 論文及其摘要,並提取了每篇論文的核心科學主張,以便代理可以從具體、可檢查的目標開始,而非從 40 頁的 PDF 文件著手。我們鼓勵多人重現同一篇論文。
參與者可攜帶自己的代理。大家使用了 Claude Code、Codex、Cursor、OpenResearch 的 orx 等各種工具。我們提供了一個簡化的介面,讓代理只需一個指令就能獲取論文、其主張和挑戰說明。
重現後,發布所有內容。每次執行都會產生一份 Trackio 日誌:一個靜態的 Hugging Face Space,其中包含報告、執行的程式碼、產生的產物,以及(可選地)作為 Hugging Face Dataset 上傳的完整代理執行追蹤。審核過程本身也必須是可審核的。
結果由評審判斷。一個自動化的日誌評審(運行開源模型 GLM-5.2)會重新閱讀每份日誌,並針對每個主張發出判決:已驗證、已證偽、玩具(縮小規模的證據)或無定論。評審被明確指示,將每份日誌的自我評估視為不可信。
參與者獲得了 20 美元的 Hugging Face 運算點數,用於在 HF Jobs 上運行實驗;在整個挑戰中,參與者啟動了 2,962 個雲端任務。當無法進行完整重現時,例如論文的資料集是專有或檢查點未發布時,參與者會使用模仿原始屬性的人工資料進行玩具規模的重現。
從數據來看,這次駭客松可能是迄今為止規模最大的科學會議重現嘗試:共有 1,221 名社群成員參與組織,發布了 6,816 份重現日誌。
總計嘗試了 2,226 篇論文,佔整個會議的 34%,其中許多論文由多個獨立團隊重現。共判斷了 35,908 項主張,所有判決在挑戰結束時都凍結在公開資料集中。
此外,啟動了 2,962 個 HF Jobs,並在 Hugging Face 上發布了 274 個完整的代理追蹤資料集。
彙整每篇論文的主張級別判決結果如下:
51% 的受審查論文(1,103 篇)至少有一項主張被獨立驗證。其中,有 266 篇論文被完全重現,所有提取的主張都得到驗證;另有 632 篇論文被部分重現,且沒有任何主張被證偽。總計有 3,978 項獨立主張透過實際實驗得到證實。
23% 的受審查論文(496 篇)至少有一項主張被證偽或存在爭議。這包括 49 篇所有主張都被證偽且無法驗證的論文,以及最有趣的是,有 242 篇論文的獨立重現團隊對相同主張達成了相反的判決。重現性並非二元對立,而是一種對抗性的過程。
其餘論文則介於兩者之間:502 篇論文僅有玩具規模的證據,而 280 篇論文則無法確立任何結果(最常見的原因是缺少產物)。
有些論文經受住了嚴格考驗,表現出色,社群中最好的日誌本身就值得一讀:
論文「Flat Minima and Generalization: Insights from Stochastic Convex Optimization」被 20 個獨立團隊重現,其中 12 個團隊驗證了所有主張。連結的日誌甚至包含了完整的代理追蹤。
另一篇論文「A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness」在 17 份日誌中有 14 份驗證了所有主張。這篇關於不可靠 LLM 評審的論文,在 LLM 代理的審查下依然站得住腳,這點相當有趣。
共有 35 名參與者正式聲稱他們證偽了某些主張。我們對每個聲稱的證偽進行了對抗性再驗證:重新閱讀論文、重新閱讀日誌,並從論文文本中重新推導數學或重新實作實驗。
以下是一些已確認的證偽案例,並連結到發現它的日誌:
介紹中提到的分頁論文。那位沒有仔細檢查證明的審稿人?論文「Towards Optimal Robustness in Learning-Augmented Paging」聲稱其演算法實現了 Hk+O(1) 的穩健性。一位參與者的日誌測量到附加項以 0.38lnk 的形式增長,並找到了證明中出錯的確切步驟。
我們自己的重新實作將掃描範圍擴展到 k = 1,024,並確認了約九個標準差的增長。真正的穩健性應為 Hk+Θ(logk)。
一個在第 224 步後失效的定理。論文「Attention's forward pass and Frank-Wolfe」證明了當原點位於其凸包內部時,token 粒子會塌縮到原點。三個獨立團隊發現了反例,違規現象首次出現在 t = 224、約 3,800 和 6,416 步,這清楚解釋了為什麼其他人「驗證」了該主張:有限時間範圍的檢查停止得太早。
最清晰的反例以精確的有理數算術表示,因此沒有浮點模糊性可供掩飾。作者在同一天確認並正在修復。
理論與實作不符。在論文「Self-Distillation Enables Continual Learning」中,論文的核心方程式及其整個理論部分分析的是逆向 KL 散度,但發布程式碼的預設值(根據作者說法,產生了論文所有結果)卻計算的是正向 KL 散度。發現此問題的日誌也未能重現作者自身程式碼和資料下,論文宣稱的 +4pp 關鍵結果。作者已將澄清版本上傳至 arXiv。
被填充稀釋的評估。在論文「Do Transformers Need Three Projections?」中,一位參與者發現約 66% 的評估標籤位置是 EOS 填充 token,這些 token 訓練到接近零損失,導致困惑度(perplexity)被稀釋了約三倍。摘要中「50% 快取減少帶來 3.1% 品質成本」在修正後變為約 9.4%。
🚨 錯誤的證偽。有時我們也會在重現嘗試中發現缺陷。一份日誌戲劇性地聲稱「該論文的方法比基準慢兩倍」;結果這是一個重現中的算術錯誤:將單次軌跡時間與每批 50 次的時間進行比較。正確正規化後,參與者自己的數據證實了論文宣稱的 8 倍加速。
我們已開始向每個已確認發現的論文作者發信,以簡單的框架說明:「這是我們發現的,這是所有證據,您同意還是我們的分析有誤?」早期的回應都非常積極:
截至目前,作者們已確認了多篇論文的發現,兩份 arXiv 修正正在進行中。在一個案例中,一位作者在挑戰發現錯誤前一個月,已悄悄地在新版 arXiv 中修正了錯誤,我們將此視為獨立的收斂。
這次駭客松引發了最有趣的問題是:人類在審查論文中是否仍扮演著角色?我們認為是的,原因有幾個:
純粹的代理執行會遇到實際限制。代理會陷入局部循環、誤讀依賴規模的行為(分頁論文的幾個「已驗證」判決來自於在 log-k 增長變得可見之前就停止的檢查),偶爾還會因為單位不匹配而導致整個證偽。挑戰中最可靠的結果來自於有人類引導的工作流程:重新引導代理、質疑假設,或在浪費一週運算時間之前判斷實驗前提是否錯誤。
目前,某些評估本質上仍需要人類參與。我們「人類在環」的獲勝者就是最清晰的例子。該論文聲稱在極端量化下能穩定生成圖像。數值指標顯示「沒有崩潰」;但圖像是否真正可用,則是一個感知問題。代理建立了一個專用的審查使用者介面,由人類親自判斷所有 128 對圖像,並將註釋提交到儲存庫,隨後代理驗證其一致性。
已發布的代理追蹤記錄了整個交流過程,甚至包括參與者詢問審查工具如何運作,然後回覆「我已經檢查了這些對並將 csv 放入儲存庫,請檢查」。
那麼,作為人類審稿人,我們的角色是什麼?我們認為是有效管理智慧。就像教授或主要研究員(PI)為研究生創造一個良好的工作環境,提供運算資源、工具、資料存取和適時的針對性回饋一樣,那些最能善用代理的參與者,正是那些建立了正確環境並提出了正確問題,然後讓代理執行任務的人。
感謝所有 1,221 位參與者、獲獎者、優雅回應的作者,以及 Hugging Face 和 alphaXiv 的組織者。挑戰中的每一份日誌、判決、追蹤和產物都已公開,可從挑戰 Space 存取。我們認為這是迄今為止對機器學習會議進行的最大規模、逐項主張的公開審計,並希望這個紀錄不會保持太久。
請持續關注未來的重現活動。



