科學數據很少附帶操作說明。研究人員必須判斷模式是反映生物學還是雜訊,數據是否能支持所提出的問題,以及每個結果應如何改變他們接下來的行動。AI 代理正日益擅長執行複雜分析,但真正的科學研究不僅依賴於回憶事實或遵循預定義的工作流程,更取決於做出這些高階判斷。

今天,我們推出了 GeneBench-Pro,一個具挑戰性的研究級基準測試,用於評估模型是否能處理真實世界計算生物學所需的、需要大量判斷力的分析。它擴展了 GeneBench,涵蓋了基因體學、定量生物學和轉譯醫學中更困難、更真實的任務,捕捉了計算生物學中科學研究的複雜性、迭代性質和模糊性。

迄今為止,很少有令人信服的評估能針對使真實世界計算研究變得困難的系統級判斷。這些判斷包括處理歧義、修正假設、選擇正確的分析路徑,以及知道何時結果已準備好做出決策。由於這些技能難以形式化,因此也難以嚴格評估,儘管它們的弱點正日益限制 AI 的整體性能。

GeneBench-Pro 旨在精確測量這些更高層次的能力。在 GeneBench-Pro 中,我們將「研究品味」定義為塑造分析的判斷鏈:數據能支持哪些問題、早期診斷應如何改變模型或估計量,以及何時需要修改初始計畫。每個 GeneBench-Pro 問題都為模型提供了一個真實且混亂的數據集、簡短的實驗背景,以及一個與下游決策相關的目標估計量。

為了正確回答,模型必須探索數據、選擇適當的分析方法、參與迭代實驗過程,並提供最終答案。

在生物學中,數據生成(例如基因組測序)的成本已大幅下降,一些研究人員現在認為,限制因素不再是樣本採集,而是下游的計算和分析。GeneBench-Pro 旨在評估解決這一瓶頸的進展,包含 129 個問題,涵蓋了廣泛的計算生物學設置和方法。

這個領域圖譜預覽了 GeneBench-Pro 的廣度。請訪問案例研究頁面,以更詳細地探索 10 個代表性問題。GeneBench-Pro 也旨在避免常見的基準測試失敗。

許多長期生物學基準測試圍繞混亂的歷史數據集構建多步驟問題,其中可能沒有單一的正確分析路徑。一個代理可能選擇一個合理的截止點,而另一個可能選擇一個不同但同樣合理的選項,這更多地反映了基準測試創建者的任意選擇,而非模型性能的任何根本差異。反之亦然:如果問題對數值不夠敏感,代理可能在分析中犯下根本性錯誤,但仍能產生通過的結果。

為避免這些失敗模式,每個 GeneBench-Pro 問題都是合成構建的:我們知道完整的因果結構並直接模擬數據生成過程。這使我們能夠調整每個問題的複雜性,確保主觀分析選擇的合理差異仍能產生可接受的數值結果,並透過消融研究驗證合理但不正確的分析會失敗。

然後,我們透過詳細的追蹤分析審核問題草稿,檢查資訊洩漏和意外的解決途徑。這讓我們相信,獲得正確答案取決於選擇正確的分析路徑,而不是利用捷徑或符合任意作者偏好。

我們將 GeneBench-Pro 的 129 個問題中的 82 個發送給外部領域專家,包括研究生、博士後研究員、產業科學家和教授。審稿人評估了每個問題的真實性、目標答案是否可識別,以及方法和估計量是否適當。反饋用於改進問題。

每個 GeneBench-Pro 問題都是一個獨立的科學分析。代理可以訪問一個隔離的工作區,其中包含簡短的提示詞、數據文件和標準的生物資訊學堆疊,包括 Python、科學計算庫和基本的基因體學套件,如 PLINK 2.0(儘管問題不需要領域特定的工具)。

由於我們控制了完整的數據生成過程,我們可以根據已知目標確定性地評分正確性,避免了標準基於評分標準的評估中出現的模型選擇變異性和冗長效應。每個問題還附帶豐富的元數據,包括預期的分析結構、附加數據文件、詳細的多頁案例研究和專家審查結果。

我們正在 Hugging Face 上完全開源 10 個代表性的 GeneBench-Pro 問題,並提供一個互動式網頁介面供瀏覽。最後,我們將在不久的將來向 Artificial Analysis 提供 50 個問題的子集,用於獨立的第三方基準測試。

我們最強大的模型 GPT-5.6 Sol 在最高推理級別的通過率達到 28.7%(啟用專業模式後為 31.5%)。這比我們開始構建原始 GeneBench 時有了顯著提升;當時,我們最好的前沿模型 GPT-5 的得分低於 5%。這個基準測試的進展表明,前沿模型正在快速改進,即使是在較不具體的系統級科學推理方面。按照目前的進度,這個基準測試可能在今年年底達到飽和。

結果還顯示了擴展測試時計算的影響。在最低推理級別,GPT-5.6 Sol 僅達到個位數的通過率。在最高推理級別,GPT-5.6 Sol 解決的問題數量幾乎是 GPT-5.2 的六倍,而使用的 token 數量約為其三分之二。

跨模型系列的比較表明,GPT 模型在定量不確定性下的高階科學推理方面是最強大的系統之一。GPT-5.6、GPT-5.5 和領先的開源模型(如 GLM 5.2)之間的性能差距明顯大於我們從程式碼基準測試中推斷出的預期,這表明開源模型更專注於程式碼,而非更廣泛的推理能力。

我們在開發過程中使用了前沿的 GPT 模型來評估和強化問題。因此,我們懷疑 GeneBench-Pro 可能對 GPT 模型相對於其他模型系列存在偏見。然而,競爭對手模型在發布時充其量只能與相應的 GPT 模型表現持平,並且往往明顯不足。

這些評估結果,GPT-5.6 Sol(專業版)高達 31.5%,考慮到 GeneBench-Pro 問題的難度,令人驚訝。在一項調查中,我們的審稿人估計,一個典型的 GeneBench-Pro 問題需要人類專家約 20-40 小時才能完成。

以保守的每小時 200 美元計算,單個問題的人力成本高達數千美元。目前的 AI 代理仍然不可靠,無法取代人類專家,但成本差距巨大,每個問題的推論成本僅為幾美元。這意味著即使是目前能力的局部自動化也能創造有意義的經濟和科學價值。

儘管如此,前沿模型仍解決不到三分之一的問題,這表明仍有很大的改進空間。模型可以在具挑戰性的問題上取得部分進展,但它們難以「閉合推論迴路」。這種失敗模式反映了人類專家和新手之間的對比。專家利用他們的經驗來構建問題並調整他們的方法,而新手則會觀察,但難以將其整合到問題的更廣泛背景中。

要實現近乎完美的性能,將需要既能可靠測量進度又能識別模型仍在哪裡失敗的評估。像 GeneBench-Pro 這樣的基準測試可以幫助將模糊的能力缺陷轉化為我們可以診斷和改進的東西。如果代理能夠可靠地自動化這類分析,它們可以顯著加速科學發現。

人類基因證據已經成為目標優先排序和轉譯追蹤的核心,因為具有基因支持的機制更有可能導致獲批的治療方法。同時,測序成本已大幅下降,生物銀行規模的數據集現在以前所未有的廣度連結了分子、表型和健康記錄資訊。限制因素正從數據生成轉向將資訊轉化為可操作的見解。能夠持續執行目前由人類專家團隊處理的分析的模型,可以透過加速假設篩選、目標追蹤以及數據生成和決策之間的迭代週期來改變產業研究。

GeneBench-Pro 代表了評估經驗豐富者所具備的良好科學判斷中更抽象技能的初步努力。這些技能使他們能夠直覺並識別最有前景的初始分析,在數據與初始假設矛盾時迭代和修正他們的思維,並得出下游臨床、學術或商業決策可能依賴的結論。我們預計,隨著模型能力的提升,探測模型在這些更高抽象層次能力的基準測試將變得越來越有用,超越那些僅測試書本知識或執行常規分析能力的基準測試。