語言模型已能協助研究人員搜尋文獻、綜合證據並處理複雜問題。然而,科學工作對這些模型有特殊要求,答案必須以證據為基礎,模型需保留證據實際支持的內容,而非悄悄擴大研究結論,且研究人員必須能驗證最終輸出。

我們從科學家使用 Asta(我們用於科學工作的代理平台)的方式中觀察到這一點。使用者通常不只進行簡單的關鍵字搜尋,還會提供大量背景資訊和多重限制,例如要求 Asta 比較不同文獻中的方法,同時考量特定方法、群體或環境。許多人也會將生成的報告視為工作研究成果,而非一次性答案,日後會再回頭參考。

我們希望協助科學家更快地生成帶有引用的報告,並提供一個他們可以自行下載運行的模型。為此,我們測試了一個專為科學報告生成訓練的小型開源模型,是否能在降低生成時間和服務成本的同時,達到我們所用專有模型的報告品質。

我們開發了 AstaBrief 8B,這是一個能將研究問題和檢索到的文獻摘要轉化為帶有引用的報告的模型。AstaBrief 現已在 Asta 的「生成報告」功能中以「快速模式」(Fast mode)提供,與由 Claude 驅動的「思考模式」(Thinking mode)並行。我們也將其模型和訓練資料開源,以便其他人能研究、重現並在此基礎上發展。

開發 AstaBrief 需要數萬個真實研究查詢、以引用為中心的篩選、偏好資料,以及重新設計的報告生成流程,該流程能一次性寫出完整報告,而非逐節生成。結果顯示,與我們追蹤的專有模型相比,報告生成時間幾乎減少了一個數量級。在整個 Asta 流程中,「快速模式」平均每份報告耗時 51.1 秒,而「思考模式」則為 178.5 秒,速度約快 3.5 倍。

這些效率提升共同使 AstaBrief 成為一個更廣泛目標的有用測試案例:建立可適應科學工作特定需求的開源語言模型。開放權重也將使各機構能夠在其自有基礎設施上運行 AstaBrief,這對於涉及敏感或未發表研究的問題至關重要。除了模型權重,我們還發布了一個範例工作流程,研究人員可以調整該流程,從自己的 PDF 文件中建立報告,為本地報告生成提供起點。

本文涵蓋了我們如何訓練 AstaBrief、我們在使其以科學證據為基礎方面學到了什麼,以及我們認為哪些方法可以應用於未來的科學模型。描述的大部分訓練和評估工作於 2025 年完成,因此用於生成訓練資料和作為比較點的專有模型反映了當時的尖端技術。我們尚未針對當今的尖端模型重新進行全面評估;以下結果最好被視為我們測試的特定訓練和系統設計選擇的證據。

訓練模型

我們開發 AstaBrief 的目標是建立一個具有開放權重的模型,具備長篇科學綜合最重要的所有品質:答案品質、相關性、結構和引用基礎。我們從 Qwen3-8B 開始,並將大部分精力集中在後訓練資料、評估和周邊的報告生成框架上。

將通用模型應用於科學工作,以及從頭開始訓練新的科學模型,是我們 Ai2 正在廣泛探索的領域。透過 NSF OMAI(由 Ai2 主導的美國國家計畫,旨在為科學發現建立完全開放的 AI 基礎設施和模型),我們的研究人員正直接與科學社群合作,了解他們對未來開源模型的需求,以及當今通用模型的不足之處。這包括研究不同科學領域和工作流程的需求差異,未來將分享更多研究成果。

最近的研究,包括我們的 DR Tulu,表明基於強化學習(RL)的方法可以改善開放權重模型的長篇報告生成,尤其是在訓練循環中涉及評審模型時。我們曾考慮將此路徑用於 AstaBrief,但最終選擇了更簡單的方法,圍繞監督式微調(SFT)和直接偏好優化(DPO)來建構。

基於 RL 的訓練可能不穩定且昂貴。我們希望了解在更便宜、操作上更易於管理的設定下,報告生成品質能達到多高,這種設定也更容易除錯和迭代。這使得訓練資料的品質特別重要。我們沒有依賴更複雜的優化方法來彌補有雜訊的範例,而是花費大量時間研究如何生成、選擇和篩選實際展示我們所需報告寫作行為的範例。

我們還希望 AstaBrief 更快,以便使用者可以快速獲得初步報告,然後在後續的迭代中進行修改。為了提高速度,我們決定訓練 AstaBrief 在給定使用者查詢和相關檢索片段的情況下,直接一次性生成最終報告,繞過我們基於 Claude 的「思考模式」所使用的昂貴片段摘要和聚類階段,也不再逐節寫出答案。有趣的是,我們發現這樣做可以在不犧牲性能的情況下實現。

收集 SFT 訓練資料

訓練流程始於透過我們論文「使用檢索增強型語言模型綜合科學文獻」中描述的系統以及 ScholarQA(目前支撐 Asta「生成報告」功能的框架)提交的真實使用者查詢。我們希望 AstaBrief 能從真實科學家的真實查詢中學習,而不是僅僅在合成提示詞或基準測試任務上進行訓練。

我們的研究表明,科學家對語言模型的要求通常與一般聊天機器人或傳統搜尋工具的使用者不同。在我們對數十萬個 Asta 查詢的分析中,專業研究人員經常提供大量背景資訊、多重限制以及概念之間的關係,而不是依賴簡短的關鍵字式提示詞。

最近的 Asta 使用者研究也揭示了研究人員希望 AI 參與其工作方式的差異,有些人樂於將模型用於構思或實驗,而另一些人則偏好在綜合、文獻監測或模式發現中扮演更狹窄的角色。儘管存在這些差異,參與者都希望有更清晰的來源可追溯性、對模型運作方式有更高的可見度,以及對其使用背景有更大的控制權。

我們對收集到的使用者日誌進行了品質、相關性和隱私篩選,刪除了 Beta 測試者和機器人流量,捨棄了過短而無意義的查詢,並使用基於大型語言模型的篩選過程來捕捉非英語查詢、非科學請求和包含個人資訊的提示詞。這留下了一個包含 9 萬個以研究為中心的查詢池。

對於 SFT,我們使用 Asta 報告生成背後的 ScholarQA 多步驟流程,從篩選後的查詢中生成了完整的報告目標輸出。該流程檢索相關文獻,將材料組織成章節,並使用後端報告生成模型將證據綜合為帶有引用的報告。我們綜合使用了多種專有系統:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。經過品質篩選後,這產生了 4.7 萬個可用的訓練範例。

建立 DPO 配對

DPO 需要不同類型的訓練資料。它需要每條查詢的報告配對,其中一份報告比另一份更受偏好,而不是單一目標報告。

我們從未用於 SFT 資料生成的獨立查詢子集中建立這些配對。每條查詢的一份報告來自現有的 ScholarQA 流程,通常由 Claude 3.5 Sonnet 或 3.7 Sonnet 提供支援。競爭報告則透過將 ScholarQA 檢索到的文獻摘要輸入到不同的模型(o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1,視範例而定)來生成。

兩個評審模型(GPT-4.1 和 DeepSeek-R1)比較了每對報告並選出獲勝者。我們確保大型語言模型評審與人類偏好一致(95% 的一致性),並且只保留兩個評審都同意的配對,這為我們提供了更清晰的偏好集,並減少了大規模生成偏好資料中常見的雜訊。經過品質篩選後,最終的 DPO 資料集約有 6 千個範例。

使用多個生成器並要求兩個評審達成一致,為我們提供了一種相對簡單的方法來建構偏好資料,而無需將任何單一模型的輸出或判斷視為黃金標準。

篩選資料以獲得更好的歸因

我們的主要評估目標是 SQABench-CS2,這是一個包含 200 個使用者撰寫的電腦科學研究問題的集合。在 AstaBrief 的開發過程中,我們追蹤了四個指標:

  • 評分標準分數:衡量報告涵蓋了多少必要內容。
  • 答案精確度:衡量每個段落是否與問題相關。
  • 引用精確度:衡量每個引用是否支持其所附的論點。
  • 引用召回率:衡量報告的論點是否完全由所提供的引用支持。

對於我們的最終模型,我們還進行了次要評估:DeepScholarBench(一個由近期 ArXiv 論文建構的 63 個查詢的長篇研究綜合基準),以及兩項針對由 Claude 驅動的流程生成的報告的獨立配對評估,包括 SQABench-CS2 上的大型語言模型判斷比較和一項小型人類研究。

一份報告可能聽起來精煉且完整,但卻偏離了問題,或者將引用附在底層證據不支持的論點上。對於科學綜合,我們需要單獨衡量這些行為。但引用支持只是科學忠實性的一部分,模型可能引用了正確的研究,但卻提出了比研究本身支持的更強烈的論點。這可能以微妙的方式發生,例如將關於特定樣本的發現轉化為關於整個群體的通用論點,將過去時態報告的結果轉變為聽起來更普遍真實的現在時態陳述,或者將描述性發現轉變為對臨床醫生、政策制定者或研究人員應該做什麼的建議。

這些概括對於科學報告生成尤其重要,因為每一步都可能擴大證據的表觀範圍,而不會引入明顯錯誤的陳述。因此,一個被引用的句子可能在技術上與其來源相關,但仍然誇大了研究人員實際建立的內容。我們的開發指標主要關注相關性、涵蓋範圍和引用基礎;對科學報告撰寫者的更豐富評估也應測試他們是否保留了其來源中論點的範圍和強度。

我們的首次 SFT 運行改善了整體內容品質,但在答案精確度和引用品質方面仍落後於我們基於 Claude 的報告生成流程。換句話說,模型在撰寫報告方面有所改進,但其證據基礎仍未達到我們科學綜合所需的持續一致性。這促使我們花更多時間在資料品質上。我們測試了四種基於統計的篩選器,以識別較弱的合成訓練範例:

  • 輸出與輸入詞元比例:比例非常高的答案通常雜訊較大,因為它們從過少的證據中生成了大量文字。
  • 引用相關性:對於訓練集中的每個合成報告,我們計算其引用論文的檢索相關性分數的平均值。低平均值表明報告過度依賴排名較低的證據。
  • 引用密度:我們衡量了至少有引用的陳述所佔的比例。