避險基金橋水(Bridgewater)與Thinking Machines Lab表示,經過微調的開源模型在評估金融文件方面,其表現超越了最強大的AI模型,且成本僅為一小部分。這些數據來自他們自己的內部評估。

投資者每天都被新聞、分析報告、公司文件和電子郵件淹沒。根據橋水旗下AIA Labs與Thinking Machines Lab(由前OpenAI技術長Mira Murati創立的新創公司)的報告,閱讀並非真正的工作。真正的工作是持續不斷地對哪些資訊真正重要做出重複且細微的判斷。研究人員希望將這種資訊篩選過程自動化。

他們從投資者的日常工作中定義了六項任務。其中一個例子是判斷某篇金融文章是否與某位高階主管相關;另一個則是判斷央行文件是否預示著未來利率變動的方向。對投資者而言,這些判斷看似微不足道,但他們卻難以用言語表達其推理過程。報告中提供了一個說明性的例子:關於川普聲稱擁有格陵蘭島的新聞標題被標記為不相關,而川普威脅對中國加徵新關稅的報導則高度相關。兩者都涉及地緣政治和金融。

這些前沿模型在作者的測試中表現不佳。Gemini、Claude和GPT的變體在僅使用基本提示詞的情況下,準確度約為50%。透過專家編寫的指令和三層評級系統(「相關且有趣」、「相關但不有趣」、「不相關」),準確度提升至70%左右。然而,這仍未達到作者設定的80%可信賴部署門檻。

當專家編寫提示詞時,模型的性能相較於簡單提示詞有顯著提升。

報告指出,較新的模型在每美元的性能提升上微乎其微。例如,GPT 5.4的成本比5.2高出43%,但準確度僅略有提高。

真正的價值存在於投資者的腦中。

解決方案是微調,即使用專有範例重新訓練開源模型。關鍵要素是橋水投資者的判斷:起初,他們聘請廉價的外部承包商來標註文件,但許多標籤都是錯誤的。為了避免讓昂貴的專業人士審查所有內容,研究人員採用了一種變通方法。第一個模型從有缺陷的標籤中學習,並重新評估相同的文檔。凡是模型與原始標籤不一致的地方,很可能存在錯誤。只有這些有爭議的案例才會交由投資者進行修正。

訓練是在Thinking Machines Lab的Tinker平台上進行的,該平台建立在開源模型Qwen3-235B之上。在團隊自己的評估中,經過微調的模型達到了84.7%的準確度,而表現最佳的前沿模型僅為78.2%。此外,其運行成本也降低了近14倍。當然,這並非一個完全獨立的比較,因為兩家公司都有明確的產品銷售利益。

儘管如此,這些數字背後的發現仍值得關注。它再次表明,像OpenAI這樣的大型實驗室並未吸收所有現有的數據。大量的專有企業數據和未經訓練的人類專業知識依然存在,它們蘊藏著巨大的改進空間。當公司刻意將其最有價值的數據保密時,這一點尤其明顯。任何將這些數據交給前沿實驗室的公司,都可能面臨與基於這些數據開發的產品競爭的風險。

透過Tinker等工具微調開源模型,為企業提供了一種替代方案。他們可以保留模型的權重、數據,甚至根據設定,保留GPU本身。