普林斯頓大學、華盛頓大學及其他機構的研究人員發表了一篇理論經濟學論文,挑戰了AI能自動提升效率的普遍假設。當AI減輕科學家的工作負擔時,科學家的時間反而變得更有價值。投入現有專案的每一小時,都意味著無法開啟新專案的機會成本,這正是該論文模型的核心概念。
為了進行分析,作者們刻意將大型語言模型(LLMs)理想化。他們將LLMs視為一種能節省時間成本、不引入錯誤且財務成本可忽略不計的工具,這種設定旨在將時間節省的純粹效果,與該技術眾所周知的弱點區隔開來。
研究人員建立了一個數學模型,其基礎來自行為生態學中的「最佳覓食理論」,該理論描述了生物如何在相互競爭的機會中分配精力。將其應用於科學研究,這個模型模擬了研究人員如何在不同專案之間分配勞動,以及當LLMs縮短專案生命週期的不同階段時會發生什麼。
在模型中,一個研究專案分為兩個階段。研究人員首先會檢查一個想法是否可行,然後決定是放棄還是繼續推進。推進專案包括強制性部分,例如製作圖表、排版文字和提交論文;以及自願性部分,例如進行額外實驗、更深入的分析或潤飾文稿。他們認為,當時間變得稀缺時,正是這個自願性部分會被犧牲。
該論文提出了三種情境,取決於AI在研究過程中的應用階段。在第一種情境中,AI協助評估早期想法。由於重新開始的成本較低,研究人員會變得更挑剔,只推進最有潛力的專案。然而,即使是這些專案也會得到較不徹底的處理,因為節省下來的時間最好用於啟動新專案。作者們指出,這種模式在技術領域很常見。
在第二種情境中,AI透過加速寫作、排版和分析來協助發表。由於發表論文所需的精力減少,一些較弱的專案也變得值得追求。結果是流通的論文數量增加,但每篇論文的深度卻變淺了。這種模式在以田野調查為基礎的學科中很常見。
只有在第三種情境中,AI才能真正提升研究品質。在此情境下,AI加速了自願性的深入探索階段,例如額外實驗或更仔細的分析。由於AI精準地針對了研究人員因時間壓力而經常偷工減料的階段,因此節省下來的時間能轉化為更徹底的工作。
因此,在三種情境中有兩種會導致研究的徹底性下降。當時間變得更有價值時,再花時間潤飾一篇已經可以發表的論文就不再合理。這些時間最好用於下一個專案。
作者們寫道:「作為一種勞動增強技術,LLMs增加了我們時間的機會成本,促使我們做得更多,但做得更糟,而不是做得一樣多,但做得更好。」「認為節省下來的時間會自動轉化為更深入分析的想法,是站不住腳的。」
模型中描述的理論情況,在實踐中已經開始顯現。OpenAI一份涵蓋八個科學案例研究的實地報告發現,重寫研究軟體時速度可提升高達60倍,但瓶頸只是從編碼轉移到驗證和長期維護。甚至感知到的時間節省不一定是真實的,也能改變行為。METR的一項研究發現,經驗豐富的開源開發者使用AI工具完成任務,實際花費的時間反而增加了19%,儘管他們感覺速度快了24%。
這種摩擦在出版系統中也顯而易見。在LLMs加速寫作的領域,投稿量已經快速攀升,使本已超負荷的同儕審查系統承受巨大壓力。Sakana AI的「AI Scientist-v2」甚至將一篇完全由AI生成的論文,包括引用錯誤在內,成功提交到ICLR研討會。Arxiv對此做出回應,祭出更嚴厲的懲罰,威脅對引用幻覺來源或在文本中留下AI元評論的論文處以一年禁投。
論文指出,機構的應對措施需要針對特定學科,因為AI對研究的影響並非均勻加速。它取決於研究過程中哪個階段被加速。最近一項關於軟體開發的研究將類似的動態描述為「公地悲劇」,即個人生產力的提升是以犧牲後續需要審查和維護成果的人為代價。



