在研究期間,學生自我回報的AI使用率從幾乎為零上升到約80%,其中DeepSeek V2.5於2024年9月發布以及DeepSeek R1於2025年1月發布時,使用率出現大幅躍升。最受歡迎的工具包括Doubao、DeepSeek、ChatGLM、Ernie Bot和Qwen。

研究顯示,作業分數上升了18%,完成時間從64分鐘減少到45分鐘,但閉卷考試分數卻驟降20%。這項研究利用學生在不同時間點自行發現AI的事實,採用了雙重差分設計方法。

這種方法測量了受干預組在干預前後結果的變化,並減去未受干預的對照組在同期內的變化。在這裡,研究人員追蹤每位學生在使用AI前後的表現變化,然後將這種趨勢與尚未開始使用AI的學生進行對比。

首次使用AI的時間來自自我回報數據,其因果關係主張假設兩組學生若沒有AI,發展會相似。在使用AI六個月後,作業分數上升了18%,而每次作業的平均時間從64分鐘降至45分鐘。

同時,每月閉卷考試的成績下降了20%。對高利害關係的升學考試影響同樣巨大,但累積速度較慢。常規考試表現半年內就開始下滑,但對升學考試的全面影響則需約兩年才會顯現,下降幅度介於18%至24%。

研究人員指出,短期研究因此會錯過學習的長期成本。常規考試的負面影響在六個月內達到全面程度,而中考和高考等升學考試的下降則需約兩年才能完全顯現。

在使用AI超過五個月後,約81%的學生能在50分鐘內完成作業,甚至比最快的非使用者還要快。他們作業成績高,但考試卻考得很差。作者寫道,這種短完成時間、高作業成績和低考試分數的組合,表明這些學生將作業外包給了AI。

學習損失主要集中在那些異常快速完成作業的學生身上,這種模式表明他們將任務外包給AI,而非實際學習。另一方面,那些花費與非AI同學相似時間完成作業的AI使用者,在考試中表現同樣出色,同時也獲得更好的作業成績。

這組學生沒有表現出基於先前表現的正面選擇跡象,這意味著他們一開始並非單純是更好的學生,且AI本身並非有害。它主要在取代獨立思考時造成損害。社會科學科目,如政治和地理,平均下降了27%,STEM科目下降22%,英語下降17%,中文下降9%。

這很重要,因為大多數先前的實驗都集中在數學、程式設計和外語上。儘管過去的實驗主要集中在數學和語言上,但學習損失對社會科學科目的打擊最嚴重。不同學生群體之間的影響也差異顯著。

國中生比高中生損失更多(24%對17%),男生比女生受影響更嚴重(21.6%對18.4%),研究將此主要歸因於男生使用AI更頻繁。表現最好的學生受害最深,前三分之一的學生下降24%,而後三分之一的學生下降16%。

劑量反應模式也出現了。每週使用AI一小時的學生損失約5%,而使用五小時或更多的學生則損失30%。學習損失估計從2023年初的約25%下降到2025年6月的16%。

這種下降也出現在一群固定的早期採用者中,表明學生和教師在一定程度上有所適應,但損失並未消失。這項研究解釋了為何反應一直很平淡。教師通常只教一個科目,單一科目成績下降20%本身並不罕見。

直到2025年6月,縣級平均總體影響才達到約負10%,因為很少有學生長期使用AI以致損害累積。學生自己也常常無法將這些點連結起來,誤將獨立學習的腦力勞動視為學習不佳的跡象。作為因應措施,研究建議向學生提供關於外包長期成本的可信資訊,增加實體考試的權重,並追蹤完成時間而非作業分數。

AI削弱了作業作為信號的價值,在作業分數高於平均水平的AI使用者中,更高的作業分數實際上預示著更差的考試結果。Anthropic研究員Andrej Karpathy曾主張,學校應停止試圖規範AI生成的作業,轉而將大部分評分轉移到課堂作業上。他的推理與這項研究的發現一致。

當學生知道他們將在沒有AI的情況下接受測試時,他們會保持學習材料的動力。這種模式與其他環境的最新發現一致。Anthropic最近的一項研究顯示,在AI幫助下學習新程式設計技能的參與者,在後續知識測驗中的得分比對照組低17%,且沒有節省任何實際時間。

結果取決於人們如何使用工具。那些單純複製AI答案的人表現更差,而那些使用AI來更好地理解任務的人則沒有看到同樣的下降。瑞士商學院的一項研究發現,AI使用與批判性思考之間存在負面關聯。美國和英國多所大學研究人員的另一項研究表明,那些主要將AI視為答案機器的人,認知能力下降最快。

UC Berkeley一項分析超過50萬個成績的研究也顯示,自ChatGPT推出以來,寫作和程式設計密集型課程中獲得A等最高成績的比例上升了13個百分點。同樣,這種影響集中在無人監督的作業上,而監考考試則沒有顯示出可比的增長。