A 等級的比例躍升了 13 個百分點,比 2022 年的基準線高出約 30%。平均 GPA 上升了 0.12 分,且成績分佈範圍縮小。原本的 A- 和 B+ 等級現在被提升為直接的 A。
這項研究追蹤了 8 個秋季學期(2018 年至 2025 年)中,橫跨 84 個學系的 319 門課程的成績趨勢。每門課程的 AI 暴露程度,是根據 ChatGPT 問世前,2022 年秋季課程大綱中的作業組合來衡量。其中,寫作和程式設計任務的比例最為關鍵,因為這些是 AI 表現最佳的領域。
成績飆升的驅動因素是作業分數,而非考試成績。研究問題在於,更高的分數是否反映了實際的學習進步,或者僅僅是 AI 在代勞。為了找出答案,作者 Igor Chirikov 也檢視了作業在最終成績中所佔的比重。
如果 AI 確實能提升學習成效,那麼無論課程是側重作業還是監考考試,成績都應該有所提升。但如果 AI 只是取代了學生在無監督作業上的工作,那麼其影響應該集中在作業佔比更重的課程中。
這正是數據所顯示的:在作業佔總成績比重高於中位數的課程中,A 等級的比例額外增加了 16 個百分點,相較於 AI 暴露程度相同但作業佔比低於中位數的課程。在這些作業佔比低的課程中,AI 的影響很小且不具統計顯著性。Chirikov 寫道,這個結果「很難單純用廣泛的學習進步或分流效應來解釋」。
總體而言,在 ChatGPT 於 2022 年 11 月發布後,所有課程中獲得 A 或 A- 等級的學生比例急劇上升,而 B+ 到 C- 等級的比例幾乎沒有變化。安慰劑測試也支持了這一點:對於 AI 用處較小的口頭報告作業,學生的成績並未受到影響。
成績膨脹在美國大學中並非新鮮事。研究指出,哈佛大學的 A 等級比例從 2005 年的 24% 上升到 2025 年的 60.2%。早期的研究將此歸因於鼓勵寬鬆的教學評估、大學之間的競爭以及學校的評分政策。
然而,Chirikov 認為 AI 的運作方式有所不同。所有先前的驅動因素都在評分階段介入,也就是學生提交作業之後。AI 則是在教師看到作業之前,就改變了作業本身的製作方式。
研究警告,如果寫作和程式設計等課程的成績越來越多地反映 AI 生成的內容,而非學生的真實技能,那麼雇主和研究所可能會做出錯誤的選才決策。Chirikov 也指出一個潛在的惡性循環:如果 AI 在大學期間接管了技能培養任務,畢業生在 AI 最擅長的領域反而會變得更弱。這可能加速自動化並擴大就業市場的技能差距。
作為解決方案,研究建議重新思考考試形式。將所有評估都轉為監考考試並不足夠,也並非易事。更好的做法是設計能限制 AI 使用,或刻意將其融入的作業,例如透過記錄工作過程,或進行後續互動以證明理解程度。
即使是 OpenAI 執行長 Sam Altman 也擔心批判性思考能力會下降。Sam Altman 在最近一次採訪中承認,ChatGPT 推出三年半後,教育系統對 AI 的反應微乎其微。他原本預期會有一年的作弊潮,然後是系統性的改革。然而,他卻看不到任何有意義的系統性變化。他警告,如果沒有改變,批判性思考能力恐將面臨「顯著的萎縮」。
Altman 仍然相信教育能夠適應,就像它過去面對科技躍進時一樣。但他認為,寫作和程式設計等某些技能仍應持續教授,因為它們能訓練心智本身。Altman 表示:「我是一個透過寫作思考的人,我寫了很多從未示人的東西,但對我來說,這對於理清思緒仍然很重要。這就是為什麼我很慶幸我學會了寫作。人們對程式設計也有同樣的看法。」
挪威最近在小學中大部分禁止了 AI 工具的使用,並限制了其在中學的應用。挪威總理 Jonas Gahr Stoere 表示,不加批判地使用 AI 會誘使學生跳過重要的學習步驟。



