當學生在實際作業中使用 ChatGPT 時會發生什麼?品質的提升是否會犧牲原創性?博科尼大學研究人員與 OpenAI 經濟研究團隊合作進行的一項新實驗發現,ChatGPT 的使用與批判性思考訓練產生了獨特且互補的效果。使用 ChatGPT 改善了學生作業的品質和連貫性,而因果推理(一種批判性思考形式)的練習則促使學生產生更多獨特的想法。同時獲得 ChatGPT 使用權和訓練的學生則展現了這兩種效果。

實驗結果也強調了在評估學生進度時,採取全面性方法的重要性。隨著 AI 讓學生更容易產出精緻的答案,作業可能需要調整,以衡量其他期望的特質,例如原創性。

在實驗期間,超過 1,000 名博科尼大學的大一學生參與了一項實際的商業案例,為該大學的商品店制定行銷建議。

學生們依班級被隨機分組為四組:獲得 ChatGPT(GPT-4o)使用權、接受因果推理訓練、兩者皆有,或兩者皆無。因果推理是一種特定的批判性思考形式,與連結因果關係以及解釋特定解決方案為何可能有效或無效有關。學生接受的訓練與 AI 無關,而是透過包含遊戲、範例、問題和回饋的練習,教導學生因果推理的概念。

學生的提交內容由訓練有素的人工評分員使用五點評分標準進行評估。此外,研究人員還使用自動化文本分析來衡量每份提交內容的想法數量和多樣性、因果推理的跡象,以及與三位專家提交內容的相似度。

獲得 ChatGPT 使用權的學生在五點評分標準上幾乎高出整整一分。他們的答案包含了更多想法,邏輯更清晰,並且與專家撰寫的建議更相似。換句話說,AI 幫助初學者產出了看起來更專業的作品。重要的是,學生並非只是將作業交給 ChatGPT,他們仍然必須決定要問什麼、評估回應,並選擇最終提交的內容。

批判性思考練習產生了更出乎意料的結果。完成練習的學生更清楚地解釋了他們想法可能奏效的原因以及可能失敗的時機,但在評分標準上並未獲得更高的分數,因為該標準僅衡量建議在多大程度上解決了兩個標準行銷目標:提高大學商店的知名度和使用率。

文本分析揭示了評分標準未能捕捉到的另一個好處。在該組中,完成練習的學生產生了更廣泛、更獨特的想法,與同儕產生的想法相比更具區別性。這很重要,因為像本次實驗中用於評分學生的傳統評分標準,可能會獎勵清晰、結構良好的答案,卻忽略了學生是否提出了別人沒有想到的獨特想法。

AI 使用權可以補充思考技能。將教育辯論框定為學生應該學習獨立思考還是學習使用 AI,這可能很誘人。然而,這項實驗強調兩者都以不同的方式具有價值。

AI 使用權幫助學生產出更精緻、想法更豐富、邏輯更連貫的答案。批判性思考訓練則鼓勵他們發展更廣泛的原創想法、質疑假設,並解釋他們想法為何應該奏效。兩者相輔相成。

同時獲得 ChatGPT 使用權和批判性思考練習的學生展現了兩者的好處。他們的想法多樣性與僅完成練習的學生相符。他們的評分標準分數和想法數量與僅使用 ChatGPT 的學生相似。他們的作品也顯示出更強的邏輯連貫性,以及更多尋求解釋和質疑假設的證據。總體而言,這組學生在最廣泛的衡量指標上都取得了進步。

這項實驗的隨機設計讓研究人員能夠深入探討這些不同因素,將 ChatGPT 使用權和批判性思考練習的效果與兩者結合的效果分開。這使得這項實驗對快速增長中的 AI 對學生影響以及如何最好地建構和支持他們學習的研究領域,做出了特別有用的貢獻。

學校面臨的挑戰是,如果 AI 可以幫助學生產出精緻、像專家一樣的作品,那麼僅僅看最終答案,我們對學生實際理解了什麼的了解就會減少。許多教育工作者已經在努力應對作業和評估可能需要改變的影響。這遵循了數十年來科技與教育共同演進的模式,以支持現代社會學生所需的技能。

這些結果強調了獎勵學生產出反映原創性、推理和考慮多種方法的作品的重要性,而不僅僅是傳統或精緻的答案。總結來說:AI 幫助學生讓他們的答案更好。批判性思考訓練幫助他們的想法更廣泛。兩者在為學生的未來做準備方面扮演著互補的角色。