今天,我們將介紹 TutorMoments 的預覽版,這是一個旨在衡量尖端大型語言模型(LLM)能否在教育中最困難的權衡之一中取得平衡的框架:何時介入幫助學生,以及何時放手讓學生獨立完成更多工作。
TutorMoments 是一種基於重播的評估方法,它建立在真實的一對一數學輔導課程之上。經驗豐富的數學老師會審閱從美國輔導計畫中收集的逐字稿,並標記出家教必須在「讓問題更容易上手」和「鼓勵學生自己進行更多推理」之間做出選擇的關鍵時刻。
TutorMoments 會將逐字稿截取到該決策點,然後將其交給語言模型,讓模型在模擬課程中扮演家教的角色,由另一個語言模型扮演學生,以觀察 LLM 家教的行為。
我們發現,當只被告知「好好輔導」時,模型往往會過度協助,提供過多的支援,很少鼓勵學生進行更深入的思考。在家教提示詞中明確說明這種權衡(何時幫助與何時放手)可以提高表現,但仍無法彌補與人類家教在適時輔導方面的差距,而且不同的 LLM 在做出這種判斷的可靠性上仍存在巨大差異。
作為我們開放研究承諾的一部分,我們正在發布去識別化的輔導逐字稿資料集、執行重播管線的程式碼,以及我們在這些逐字稿中評估的關鍵時刻的模型家教重播,以確保研究的可重現性。我們希望 TutorMoments 能為教育工作者、研究人員以及開發 AI 家教的團隊提供更精確的方式,來探討模型如何處理最重要的教學決策,並幫助該領域建立能適應每個學生而非代勞的家教。
向一位優秀的數學家教尋求幫助,你很可能會得到一個反問:「你對問題的要求了解多少?」這並非不樂於助人,高效率教學的一部分是診斷學生已知什麼,並在當下提供適當的支援。立即主動提供支援會剝奪學生進行智力工作以幫助他們學習的機會。有時需要支援;其他時候,最有效的方法是透過解釋正確答案來鞏固理解。
然而,語言模型被訓練成樂於助人,而樂於助人的助手往往會為你完成困難的部分,解釋概念、列出步驟並引導你找到答案。在輔導課程中,這可能會縮短「有效的掙扎」(productive struggle),這種費力、有時令人沮喪的問題解決過程,長期以來被學習研究證明與更深入的理解相關。
大多數評估語言模型作為家教的基準測試並未捕捉到這種張力。它們傾向於獎勵某種特定行為,例如,從不洩漏問題答案,或者總是提供提示,卻沒有考慮這是否是學生實際理解程度的正確舉動。但好的輔導並非一種可以全面識別的固定行為。這是一個判斷:這位學生現在、在這個問題上需要什麼?
TutorMoments 建立在真實的輔導數據之上。我們發布的資料集 TutorMoments-Preview 包含 462 份去識別化、純文字的真實一對一數學輔導逐字稿,對象是美國 2-7 年級的學生,其中包含超過 1,500 個由老師標註的關鍵時刻,以及來自 27 位美國教師標註者的數千條自由文字註釋。
所有註釋都來自經驗豐富的數學老師,我們請他們閱讀逐字稿並標記關鍵學習時刻,記錄當時發生了什麼、家教做了什麼,以及學生反應如何。每個關鍵時刻都是一個決策點,家教必須權衡「提供鷹架」(讓問題更容易理解)與「推動嚴謹性」(鼓勵學生進行更深入的思考)之間的關係。
TutorMoments 的運作方式是,在其中一個關鍵時刻暫停逐字稿,並將課程交給語言模型,該模型在與模擬學生的五輪互動中扮演家教的角色。我們將這些模型生成的延續稱為「重播」。然後,一個基於 LLM 的評分管線會對每個重播進行三項評分:模型是否 (1) 在學生需要支援時提供鷹架,(2) 在學生準備好接受更多挑戰時推動嚴謹性,以及 (3) 避免過度鷹架(減少的挑戰超出了當時的需求)。
評分管線從老師定義的「黃金標準」開始:對於每個關鍵時刻,它是否需要鷹架或推動嚴謹性。幾位老師對每個時刻進行了註釋,當他們意見不一致時,我們採用多數標籤,如果三位老師註釋了一個時刻,其中兩位要求嚴謹性,一位要求鷹架,那麼黃金標準就是嚴謹性。一個獨立的、經過老師註釋驗證的語言模型分類器隨後判斷家教的實際舉動是否符合當時的需求,「適當」的轉變意味著家教的分類行動(鷹架、推動嚴謹性或過度鷹架)與老師判斷當時的需求相符。
我們使用兩種提示詞對七個 LLM 進行了 TutorMoments 測試:一個是沒有實質指導的「普通提示詞」,它只告訴模型利用其對良好輔導的了解來回應學生,另一個是明確說明鷹架、過度鷹架和推動嚴謹性之間權衡的「評估感知提示詞」。每個模型都在輔導逐字稿中的關鍵時刻進行評分,這些時刻平均分配在需要鷹架和需要嚴謹性的情況。
表格中的每個數字都是介於 0 到 1 之間的評分,模型在相關時刻做出適當行為的比例,因此分數越高表示模型做出正確判斷的次數越多。例如,適當嚴謹性得分為 0.50 意味著模型在需要嚴謹性的一半時刻中推動了嚴謹性。
閱讀分數時請記住幾點:人類家教是自然參考,而非上限。我們不將人類家教視為理想實踐的典範,即使是經驗豐富的家教也會在當下做出不盡理想的選擇。以相同方式在相同決策點進行評分,我們逐字稿中的人類家教得分為 0.458(適當鷹架)、0.182(適當嚴謹性)和 0.496(避免過度鷹架),所有這些都低於模型的評估感知提示詞分數,並與其普通提示詞分數大致相同。
但這並不是聲稱 AI 家教優於人類教師。註釋者特別尋找輔導本可以做得更好的時刻,因此資料集側重於錯失的機會而非理想實踐。
分數衡量的是家教行為,而非學習成果。重播使用模擬的「預言機學生」,因此這些數字反映的是模型在決策點的行為方式,而不是真實學生是否學到了東西。嚴謹性比鷹架更具雜訊。評分管線檢測嚴謹性推動的可靠性較低,並且底層註釋中嚴謹性時刻(260 個)少於鷹架時刻(738 個)。
表格中最明顯的模式是提示詞的重要性:每個模型在評估感知提示詞下的得分都高於普通提示詞。這表明模型預設的「樂於助人助手」行為本身不足以進行良好的輔導。但提示詞中明確說明權衡的影響有限,儘管它提高了每個分數,模型在解釋增強提示詞方面仍存在巨大差異,即使是得分最高的模型也有很大的改進空間。
我們還分析了家教在每種情況下採取的行動。雖然提示詞鼓勵模型推動嚴謹性,但它們使用的策略比人類少,通常依賴於要求學生解釋答案。相比之下,人類家教採用更多樣化的策略,並且更有可能退後一步,讓學生獨立工作。
TutorMoments 仍處於早期開發階段,目前存在一些限制。最大的限制是,自動化評估能提供模型在決策點行為的訊號,但它無法取代對真實學生和真實學習成果的研究。資料集也較為狹窄:基於美國、主要針對小學和中學數學,並由單一教育工作者群體進行註釋。我們的發現可能無法推廣到其他科目、年級或環境。
我們分享這個預覽版是為了在我們建立更大、多模態資料集、更強大的評分管線和更深入分析的過程中收集回饋。
此專案的部分資金來自 Gates Foundation 和 Learning Commons 的支持。



