更好的答案、更開闊的思考:學生如何受益於 ChatGPT 與批判性思考訓練
一項由逾 1,000 名學生參與的隨機實驗顯示,ChatGPT 使用與因果推理訓練能以互補方式改善學生的作業表現。
學生使用 ChatGPT 完成真實情境的作業時,會有什麼結果?品質提升是否會犧牲原創性?
博科尼大學研究人員與 OpenAI 經濟研究團隊合作進行的一項新實驗發現,使用 ChatGPT 與接受批判性思考訓練會帶來不同且互補的效果。使用 ChatGPT 可提升學生作品的品質與連貫性,而因果推理這項批判性思考練習則讓學生提出更多獨特的點子。同時可使用 ChatGPT 並接受訓練的學生展現了這兩種效果。
研究結果也顯示,評估學生的進步需要兼顧多個面向。隨著 AI 讓學生更容易產出成熟完善的答案,作業設計可能也需要調整,才能衡量原創性等其他重要特質。
實驗期間,博科尼大學超過 1,000 名大一學生針對一個真實商業案例,為校內紀念品商店擬定行銷建議。
研究以課堂時段為單位,將學生隨機分配至四組之一:獲得 ChatGPT (GPT‑4o) 使用權、接受因果推理訓練、兩者兼有,或兩者皆無。因果推理是批判性思考的一種特定形式,著重連結因果關係,並解釋特定解決方案為何可能有效或無效。這項訓練並非教授 AI,而是透過包含遊戲、範例、問題與回饋的練習,教導學生因果推理概念。
受過訓練的人工評分員使用五分制評量表,評估學生提交的作業。此外,研究人員運用自動化文字分析,衡量每份作業的點子數量與多樣性、因果推理跡象,以及與三位專家所提交內容的相似程度。
能使用 ChatGPT 的學生在五分制評量中的分數幾乎高出一分。他們的答案包含更多點子、邏輯更清晰,也更接近專家撰寫的建議。換句話說,AI 幫助新手產出的作品看起來更專業。重要的是,學生並非只是把作業交給 ChatGPT 代勞。他們仍須決定要問什麼、評估回覆,並選擇最終作業要納入哪些內容。
批判性思考練習帶來了更出乎意料的結果。完成練習的學生能更清楚地解釋自己的點子為何可能奏效、又可能在何種情況下失敗,但他們在評量表上的分數並未提高。這份評量表只衡量建議能否充分達成兩項標準行銷目標:提高校內商店的知名度與使用率。
文字分析揭示了另一項未能反映在評量表中的優點。整體而言,完成練習的學生提出了更多元的點子,而且與同儕相比更具獨特性。這一點很重要,因為本實驗用來評分的傳統評量表可能會肯定清楚、結構完整的答案,卻忽略學生是否提出了別人未曾想到的點子。
談到教育議題時,人們很容易認為只能二選一:學生究竟應該學習獨立思考,還是學習使用 AI?
這項實驗顯示,兩者各自帶來不同的價值。AI 使用權能幫助學生產出更成熟、點子更豐富且邏輯更連貫的答案。批判性思考訓練則鼓勵學生發展更多元的原創點子、質疑假設,並解釋自己的構想為何可行。
兩者相輔相成。
同時獲得 ChatGPT 使用權並完成批判性思考練習的學生展現了兩者各自的益處。他們的點子多樣性與只完成練習的學生相當。他們的評量分數與點子數量則和僅獲得 ChatGPT 使用權的學生相近。他們的作品也展現更強的邏輯連貫性,並顯示他們更常探究原因與質疑假設。整體而言,這組學生在最多項指標上取得進步。
這項實驗採用隨機設計,讓研究人員得以深入分析各項因素,分別檢視 ChatGPT 使用、批判性思考練習,以及兩者結合所產生的效果。因此,這項實驗為迅速發展的相關研究提供了格外有用的參考,有助於理解 AI 對學生的影響,以及如何妥善規劃並支援學生學習。
這項練習對學生產生的影響與傳統評量表所能反映的結果之間存在落差,顯示學校正面臨更廣泛的挑戰。
如果 AI 能幫助學生產出成熟完善、媲美專家的作品,那麼只看最終答案,就更難了解學生實際理解了多少。
許多教育工作者已開始思考作業與評量方式可能需要改變。這項調整方向符合數十年來科技與教育共同演進的趨勢,目的是培養學生在現代社會所需的技能。
這些結果凸顯出,評量應肯定能展現原創性、推理能力並考量多種方法的學生作品,而不應只重視最傳統或最成熟完善的答案。
重點:AI 幫助學生改善答案。批判性思考訓練則讓學生提出更多元的點子。兩者發揮互補作用,協助學生為未來做好準備。


