答案更佳,思考更廣:學生從 ChatGPT 和批判思考訓練中有何得着
一項涵蓋逾 1,000 名學生的隨機實驗發現,使用 ChatGPT 與接受因果推理訓練,分別以互補的方式改善了學生的作品。
學生使用 ChatGPT 完成一項以現實情況為題的作業時,會有甚麼結果?質素提升是否以犧牲原創性為代價?
博科尼大學研究人員與 OpenAI 經濟研究團隊合作進行的一項新實驗發現,使用 ChatGPT 與接受批判思考訓練,分別帶來不同而互補的成效。使用 ChatGPT 提升了學生作品的質素和連貫性;因果推理是一種批判思考,而相關練習則讓學生提出更多獨特構思。同時獲准使用 ChatGPT 並接受訓練的學生,均展現出這兩種成效。而因果推理練習這種批判思考訓練,則讓學生提出更多獨特構思。同時獲准使用 ChatGPT 並接受訓練的學生,兼得兩方面的成效。
結果亦凸顯以全面方式評估學生進展的重要性。隨着 AI 讓學生更容易寫出完善的答案,作業或需作出調整,以衡量原創性等其他值得重視的特質。
實驗期間,博科尼大學逾 1,000 名大學一年級學生處理一個真實商業案例,為大學紀念品店制定市場推廣建議。
研究人員按上課時段將學生隨機分為四組:可使用 ChatGPT(GPT‑4o)、接受因果推理訓練、同時獲得兩者,或兩者皆無。因果推理是批判思考的一種特定形式,涉及連繫因果關係,並解釋某個解決方法為何可能有效或無效。學生所接受的訓練與 AI 無關,而是透過包含遊戲、例子、問題和意見的練習,教授因果推理概念。
受過培訓的評分員按照五分制評分準則,評估學生提交的作品。此外,研究人員運用自動化文本分析,衡量每份作品的構思數量及多樣性、因果推理跡象,以及作品與三名專家所提交內容的相似程度。
可使用 ChatGPT 的學生在五分制評分中,得分高出接近一整分。他們的答案包含更多構思、邏輯更清晰,也更接近專家撰寫的建議。換言之,AI 幫助初學者完成看起來更專業的作品。重要的是,學生並非只是把作業全盤交給 ChatGPT。他們仍須決定提出甚麼問題、評估回應,並選擇哪些內容納入最終提交的作品。
批判思考練習帶來了一項較出乎意料的結果。完成練習的學生能更清楚解釋其構思為何可能奏效,以及在甚麼情況下可能失敗,但他們在評分準則下並未取得更高分數。該準則只衡量建議能否達成兩項常見的市場推廣目標:提高大學紀念品店的知名度和光顧率。
文本分析顯示,這項練習還有另一項未能反映在評分準則中的益處。整體而言,完成練習的學生提出了更多元的構思;與同儕的作品相比,他們的構思亦更具獨特性。這一點十分重要,因為像本實驗所採用的傳統評分準則,可能會肯定清晰且結構完整的答案,卻忽略學生是否提出了其他人未曾想到的構思。
在教育議題上,人們很容易把討論歸結為二選一:學生應學會獨立思考,還是學習使用 AI。
這項實驗說明,兩者各有不同價值。使用 AI 幫助學生寫出更完善、構思更豐富且邏輯更連貫的答案。批判思考訓練則鼓勵他們發展更多元的原創構思、質疑假設,並解釋構思為何應該奏效。
兩者結合,便能相輔相成。
同時獲准使用 ChatGPT 並完成批判思考練習的學生,展現出兩者各自的益處。他們提出的構思與只完成練習的學生同樣多元;按評分準則所得的分數和構思數量,則與只使用 ChatGPT 的學生相若。他們的作品亦展現出更強的邏輯連貫性,以及更多探究原因和質疑假設的跡象。總括而言,這組學生在最多項評估指標上都有進步。
實驗採用隨機設計,讓研究人員能深入探討不同因素,分辨使用 ChatGPT、進行批判思考練習,以及兩者結合所產生的成效。因此,這項實驗為一個迅速發展的研究領域作出了尤其有價值的貢獻;該領域探討 AI 對學生的影響,以及如何以最佳方式設計並支援學生的學習。
練習對學生產生的實際影響,與傳統評分準則所能反映的成效存在差異,這揭示了學校面對的一項更廣泛挑戰。
如果 AI 能幫助學生完成看似完善且具專業水準的作品,單看最終答案便更難了解學生實際掌握了多少。
許多教育工作者已開始思考這項轉變帶來的影響:作業和評估方式可能需要改變。數十年來,科技與教育一直共同演進,以培養學生在現代社會所需的技能;這亦延續了同一趨勢。
這些結果凸顯,評核學生作品時不應只肯定最常規或最完善的答案,也亦應肯定學生展現的原創性、推理過程及對多種方法的考量。
重點:AI 幫助學生改善答案。批判思考訓練則拓闊了他們的構思。兩者在協助學生為未來作好準備方面,發揮互補作用。


