答案更出色,思路更开阔:学生能从 ChatGPT 和批判性思维训练中获得什么
在一项覆盖 1,000 多名学生的随机实验中,使用 ChatGPT 和接受因果推理训练以互补的方式改善了学生的作业表现。
学生使用 ChatGPT 完成现实任务时,会发生什么?质量的提升是否会以牺牲原创性为代价?
博科尼大学的研究人员与 OpenAI 经济研究团队合作开展了一项新实验,发现使用 ChatGPT 和接受批判性思维训练会产生不同但互补的效果。使用 ChatGPT 提升了学生作业的质量和连贯性,而因果推理练习——一种批判性思维训练——则促使学生提出更多独特的想法。既能使用 ChatGPT 又接受了训练的学生同时展现出这两种效果。
结果还凸显了以全面视角评估学生进步的重要性。随着 AI 让学生更容易给出完善的答案,作业设计可能也需要调整,以衡量原创性等其他期望特质。
实验期间,博科尼大学的 1,000 多名本科一年级学生围绕一个真实商业案例展开研究,为学校纪念品商店制定营销建议。
研究人员按上课时段将学生随机分为四组:使用 ChatGPT(GPT‑4o)、接受因果推理训练、两者兼有,或两者皆无。因果推理是批判性思维的一种具体形式,涉及建立因果联系,并解释某个解决方案为何可能有效或无效。学生接受的训练与 AI 无关,而是通过包含游戏、示例、问题和反馈的练习来教授因果推理概念。
经过培训的人工评分员依据五分制评分量表评估学生提交的作业。此外,研究人员还利用自动文本分析,衡量每份作业中想法的数量和多样性、因果推理的迹象,以及与三位专家所提交内容的相似程度。
能够使用 ChatGPT 的学生在五分制评分中平均高出近一分。他们的答案包含更多想法,逻辑更清晰,也更接近专家撰写的建议。换言之,AI 帮助新手完成了看起来更专业的作业。重要的是,学生并非只是把作业直接交给 ChatGPT 完成。他们仍需决定提出什么问题、评估回复,并选择最终提交哪些内容。
批判性思维练习带来了一个更出人意料的结果。完成练习的学生能更清楚地解释自己的想法为何可能奏效、又会在何种情况下失败,但他们在评分量表上的得分并未提高。该量表仅衡量建议在实现两个常规营销目标方面的表现:提高学校商店的知名度和使用率。
文本分析揭示了评分量表未能体现的另一项益处。从整体来看,完成练习的学生提出了更丰富的想法,而且与同伴相比,这些想法也更具独特性。这一点很重要,因为本实验所采用的传统评分量表可能会奖励清晰、结构严谨的答案,却忽视学生是否提出了其他人从未想到的观点。
人们很容易把教育争议归结为一道选择题:学生应该学会独立思考,还是学会使用 AI?
这项实验表明,两者各有不同的价值。使用 AI 帮助学生给出了更完善、想法更丰富且逻辑更连贯的答案。批判性思维训练则鼓励他们构思更多样的原创想法、质疑假设,并解释自己的想法为何应该有效。
两者结合,便能形成互补。
既能使用 ChatGPT 又完成了批判性思维练习的学生,同时展现出两者的益处。他们想法的多样性与仅完成练习的学生相当。他们的量表得分和想法数量则与仅使用 ChatGPT 的学生相近。他们的作业还表现出更强的逻辑连贯性,也有更多证据显示他们会探寻解释并质疑假设。总体而言,这一组在最广泛的衡量指标上都取得了进步。
实验采用随机设计,使研究人员能够深入分析不同因素,分别考察使用 ChatGPT、进行批判性思维练习以及将两者结合所产生的效果。因此,对于 AI 如何影响学生,以及应如何优化学习安排和支持方式这一迅速发展的研究领域,该实验提供了格外有价值的成果。
练习对学生产生的实际影响与传统评分量表所能反映的效果之间存在差异,这揭示了学校面临的一项更广泛挑战。
如果 AI 能帮助学生完成完善且媲美专家的作业,那么仅看最终答案,就更难判断学生真正理解了什么。
许多教育工作者已经开始思考由此产生的影响:作业和评估方式可能需要改变。这延续了数十年来技术与教育协同演进的趋势,旨在帮助学生掌握现代社会所需的技能。
这些结果凸显了奖励学生原创性、推理能力和多角度思考的重要性,而不应只看答案是否最符合常规或最为完善。
核心结论:AI 帮助学生给出更好的答案。批判性思维训练则帮助他们拓宽思路。两者在帮助学生为未来做好准备方面发挥着互补作用。


