本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

是的,可以,但用人工智能产出更好的作业,并不必然意味着学习更好。 研究记录了真实的学习收益、可忽略不计的效果,以及学习上的损害。重要的问题不只是学生是否使用人工智能,而是人工智能帮助他们做了什么、哪些思考仍由他们负责,以及他们事后能够做什么

本知识库把成功的人工智能辅助作业与真正获得的能力之间的区别,称为表现与学习之间的差距。学生可能在人工智能帮助下提交出一篇更有力的论文,或解出更多练习题,而独立完成同类任务的能力却没有提高,有时甚至更差。反过来,精心设计的人工智能反馈、示例与辅导,可以在不使用人工智能的情况下改善后续表现。参见学习收益认知卸载

研究究竟显示了什么?

一些人工智能支持的干预确实改善了学习

一个宽泛的起点是教育技术能否弥合学习差距?来自数字干预的全球证据。这份世界银行的综合报告汇总了跨越十个经济体的 14 项随机研究,估计自适应与人工智能赋能的教育技术平均带来了 0.125 个标准差的正面学习效应。然而,它把较早的自适应系统生成式人工智能工具合并在一起考察。它并未发现较新的生成式工具具有统计上成立的优势,同时承认这一比较存在相当大的不确定性。该结果支持这类干预的潜力,但并不等于断言任何聊天机器人都会改善学习。

更具体的证据说明了教学设计为何重要。在高等教育中以人为中心的生成式人工智能反馈设计这项涉及 1,176 名一年级本科生的多地点随机研究中,研究者比较了同伴反馈、直接的人工智能反馈、先自我评价再接受人工智能反馈,以及把自我评价、同伴反馈与人工智能批判结合起来的混合流程。

反思式与混合式设计所产生的延迟的无人工智能迁移效果强于直接的人工智能反馈。学生随后在一项新的科学论证任务上表现更好,而不仅仅是在被修订的那份作业上表现更好。然而,这些条件也要求额外的评价活动,并可能需要更多时间。该研究支持的是完整的反馈设计,而不是证明某个组成部分或人工智能本身带来了这一优势。

人工智能可以提高练习表现,同时损害学习

最清楚的警示来自缺乏护栏的生成式人工智能可能损害学习:来自高中数学的证据

在这项有近 1,000 名学生参与的随机现场实验中,一个通用型人工智能界面把有辅助的练习成绩提高了相当于对照组的 48%,但学生随后在无辅助考试中的成绩低了 17%。一个配置了教师设计的指导与提示的辅导系统则基本避免了这种代价。关键在于,它并未在无辅助考试表现上相对对照组产生统计上显著的改善。避免伤害并不等同于证明了额外的学习。这些百分比描述的是这一特定干预与特定情境,而不是人工智能使用的普遍效应。

其含义很实际:用完成的作业、练习中答对的题目或学生的满意度来判断一个人工智能工具的教育价值,可能得出误导性的图景。满意度与感知到的学习属于自我报告测量,本知识库记录了它们与实测学习之间可能相距多远。

一项规模更大、持续时间更长的现场研究在更大范围内指出了同一方向。生成式人工智能的学习代价采用错开引入人工智能的方式,追踪了 26,811 名中国中学生(7–12 年级)长达 30 个月。作业成绩上升了 18%,完成时间下降了 30%(从 64 分钟降至 45 分钟),而闭卷月考成绩在六个月内下降了 20%,高利害升学考试成绩相对基线下降了 18–24%,但这只在大约两年之后才出现。损失集中在约 81% 的行为表明把作业外包出去的人工智能使用者身上;作业用时与非使用者相当的使用者,学习效率大致相同。作业表现与考试表现之间的背离,就是把表现与学习之间的差距写在全国性队列上,而两年的滞后期意味着短期评价会系统性地低估这一代价。

仅有可及性与保障措施还不够

一项为期两年的学校随机实验,只有一次点击之遥:使用 Khanmigo 的人工智能辅导,在 18 所中学发现了适度的数学成绩提升。然而,学生很少投入实质性的辅导对话。作者指出,这些提升与没有人工智能的结构化练习所带来的提升相似。由于该干预把个性化练习与人工智能辅导结合在一起,它无法干净地分离出人工智能部分的额外贡献。有能力的辅导者可用,与学生富有成效地使用它,是两回事。

较新的让人工智能辅导富有成效实验提供了一个相关的教训。在使用 NUMI 的 6,000 多名中学生中,人工智能支持改善了犯错后的恢复,却拖慢了过题的进度。连对三次的精熟规则提高了平台定义的成效,但其本身并未改善一周后的学习。最强的延迟学习信号出现在人工智能被嵌入精熟学习流程之时,但这些提升仅有边缘统计显著性,且集中在特定的练习材料上。这份工作论文为一种精心结构化的方法提供了提示性证据,而不是一套已被广泛证实的配方。

决定结果的是学生如何使用工具,而不仅仅是有没有工具

同一项技术在互动结构不同的情况下会产生不同的学习。在一项针对 38 名本科生的质性研究中,在无人监督的论文评价情境下,学生的投入程度横跨从认知外包认知再分配(即把精力从低层次的信息提取转向批判性评价)的整个谱系。大多数学生(n = 31)打算把生成式人工智能当作学习助手,然而 76.32% 的学生依赖单轮式的“提问、得到答案、结束”对话,78.94% 的学生在写作之前或之后使用该工具,而不是贯穿任务过程,由此产生了效率悖论:以构建图式所需的认知劳动为代价换来了便利(“忘掉它的速度也非常快”)。只有 8 名学生通过持续、迭代的对话,把工具当作认知伙伴来使用。

其中的教学法教训是:一概允许或一概禁止,都会让学生只能靠猜。真正改变行为的是针对具体任务的指导,说明哪些认知工作必须由学生保留、哪种人工智能协助是恰当的,这正是我怎样才能减少课程中的人工智能作弊?中展开的设计方向。

付出更少的努力并不自动意味着更少的学习

如果由此得出“只有当人工智能让学生更费力,或者从不展示完整示例时它才有帮助”的结论,那也是错误的。

教练而非拐杖所报告的预注册实验中,使用人工智能练习修改求职信的成年人,后来在无人工智能条件下写出的文字优于独自练习的人,尽管他们付出的努力更少。这种好处在一天后的随访中仍然存在。另一项实验发现,观看一份经人工智能修改的示例,所产生的好处与使用该工具进行练习相当。这些都是简短、有边界的写作任务,并不构成对所有类型写作都有持久改善的证据,但它们表明示例可以支持学习,而不必然替代学习。

因此,目标并不是最大化的难度,而是保留或改善那种培养出预期能力的活动。

这一模式在计算机教育中重复出现

一篇涵盖计算机教育领域 72 项研究的系统综述在其最稳健的结果中发现了同样的结构。生成式人工智能可靠地提高了短期完成度并减少了任务用时(36 项研究),并且整个语料中没有任何一项研究记录了它对即时表现的负面影响,然而这些收益“无法迁移到独立表现”(21 项研究)。使用 Codex 辅助的学生在学习过程中完成的任务数量是两倍,但在无人工智能的后测中并不优于对照组。先前知识调节着一切:准备充分的学生能把协助转化为持久的技能,而准备不足的学生则可能把它当作拐杖,从而失去他们所需的练习。该综述提出的核心设计要求是核实,即阅读、测试、修改、解释与批判人工智能的输出,并把它变成作业中被评分、可观察的组成部分,而不是留给个人酌情处理的愿望。

一条有用的设计原则:搭脚手架,而非替代

本知识库的Scaffolding主动学习综述强调的支持,是帮助学习者理解、练习、评价,并最终在更少协助下完成任务。

“搭脚手架,而非替代”是一条有用的原则,但它需要应用到学习目标上,而不是机械地应用到每一个人工智能功能上。一份完整的示例可以是学生学习的素材;一串提示也可能变成学生不假思索点过去的东西。重要的区别在于学习者如何对待这些协助。参见认知卸载Help-Seeking

对于旨在培养独立能力的活动,一个合理的起始流程是:

  1. 先建立学习者自己的思考。 要求他们先给出初步尝试、预测、草稿、解释,或对一个合适示例的解读。
  2. 提供有针对性的协助。 用人工智能就这一难点给出提示、解释、对照示例或聚焦的反馈。
  3. 要求对协助作出回应。 让学生解释、修改、核实,或论证他们为何接受或拒绝该建议。
  4. 在更少支持下检验新的应用。 让学生解决一个同类问题,或把这一想法应用到不同的情境中。

这是一条教学上的起始做法,而不是一套已被普遍验证的流程。支持的量与时机应当反映学生的先前知识与任务本身。参见减少人工智能误用先前知识

把留给学生的思考明确出来

在数学上,教师可以要求学生先提交他们尝试过的解法,再请求帮助,然后使用这样的提示:“指出我应当重新考虑的第一步,给我一条有用的提示,并要求我再试一次。”之后的检查应当要求给出新的解法并作出解释,而不是复述人工智能给的答案。这实践了ScaffoldingHelp-Seeking中的指导。

在写作上,教师可以让学生在接受人工智能批判之前先依据评分量规评估自己的草稿,然后说明他们接受、修改或拒绝了哪些建议。如果目标是构建论证,那么人工智能生成的文字就不应替代“学生能够构建论证”的证据。如果目标是评价不同的修改方案,那么比较完整的示例可能是恰当的。参见写作教育反馈素养

这些都是对证据的设计应用。它们仍应在课程中接受评价,而不是因为听起来符合教学法就假定其有效。

我怎样才能判断人工智能在我的课程中是否有帮助?

人工智能教育评价页面建议把人工智能输出的质量、学生使用它的体验与学生的实际学习区分开来。一次实用的评价需要的不只是满意度调查或作业成绩的比较。

先明确要培养的能力。 确定学生在活动之后应当理解什么、能够做什么。“产出一份漂亮的报告”不同于“选出恰当的证据”“解释一种因果关系”或“识别一个缺乏支持的结论”。评价应当揭示你想要培养的那种能力。参见教育测量

测量之前、之后与更晚一些的表现。 使用一个简短的基线任务、一次即时的学习检查,以及一次延迟的应用。既要包含同类任务,也应在适当情况下包含改变情境或要求不同应用的任务。当目标是独立胜任能力时,应当去掉那些可以代替学生表现这种能力的人工智能协助。练习后立即进行的成功检查是有用的,但它并不能确立数月后的保持或跨领域的迁移。参见学习收益学习迁移

使用有意义的对照。 在可行的情况下,把人工智能支持的活动与设计良好、内容、教学时间与练习机会相近的非人工智能方案进行比较。简单的前后改善无法确立是人工智能带来了这一提升;学生也可能在教学的其余环节中获得进步。若要作出更强的因果论断,在设计比较时请参考效果研究方法

观察学生如何使用这些帮助。 留意解释、纠错的尝试、有依据的修改与核实,而不只是登录次数、消息条数或完成的题量。这些观察有助于解释结果,但不应取代学习测量。参见Help-Seeking学生与人工智能的互动

考察仪表盘实际测量的是什么。对八个医学教育人工智能教学智能体的评价这项医学教育研究中,按平台自身分数排出的智能体排名与经专家验证的教学质量量规并不一致:平台排名第三的智能体在量规质量上排名最后,因为平台分数追踪的是互动过程中学生的表现,而不是智能体的教学行为。内置指标是一个有待验证的假设,而不是学习的证据。关于能让这种检查站得住脚的测量与比较设计,参见教师可以用哪些测量工具与研究方法去评价与人工智能相关的干预?

一个重要的限定是,并非每一项合理的学习成果都必须在没有人工智能的条件下得到展示。一门课程可以有意识地教授有效的人工智能辅助工作。在这种情况下,应当评价学生选择、核实、修改并为其人工智能使用作辩护的能力,同时评价该学科所要求的独立基础。人工智能时代学习成果的人类能力测验提出了独立能力、人工智能增强表现与核实责任之间的这一区分。它是一个概念性的评价框架,而不是适用于每门课程的已验证方案。

检查谁受益,以及受益的代价是什么

平均改善可能掩盖那些获益很少或遇到新障碍的学生。数字鸿沟综述区分了工具的可及性、使用工具所需的技能,以及最终获得的结果。

在课堂评价中,应当按先前知识、语言需求与无障碍要求等相关的起点来考察结果。应当提供指导,而不是假定学生已经知道如何获得并评价有用的反馈。在评价独立学习时,应当去掉那些提供目标思考的协助,而不是去掉进入任务所需的无障碍支持。参见人工智能素养人工智能教育中的公平无障碍

还要检查学生实际收到的反馈。一段流畅的回复可能误判他们的困难、强化一个错误,或在需要另一种支持时直接给出答案。应当使用与课程对齐的材料,保留通往人类帮助的途径,并避免收集超出活动所需的学生信息。这些问题直接关系到人工智能反馈质量教学安全隐私

结论

人工智能可以帮助学生学习,但可及性、漂亮的产出或“辅导者”的标签都不能证明它确实做到了。 当一项明确规定的教学设计,借助针对学生本该培养的能力的测量,与一个有意义的替代方案进行比较时,证据最为有力。长期保持、广泛迁移以及在不同学习者与情境中的推广,仍然是重要的不确定之处。参见AIEd 研究中的局限

对教师而言,最有用的一个问题是:

在这项人工智能支持的活动之后,我的学生能理解、解释、判断或做什么,是他们在之前做不到的?又有什么证据表明这种改善?

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.