问答
我怎样才能让学生不过度依赖人工智能?
本页是英文页面的机器翻译,尚未经母语者审校。
你手上有一些评分后的作业,读起来比学生自己所能解释的要好。他们在家完成的习题集拿了高分,考试时却一片空白。分数已经不再能预测他们真正理解了什么,而你怀疑是工具在替他们思考。
你的判断很可能是对的,而这是一个设计问题,不是监管问题。过度依赖并不等于频繁使用,而减少它的干预措施大多是任务设计,而不是限制使用权限。 持久的学习由提取、精细化加工与生成来建构,而生成式人工智能可以在不要求这些过程的情况下直接提供它们的产物。
结论是:把学生自己的尝试放在工具之前,保护工具缺席的那些时刻,让核实变得可见而不只是可用,并且对学生在无辅助情况下完成的东西评分。
过度依赖究竟是什么,以及如何判断自己遇到了问题
认知卸载是把认知需求转移到外部工具上,从而为更高阶的加工腾出有限的心理资源。Guo 与 Ye(2026)借助 Nelson 与 Naren 的动态元认知模型来审视这一构念:在这一模型中,对难度的监控会影响到是把任务卸载给内部策略还是外部策略这一决定。卸载是一种自我调节的选择,而不是缺陷;真正的失败是校准失误,而不是数量上的多少。
Biswas(2026)把依赖建模为三种行为:独自解决、不经验证就接受人工智能的答案,或者使用并加以核实;并对称地定义了两类校准错误:过度依赖是接受了错误的输出,而依赖不足是在人工智能出错之后就丢弃有用的内容。集体性的过度依赖是整个群体放弃核实;由于原始意义上的过度依赖与后悔并不一致,高依赖并不自动等于有害。对每一条人工智能答案都对照你的材料核对的学生,并不是你的问题所在;提交模型初稿的那个人才是。
你能测量到的大部分内容都是自我报告。Gerlich(2025)调查了 666 名英国参与者并做了 50 次访谈,发现人工智能的使用与批判性思维呈负相关(r = −0.68),其中卸载起部分中介作用(总效应 b = −0.42;间接效应 b = −0.25)。Gao、Sun 与 Khan(2026)使用了来自 623 名中国学生的三波滞后调查数据,并辅以教育者访谈,发现有效使用人工智能会同时提高可持续的学习表现与过度依赖。这两种设计都属于相关研究,而且它们自己也都这样说明。
行为层面的测量工具则更为单薄。PAUSE(Alam,2026)是一个仅在浏览器中运行的自检工具,没有信度或效度证据,而它最重要的警告涉及题目效度:这些题目记录的是人工智能在何时、以多高的频率进入工作流程,而不是学生自己的推理是否仍在参与;因此,一个有意在早期用人工智能搭建脚手架的学生,会被如实地记为卸载。它还引用了 Padmakumar 等人(2026)的卸载分数(Offloading Score),该分数根据行为日志估算被卸载的努力比例(n = 40 名开发者)。使用频率不是这个构念,学生能在无辅助情况下做到什么才是。
人工智能如何挤掉那些产生学习的工作
Lodge 与 Loble(2026)把这一风险概括为“按需的流畅”:连贯而自信的输出绕过了Desirable Difficulties(提取、精细化加工、生成),而知识正是通过这些过程巩固下来的。他们的表现悖论是:有人工智能辅助的工作感觉很流畅,学生在当下表现良好,却记住得更少,这是一种能力的错觉。他们提出了元认知懒惰(沿用 Fan 等人 2024 年的说法):便利让学习者放弃了自己本应发展起来的自我调节过程。Guo 与 Ye(2026)补充了一条设计上的边界:替代性卸载取代内部加工,而重复性卸载则为其提供补充;一旦移除外部存储,替代性卸载者的表现会严重下降,而重复性卸载者则能通过内部编码保持准确度。
因果证据在这里最为明确。Brcic 与 Frljic(2026)报告说,不加防护的人工智能助手让高中学生在无辅助考试中比没有工具的同伴差了大约 17%;把同一个模型改造成拒绝给出答案之后,这种损害就消失了;而一个设计良好的导师则让学习效果大约翻了一倍。他们给出的判断标准是:如果让人工智能介入后任务变得毫不费力,那它就放错了位置。PAUSE 补充了相吻合的发现:Bastani 等人(2025)发现被给予 GPT-4 的学生在工具帮助下解决了更多问题,但一旦移除工具,表现就比对照组更差;Liu 等人(2026)则在随机对照试验中发现,这种协助还降低了坚持性(N = 1,222)。
真正能改变学生行为的做法,按收益排序
1. 扣住或限量提供任务本要培养的东西(收益最高,成本中等)。 因果影响最大的杠杆是一个拒绝直接给出答案的工具:在中间阶段使用受约束的人工智能(提示、示例、练习),在最后设置安全可靠的终结性检查。这使人工智能使用政策变成一条按技能划分的安置规则,而不是一张禁止清单。Zohar、Bloom 与 Inzlicht(2026)认为努力与意义之间呈倒 U 形关系,因此目标是形成一个梯度:移除压倒性的障碍,同时保留那些能产生理解与主人翁感的挣扎,并把协助作为补充而不是替代。
2. 为协助排出顺序,而不是限制它(收益高,成本高,属于重新设计)。 经过检验的最强结构是“先思考,稍后再用 ChatGPT”。Wong 与 Qiu(2026)让 N = 196 名学生分别独立完成、自由使用 ChatGPT,或者在有约束的条件下完成:先自己生成想法,再与 ChatGPT 协作改进和评价这些想法,然后独立地打磨并提交一个方案。自由使用组在有辅助的任务上产出了更有创造性的作品,但在之后一项没有 ChatGPT、难度更高的任务上退回到仅靠人的水平;受约束组没有表现出即时的优势,却在之后独立完成创造性任务时超过了另外两组。过程分析显示,其提示中有 88.6% 属于协作型,这是唯一与之后独立原创性显著相关的提示类型。
3. 让核实变得可见并被要求(收益高,成本低)。 Biswas(2026)发现,让核实变得可见会触发反向级联,使核实接近完全完成(过度依赖 0.00,后悔降到 0.07);而降低核实的摩擦是最弱的杠杆,因为它无法对抗那种趋向未经核实使用的社会拉力。一条必须提交的来源核查说明,胜过一条图书馆链接。当准确性不确定时,把输出与课程材料、同伴或教师核对,正是Viberg 及其同事(2026)发现较强的学生已经在做的事。
4. 把反思提示安排在它能发挥作用的阶段(收益中等,成本低)。 Guo 与 Ye(2026)推导出一条时机与成分相匹配的原则:针对稳定信念的反馈在任务之前有效,而针对具体任务正确性与难度的即时反馈在任务进行中有效。Lodge 与 Loble(2026)建议采用整合式的元认知提示,让学习者暂停、反思并评估自己的理解,同时配合“减轻负荷教学”(Load Reduction Instruction),在管理认知负担的同时实现逐步独立。一次一分钟的任务前预测不花什么成本,而且正好落在那个窗口里。
5. 要求无辅助的提取、解释与迁移(收益高,成本中等)。 有辅助的成果很难代表真实能力;评分的时刻必须包含一个工具不在场的情境。Wong 与 Qiu(2026)之后的无辅助任务就是这样的测量;而且即便是他们那个仅靠人的组,也在难度更高的后续任务上出现了下降,所以没有脚手架的单干同样不是答案。交替使用模式也有支持:PAUSE 报告了 Kosmyna 等人(2025)第四次会期的结果,其中只用脑力完成、之后再使用 ChatGPT 的参与者,表现优于持续使用 LLM 的人。问责通过解释来起作用:Makransky 等人(2025)发现,一个会促使学生把想法联系起来并解释自己推理的辅导聊天机器人,比传统教学带来了更好的测评表现。
哪些做法无效,哪些会适得其反
- 降低摩擦。 在 Biswas 的模型中,让核实更省事是最弱的杠杆;障碍来自社会因素,而不是机械因素。更好的抄袭检测器并不会让学生去核实。
- 禁止或一律管制。 证据指向的是安置,而不是禁止:变量不在于工具本身,而在于它在任务中的位置。
- 没有脚手架的单干。 Wong 与 Qiu(2026)的仅靠人组在难度更高的后续任务上同样出现了下降。在没有支持学习者的前提下移除工具,算不上一种干预。
- 统计使用量、调查态度。 PAUSE 的题目记录的是人工智能何时、以多高的频率进入工作流程,而不是推理是否仍在参与,因此一个谨慎搭建脚手架的学生会被记为卸载者。依据这些数字行事,会惩罚你真正想要帮助的那些学生。
- 把满意度和流畅感当作证据。 它们就是那种错觉。应当优先看无辅助的表现与延迟的迁移。
- 依赖面向学生的人工智能素养,而不去支持教师。 Lodge 与 Loble(2026)提醒说,在这上面投入过多可能是错误的资源分配。
重新设计任务,让依赖成为更难走的路
有四项举措承担了大部分分量,而且都不需要校园层面的政策。
任务设计。 在工具接触任务之前,先要求学生给出自己的想法、假设或粗略草稿。在 Wong 与 Qiu 的受约束条件下,顺序是固定的:自己生成想法,与 ChatGPT 协作改进并评价它们,然后独立打磨并提交一个方案。凡是任务所要测量的正是目标技能的地方,就把工具配置成只给提示而不给答案。
核实要求。 把核实变成一项交付物:核查来源、与同伴比较、请教师检查,并写入作业要求,而不是想当然。可见的核实规范比更省事的核实更重要。
课堂上演示失败模式。 现场演示:给出一个任务,让学生用一条自信但错误的人工智能答案去解决,然后让他们对照课程材料来核对。再加上证据:不加防护的助手让学生在无辅助考试中差了大约 17%,而被给予 GPT-4 的学生在工具帮助下解决了更多问题,一旦移除工具却比对照组表现更差。一次被演示出来的失败,比十次警告教得更多。
重新设计评价。 让第一次艰难尝试和最终的终结性无辅助检查都不使用人工智能,即Brcic 与 Frljic(2026)所指出的两个受保护的时刻,并对无辅助的那一次评分。要求学生解释自己的推理,并在平行或迁移性的任务上作答,同时把有辅助的成果读作表现,而不是学习。当目标技能是分析而不是机械操作时,把较低阶的部分卸载出去反而可以服务于较高阶的部分:PAUSE 引用了 Hong 等人(2025),其中有意识地把较低阶的写作任务卸载出去,以便腾出注意力用于分析与修改,结果带来了更大的批判性思维提升。
健康的求助与有害的卸载
证据清楚地区分了这两者,你的评分量规也应当如此。Viberg、Feldman-Maggor 与 Wong(2026)访谈了 20 名 STEM 专业的大学生,发现了一个四阶段过程:判断是否需要帮助、选择来源、选择帮助的类型、评价所获得的帮助;在这个过程中,较强的学生更偏好工具性帮助(提示、讲解),而不是执行性帮助(直接给答案)。他们警告说,即便学生避免直接索要答案,把 LLM 用于调试或跨语言编程也可能绕过独立的Problem Solving。
工具性使用(提示、示例、讲解、自己动手修正的调试)属于重复性卸载,在工具被拿走之后仍然站得住。执行性使用(拿来输出就提交)则属于替代性卸载,一旦移除就会崩塌。自由使用往往偏向后者:在Wong 与 Qiu(2026)的实验(N = 196)中,自由使用组的提示有 70.9% 是非协作型的,59.6% 只是直接要求 ChatGPT 生成想法。受约束组呈现出相反的特征:88.6% 是协作型提示,而这是唯一与之后独立原创性相关的类型。把这一区分写进作业要求,要求使用协作型提示,并对学生补充的推理进行评分。
谁最容易受影响,以及何时受影响
Lodge 与 Loble(2026)把风险定位于先前知识与自我调节上,并提出一个元认知公平差距:善用人工智能需要新手恰恰不具备的资源,因此最需要练习的学生,也最可能把学习本身交托出去。他们报告说,80% 的澳大利亚学生已经在使用人工智能,早期中学教师中也有三分之二在使用(OECD 2025)。Gerlich(2025)发现,17–25 岁的参与者比 46 岁及以上者表现出更高的人工智能依赖与卸载水平,以及更低的批判性思维;而学业成就无论是否使用人工智能都能预测更好的批判性思维(r = +0.34),且存在显著的交互作用,表明它能缓解负面影响。Gao、Sun 与 Khan(2026)发现,多时性倾向(一种同时处理多项任务的倾向)会调节这一路径,多时性倾向高的学生风险更大。
情境与个人同样重要,而这正是你的课程可以发挥作用的地方。Biswas(2026)表明,任务难度与人工智能的质量决定了基线水平(随难度上升,过度依赖从 ≈0.02 升到 0.38;在困难任务上,差的人工智能对应 0.38,而好的人工智能对应 0.16),并且最高的后悔来自困难任务上高质量的人工智能(0.441),因为智能体会过度听从、很少自我依赖:一个能力强的模型面对一项高要求的任务,正是核实停止的地方。同伴的影响会放大这一点:当可见的社会证明从 0 升到 0.6 时,核实从 0.29 崩落到 0.002。
“但是……”:三种反对意见
“这不就是好的教学法吗。” 部分是:这些都是脚手架、形成性反馈与有益挣扎。但可见的核实胜过更省事的核实,而两个受保护的时刻是第一次艰难尝试与最终的终结性无辅助检查。把熟悉的事情,按新的顺序来做。
“我没办法监管它。” 你确实没办法,而证据也表明你不该尝试。这里最强的结果来自安置,而不是禁止。要这样设计任务:让工具在不该出现的时刻出现这件事体现在作业本身之中,比如一个无法解释的答案、一个缺失的核实步骤,而不是依赖监视。
“我的课程太大了。” 最便宜的杠杆是可以规模化的。一条必须提交的核实说明、一次一分钟的任务前预测,以及把评分的检查移到一个不使用人工智能的场合,每节课只花几分钟。较贵的那一项,即完整排序的“先思考”单元,可以先从一个作业开始。把一个习题集重新拆成有辅助与无辅助的两半,看看差距告诉了你什么。
尚未确立的内容(在下定决心之前请先阅读)
本语料中没有任何研究检验过某项具体的过度依赖干预是否能在不同情境或学期中站得住。先思考的设计只基于一个实验(N = 196),而扣住答案这一结果来自Brcic 与 Frljic(2026)的综述,而不是它自己开展的试验。关于摩擦的论证是一篇没有新数据的概念性评论,其倒 U 形关系只有一个实证锚点,也没有被量化,因此对某个具体学习者而言最优点在哪里并不明确。
Biswas(2026)说明了该模型的局限:外生的、稳定不变的人工智能质量,固定的网络,程式化的核实;并指出未来的工作需要从纵向痕迹中估算什么:每项任务的核实率、社会证明的强度,以及信任在经验证与未经验证的使用之后如何更新。测量仍然是最薄弱的环节:主流设计都是问卷调查,而Gerlich(2025)与Gao、Sun 与 Khan(2026)都呼吁开展纵向与实验性的后续研究。PAUSE没有心理测量学证据,而且是为成年人设计的。公平差距能否通过教学来弥合,目前只是理论上的推断,而非已被证明。
本周行动清单
- 为下一次作业增加一个核实步骤:用一句话写明学生核对了什么、依据是什么。
- 把评分的检查移到一个不使用人工智能的时刻,并对那一次评分。
- 把第一次艰难尝试放在工具之前:在人工智能接触任务之前先给出想法、假设或草稿。
- 把你推荐的工具配置成只给提示而不给答案。
- 现场演示一次自信的人工智能失败,让学生对照课程材料把它抓出来。
- 在一个困难单元之前增加一次一分钟的任务前预测。
- 把一道测验题换成同样内容上的“解释你的推理”题。
- 要求学生把自己的使用标注为工具性或执行性,并对他们补充的推理评分。
- 把有辅助的作业读作表现而不是学习,并将它与无辅助的检查相比较。
- 把投入与满意度视为弱指标,优先看无辅助的表现与延迟的迁移。
本页与相邻 FAQ 有何不同
使用人工智能真的能帮助我的学生学习吗?讨论人工智能是否真的产生学习,并阐述了表现与学习之间的差距;我怎样才能减少课程中的人工智能作弊?则涉及诚信、检测的局限与评价的安全性。本页假定学生可能是在诚实地使用人工智能,并追问哪些设计能让学习者的推理始终留在循环之中。
关于相关研究,参见使用人工智能真的能帮助我的学生学习吗?与我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?,以及Cognitive Offloading、Metacognition与Desirable Difficulties概念页。