问答
在人工智能教育研究中,教师最应该了解的 10 项主要发现是什么?
本页是英文页面的机器翻译,尚未经母语者审校。
并不要求你成为人工智能研究者。要求你做的,是作出日常的教学决策,比如某次作业允许什么、一个分数应该证明什么、你的学生在没有工具时应能做到什么,而你会希望这些决定所依据的,不只是个人意见和厂商宣传。
总而言之,就本知识库所汇集的这些研究来看:人工智能如何被嵌入学习活动,决定了它是在强化思考还是在替代思考。 问题并不是简单的“使用人工智能”还是“禁用人工智能”,而且这些发现背后的研究都很新,往往是短期的,并且与特定课程相关。请把它们当作目前可得到的最强指引,而不是已经定论的法则。
简要版
- 先确定这项任务存在是为了培养什么思考,然后给人工智能一份不会替学生完成那项思考的工作。
- 用学生在之后、没有工具时能做什么来判断成功,而不是用作品现在看起来有多好。
- 把人工智能当作导师、教练或批评者,远多于当作答案机器。
- 把一份打磨精美的提交作品当作学习的弱证据,同时也要收集一些过程证据。
- 为每一项重要的作业设定明确的人工智能规则,并说明这条规则为什么是这样。
- 教学生核查、质疑并反驳人工智能的输出。这种能力不会仅靠接触就发展出来。
1. 在人工智能辅助下看起来更好的作业,并不证明学习更好
学生借助生成式人工智能可以产出更强的作品、更快完成,但自己学到的东西更少。风险在于认知卸载:当人工智能执行了本该由学生练习的推理时,对学习的伤害最大。真正重要的区分,是在辅助之下表现与之后在没有辅助的情况下展示出来的学习之间的区别。
最有力的锚点是一项涵盖 72 项同行评审的计算教育研究的系统综述:在 36 项研究中,生成式人工智能稳定地提高了短期完成度并缩短了任务用时,这是整个文献库里复现最好的结果;然而在 21 项研究中,这些效率增益“并不能迁移到独立表现”。一项对 38 名本科生进行出声思维访谈的研究在他们实际的工作方式中发现了同样的分化:76.32% 始终停留在单轮的发问、作答、停止模式,只有 21.06% 会把使用人工智能与独立阅读和起草交替进行。一篇 2026 年的框架论文把这一模式命名为批判性思维悖论:成绩和作品可以上升,而产生持久学习的心智劳动却在下降。
课堂做法: 每个单元至少设计一项任务,让学生在完全没有人工智能在场的情况下回忆、解释、解决或为自己的观点辩护,并对这项任务评分。
2. 人工智能的价值在于当导师,而不是答案机器
数十年的智能辅导研究指向同一个方向:诊断学生理解了什么、提出问题、给出分级的提示、要求学生解释、给出反馈,而不是把解法直接交出去。当前的Pedagogical Agent研究同样在教学行为与答案生产之间划出界线。Thermomix 厨房电器的类比让这一点变得具体:同一台电器既可以替你做饭,让你失去这项技能,也可以充当你想法的检验伙伴,而这些想法仍然需要你自己弄明白。这些模式与ICAP 框架相吻合,该框架预测被动、主动、建构和互动四种使用方式会带来不同的学习。
更新的研究显示,同样的原则也存在于一个较窄的工具之内。一个以结构化方式读取工程图的导师在边级别达到 93.0% 的 F1,而整图准确率为 89.3%,这意味着即便整张图是错的,它也能指出具体缺失或看错的连接:这是学生可以据以行动的反馈,而不是一个通过与不通过的判定。
课堂做法: 让学生去要“给一个提示”“向我提问”或“批评我的推理”,而把“直接解题”变成不常见的用法。
3. 不要抹平有益的努力挣扎
有益失败指的是这样一个发现:学习者在被示范怎么做之前先自己尝试一个问题,往往能保留更多。让学习变得毫无摩擦,可能会正好移除掉产生学习的那部分劳动。在那项针对 38 名学生的访谈研究中,人数最多的一组(n = 31)描述了掌握型目标,却以碎片化的单轮方式工作,随后报告了过度依赖、心智上的自满和快速遗忘;一位参与者把它说成“你忘记它的速度也非常快”。Thermomix 的类比把这个风险压缩成五个字:有了 Thermomix,你就失去了做饭的能力。
课堂做法: 采用尝试 → 人工智能辅助 → 修改 → 反思的顺序,而不是每项任务一开始的第一秒就打开工具。
4. 只有当学生对反馈做了些什么,反馈才算数
人工智能反馈可以及时、具体、可规模化,并且为学生所接受,包括在高等教育中。它是否真正在教,取决于准确性、与教学的契合度,以及学生的反馈素养,即他们判断反馈并据以行动的能力。一项对 14 份机构指导文件的批判性分析警告说,通用提示词会产出彼此孤立的学习成果、活动和评估:因为工具无法知道一个主题内部的相互关联有多深,它的反馈只能停留在泛泛而谈,而做不到诊断式的精确。
两项 2026 年的研究显示,输入在很大程度上决定了输出。在一项关于针对学习目标的人工智能反馈的研究中,仅模型本身就解释了反馈质量变异的 26.9%,加上提示词后提高到 42.8%,也就是多了 15.9%。唯一真正起作用的提示词特征是学科专用术语;把它换成日常表述会让反馈显著变差。模型选择也很重要:Claude 3 和 Gemini Advanced 产生的反馈评分显著低于 ChatGPT-4。与此同时,一项对 18 个语言模型批改 6,081 份编程作业的比较发现,平均分随模型不同从 0.290 到 0.608 不等,完全一致率最低只有 0.20,最高也只有 0.74。
课堂做法: 让学生把人工智能的反馈与你给的量规对照权衡,决定接受或拒绝哪些,并说明他们改动了什么。
5. 教学设计比你用哪个模型更重要
一项比较把基于理论、为学生解释提供脚手架的聊天机器人,与普通的 ChatGPT 以及照常教学进行对照,结果没有发现显著的即时差异;但四周之后,接受脚手架的那一组保留了更多概念性知识。这只是单项研究,不是普遍效应,但它最清楚地说明,设计可以胜过模型能力。那项涵盖 72 项研究的综述落在同一个设计层面上,称对人工智能输出的批判性投入是“贯穿文献库中每一项有效干预的共同机制”,并建议采用渐进式开放,即在显示出基础能力之后才引入生成式人工智能。
课堂做法: 围绕自我解释、回忆提取、比较、论证、讲授或批评来设计人工智能活动,而不是围绕内容生成。
6. 别再把力气花在抓人工智能上,而要开始产出学习证据
人工智能检测器在可靠性和公平性上的问题已有充分记录,而更深层的问题在于效度:一份打磨精美的带回家完成的作品,已经不能证明提交它的人具备相应能力。以检测为框架的政策还会抑制正当的使用。在一项对 85 名实习教师的混合方法研究中,62.4% 的人在即使允许的情况下也拒绝使用生成式人工智能,而在拒绝者中有 41.5% 提到害怕被指控抄袭,有 9 位受访者(共访谈 11 位)把这项宽松政策本身读作一个陷阱。
新的证据提高了自动化评判的风险。在一项涵盖十个学年、1,426 篇心理学学位论文的研究中,四个 AI 评分者全都给学生撰写的作品最低分、给 AI 撰写的作品最高分;而 10 项比较(共 16 项)大到这种差距在教育研究中很罕见,其中还包括所观察到的最大差距。这种偏倚在对完全由 AI 生成的文本上最强,这意味着评分者可能因为文本像机器写的而给它奖励,即便它的指令要求评判内容。
课堂做法: 在评估作品的同时评估过程,包括草稿、推理、批评、口头答辩、演示和反思。
7. 对所有作业只用一条人工智能规则行不通
一个有用的评估框架区分三种情形:当你测量的是独立能力时限制人工智能;当有边界的帮助不会损害这种能力时用人工智能做脚手架;当熟练的人机协作本身就是学生必须学会的东西时要求使用人工智能。那项实习教师研究说明了为什么这些条件必须明确且一致:只有 37.6% 的学生真正使用了被允许的生成式人工智能,他们的选择更多跟随项目文化和评估设计,而不是某门课程的许可;而且他们自己的披露声明在每一门课程中都低报了实际使用情况。
课堂做法: 对每一项重要评估说明其人工智能条件,并解释这项作业为什么采用该规则。
8. 人工智能素养远不止是写好提示词
高等教育框架现在把人工智能素养视为概念理解、操作技能、批判性评价、伦理判断和对局限的意识,而不只是提示词工程。学生需要学会何时怀疑工具、核实主张、识别偏倚、辨认不确定性,并对结论保持责任。那项计算教育综述在这一点上讲得很具体:提示词工程、输出核实和分析人工智能错误都是可以教的技能,不会靠接触自动发展;而核实是它提出的三项设计要求中的第一项。
两项 2026 年针对教育者的研究显示,离自动化还有多远。在已经完成人工智能培训的科学教师中,平均人工智能素养为 16.7 分(满分 30 分),低于参考样本的 18.79,而且它与年龄、性别、工作年限或使用人工智能的多少都无关。一项对 412 名职前数学教师的调查发现准备度仍处在早期阶段:教学信念得分最高(均值为 5.24,采用 7 点量表),而技术性的人工智能知识得分最低(4.23)。
课堂做法: 给学生故意做得不完美的人工智能输出,并对他们核实、批评、改进和情境化它的能力评分。
9. 即便人人都有访问权,人工智能也可能拉大差距
数字鸿沟现在至少沿着三条线分布:工具的获取、使用工具的技能,以及谁能真正得到有用的结果。仅凭提示技能本身就会造成一种“提示特权”,让更有经验的用户从同一系统中得到更好的输出。那项 72 项研究的综述区分了两种机制:一种是技能差距,先前知识更强的学生能把帮助转化为持久的收益,而准备不足的学生则用它替代练习;另一种是资源差距,可靠的互联网和有偿的访问权让不同机构的工具使用水平出现分化。文献库中只有六项研究直接考察了公平问题,而作者认为这本身就是问题所在。
一项包含四个实验、研究学习者借助人工智能代理发现隐藏规则的研究发现,这种帮助把所需的步数减少了 33–52%,但收益集中在表现最弱的人身上:较强的学习者基本不受影响。换句话说,帮助可以缩小差距,但只对那些真正投入其中的学生有效,而不是那些本来就不需要它的学生。
课堂做法: 不要让先前的人工智能使用经验变成隐性的先修条件。提供公平的访问、范例、直接讲授、替代方案和合理便利。
10. 人的判断仍然是无法自动化的那部分
人工智能的整合带来了一系列相互关联的问题,涉及偏倚、隐私、透明度、学习者的自主性、问责制以及教学安全。因此教师需要的是教学层面的人工智能能力,而不只是技术上的熟悉;关于教育者培养的综述把它描述为教学推理加上批判性与伦理判断。那份指导文件分析提出了一个具体的设计答案:一个有边界、按机构配置的检索增强代理,它引导思考而不提供答案,标记不一致之处,并在边缘情形上升级给人工处理;其权限是“派生的、有边界的”,而不是自主的。
现在已经有了直接证据,说明应当把人留在循环之中,而不是只把他们摆在前面。一个课程材料生成系统在人们持续参与时得分更高:人工输入最多的模式比完全自主模式把评审者评分提高了 0.5–0.9 分。它的自主评审者与人类评审者的行为也不一样:AI 评审者的评分紧密聚集在 2.9–3.1 附近,而人类评估者的分布更分散、区分度更高;因此作者把人的判断保留为首要的质量信号。
课堂做法: 把有重大影响的教学与评估决定置于有实质意义的人工监督之下,尤其是在涉及准确性、公平、隐私或学生学业进展的地方。
这 10 项发现共同的底层规律
替代思考的人工智能 → 对学习更危险。 引出思考的人工智能 → 对学习可能有价值。
所以,不要问*“学生应该使用 ChatGPT 吗?”*,而要问三个更好的问题:
我需要学生练习什么思考? → 人工智能应当扮演什么角色而不做那项思考? → 什么证据能表明学生学会了它?
这就引向这样的活动:先尝试再用人工智能、让人工智能充当苏格拉底式导师、批评人工智能、比较人类与人工智能的解法、人工智能反馈加上学生判断、过程作品集,以及简短的口头答辩;同时也远离在开放使用与全面禁止之间的虚假选择。
这周你就能做的事
挑一项让你不安的作业,做两处改动:明确写出人工智能规则并附一行理由;再加一个简短的课堂内环节或录音环节,在完全没有人工智能的情况下展示学生的推理。这两项改动通常就足以回答一个问题:这项作业是否真的在测量你本意要测的东西;而它几乎不占用你的课堂时间。
你可能会听到的反对意见
- “我的学生说人工智能对他们有帮助。” 对眼前这份作业,它通常确实有帮助;但这些发现说的是之后还剩下什么。问他们在没有辅助时还能做什么,你会得到不一样的答案。
- “检测工具是我们唯一有的东西。” 它们不可靠、会误判正当的作业,而对它们的恐惧会压制被允许的使用:在一项研究中,41.5% 的非使用者提到了这种恐惧。过程证据更强,也更公平。
- “我教 200 个学生,没法读草稿。” 你不必什么都读。简短的口头检查、课堂内写作,以及关于与人工智能互动的反思记录,都比通读全部草稿更省力,也更具诊断价值。
- “我不教人工智能,这不是我的学科。” 这里的发现正是关于你的学科的:当人工智能做了你的课程本应提供的练习时,恰恰就是它造成干扰的时候。
- “直接禁止更简单。” 确实更简单,而且通常会失败:在一项研究中,学生的采用情况跟随的是项目文化,而不是任何单门课程的政策;而披露在每一门课程中都低报了实际使用。
关于这些误解按利益相关者逐一展开的版本,参见我们应当如何应对关于教育中人工智能的常见误解?;关于发现 9 和 10 所隐含的设计要求,参见教育中的人工智能研究应当如何纳入公平、可及性、隐私、伦理与教学安全?和人工智能时代应当如何重新设计评估?。
一个重要的提醒:生成式人工智能的证据基础正在迅速发展。其中很大一部分是短期干预、自我报告研究、单一学科,或者是 2025–2026 年新兴的工作;来自成熟智能辅导研究的发现,通常比关于不受限制的通用聊天机器人的主张更可靠。对于只显示学生满意度、任务速度、输出质量或即时辅助表现、而没有测量延迟或无辅助学习的结果,要格外怀疑。