问答
我该如何教学生核查人工智能的输出?
本页是英文页面的机器翻译,尚未经母语者审校。
你已经警告过他们。聊天机器人不是搜索引擎,要核对来源,要负责任地使用。可是那些编造的引文和自信的错误答案还是照样出现在提交的作业里。这些警告之所以失效,是因为它们要求的是一种性情。细心的学生有这种性情,匆忙的学生没有,而这句话里并没有任何东西能让一个学生晚上 11 点面对屏幕上读起来毫无破绽的输出时真正照着做。
这里汇总的研究表明,这种框架太粗糙,既无法教,也无法评。核查是一组在分析上彼此独立的行动,而“负责任地使用”这个宽泛的标签掩盖了这样一个差别:一个学生尝试做了核查,另一个学生则真正判定了输出是否正确。要点是:一旦你不再把核查当作一种特质,而开始把它当作一个序列,核查就变得可教了。这个序列包括:在核查之前先确定标准,核查要产生一份记录,以及学生必须基于领域依据为之辩护的一个判断。这是一个你本周就能解决的设计问题,也是一个可以用作业本身已经产生的材料来解决的评分问题。
本页讨论核查本身的机制。至于学生应当如何理解这些系统的工作方式,以及这种理解如何被定义、排序和评价,参见我应当如何把人工智能素养融入我的课程?与关于高等教育中的人工智能素养干预,有哪些证据?。一个学生可能对大语言模型了解很多,却什么都核查不了。
核查究竟要求学生做什么
Wei 与 Shang(2026)区分出七个目标,而“批判性地使用人工智能”通常把它们压缩成一个:认识论评估、核查的启动、过程质量、核查成功、依赖决策、即时任务表现与独立学习。你的课程大纲评分量规写着“核查了来源”,这只对应第二步,而对于核查是否合格(过程质量)、是否改变了什么(成功,然后是依赖决策)却只字未提。启动并不等于成功:强过程可能以无结论告终,弱过程也可能得出正确答案,而一个做了检索却仍然困惑的学生,与一个真正解决了问题的学生得到同样的分数。
第二组区分是Trust与依赖之间的区分。同一篇综述把依赖校准定义为:在人工智能输出的实际质量给定的情况下,判断某一依赖决策是否恰当。这是一种以输出为条件的分类,既不是时间轴上的某个阶段,也不是信任量表上的一个分数。一项经过审查的研究发现,错误的 ChatGPT 信息改变了参与者自报的信任,但从未记录他们后来是否接受或拒绝了某个具体建议。另一项研究为 78 名翻译专业学生记录了他们针对 ChatGPT 反馈的接受与拒绝决策,但若没有独立的专家评估,接受不能被称为恰当,拒绝也不能被称为合理。没有关于输出质量的客观真值,依赖根本无法被分类,这也就说明每一项核查任务都需要什么:一份站得住脚的答案标准。
正因如此,Jaidka 与 Cai(2026)把校准偏差视为设计问题,而不是学生的缺陷。他们的类型学把核查能力与核查动机交叉起来,而不同剖面需要不同的补救:能力强、动机低的用户容易产生自满的过度信任,而能力低、动机低的用户暴露最严重。因此,两个在同一项核查上失败的学生,可能需要相反的补救措施。
如何教这项能力
Wei 与 Shang 的综述基于 Web of Science Core 检索得到的 493 条去重记录,并把 14 项重点实证研究映射到核查、依赖与结果三列上。它建设性的产出是可以围绕其设计任务的序列:先裁定输出质量,记录核查是否被启动,对过程质量进行编码,给是否成功打分,记录接受、修改或拒绝的决策,并依据已裁定的质量来评价这一决策。这里也需要提醒一句:减少不恰当接受的干预,还必须检查是否无意中让学生拒绝了正确的帮助,因此要给学生留出空间,用说明理由的方式接受好的输出。
先预测,再比较。 Gousopoulos(2026)围绕先预测再运行构建了一套面向建构类任务的测量方案:学习者先说明应当发生什么,然后依据这一预测、从领域依据上判断作品的行为,而不是看它能否运行。该研究对 24 项研究的审查发现,同一款工具在不同任务结构下会产生相反的结果:常规的 ChatGPT 配置在成绩、自我效能与心流上都显著更低,而增加核查要求与错误反思模块的条件则表现出更强的高阶思维。由于预测先于输出,推理过程被记录下来,而这份记录正是你要评的东西。
要求对照原始记录核查来源,并指明核查目标。 Denny 等人(2026)追踪了 113,588 条参考文献,它们来自 5,225 篇 2021 年以来发表的计算教育论文,并人工核实了 828 条可疑记录,发现其中 30 条包含可证实的伪造文献信息,分布在 14 篇论文中,全部来自 2025 年与 2026 年。其中十三条完全伪造;另外 17 条则是把真实标题与伪造或错误的作者、出处或年份组合在一起。在 SIGCSE Technical Symposium 上,这一数量从 3 条(2025 年会议论文集)上升到 17 条(2026 年),即 2.3%,占 2026 年会议论文的比例。在生成式参考文献中,作者字段出错的频率高于任何其他部分,因此“打开来源,读一读作者列表”针对的正是最可能出错的部分。不要让学生“确认来源是真的”;要让他们对照原始记录确认作者、出处与年份。该论文要求每一部被引用的作品都经过核实,并且任何核查者都应保持人在回路中,而这正是引文核查要求所演练的做法。
教学生辨别,而不只是提醒。 Gousopoulos 把核查形式化为一个信号检测问题,包含两个彼此独立的参数:敏感性,即辨别正确与有缺陷输出的能力;以及判定标准,即学习者设定的拒绝阈值。过度依赖也相应地被拆分开来:警告、核对清单与幻觉提示改变的是判定标准,从而改变学生何时拒绝;而领域教学、示范对比与植入错误的练习提高的是敏感性,因为学习者此时能够辨别。由此可得一个前提:只有当敏感性可以超过零时,核查教学才具有教育意义,而这需要足够的领域知识来区分正确与错误的输出。在同一项审查中,被要求解释 Large Language Models (LLMs) 生成代码的新手大约只在三分之一的任务上成功,这正是为什么只有在自身推理有实质内容时,用自己的推理去判断人工智能的反馈或代码才算是一次真正的核查。如果你的学生尚且无法独立完成领域思考,再多的警告也没有用;先教内容,再把核查附着其上。
在任务之前立即预警。 Vu、Cummings 与 Park(2026)在两项任务之前立即向 100 名美国学生(40 名本土学生与 60 名国际学生,均为把英语作为外语的学习者)展示了一条通用的“接种”(预警)信息。接受接种的学生显著更可能在学术来源摘要任务中进行核查(M = 0.34 对比 0.18),而自我报告的核查意向没有变化。这里有两层经验:在使用现场给出的一句简短警告会改变实际行为;而这一效应取决于任务类型,它出现在来源摘要任务上,但在关于指数运算与大数乘法的数学测验上并不一致。
让纠正付出代价。 在综述所审查的一项纠错范式中,纠正过程中的努力对学习很重要;简单地替换答案不太可能带来同样的收益。要求学生复现一个步骤、重写一段文字,或者说明某段输出错在什么地方的领域理由,就把一次核查变成了实际的工作。Venetsanos(2026)给出了哪些内容可以机械核查的门槛:有书面记录的标准、在无需解释性判断的情况下与既有知识作比较,以及答案唯一或事先规定好的可接受备选答案。任何需要解释性判断的内容都过不了这一门槛,因此要把机械层面(日期、公式、引文、计算)与判断层面分开,在判断层面上,学生自己的阅读才是核查的工具。
如何在不监视学生的前提下评价它
Gousopoulos 直接给出了结论:如果人工智能能够产出这份作品,那么作品就不能作为评价本身,评价于是转移到规格说明、验证推理与解释上。他的“模型作者身份”构念有四个方面:规格说明、概念模型、验证与解释,分为从“委托”到“作者”的四个有序层次;在“作者”层次上,要求在第一句提示之前先有一份可验证的规格说明,基于领域理由并给出说明地拒绝输出,以及超出作品自我陈述的解释。由于评分依据的是建构类任务本身已经产生的材料,同一套工具既能作为形成性评价,也能作为研究测量工具。这就是对“额外负担”担忧的回答:你并没有增加一项作业,你只是在给一份副产品打分。
有三项决定可以防止这件事变成监视。第一,依据已裁定的质量、而不是努力程度来给核查打分,否则你就制造了一种表演式核查的动机。第二,像 Venetsanos 要求的那样说明来源:学生必须理解他们所收到反馈的来源、性质与局限,哪些部分经过机器核实、哪些部分经过解释性判断,以及人类判断具有优先地位,因为学生无法权衡他们无法定位的反馈。第三,不要把执行要求交给检测工具。Bassett 等人(2026)主张,人工智能检测根本不应被用于教育:它的估计是概率性的,而且由于现实文本的来源不可知,这些估计无法被独立核实;它的分数达不到学术诚信调查所需的“盖然性权衡”标准;而且对于与人工智能共同创作、而非由人工智能创作的作品来说,人与人工智能的二分毫无意义。他们的结论是,检测“并不能保障学术诚信,反而会削弱它”,监视体制滋生猜疑,侵蚀学生的Trust。要把检测的两层含义区分开来:检测人工智能生成的文本在这里没有站得住脚的证据地位,而教学生发现人工智能输出中的错误,才是这项练习的目的所在。
这种分离是架构层面的,而且值得告诉学生:Li、Zhang 与 Botelho(2026)用第二个模型来核查输出,而不是把核查内嵌在生成器里;而看清其中道理的学生,也就能看清为什么“工具说它是对的”不构成核查论证。
学生为什么会跳过核查
校准。 Jaidka 与 Cai 的类型学把能力强、动机低的学生置于自满式过度信任的风险之中,而能力低、动机低的学生暴露最严重。经过审查的文献也以微缩的方式显示出同样的分化:一种提供约有一半时候正确建议的设计,学生赋予这些建议的权重会随先前知识而变化。校准失败无法靠说教来修复:出问题的正是学生自己的信心信号。
流畅性。 读起来顺畅的输出会被当作正确的。被要求解释 Large Language Models (LLMs) 生成代码的新手大约只在三分之一的任务上成功,而一项关于学生与 ChatGPT 测验对话的实地研究发现,即使遵循了正确的引导,仍然会得出错误答案。当敏感性接近于零时,跳过核查对学生来说没有任何他能够察觉的代价:这种失败在被评分之前一直是无形的。
社会证明与意向。 学生报告说自己打算核查,而这份报告毫无价值:在 Vu、Cummings 与 Park 的研究中,自我报告的核查意向没有变化,实际行为却变了(M = 0.34 对比 0.18)。不要给意向打分。基于规范的说服也不是可靠的退路:Jaidka 与 Cai 报告的一项直接对比试验显示,基于信息的规范助推没有显著效果。时间压力是文献记录的学生跳过核查的原因之一,而一份没有为核查安排时间的大纲,等于在说核查是可选的。
三种反对意见
“他们可以只是为了分数而做。” 部分属实,所以要去评那些人工智能无法代替学生产出的材料。在第一句提示之前写下的规格说明、运行作品之前记录的预测、对照原始记录核查过的来源清单、说明拒绝的领域理由:这些每一样都要求学生持有一个生成器无法提供的立场。在“作者”层次上,Gousopoulos 要求基于领域理由并给出说明地拒绝输出,而伪造的理由和伪造的引文一样容易被看出来。剩余风险由敏感性阈值界定:如果一个学生没有可用于核查的领域知识,核查就是演戏,任何评分量规都救不了它。这支持的是先教领域内容,而不是放弃核查。
“课程大纲里没有时间。” 预警只是任务之前的一条信息;植入错误的任务有二十个题目,其中八个含有一处领域层面的错误,它能告诉你学生究竟能不能辨别;而评分量规依托的是任务本身已经产生的材料,所以它花费的是你本会缺失的证据上的批改时间,而不是增加一项新作业。真正花时间的是替代方案:未经核查的提交、伪造的参考文献,以及随之而来的学术诚信谈话。这一约束仍然真实存在:时间压力是文献记录的学生跳过核查的原因之一,因此没有被安排进任务的核查就不会发生。
“工具通常是对的。” 那么核查就很便宜,而例外才是关键所在。关于参考文献的记录并不令人安心:30 条可证实的伪造条目分布在 14 篇论文中,全部来自 2025 年与 2026 年,其中 17 条把真实标题与伪造或错误的作者、出处或年份配在一起,13 条完全伪造,而且从 3 条(2025 年 SIGCSE 会议论文集)跃升到 17 条(2026 年),即 2.3%,占 2026 年会议论文的比例。你恰好注意到的部分是否准确,说明不了你没有注意到的部分:作者字段出错的频率高于生成式参考文献的任何其他部分。而且即使引导是正确的,被接受的答案仍可能是错的:那项关于学生与 ChatGPT 测验对话的实地研究记录的正是这种情况。教核查的理由不是工具通常出错,而是学生无法分辨自己身处哪种情况,而这恰恰是这门课程存在的意义所在。
仍然未知的问题
- 是否有任何干预能改善核查成功以及其后的依赖决策,并以已裁定的输出质量为评判依据:在 Wei 与 Shang 的 14 项重点案例中,没有任何一项同时测量了这两者,而很少有研究在即时表现之后继续追踪延迟的保持或迁移。
- 这些成分之间的关系是否如该框架所暗示的那样有序。七个目标是一种分析性的排序,而不是经过验证的因果模型。
- 这些设计主张是否有效。Jaidka 与 Cai 的八个主张是尚未检验的预测,而基于信息的规范助推在他们报告的一项直接对比试验中没有显著效果。
- 内嵌于反馈中的核查究竟会培养自我核查的习惯,还是会形成对外部确认的依赖,这是 Venetsanos 提出但未予回答的问题。
- 核查教学在领域知识阈值以下是否有效。Gousopoulos 预测它无效,并指出有些领域能提供外部标准(物理、化学、生态学、流行病学),而历史、文学与Ethics大多不能。
本周可以做的事
- 在核查之前先定标准。 明确对该任务而言“已裁定的正确”意味着什么,这样核查才有可以对照的东西。
- 先要预测。 让学生以书面形式写下他们预计会发生什么,然后从领域依据而非流畅程度来比较输出。
- 要求核查引文,并指明核查目标。 作者列表是生成式参考文献中最不可靠的部分;让学生打开原始记录,确认作者、出处与年份。
- 分别诊断敏感性与判定标准。 因为分辨不出而接受有缺陷输出的学生需要领域练习;分辨得出却仍然接受的学生需要移动阈值。
- 给核查打分,而不只是给作品打分。 给规格说明、预测记录、验证日志、来源核查以及说明的拒绝理由评分。
- 说明来源。 告诉学生哪些反馈经过机器核实,哪些由人做出判断。
- 不要用检测器来执行要求,并把核查排进日程。 时间压力是文献记录的学生跳过核查的原因之一。
- 运行植入错误的任务。 二十个题目,其中八个含有一处领域层面的错误,它能告诉你学生究竟能不能辨别。
- 在使用现场说出警告。 按任务类型分别预警,而不是整份大纲只预警一次。
关于与之配套的工作,参见如何把人工智能素养融入课程与人工智能素养的证据说明了什么,这两页建立起本页所要运用的理解。