本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

现在是第六周。你手上有一摞草稿,有一套你信得过的评分量规,而且越来越怀疑自己三分之一的评语会被匆匆扫过、然后被忘掉。有同事提到,现在有个工具能在一小时之内给每一份草稿写出评语。你想知道这究竟是真正的升级,还是一种更快地生产出没人阅读的文字的方式。

要点: 在一条狭窄的区间内,也就是文字层面的编辑级语言工作与依据量规的第一轮评语,人工智能反馈值得为覆盖面、及时性与一致性而采用;而只有当你在评语周围会发生什么这件事上做出设计,它才值得采用。覆盖面是最容易的部分。在一项涉及 1,176 名一年级本科生的整群随机试验中,反思式与混合式设计在延迟进行的、不使用人工智能的迁移任务上优于让人工智能直接给出批评;而在一项涉及 70 名学生的随机作文实验中,质量更高的人工智能反馈并没有带来比经验丰富的教师更好的修改。综合这些证据来看,学生拿一条评语做了什么,比这条评语多快到达更重要;而反馈素养,而不是能否使用人工智能,区分出了获得成长的学生与照抄的学生。

决定一切的那条区分:数量不等于质量,发出不等于被读到

本页的大部分工作都由两条区分来完成。

更多反馈并不等于更好的反馈。 人工智能可以每一周为每一份草稿写出评语;数量几乎免费。质量则不然。Zhan、Boud、Dawson 与 Yan(2025)把提示词的质量当作整个过程的枢纽:含糊的提示词产出泛泛而无用的输出,而生成的评语可能是幻觉、有偏见或相互重叠的,这就把评价性判断推回给读者。校准问题更为尖锐:在Farrokhnia 等人(2026)的研究中,GenAI 反馈的质量与学生的初稿水平显著相关,而教师反馈的质量则不然,也就是说教师的校准更加稳定一致。数量可以规模化,校准不能。

已发出的反馈并不等于被落实的反馈。 这是代价更高的那重混淆。Farrokhnia 等人把 70 名用波斯语撰写议论文的学生随机分成三组。思维链提示产出的反馈评分显著高于零样本提示(M = 11.25,p = .01)和一位经验丰富的真人教师(M = 11.20,p = .008),达到 M = 12.90。然而,思维链组的作文修改幅度并不显著高于教师反馈组,后者的提升与之相当。评分更高的评语,同样的修改。如果你衡量的是模型写出来的东西的质量,这读起来像是胜利;如果你衡量的是作文里改变了什么,它就不是。

谁把反馈落实下去,取决于学习者。在Hawkins、Taylor-Griffiths 与 Lodge(2026)中,32 名心理学学生在一个 25 分钟、有屏幕录制的作文任务中可以不受限制地使用 ChatGPT,随后在一次视频刺激回忆访谈中回看录像。反馈素养是作文成绩唯一显著的正面预测因子(β = 0.46,p = .017);Zhan、Wood、Carless 与 Yan(2026)的特刊编者按指出,GenAI 的使用频率、来源的可信度先备知识都不能预测表现。不到三分之一的学生把人工智能的输出与另一个网络来源做过比较;一半的学生表示会出于学术诚信或希望文章出自自己之手而有意回避人工智能;多数人请求的是任务层面的反馈,而这类反馈很难迁移到其他任务上。

反馈的采纳也不均衡。在Tubino 与 Adachi(2022)报告的全校性 Deakin 试点中,这款人工智能工具是可选的,尽管有将近 4,000 名学生可以使用,实际使用率平均约为本科生的 13% 与研究生的 12%。积极主动、成绩优秀的学生用得更多。这就是“把工具提供出来”所能买到的结果,也正因如此,本页余下的部分谈的是设计,而不是可及性。

人工智能真正擅长什么,又在哪里止步

擅长:狭窄区间内的覆盖面与一致性。 Tubino 与 Adachi 报告了 2021 年在 Deakin 的那次试点,使用 FeedbackFruits 的人工智能自动反馈工具,涉及 29 个教学单元和将近 4,000 名学生。它作用于微观层面的文本特征,例如句子长度、标点、语法、文本结构,支撑的是文字编辑阶段:教师设定参数,学生独立使用工具,并及时得到可操作的反馈。能够规模化的是这种分工,而不是模型。

不擅长:通用性、正确性与校准。 恰恰是这些方面会失败(Zhan 等人,2025),而补救办法是提示词、量规或人,而不是一个更大的模型。Aldino 等人(2026)又补充了教师一侧的失效模式,来自 21 名高等教育教师:语气不一致(n = 7)、可能有错误信息(n = 5)与信任问题(n = 5),而修改精力花在删掉夸大其词的赞美与泛泛的建议上,而不是增加内容。

一种经得起检验的部署模式

证据支持某一种形态的程度超过其他任何形态:人工智能起草,学生先做评价,由人来定稿。

哪些可以自动化。 微观层面的语言工作与依据量规的第一轮诊断。给模型一份量规,让它一步一步推理:Farrokhnia 等人所获得的质量提升来自一段思维链提示,它引导模型依据论证量规逐步评估,而不是一句赤裸的指令。Gu、Chen 与 Yan(2026)同样给他们的 GenAI 组提供了带有预先训练量规与提示指南的 ChatGPT-4o,正是这一点让输出可以对照明确的标准来检查。依据量规的生成可以自动化,判断不能。

哪些必须留给人。 最终的评语、语气,以及任何会成为记录的内容。Becerra、Palma 与 Cobos(2026)描述了 AICoFE:它让三个各自微调过的模型(GPT-4.1-mini、Gemini 2.5 Flash、Llama 3.1)依据量规分数与定性观察生成各自独立的评语草稿,然后由教师通过挑选句子或段落来组织最终评语,并用图例标明哪一句来自哪个模型。人工智能是草稿生成器,不是最终发出者。Aldino 等人发现了同样的“协助但核实”模式:机器学习组件最常指出缺失的是达成学习目标(21 名教师中有 20 人遗漏,16 人接受)与师生关系(14 人遗漏,12 人接受),而教师凭专业判断决定每一条建议。

如何排序。 不要把来源并排堆在一起,而要让它们分阶段出场。在Ateş(2026)的实验中,反思条件要求学生在人工智能批评之前先做自我评价,混合条件则依次进行自我评价、同伴反馈与 GenAI 批评。Tubino 与 Adachi 出于同样的理由为三个草稿阶段提出了模板。要把人工智能与同伴反馈结合起来,而不是用一个替代另一个:Gu 等人让两个平行的英语班级(中国 118 名一年级本科生;GenAI 组 n = 56,同伴组 n = 62)在一个学期里经历三轮自我评估,GenAI 脚手架相比同伴互评在反馈素养上带来了轻微但显著的提升(ANCOVA p = 0.049,ηp² = 0.03)。GenAI 组的学生会反复改进提示词,并核实或质疑不准确的输出,而同伴组的学生出于社交便利选择来源,其评价性判断被友谊偏差扭曲。同伴互评在读者意识方面保留了独特的价值,因此作者提出采用包含匿名同伴反馈的多阶段设计。

如何向学生说明。 把它说成一种有待评判的草稿意见,而不是可以照抄的答案。要明确说,模型的评语可能是幻觉、有偏见或相互重叠的,修改的责任在学生自己。Zhan 等人笔下那对 IELTS 写作者展示了两种极端:一位素养较低的学生拿到含糊的提示词,得到泛泛的反馈,信任它或过度照抄,参与得很表面;一位素养较高的学生写出参照标准的提示词,会追问、交叉核对来源并监控自己的修改。区别在于指导和习惯,而不是能否使用工具。

如何检查输出。 把生成的评语抽样出来,与你亲自阅读同一批草稿的判断作对比,寻找上面点出的那些失效模式:语气、错误信息、夸大的赞美、重叠。在 Deakin 试点中,正面的平均评分与由学生标记出的错误同时存在,所以满意度是一个很弱的质量信号;一张笑脸调查不是准确性证据。

失效模式,连同数字

起决定作用的是设计,而不是工具是否可得。 最强的设计证据是一项多点、整群随机、纵向的实地实验:来自 4 所大学、3 个科学领域、48 个教学班的 1,176 名一年级本科生,在班级层面被随机分配到仅同伴、直接 GenAI、反思式 GenAI 与混合四种条件。混合条件在论证质量上的提升最高,在概念学习上的优势也最清楚。反思式与混合式都产生了比直接 GenAI 更强的反馈采纳度和自我调节学习,并且在延迟进行的、不使用人工智能的迁移任务上都胜过它。直接 GenAI 确实比同伴反馈更好地改善了即时的论证质量,这是它的优势所在,但迁移更弱。因此教育价值与其说取决于能否使用人工智能,不如说取决于反馈环境能否在修改过程中保住学生的学习者能动性、评价性判断与所有权:直接批评容易招致被动接受,而反思式与混合式设计迫使学生去解释它、对照标准比较它、判断它的相关性,然后再修改。其他效应量则让人保持谨慎。Gu 等人相对同伴互评的优势很小,他们把它解读为真实存在但单靠它并不具有变革性,真正支撑工作的是教师脚手架、提示指南与学习单。编者按的框架是:只有当互补性被明确规定出来时,GenAI 与人的反馈才是互补的,而这要靠排序、比较、编辑与治理来实现,而不是把两个来源并排放着。

信息管道两端都会出现过度信任。 学生在落实反馈时可能不加批判地过度依赖,教师也可能过度顺从建议。教师反馈还常常被学生感知为比 GenAI 反馈更负面或更有风险,这颠倒了通常的质量假设。要把反馈素养当作前提而非假定:在 Hawkins 等人的研究中,最强的预测因子是学习者的反馈素养,而不是他们使用人工智能的频率。

转移而非缩减的工作量。 工作量问题是最常被承诺掉的那一个。被问到人工智能反馈工具带给了他们什么时,21 名教师中只有很少的人提到节省时间(n = 2),而提到反思(n = 14)、语言与结构的改善(n = 11)以及发现缺失成分(n = 10)的人要多得多。可见的收益是一份草稿和一次诊断性提示,而不是一条成品评语。取而代之出现的是审阅、校准与核实的工作。21 名教师中有十二人做了进一步的句子层面修改;编辑(f = 32)与删除(f = 27)占主导,新增很少(f = 8)。主要模式是校准语气:把赞美调低(f = 11)、删掉建议(f = 9)、删掉鼓励(f = 8),以保护真实性与专业口吻,而修改集中在关系维度,尤其是师生关系(f = 24)。教师提到的需求包括人工编辑(n = 9)、语气不一致(n = 7)、错误信息(n = 5)与信任问题(n = 5);教龄超过五年的教师报告了更多这类问题,而经验较少的教师则看重脚手架,这也是要留意新手是否因为顺从人工智能建议而建立起更弱的独立判断的一个理由。编者按给出的规则是:GenAI 是在重新分配教师劳动,而不是消除它,设计不当的工具还可能让工作量增加。

三个值得认真对待的反对意见

“人工智能反馈不具个人化。” 往往确实如此,而这正是要把最后一句话留给人来说的理由。AICoFE 之所以存在,就是因为泛泛的模型文风不是学生应当收到的东西:由教师来挑选、编辑并署名最终评语。Aldino 等人研究中的 21 名教师出于同样的理由重写语气,删掉夸大的赞美,砍掉不符合他们与学生关系的建议。在这个设计里,个人化不是模型的任务,而是你的任务,模型做的是前期准备工作。

“我的学生反正不会读反馈。” 他们读的比我们希望的要少,而证据表明解决办法是设计,不是数量。Deakin 试点中的采纳率大约是本科生的 13% 与研究生的 12%。Farrokhnia 等人评分更高的人工智能评语并没有带来比教师评语更多的修改。真正推动变化的是那种迫使学生参与的排序,即先自我评价、再同伴反馈、最后人工智能批评,再加上一个学期里的三轮修改周期,这才产生了可测量的反馈素养差异。同一天多次重新提交,是一个可用的痕迹,能说明学生究竟有没有参与。

“这不是学生花钱买的东西。” 那就不要让模型成为他们从你这里听到的唯一声音。这个工具站得住脚的版本,是学生获得更多反馈时刻,而你把时间花在判断密集的部分:最后那句话、校准、带有你权威的评语。在粗心的部署下,学生失去的不是你的在场,而是标准、评语与结果之间的一致性。把互补性规定清楚,即排序、比较、编辑、治理,这个反对意见就会消解;把两个来源并排放着,它就不会。

本周

1. 把自己上一批评语分成语言层面的修补与判断层面的裁定两类。只有第一类可以作为自动化的候选。

2. 写出你愿意交给模型的、依据量规的逐步提示词,并拿你已经评过分的三份草稿来测试它。

3. 对输出抽样,与你自己的评语比对,记录模型在哪里显得泛泛、出错或一味奉承。

4. 把一项作业排成自我评价 → 同伴反馈 → 人工智能批评,并告诉学生人工智能只是一个有待他们挑战的草稿意见。

5. 要求他们与第二个来源或与标准做一次比较:不到三分之一的学生会主动这样做。

6. 为你在语气和删除上实际会花掉的审阅时间做预算,并与你省出的时间作比较。

7. 留意专家与新手的差异。如果有经验的同事报告的该工具输出问题比你报告的多,那是关于你自己校准水平的信息。

8. 决定什么结果算数并去测量它:使用率、修改痕迹与延迟进行的无辅助表现,而不是满意度评分。Deakin 试点的大约 13% 与 12% 是一个有用的基线,而 AICoFE 的择句追踪则示范了教师一侧的做法:记录最终反馈中有多少来自模型、有多少是你改过的。

本页的定位。 Feedback是整个系统的上位概念,涵盖提供、回路、采纳与评价情境;人工智能反馈质量讨论的是什么让生成的评语准确、有用、及时且在教学中站得住脚。本页是两者之间实用的中间层:这些部分的哪些组合能在大规模下产生更好的反馈。关于在涉及人工智能时分数应当意味着什么的问题,包括构念替换、经认证的过程证据、诚信规则,属于人工智能时代的评价再设计评价效度,而不属于本页。

关于写作教学这一特殊情形,参见人工智能情境下写作教学的最佳实践

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.