问答
在人工智能语境下,写作教学的最佳实践是什么?
本页是英文页面的机器翻译,尚未经母语者审校。
本页面向必须逐门课程、逐份作业地决定人工智能在学生写作中被允许做什么的教师。它取材于教育中的人工智能知识库,尤其是其中关于写作教育中的人工智能、认知卸载、人工智能反馈质量、反馈素养与学术诚信的综合梳理。
研究指向一条一致的原则:
用人工智能来增加反馈、反思、批判与修改,而不是移除写作本应培养的那些智力劳动。
这条原则之所以重要,是因为写作不是生产打磨好的文本,而是一个认知、修辞与社会性的过程。人工智能可以改善产品,同时削弱你的作业本来要培养的推理、作者身份、来源评价与修改等过程。下文的每一项内容都是运用这一区分的方式。
八项有研究依据的教师实践
1. 先决定学生必须保留哪些智力劳动,再划定人工智能的边界。 在决定人工智能是否“允许”之前,先说出这份作业所培养或评价的构念。如果目标是论证,学生就必须提出并捍卫主张。如果是学科解释,他们就必须作出解释性判断。如果是科学推理,他们就必须把证据与结论连接起来。替代这些工作的人工智能使用会削弱作业的效度,即使产出的文字很出色也是如此:产品不再能支撑你想从中得出的推断。这是写作教育与学术诚信的核心逻辑,也是为什么任务层面的规则胜于课程层面的禁令。
Nash 与 Burriss说明了这条边界有多难划好。在 27 位职前英语教师的课堂人工智能政策中,22 份允许把人工智能用于构思与头脑风暴,22 份禁止或未说明是否可以用人工智能来撰写句子、段落或论文,而有 22 份对阅读只字未提。作者揭示出的矛盾很说明问题:同一些教师把构思与修改称为“思考”,却把真正的思考只定位在最终的书面文本中。如果思考分布在规划、起草、修改与评价之中(正如该文所援引的写作研究所得出的结论),那么只守护最终产品的政策就是守错了环节,而阅读理应得到与写作同等的明确对待。
2. 宁可“学生思考、人工智能回应”,也不要“人工智能写作、学生修改”。 这是证据基础中最具可操作性的一条原则。Chen 的层面敏感研究以六个完整班级的 168 名本科生为对象,区分了表层、结构、想法与推理四种卸载:开放式的人工智能协作产生了最强的人工智能辅助写作,却带来最差的后续独立表现,而把推理委托出去与独立高阶思维的负相关最强。一个限制委托、并要求学生解释他们如何接受、修改或拒绝人工智能建议的受限条件,在独立写作、论证深度与修改上表现更好。该研究是准实验设计,且只有六个完整班级,因此对因果主张要谨慎;但这一模式与更广泛的卸载文献相一致。
由此得出一条实用规则:要求学生在请人工智能批判或展开自己的解读、假设、论证或分析之前,先自己确立它们。可以让人工智能做的是:“这是我的论证面临的三条反驳。”而很少应当让它做的是:“替我把论证写出来。”
3. 对人工智能生成的第一稿尤其要谨慎。 在一项针对 253 名写作者的研究中,任何人工智能协助都降低了感知到的作者身份,但起草协助降低得最多,规划协助降低得最少;人工智能贡献的文本与想法越多,文章质量越好,作者身份感却越低(从规划到修改的作者身份研究)。这种取舍是真实的:你可以在同一份提交中既得到更好的文章,也得到更弱的作者感。如果保存作者身份在你的课程中很重要,就把推动学生规划的人工智能与生成段落的人工智能分开:前者几乎在任何场合都站得住脚,而当写作本身就是目标能力时,后者很少站得住脚。
4. 把人工智能当作反馈伙伴之一,并让人类反馈留在系统中。 这里最强的课堂证据是PAIRR,它涉及十门写作课程与三门写作密集型STEM课程中的 654 名学生:学生起草,完成同伴评价,获得基于量规的人工智能反馈,比较并评价这两个来源,制定修改计划,进行修改,然后反思。有百分之五十八的人偏好同伴加人工智能的组合反馈,而偏好单靠人工智能反馈的人只有 6 %。学生发现人工智能在宽泛的、面向量规的修改建议上有用,而同伴则提供了情境知识与真实的读者反应。要说清这表明了什么:PAIRR 测量的是学生对反馈的体验与评价,而不是长期的学习收益,因此它是支持反馈设计的有力证据,对写作持久改善的支持则较弱。
5. 教学生评价反馈,而不仅是索取反馈。 获得好的反馈并不够。学生需要反馈素养,即主动寻求反馈、判断其质量、管理自己对反馈的反应,并把它转化为修改的能力。反馈素养较高的学生从人工智能反馈中获益远多,而把反馈当作权威的学生则获益较少(人工智能反馈质量)。一个有用的作业组成部分是一张简短的反馈决策表:人工智能建议 → 接受/拒绝/修改 → 理由 → 支持这一决定的量规条目或证据。这把人工智能输出变成了用于判断的材料,而不是必须服从的指令,也给了你一些可以评分、且并非文章本身的东西。
6. 保留一些可以独立观察的写作与推理。 人工智能辅助下的表现不等于独立能力。应在适当时候保留撤除条件:简短的无人工智能写作、课堂内的解释、口头说明、一次面谈、即兴修改,或一个需要把同一推理迁移到新案例的后续问题。当期末论文在成绩中占很大权重时,这一点最为重要。这并不意味着把每份作业都变成监考考试:少数几个策略性安排的独立样本,就能为你和学生提供解读受助作品的基线(认知卸载;Chen 的研究)。这是我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?中一般性评价重设论证在写作领域的具体情形。
7. 把披露当作反思,而不是陷阱。 披露并非中性:当政策含糊、带有惩罚性或污名化时,学生会隐瞒人工智能的使用,而诚实甚至可能招致怀疑。当披露让决策过程变得可见时,它在教学上才起作用:人工智能被用来做什么、向它提供了什么、哪些建议起了作用,以及学生最终接受或拒绝了什么(人工智能使用与披露声明;关于学生自我合理化的研究)。针对具体任务的指导优于一刀切的“允许使用人工智能”或“禁止使用人工智能”规则,因为恰当的边界在头脑风暴、论证展开、句子润色、资料处理与最终成文之间各不相同。要说明披露将如何影响评分,否则学生会往最坏处想。
Mohamed 与 Temimi关于评价设计的建模提供了机制:只有当诚实的成本保持较低时,披露才会成为有吸引力的选项;而由于检测工具的误报也会落在诚实的学生身上,更严密的监控反而可能让隐瞒相对更有吸引力。他们的建议是:针对最有可能隐瞒的那类学生来设计,并把申报的使用当作背景信息而不是自白。
8. 不要把通用的大语言模型判断当作你自己判断的替代品,尤其是在总结性评价中。 两个看似冲突的结果其实可以并存:经过仔细校准、配有详细量规与示例的系统可以很好地为特定任务评分,而开箱即用的大语言模型评分则与人类判断存在明显偏差。Mathew 等人发现人类与大语言模型之间的一致性很弱,且会随文章质量系统性地变化:大语言模型会高估短小、表面易读的文章,而低估较长、较强但带有少量表层错误的文章,并向量表中间聚集。因此,人工智能用于低利害的形成性反馈、意见草拟或初步筛查,要比作为自主的最终评分者容易得到辩护得多(自动作文评分)。
学生自己也会划出类似的分界。在一门本科技术传播课程中,ChatGPT为手写作业评分,并且学生被告知了这一点,13 名参与者全都认为反馈清晰、对表层修改有用,然而大多数人把反馈的实用性与评价的权威区分开来:他们接受批评,同时坚持成绩应由教师决定(Who Should Grade My Work? Student Perspectives on Transparent AI-Assisted Writing Assessment in Higher Education)。这种双重判断的模式说明,应当把人类监督设计成人工智能输出转化为成绩的那一环节,而不是把它当作可有可无的礼貌。
你可以采用或改写的默认流程
一套稳健的人工智能时代写作流程把推理留给学生,并让人工智能扮演顾问角色:
| 阶段 | 学生的责任 | 恰当的人工智能角色 | 你可以收集什么 |
|---|---|---|---|
| 1. 接触证据 | 阅读、观察、批注、计算、做实验 | 通常不需要,或仅作澄清 | 笔记、批注、观察记录 |
| 2. 形成初步立场 | 产生解读、问题、假设、主张 | 可以提问或挑战假设 | 主张或假设备忘录 |
| 3. 规划 | 决定证据、顺序、受众、文体 | 可以批评提纲或提出替代方案;由学生决定 | 提纲及理由说明 |
| 4. 起草 | 产出实质性的文字与推理 | 依学习目标加以限制 | 草稿与版本历史 |
| 5. 人类回应 | 给出并接受同伴或教师反馈 | 无需使用 | 同伴评论 |
| 6. 人工智能反馈 | 索取参照标准的批评 | 批评者、读者、反驳生成器、清晰度检查者 | 人工智能反馈记录 |
| 7. 评价反馈 | 比较同伴、教师与人工智能的建议;接受或拒绝并给出理由 | 人工智能输出成为评价对象 | 反馈决策备忘录 |
| 8. 修改 | 作出实质性修改并说明理由 | 检验清晰度、提供替代方案 | 修改稿 |
| 9. 核实 | 检查每一项事实性或依赖来源的主张 | 人工智能无法核实自己的输出 | 来源与证据 |
| 10. 反思与披露 | 说明人工智能的作用以及自己的思考发生了哪些变化 | 无需使用 | 简短的过程反思 |
| 11. 必要时独立检查 | 在没有人工智能的情况下解释或应用该推理 | 无需使用 | 口头答辩、快速写作、新案例 |
这基本上是PAIRR的扩展版:起草 → 人类反馈 → 人工智能反馈 → 批判性比较 → 修改 → 反思,并加上一条独立基线与围绕推理的更清晰边界。
学科特定的指导
写作与作文课程
作文课教师最有理由保护写作过程本身,因为起草、修辞决策、修改、受众意识与声音的形成不只是展示学习的方式,它们就是学习目标本身。应当循序渐进地教人工智能的使用,而不是把它当作二元开关。学期初,收集若干独立样本,让你和学生都知道这位写作者目前能做什么。然后主要把人工智能作为受众、批评者与修改伙伴引入:让它指出读者在哪里跟不上思路,对论点提出反驳,把草稿与量规对照,标出缺乏支持的主张,或解释某一段为什么读起来不通顺。建议由学生自己判断。
即使人工智能反馈可用,也要保留同伴互评:同伴提供了人工智能所没有的情境与受众知识,而评价两者之间的差异本身就是写作训练。当学习目标就是学会写作时,对用人工智能生成大段初稿要保守,因为上文的作者身份与卸载证据都表明了这一点。同时,也要避免对语法、措辞或语言协助的一律禁止:它们会给多语写作者制造不必要的障碍。更好的做法是把语言支持与智力作者身份分开:学生可以在表达上获得帮助,同时仍对想法、证据、修辞决策与意义负责。要注意人工智能反馈并非语言中立:Tan 等人发现,当提示中包含了学生的人口学属性或教育背景属性时,同一篇作文会得到更多赞扬与更少实质性批评,因此偏见审查应当纳入你的反馈设计。
人文与社会科学课程
在这里,解释往往是目标能力,因此要让接触来源先于接触人工智能。学生应当先批注原始文本、史料、艺术作品、档案材料、访谈或理论段落,并在咨询人工智能之前形成初步解读。之后,人工智能作为陪衬才有教学价值:“给出一种替代读法”“什么证据会挑战我的解读”“我的论证预设了哪些前提”“从一种对立的理论视角生成一种解读”。由学生决定实际文本支持哪一种读法。
作业也可以把对人工智能的批判本身变成学科学习的一部分:给学生一份对某首诗、某个事件、某个论证或某种社会现象的人工智能解读,让他们回答它注意到了什么、遗漏了什么、哪些证据支持它的主张、谁的视角缺席,以及它在哪些地方把歧义折叠成了平滑的答案。这样就能保住人文学科所教的解释性判断,而不是把大语言模型当作神谕。应当评价解释性决策与证据论证,而不是文字打磨:像“你为什么这样读这一段,而不是你排除的那种替代读法?”这样的简短面谈问题,比猜测一个句子“看起来是否像人工智能生成”要强有力得多(人工智能检测)。
STEM 课程与实验报告
先说一个限定: 本知识库关于人工智能支持的一般学术写作有远为更强的证据,而关于人工智能在实验报告写作中的证据则较弱;动手实践与实验室教学法的覆盖仍然不足,工程教育文献中也是如此。以下指导是对写作、卸载、效度与工程类证据的合理应用,而不是来自大量实验报告文献的结论。
把人工智能的边界划在科学推理而不是整体文字表达周围。学生仍对观察、原始数据、计算、不确定性、图表、分析选择、结果与主张和证据之间的推理负责。一旦这些都存在,人工智能就可以合理地帮助组织、可读性、过渡与学科惯例,这与上文表层与推理的区分相同(Chen 的研究)。
因此,一套有力的人工智能时代实验报告作业应当包含报告加上选定的原始数据、计算或笔记本输出、带有学生自己撰写的解读的图表,以及一段简短说明,讲清核心结论如何从证据中得出。对于高利害报告,可以就一幅图表、一个异常结果、某一项方法选择或某一处局限提出一两个个性化的追问。不要让写作的流畅度替代概念理解:本知识库报告说,当语言表达较弱时,自动化的物理评分可能低估概念理解,而这最沉重地落在多语学生身上(自动作文评分)。如果科学推理与科学写作都是目标,就应分别评分。
工程课程还增加了专业问责。一篇对99 项工程教育实证研究的综述把透明度、人类监督、学生独立性、隐私、作者身份、公平与善行认定为反复出现的伦理关切,并主张人工智能伦理应当属于专业养成的一部分,而不只是规则遵从。在实验或设计报告中,不仅要求学生披露人工智能协助,还要让他们确认已经核实了计算、来源、假设与安全相关的主张。
应当停止做的事
- 要求文字打磨却忽视过程。 这会让产品越来越难以被解读为学习的证据。
- 依赖人工智能检测工具。 检测处理的是检测问题,而不是学习或评价效度,而且它的证据记录很差:在一项隐蔽的现场研究中,94% 由人工智能生成的考试作答未被发现,并且得分高于真实学生;而一项受控研究发现,检测工具对合规的轻度人工智能编辑的标记率为 38–80%,却漏掉了超过 96% 的“人性化”改写(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI;Why AI Detection Fails for Academic Integrity)。
- 在不教反馈评价的情况下给予无限制的人工智能使用权限。 这假定许多学生尚未发展出反馈素养。
- 用人工智能反馈替代同伴与教师互动。 这会移除学生一致表示看重的情境与人际信息。
- 写下“允许使用人工智能”就到此为止。 学生会合理地把它理解为从拼写检查到生成核心论证都包含在内。任务层面的期望更清晰,也让披露不再像猜谜(人工智能使用与披露声明)。
判断人工智能可以做什么的一条快速规则
对每一项任务,问三个问题:
| 问题 | 如果答案是肯定的 |
|---|---|
| 这项认知活动本身就是学习目标吗? | 把实质性责任留给学生。 |
| 学生以后需要独立完成这项能力吗? | 增加独立练习与一些无人工智能评价。 |
| 人工智能能帮助学生评价、练习或修改这项能力,而不替他们完成它吗? | 这通常是最有力的人工智能整合理由。 |
应用举例:如果目标是论证,人工智能可以挑战一个论证,但不应惯常地提供论证。如果目标是历史解释,人工智能可以提出一种由学生批判的竞争性读法。如果目标是实验报告的沟通,人工智能可以在学生完成分析与推理之后改善文字。这就是实践中教练胜于拐杖的边界。
这些证据有多强?
有前景,但还不足以强到为所有情况规定唯一的写作人工智能政策。部分最好的证据来自像PAIRR这样涉及 654 名学生的大型真实课堂研究。另一些发现依赖准实验、小样本实验、概念分析以及 2025–2026 年间新兴的工作:Chen 的受限写作研究涉及 168 名学生,但只有六个完整班级;作者身份研究使用的是一项简短的实验性写作任务;而一项报告 ChatGPT 练习后即时质量提升的研究只涉及 21 名一年级国际学生,并未确立长期的迁移(Leveraging ChatGPT in academic writing: ChatGPT enhances students' writing quality, writing experience, and ownership)。
请把共识当作设计原则,而不是已经定论的处方。最可靠的跨研究结论是:保护学生能动性、评价性判断、独立胜任力、学科推理与人类反馈,同时用人工智能扩大批评、练习、修改支持与语言协助的可得性。
给课程大纲或教师工作坊的简版: 学生先做智力劳动;人工智能主要负责提问、批评、解释并支持修改;学生评价其输出,而不是仅仅照做;评价中包含足够的过程或独立证据,以显示学生实际能做什么。