问答
作为教师,人工智能如何帮我节省时间?
本页是英文页面的机器翻译,尚未经母语者审校。
人工智能最适合承担可重复、风险较低的起草与转换类工作,而涉及重要后果的教育判断仍应留给教师。 有成效的用途包括教学材料的初稿、示例、讨论问题、形成性测验、替代性解释、评分量规、反馈建议、摘要、材料的分层版本,以及日常行政用语。其关键机制是重新分配,而不是简单削减:人工智能释放出时间,教师再把这些时间投向价值更高的教学工作,而同样的时间会换来更多一对一的师生互动、更深入的反馈和更高阶的教学。
证据表明了些什么
备课:大约节省 30% 的时间,质量得以保持
文章《人工智能正在如何改变教学工作流程》总结了一项涉及 259 名科学教师的英国随机试验:使用 ChatGPT 的教师在备课上花费的时间约为对照组的 69%,也就是大约减少了 31%,而根据盲评专家评审,材料质量没有可察觉的损失。教师普遍把节省下来的时间重新分配到其他教学工作(备课规划、评分、面向学生的活动)上,而不是简单地取消工作。一份配套数据集包含来自 15,000 多名教育工作者的 104,000 多条消息,显示教师的提示平均一次涉及 1.7 个类别(例如一个请求同时包含教案、分层设计和形成性测验),因此人工智能常常会主动呈现出教师原本不必专门要求的教学要素。
人工智能在哪些方面质量可靠,在哪些方面不可靠
人工智能生成的材料并不在各方面都与人工作品一样好;其价值取决于任务和层级:
- 表现较强: 课堂小结与出口条(人工智能版本在 59.7% 的情况下比专业设计更受青睐)、高中阶段内容(59.2%),以及超出你专业范围的教学(当你对学科不太有把握时,节省的时间更多)。
- 表现较弱: 小学阶段材料(考虑发展适宜性时,约 65% 的情况下人类版本更受青睐),以及针对性的多语言/Special Education 支架(人工智能“中立”,但缺乏细致分寸)。
因此,最安全、价值最高的用途是结构清晰、规格明确、你可以审阅的材料,而不是那些细颗粒度的发展性或文化支架内容,因为后者你无论如何都得重做。
反馈与评分:重新分配的收益确实存在
一项在巴西开展的大规模实验覆盖 178 所学校、约 19,000 名高中毕业年级学生,检验了人工智能自动化的作文反馈:
- 人工智能反馈带来的学习增益与人工评分者完全相同,而人工评分每篇作文约花费 $0.85,却没有带来任何增量收益。
- 使用人工智能的课堂中,学生与教师关于写作的一对一交谈增加了约 35%,写的作文也多了 30%。
- 教师在家工作的时间下降了 20%;把时间评为“非常不够用”的教师比例从 23% 降到 9%。
- 最大的学习增益出现在最复杂的写作任务上,而这恰恰是人工智能最不擅长评估的部分,因为人工智能让教师得以专注于更高阶的教学。
需要注意的前提: 处于最低四分位的学生没有出现改善,仅凭节省出来的时间对最需要支持的学生来说还不够,因此节省必须与有意识的、公平的重新分配相配合。
一个反向参照:效率提升的错觉
节省的时间很容易被高估,身处其中的教师也不例外。在三项预注册研究(N = 2,691)中,人们系统性地低估了自己实际使用人工智能的频率,并高估了它节省的时间与精力,即使客观测量显示并无差异,他们仍相信任务变得更快、更容易;在一次会话中先前使用过人工智能会预测后续的使用,从而在自我强化的循环中固化这种误判。实践上的启示是:把Generative AI节省下来的时间当作一项需要与实际工作流程数据核对的论断,而不是凭感觉接受,并培养元认知校准能力,使自己能察觉任务何时真正加快了。不过,并非每一种感知到的节省都是幻觉:一项针对 13 名高等教育教师的被试内研究发现,可使用人工智能大幅降低了学习设计所感知到的认知负荷(中位数从 6.33 降至 3.33,p = .004),但叠加在上面的提示词培训并没有进一步改善设计质量,这提醒我们节省下来的精力与获得的能力并不是一回事。
自动化评分:有前景,但无法移植
自动化评分是最有力的节省时间主张,也是最需要谨慎对待的一项。OpRaise 基准测试用 761 篇真实的本科心理学作文检验了三款前沿模型,这些作文来自英国三所大学的 125 名学生,每款模型使用 27 种提示配置。与人工学位等级评定的吻合度因院校而异,介于 35% 到 65% 之间;人工智能给出的分数向中间压缩,因此最强和最弱的作文被评得最不准确;各模型彼此之间的一致程度远高于它们与人工评分者的一致程度;作者的核心发现是,在一种情境中收集到的证据无法迁移到另一种情境。自动化作文评分或许能节省时间,但只有那些准备好在本地对其进行验证、并把最终决定权保留在人类手中的机构才应依赖它。关于评估设计方面的对应讨论,参见我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?。
教师愿意委托什么,不愿委托什么
一项与六名中学教师共同开展的参与式设计研究发现,他们把生成式人工智能设计成一个**“有边界的专家”:在严格界定的领域内、在人类监督之下才行得通。他们欢迎人工智能在呈现内容、提供练习题以及给出形成性Feedback方面提供帮助,但拒绝把目标设定或终结性Assessment委托出去**,并坚持在模棱两可的情形下由教师来做最终决定。这条边界标志着真正的节省时间到此为止、不可接受的专业判断转移由此开始,它对你即将交出去的每一项任务都是一个有用的检验,也是把人类监督明确保留的理由。
用人工智能节省时间的具体方式
- 起草教学材料:幻灯片、讲义、练习单的初稿,或一串示例,之后由你审阅和编辑。
- 根据你自己的笔记或阅读材料生成讨论问题、形成性测验和出口条。
- 创作替代性解释:用不同的层次、不同的比喻,或面向不同的受众重新讲解一个概念。
- 起草评分量规和反馈建议:人工智能可以提出量规标准,或给出一版反馈评语供你个性化调整;人工智能反馈质量这一综述提醒,速度与数量并不保证有用,因此教学判断仍应由你把关。
- 做摘要与分层:把长篇材料浓缩成学习指南,或针对不同的准备程度为同一任务制作分层版本(要仔细审查多语言与特殊教育方面的细微差别)。
- 撰写日常行政用语:通知、课程大纲的固定条款、套用信函和往来邮件。
需要注意的地方
- 不要以为这个具体幅度可以直接迁移到高校。 31% 这个数字来自 K–12 阶段的科学教学;更稳妥的一般性经验是:把人工智能用于第一遍处理,把人的时间花在学科判断、师生关系、对学生思维的解读、反馈优先级的取舍,以及高风险决策最要紧的地方。
- 提示词缺口: 研究中的大多数教师没有用后续提示反复迭代,而是拿了第一次结果再手工修改。在AI Literacy和提示词打磨上投入一点时间,会体现在输出质量上。
- 评估陷阱: 教育者与人工智能的对话中近一半涉及评估,但有些人要求评分时并未指明量规或标准。缺乏引导的人工智能评估会带来不一致和偏见的风险,因此要保留人类监督。
- 公平差距: 只有当地节省的时间不是以牺牲多语言学习者或残障学生为代价,并且资源不足的教师用它来提升教学实践而不是仅仅勉强跟上进度时,节省时间才具有净正面价值。