问答
当人工智能能够完成作业时,我们应当如何设计与促进异步在线课程?
本页是英文页面的机器翻译,尚未经母语者审校。
你已经做出了那个让这个问题无法回避的发现。在你的异步课程里,总有那么一项作业,它的初稿如今是免费的:一次讨论帖、一篇反思、一份案例分析、一套习题。而交上来的东西文笔流畅、切合主题,却完全不能告诉你学生实际上能做什么。你不在现场,看不到思考的过程,而过去能代替思考的那份作品,现在已经不再能代替它了。
那只是问题的一种版本:学生在凌晨两点决定让模型来写这个帖子。更难对付的版本已经出现了。在一门正在进行的本科心理学课程的三次演示中,自主智能体登录学习管理系统,阅读课程材料,在没有任何学生参与的情况下完成了无人监考的考核任务:两次测验分别用大约 12 分钟和不到 5 分钟完成,都得了 10/10 分;还有一次讨论帖,智能体挖掘了同伴的帖子,然后编造出一段可信的第一人称生活经历来回应他们。作者们汇集的更广泛记录涵盖了至少 15 次有据可查的智能体运行,涉及 Canvas、Moodle 与 Brightspace,使用了七种智能体工具。他们的论点是:这是一个评价效度问题,而不只是学术诚信问题,因为由智能体完成作业,使得“提交的作品是由被评价其学习的那个人完成的”这一假设不再成立(Hadjisolomou 与 El-Haddad,2026)。
要点是:异步课程没有任何在场性或过程可见性可以依靠,因此必须由设计把它们制造出来。把学习证据从最终成品上移开,保留一项必须由学生独立完成的测量,为你提供的人工智能设置护栏,并有意识地安排整个学期的节奏:自主学习进度这种形式默默假定、却极少真正教授自我调节能力。说得直白一些:不要再围绕“产出作品就等于证明了学习”这一假设来设计。这并不是主张禁用人工智能,也不是主张把任务做成人工智能无法完成的样子,而是要这样设计课程:让人工智能产出作品,仍然不足以完成学习。
简版要点
- 把思考本身作为交付物。 分阶段草稿、决策日志与自我解释比最终作品更难外包,而且它们能让你看到原本看不到的推理过程。
- 在那些用于认证能力的评价上保留一项独立完成的测量。 总体数据显示,在监考条件下,人工智能可及性对知识保持的影响会消失,这说明捷径发生在平台之外,并且取决于你设定的条件。
- 在风险程度足以支持时使用异步口试:即时给出的题目、限时且不能重录的录音、内嵌的评分量规、自动生成的文字稿。
- 为你提供的人工智能设置护栏。 在随机试验中,只给提示而不给答案的辅导消除了无约束访问所造成的考试扣分;不加约束地提供模型,才是损害学习的做法。
- 把支持嵌入课程之中,而不是链接到一个通用聊天机器人。在试验中,Open University 的内嵌助手让投入任务的时间翻倍;而同一所机构在使用外部的、与课程无关的聊天机器人时,结果正好相反。
- 有意识地安排学期节奏。 在模块截止日期前 7–8 天就已经存在预警信号,而自我调节与幸福感会随着评价任务的集中在整个学期中同步下降。因此,把截止日期分散开来是一项有可测量后果的设计决策,而不是排课上的细节。
- 节制地促进讨论,并有意识地安排其顺序。 LLM 促进者比人类促进者明显更急于介入,而那些确实能帮助学生在大论坛中导航的摘要工具,本身并不能阻止参与度下降。要的是明确表态的立场、一次挑战与一次有记录的重新考虑,而不是发帖数量。
- 先表态,再咨询。 先让学生给出自己的立场、预测、提纲或决策,然后再引入模型来提出批评;必须被学会的思考应当发生在打开工具之前。
- 给一项易受影响的作业配一个孪生任务。 保留课外完成的分析,并增加一项时间上紧邻的第二任务,用第一种任务无法被代劳的方式来评价同一项学习结果。
- 给人工智能一个明确的角色,并且能够把这句话说完:人工智能在这里的任务是 X,学生的任务是 Y。 如果 Y 很空,这项活动就还没有准备好。
判断这项评价究竟在测量什么
异步课程比面授课程更易受影响,原因并不是那里的学生更不诚实,而是这门课程的学习证据就是提交的作业,而如今产出这份作业的成本很低。有两项因果证据说明了代价有多大。
在一项约有 1,000 名高中数学学生参与的随机试验中,无约束的人工智能辅助把练习表现提高了 48%,同时把独立完成、闭卷考试的分数降低了 17%:从未获得访问权的学生成绩反而优于获得访问权的学生。关键的细节在于补救办法:一个经过护栏设置、只给提示而不给答案的辅导系统消除了这种损害。问题从来不是模型的存在,而是对它做什么缺少约束。
大规模的行为证据指向同一方向。在 3.2 百万次 ALEKS 交互中,ChatGPT 公开发布之后,在易受人工智能影响的问题上的学习时间下降了 26.9%,正确回答监考性保持测试题目的几率下降了 25%;而一旦实施监考,这一效应就消失了。这种消失对课程设计来说才是最要紧的部分:它把捷径定位在平台之外,并表明损害是你所设定条件的一种属性,而不是学习者品格的属性。
还有一种更微妙的失败需要针对性地设计。元认知上不一致的完成指的是一种状态:提交了正确、完整的作业,而心里知道自己从未真正理解。在实体课堂上,你也许能从学生的迟疑中察觉这一点;而在异步课程中,提交的作业是你唯一的渠道,一份正确的提交读起来就是成功。因此,评价设计是第一根杠杆,而不是最后的手段。
判断在没有教室可走进时什么才算证据
如果最终成品不再能证明思考,证据就必须来自过程,或者来自一个学生无法代劳的条件。
能暴露过程的材料是成本最低的改动,而且可以规模化:分阶段提交并强制附上中间决策日志、每个答案后附一段自我解释、对某一来源的标注、根据反馈修改过的计划。它们捕捉的是推理过程,而不是它的残留物,而且教师浏览它们的成本相对较低。
当能力必须被认证时,异步口试是最强的选项。Pentland、Lowenthal 与 Krier(2026)评估了基于网络的评价方式:题目即时下发,学生录制简短的、限时的、不能重新查看的摄像头回答,教师依照内嵌的评分量规打分,文字稿自动生成。在两项研究中,分别是一门中级会计试点课程与一门数据分析课程,学生在这些评价上的得分高于现场多项选择考试(第二项研究中达到显著,第一项研究呈正向但不显著的趋势),而不同形式之间中等程度的相关支持了聚合型效度。学生报告说自己的准备方式不同了,使用了更多主动学习策略,并认为这种形式与职业相关。它直接回应了异步的问题:思考是在学生自己选择的时间与地点现场进行的,而管理成本不会随班级规模而成比例上升。
一项独立完成的测量应当出现在任何以成绩认证知识的课程中。上面 ALEKS 的结果就是理由:当监考到位时,保持上的差距就消失了。要把这个环闭上,就告诉学生这个条件为什么存在,这套理由属于你撰写课程人工智能政策的内容。
决定的是顺序,而不只是作品
一旦最终成品成了不可靠的证据,工作发生的顺序就成了评价设计的一部分。
Brcic 与 Frljic(2026)把“放置位置”作为论证的中心:允许还是禁止是一种虚假的二分法,真正重要的设计问题是工具处在什么位置。他们收集的因果证据显示,仅凭位置不同,结果就会反转:同一个无约束的助手让高中学生在无辅助考试中大约差了 17%,而一旦改造为不给出答案,就不再造成损害;而一个精心设计的辅导系统则大约让学习效果翻倍。他们用于放置工具的六步框架(预热、探查、指引、附着、强化、检验)是一份可用的清单,而他们那句一行诊断值得记住:如果让人工智能进来会让任务显得毫不费力,那它就放错了位置。 放置不当的辅助不只是帮不上忙,它还留下一种学习的幻觉,而这种幻觉会在无辅助任务上崩塌,这正是元认知上不一致的完成所指的那种状态:提交的内容正确,却没有被理解。
对于异步课程来说,这可以转化为一个可以直接写进作业里的序列:
思考 → 表态 → 使用人工智能 → 批评 → 修改 → 解释。
学生先尝试完成智识工作,并对初步的解释、预测、提纲或决策表态。只有在这之后,模型才进入,用于提供反馈、替代方案、反驳或批评。然后学生评价它产出的东西,进行修改,并解释改变了什么以及为什么。表态这一步使其余环节变得可评价:没有表态的学生没有什么可修改,而由模型从头写成的作品根本不存在修改痕迹。
关于过度纠偏的一点提醒:收集每一次提示、强制记录每一次按键,只会带来工作量而没有证据。不如要求学生给出有意义的决策点:选择了哪些证据、拒绝了哪个替代方案、批评之后改变了什么,以及你真正会去阅读的那部分推理。
给易受影响的作业配一个孪生任务
另一种结构性选择,是不再在教学上有价值的任务与站得住脚的任务之间二选一。Roe、Perkins 与 Giray(2026)提出评价孪生任务:把易受人工智能影响的作业(一篇课外论文或分析)与第二项不那么易受影响的作业配成一对,二者评价相同的学习结果,时间安排上足够接近以便交叉验证,并且相互关联地评分。他们的映射覆盖 Messick 的六条效度证据线索,设计过程包含三个步骤:识别脆弱之处、对齐学习结果并选择孪生任务,然后开发把两者连接起来的评分方式。课外分析对延伸性探究的价值得以保留;它的孪生任务可以是一个简短的案例变式、对其中一项关键决策的解释,或者一次简短的口头或多媒体答辩。
与之相伴的问题是归属,而不是作者身份。Ebrahimzadeh、Shibani 与 Buckingham Shum认为,与生成式人工智能的合著会损害若干形式的效度证据,并提出合著诚信本身就可以作为一种效度证据来源;当学生提交自己并不理解的人工智能生成内容时,它就遭到破坏。为了规模化地、而不是靠人工查看地核查归属,他们报告了关于 AI Viva 的工作:一个运行混合式口试的对话式智能体,提出类型与复杂度可控的理解性问题,并由教育专家与评价专家深入验证过。这值得与“把所有考试都监考起来”相权衡:对自己推理的口头答辩可以规模化,而在房间里装监控做不到这一点,而且它产生的是关于理解的证据,而不是关于谁当时在房间里的证据。
决定课程内的人工智能被允许做什么
真正重要的比较并不是“有人工智能”与“没有人工智能”,而是内嵌的、受约束的人工智能与一个与课程无关的聊天机器人之间的比较,而两者产生的结果不同。
Open University 的 AIDA 助手是文献记录最充分的嵌入式案例:在 18 个月里开展了六项迭代式设计研究,涉及 498 名学生与 20 名教职员,而该机构服务于 200,000 多名学习者,遍布 50 多个国家。在一项探索性随机试验中,使用 AIDA 的学生投入的时间是对照组的两倍,在课程中访问的页面也更多,而且 96% 的人希望这一助手能用于自己的正式学习。专门打造并置于学习环境之中的工具,胜过了通用且外部的工具。
Lock、Arteaga 与 Johnson(2025)的综述(63 篇文献,覆盖 32 个国家)在设计条件之外又加上了社会条件:把 ChatGPT 与教师辅导结合使用的学生,比单独使用它的学生感知到更大的学习收益。助手要么补充教师,要么取代这种关系,而其中只有一种是课程设计。
有两点提醒值得认真对待。KhanMigo 的失败并不是技术问题:学习者根本没有和这个聊天机器人互动起来,而且收益的证据有限,这说明问题出在组织准备度与教学适切性上,而不是模型质量。教师这一侧也并非自动就绪:在一项关于南非教师培养的比较中,自我报告的、用于人工智能整合科学教学的 TPACK 在校园型大学为 64.0%,而在远程大学为 47.4%,两所机构的薄弱维度都是教学法知识(Online Teaching and Learning)。把助手部署到异步课程里,并不会训练那些必须判断其输出的人。
决定异步讨论究竟如何被促进
讨论论坛正是异步课程要么建立社区、要么悄悄变成作业投递箱的地方。有两点发现应当影响你在那里自动化的内容。
第一,难点在于时机,而不在于识别话题。 Tsirmpas 及其同事构建了 PEFK 语料库以比较各种促进类数据集,随后与人类专家促进者和 LLM 评判者一起,开展了第一次关于促进时机的调查。人类在介入时更谨慎,而 LLM 则过于急切。两者在判断促进不需要时都比判断需要时更确定。经过训练的判别模型优于各种 LLM 方案,但即便如此,既有数据集仍然限制了表现的上限。实用的解读是:不要把自主管理交给智能体;如果你确实在讨论中使用人工智能,就把它配置成默认保持安静。
第二,人工智能能帮助学生浏览论坛,却不能让他们参与进来。 在三轮迭代中,针对 128 名大学生,Hao 与 Cukurova(2026)发现,人工智能生成的讨论摘要通过降低找到有意义帖子的成本,扩大了学生对同伴贡献的接触面,并强化了网络连接性,也就是社会资本理论所称的桥接型弱关系。但它们并没有阻止浏览活动在整个课程期间下降。摘要是一种用于导航的脚手架,而不是产生参与的替代品。
缓解这一点的结构是一个序列,而不是一条接续的帖子链:立场 → 挑战 → 重新考虑。 学生先对扎根于课程材料的解释表态,然后遇到另一种视角、反例或批评,接着说明自己的推理是否以及如何发生变化。你要评的是思想之间的移动,而不是帖子的数量;提交一个帖子再加两条回复已经不再能证明这一点,因为上面提到的第三次演示中,智能体正是挖掘同伴的帖子并按需编造同学的生活经历。
由于智能体模仿的是表层行为,教师自己的贡献就成了稀缺资源。机械地回复几十条单独的帖子,是教学存在感中价值最低的形式;而在讨论之上进行综合,则是价值最高的形式:你的分析中反复出现三种假设;你们中有几个人对这份证据的解读不同;这个论证一直很有说服力,直到我们引入这个反例。 这是统筹编排,而不是生产消息,而这正是本领域文献中没有任何智能体能承担的部分。
两者之下的框架性问题是问责。Ba、Gašević、Lim 与 Anderson(2026)认为,生成式人工智能动摇了探究社区的一个假设:存在性指标究竟能否归因于人类。他们把 GenAI 视为一种认识论条件,把各种存在性视为社会技术性的成就,其与探究质量的关系取决于人的问责落在何处。对异步课程而言,设计上的启示很具体:在每一次交流中决定并说明谁对什么负责,而不是假定只要论坛存在,存在感就会自然产生。
决定学生在没有教室可走进的情况下如何跟上进度
自主学习进度的形式假定学生具备自我调节能力,却很少去教它。关于究竟哪些行为与坚持完成任务真正相关的证据,出乎意料地实用。
研究者对 530 名大学生使用关联规则挖掘与聚类分析,Shi 等人(2026)发现自我调节学习行为,即目标设定、环境安排与时间管理,与低数字分心状况最一致地共现,此外还有学习者与教师、学习者与内容的投入以及技术能力。值得注意的是,依赖同伴求助与学习者之间的互动,在低分心剖面中反而出现得更少。在再设计一项小组活动之前,先把学习环境与日程安排好。
自我调节也不是一种你可以随意假定或否定的固定特质。在一整学期、75 名一年级学生参与的跟踪中,Song 等人(2026)发现自我调节学习既表现为稳定的能力倾向,也表现为波动的状态:个体基线保持稳定,而元认知知识与幸福感在整个学期中系统性地下降,其驱动力是诸如重要评价截止日期这样的课程要求。把截止日期集中在一起也许是一种高效的行政选择,但它同时也是对这种形式所依赖的自我调节能力的一笔可测量的税负。
干预的时间窗口是可以知道的。Zhang、Jeffries 与 Koprinska(2025)表明,对内容交互日志进行可解释的机器学习,可以预测模块层面的进展,并在大规模在线编程课程中提前最多 7–8 天(相对于模块截止日期)标记出辍学结果。这足以向某个具体学生发出有针对性的提醒,也比到评分时才发现失败要好。对成人学习者与远程学习者来说,AI-ALOE 的设计准则又增加了一条最重要的限制:移动端访问、离线可用能力以及真正的异步可及性,因为这些学习者只能利用其他事务之间的碎片时间学习。
作为设计者,人工智能能从你手上接过什么
有两种用途背后有合理的证据支持,而且两者针对的都是教师的工作量,而不是学习者的思考。
生产成本。 MAIC把 MOOC 那种“一个视频给 N 名学生”的广播模式重新表述为“为一名学生配备 N 个智能体”,在共享的模型基础上使用专门的教师、助手、同学与分析者智能体。作者报告说,每门 MOOC 的课程生产成本从大约 $25,000 与 60 小时压缩到不到 $2 与 30 分钟,并在清华大学的两门课程中试点,涉及 100,000+ 条来自 500 多名学生的学习记录,随后以开源项目 OpenMAIC 发布。个性化媒体在资源层面是同一个思路:在一门大型在线课程中,Tomlinson 等人(2026)发现学生更喜欢人工智能生成的个性化视频,而不是非个性化的人录视频,而且个性化效应超过了人们对真人出镜的重视。
论坛导航。 上面提到的摘要脚手架降低了找到优质贡献内容的成本,也没有把做摘要的工作压在教师身上。
哪些不要自动化。 判断一段文字是否属于学生自己的思考、判断一次讨论是否需要介入,以及校准难度,这些任务在证据看来要么不可靠,要么涉及问责。生成的材料在被赋予学分之前也需要经过教学法审查:生产成本低并不等于设计可靠。
给人工智能一个明确的角色,然后检查学生是否仍然有自己的角色
“学生可以使用人工智能”是一个过于宽泛的规格,无法据此设计。把角色明确说出来,才让一项活动变得可设计,而不同角色对存在感有不同后果:一项关于市场营销教育中生成式人工智能的研究区分了导师、队友与工具,显示它们对教学存在、社会存在与认知存在的影响各不相同,并列出那些耳熟能详的伦理风险:数据隐私、抄袭、依赖与评价公平(市场营销教育中的 GenAI)。同一个模型可以在作业之前充当苏格拉底式提问者,在初稿之后充当批评者,在案例分析中充当模拟的利益相关方,充当必须被驳倒的论辩对手,在练习中充当给提示的导师,或者只在实质性推理已经存在之后才作为编辑介入。这些都是不同的活动,把它们的差别抹掉,“允许使用人工智能”就会悄悄变成“什么都没有设计”。
脚手架提供了检验标准:支持应当帮助学习者完成他们尚且无法独自完成的事,并随着能力的发展逐步撤除。一个不断提供完整答案的模型不是脚手架,它是在代替完成这项任务。因此,对每一项借助人工智能的活动,设计者都应当能够毫不犹豫地把这句话说完:
人工智能在这里的任务是 ______,而学生的任务是 ________。
如果第二个空里几乎没有什么有意义的思考,那这项活动需要的是重新设计,而不是更严格的政策。
教评价,而不只是教操作
人工智能素养并不只是操作聊天机器人的能力;它包括批判性评估、元认知判断,以及知道何时根本不该使用这个工具;本知识库一致表明,自我报告的自信是已展示能力的糟糕代理指标。这指向一项任何异步课程都能立即采用的改变:有时候由你自己把人工智能的输出交给学生。 交出两个相互竞争的回答,问哪个更强、为什么。要求找出最弱的论断、缺失的假设、无法核实的来源、看似合理却终究错误的解释。问什么证据会让他们改变想法。
这样一框定,被评价的能力就不再只是这个学生能否产出一个答案?,而是这个学生能否辨认一个答案是否值得信任?,这更接近学科实际要求的东西,也远更难被代劳。具体技巧存在于核查实践与人工智能素养材料之中;这里要紧的是把评价放进被评分的任务里,而不是把它留作一句建议。
你会听到的反对意见
“这些人都是自己选择异步课程的成年人。如果他们让人工智能来写,那是他们自己的决定。” 如果这门课程不认证任何东西,这种选择论还能成立。但它认证。ALEKS 的证据表明,捷径制造出的能力表象无法通过监考性的检验,而代价会在之后落到学生身上:在下一门课程里、在执业资格考试中,或者在工作中。这里还有一层公平问题:最可能把认知工作卸载出去的学习者,往往正是时间最少的人,而这恰恰是异步课程存在的意义所服务的群体。
“检测才是答案。” 检测本身存在争议,而上面关于监考的结果说明了为什么设计胜过管控:损害是在条件改变时消失的,而不是在管控加强时消失的。检测还带来误判成本,并把教学变成一场军备竞赛。不如重新设计任务,并保留一项独立完成的测量,参见我怎样才能减少课程中的人工智能作弊?与我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?。
“远程不可能有教学存在感,所以异步本质上更差。” 异步课程中的存在感是靠设计出来的,而不是自然蕴含的,上面提到的探究社区再概念化指出,在 GenAI 时代,它的指标是社会技术性的成就。AIDA 试验是一个有用的反例:在一个完全没有同步会面的课程中,内嵌的生成式支持让投入任务的时间翻倍。
“监考就是监视,我不会采用。” 这是一个站得住脚的立场,而且它并不会让你无路可走。上面描述的过程暴露型材料、异步口试、自我解释与 AI Viva,都能在不必监控任何人房间的情况下捕捉推理。如果你确实采用监考条件,就在大纲里说明,解释其中的理由,并把它限定在那些用于认证能力的评价上。
“那就把所有东西都改成同步并监考。” 许多学生选择异步学习,恰恰是因为他们有工作、照护责任、残障或地理上的限制,使同步出勤变得困难;而检测本身也有公平代价:那些标记非母语写作者的工具有时会不成比例地产生误判,从而惩罚诚实的作业(人工智能检测)。比例适当的替代方案是在原本灵活的课程中安排少量核查时刻:一段简短的录音解释、一项个性化的应用、对教师选定问题的回答、一条带注释的决策轨迹、一次低风险的独立检查。核查应当提高你证据的效度,而不是取消那种让这种课程形式值得提供的灵活性。
证据没有解决什么
关于远程教育中人工智能的系统综述(56 篇文章,2020–2025 年)涵盖个性化(24 项研究)、评价与反馈(19 项)、人机互动(17 项)以及治理与公平,其结论是这一证据基础是短期且横断面的,纵向研究很少。关于在线学习中人工智能与学生投入的综述(24 项研究)只限于一个数据库,只讨论投入,并且明确把同步与异步情境混在一起,因此其结论不应被当作针对异步课程的结论来读。异步口试依据的是两门课程中的两项研究。MAIC 只是一次试点。促进时机数据集即便配上训练过的判别模型,也会限制表现上限。而且这里没有任何研究对异步学习者群体追踪足够长的时间,以显示重新设计的评价是否产生了持久的学习,而不只是产生了更好的学习证据。把这一切看作强到足以改变你的下一门课程,又薄到不足以支撑一项政策主张。
本周可以做的事
十分钟内: 挑出你风险最高的那项评价,增加一个由学生独立完成的条件。告诉他们为什么要有这一条。
在下一项作业发出去之前: 拿出那项现在可以由人工智能从头做到尾的作业,把它改写为以过程为作品的版本:一份决策日志、一份分阶段草稿、一段自我解释、两次尝试的对比。如果这项任务可以在完全不需要这些推理的情况下完成,那这些推理本来就不曾被要求。
这一学期: 把一项重要评价改为带内嵌评分量规的异步口头答辩;在大纲中按任务分别设定人工智能使用许可,并把它放在学生真正会读的位置;把重要截止日期分散开而不是集中在一起;并开启一个截止日期前 7–8 天的窗口,用来联系交互数据已经沉寂下来的学生。
用三个问题来审视你最薄弱的作业。 (1) 一个学生如果不理解材料,人工智能系统能否完成这项活动?(2) 这里应当由哪种认知活动产生学习?(3) 什么证据能表明学生确实进行了那项认知活动?如果第一个答案是肯定的,而后两个问题难以回答,那么问题出在学习设计上,而不是人工智能政策上,而且无论政策怎么措辞都无法解决它。
目标并不是打造一门人工智能无法参与的课程,而是一门人工智能可以参与、却不会取代这门课程旨在产生的学习的课程。
接下来去哪里: 课程层面的规则属于我如何撰写课程人工智能政策并向学生说明?;评价的重建参见我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?;其下的依赖问题参见我怎样才能让学生不过度依赖人工智能?;教师工作量以及人工智能现实上能减轻哪些负担,参见作为教师,人工智能如何帮我节省时间?;而在设计层面把人工智能融入学习体验的观点,参见应当如何把人工智能设计进学习体验之中?。