问答
开发有效的人工智能导师有哪些最佳实践?
本页是英文页面的机器翻译,尚未经母语者审校。
一个有效的 AI 导师应当被设计成一个学习系统,而不是一个生成答案的聊天机器人。整个知识库中最突出的主题是:教学结构(诊断、脚手架、反馈、学习者能动性与评价)至少与底层模型同样重要。下面两个完整的示例(一个微积分导师和一个写作教练)展示了同一套核心架构如何必须依照学科对学习者的要求来塑造。
1. 从明确的学习目标出发,并界定学习者要做什么
在选择模型之前,先明确:
- 学习者在之后应当知道什么、能够做什么。
- 他们必须亲自完成哪些认知工作。
- 导师可以协助哪些部分。
一个以“把题做完”为优化目标的导师,很容易破坏一个以“学会解题”为优化目标的导师。Intelligent Tutoring概念强调,效果取决于教学设计,而非仅仅取决于模型能力。
2. 先诊断,再给出方案
维护一个学习者模型,其依据包括所展现的知识、Misconceptions about AI、近期的尝试、求助行为,以及在适当情况下的信心。根据这些证据来调整难度与协助,而不是仅仅对学习者最近一条提示作出反应。要谨慎对待让 Large Language Models (LLMs) 自行完成诊断这件事:基准测试发现,LLM 导师能够识别明显正确的推理,却有时会否定合理的替代解法,或接受不正确的推理。对于后果重大的领域,一种有用的架构是结构化诊断加灵活的 LLM 对话。参见确认了正确,却错过了其余。
3. 使用提示阶梯,而不是立刻给出解答
一个有用的教学序列是:要求学习者先尝试,探查其推理,给一点小线索,给出更强的概念性提示,演示一个部分步骤,只在确有必要时提供完整解法,然后要求学习者独立解释或应用这一思路。支持应当随能力提升而逐渐撤除。这是Scaffolding概念的核心。一项关键的现场实验发现,不加防护的 GPT 界面提高了有辅助的数学表现,却降低了之后无辅助考试的表现,而一个提供提示的导师基本消除了这种学习损失;参见不带防护栏的生成式人工智能可能损害学习。
一项规模更大的随机现场实验在基于掌握式学习的练习平台上招募了 6,000 多名初中生,更细致地发现了同样的特征:被分配到人工智能支持组的学生进度更慢、尝试的题目更少,但答得更准确,而且(最清晰的机制)在犯错之后下一次作答的正确率有所提高,需要更少的尝试就能回到正确答案。这是一种有益的放慢,而不是抓取答案,也正是提示阶梯本应产生的行为。同一项研究还提供了一个关于替代指标的警示:要求连续答对三题会大幅提高平台所定义的掌握程度,却没能在随后一周的延迟测验中带来可检测的收益;延迟测验中最强的证据只出现在人工智能被放在掌握式学习流程内部(系数 0.085)而非作为独立入口的地方。参见让人工智能辅导产生实效。
4. 让反馈具体、即时、可操作,并与推理相关联
要避免只说“正确”“错误”或“做得不错”的反馈。导师应当指明所涉及的推理步骤,说明需要重新考虑什么,给学习者一个具体可做的下一步,并在合适的时候先要求学习者预测或解释,再展示反馈。本知识库把Feedback视为一个完整的提供与吸纳循环:只有当学生理解它并据其行动时,反馈才能支持学习。
5. 让事实性内容有据可依,而不是信任 LLM 的记忆
针对可信材料采用检索增强生成,例如教师认可的教材、课程笔记、已解示例、政策文件与课程资源,并在有用时公开引文或出处。对于答案可以被正式检验的领域,再加入确定性工具,例如计算器、符号数学系统、代码执行、知识图谱、基于规则的校验器,以及领域专用求解器。RAG 可以降低幻觉风险,但并不能消除它;参见检索增强生成。
6. 为元认知与学习者能动性而设计
要经常要求学习者生成、选择、论证、评价或反思。一个有用的设计原则是学习者优先,其次人工智能,再回到学习者。长期目标是让学习者把导师的提问方式与Problem Solving策略内化,而不是依赖导师。参见学习者能动性与Scaffolding。
7. 把教学安全与一般聊天机器人的安全区别对待
对教育类导师的安全测试,不应只包括毒性内容与抵御越狱的能力。还要测试答案泄露、强化错误概念、过度附和或谄媚、难度不当、认知卸载、有偏见的对待、学习者能动性的丧失、教学偏移,以及对错误解释的过度自信。导师应当友善但正确,包括在学习者坚持某个错误概念的时候;测试也应当涉及较长的对话,因为教学上的失败可能在多轮互动中累积。参见Pedagogical Safety与AI 导师的安全与教学性伤害。
8. 把隐私、无障碍与公平内建到架构之中
只收集教学上必需的学习者数据。在使用持久记忆或学习者建模的地方,要使其目的透明,给学习者适当的控制权,保护敏感信息,制定保留政策,并在后果重大的情形中提供教师或人类监督。要跨越语言背景、能力水平、文化情境、Accessibility需求,以及不同程度的先前知识与人工智能经验,审查导师的行为。不要把熟练的提示当成获得良好教学的前提;导师本身应当帮助学习者提出有益的问题。
9. 测量学习,而不只是聊天机器人的质量
回答准确率、对话长度、学生偏好、满意度、任务完成度与投入等指标,单靠它们本身是不够的。应当评价无辅助的表现、延迟保持、向新问题的迁移、错误概念的纠正、学习者的独立性、反馈的吸纳程度,以及不同学习者群体之间的差异效应。关键问题是:在导师被移除之后,学习者能否成功地完成任务。参见AI Ed Evaluation与缺失的评价维度。
近来的两项研究让这条规则在反对自我报告与短时间跨度方面更加明确。一项针对 38 名编程初学者的试点研究发现,生成式人工智能的使用与感知到的学习之间存在很强的关联(rs=0.802,p<0.001),而在没有教师支持时自主进步的指标得分最低:作者警告说,这一差距会制造能力的错觉与认知债务,而它恰恰是满意度指标所奖励的那种差距。参见作为非正式认知导师的生成式人工智能。
更根本的是,大多数评价都停在协助结束的那一刻。认知消退动态指出了那个未被测量的撤除后时段,并把四种可能的结果形式化:弹性回升、部分平台期、潜在脚手架与过度恢复;其消退曲线模型的参数包括恢复时间常数、恢复完整度,以及一个把重新学习所需的努力与最初学习努力相比较的滞后指数。由于可逆性决定严重程度,该框架主张应当依据恢复曲线来安排定期、无辅助的练习,而不是在道德层面争论。因此,导师评价方案应当包含一个撤除阶段,而不只是即时的后测。参见关于短暂协助会压低之后无辅助表现的那项随机证据。
10. 让教师或领域专家留在质量保障的循环之中
在部署之前,让教育者测试真实的学习者画像、常见错误概念、边界情形、对抗性提示、含混的回答,以及较长的辅导对话。记录教学上的失败,并用它们来修订系统提示、辅导策略、知识来源、Guardrails、学习者模型规则与模型选择。人类的监督仍然重要,因为一段流畅的辅导回复仍可能在教学上不恰当或不正确。
Lee 对 29 项 K-12 研究的系统综述展示了这种监督实际由什么构成,以及它在何处失效。教师的干预是一个反复出现的四阶段循环:监控、判断、干预与统筹;人工智能警报、仪表盘与自动评分“并不会自动转化为教学行动”;而教师最主要的策略是教学转译,即选择、修改、补充、概括或删除聊天机器人的反馈,而不是原样传递。由此得出两条设计上的警示。更多的人工智能信息并不更好:持续输出诊断的系统会让教师过载,并把注意力从他们自己的观察上拉走;因此要优先呈现值得据以行动的内容,并让它易于解读,同时以教师可以接受、修改、推迟或拒绝的形式给出建议。更多的教师支持也不更好:为了让学生独立完成任务而推迟干预,本身就是一种专业能力;而结构性条件(审阅数据的时间、班级规模、能否实际接触到需要帮助的小组)是干预的一部分,而不是背景性的后勤事务。
一种有用的 AI 导师架构
一个稳健的生产架构可以表示为:学习目标 → 学习者证据/学习者模型 → 教学策略 → 有依据且经过验证的内容 → 对话生成 → 学习者回应 → 更新后的学习者模型(回到起点循环)。安全、隐私、无障碍、教师监督与评价应当环绕整个循环。
最重要的成功标准
最重要的开发指标不是“人工智能把问题解决了吗”,而是**“在与人工智能交互之后,学习者能否独立解决一个类似的问题?”** 支持这一原则的证据在数学与编程等结构化的学习领域最为有力;能否推广到更开放的问题领域仍不那么确定,因此针对具体领域的评价至关重要。
关于导师在课程序列中而不是孤立存在时应当处于什么位置,参见应当如何把人工智能设计进学习体验之中?;关于导师必须满足的软件层面设计规则,参见设计有效的教育人工智能软件有哪些最佳实践与技巧?;关于如何评价由此产生的干预,参见教师可以用哪些测量工具与研究方法去评价与人工智能相关的干预?。
示例 1:设计一个微积分 AI 导师
设想一个大学第一学期微积分导师。它的目标应当是提高学生在导师被移除后能够独立解决和解释的内容,而不是最大化正确完成的题目数量。数学辅导尤其容易受到过度搭建脚手架、过早使用提示以及对学生推理的错误诊断的影响。参见Math Education、当帮助反而无益、抓住正确答案陷阱与Scaffolding。
学习目标。 导师可以维护一张概念图(函数与图像 → 变化率 → 极限 → 作为极限的导数 → 求导法则 → 应用 → 反导数 → 定积分 → 基本定理)。对于每个概念,它都应当区分几种不同的掌握程度。例如,“掌握导数”不应只意味着算出正确的导数;它还可以包括判断何时适合使用导数、把它解释为瞬时变化率、选择正确的法则、执行运算步骤、说明为何恰当、检查结果是否合理,以及把它应用到一个不熟悉的问题上。这有助于防止正确答案陷阱,即学习者通过有缺陷的推理得到了正确答案。
系统架构。 一个实用的六层设计:课程材料加教师政策 → 检索/RAG 层 →(问题引擎 → 学习者模型)与(符号验证器 → 诊断引擎)→ 教学策略 → 对话式 LLM → 学生 → 更新后的学习者模型。
- 课程依据层: 从教师认可的材料(教材章节、讲义、已解示例、术语、被认可的方法、记号、作业规则)中检索,使导师永远不会引入数学上成立却不适合该课程的技巧。
- 数学验证层: 使用计算机代数系统验证代数等价性、导数、积分、方程的解、临界点与数值近似;由 LLM 负责讲解与对话,让确定性系统负责数学上的检查。
- 学习者模型层: 维护每个概念的估计(例如 极限:发展中,幂法则:已掌握,乘积法则:发展中,链式法则:尚未展现),以及带有证据与置信度的错误概念假设。人工智能应当把错误概念当作假设,而不是既定事实,因为 LLM 可能臆造证据或错误地推断出错误概念;因此需要一个检测 → 验证 → 回应的过程。
一次辅导互动。 对于求 的导数,传统的聊天机器人可能会立刻给出答案。而一个以学习为导向的导师会在内部先做推理:学生分别对两个组成部分求了导,但看起来是把它们的导数相乘了(可能是把乘积法则当成 的错误概念);因此它先提出一个诊断性问题(“两个函数相乘时,你用哪条法则”),然后让学生用符号写出乘积法则,再设出 与 ,只有在学生自己重建了最终表达式之后才加以验证。
分级帮助策略。 协助可以沿着一架层级阶梯调整:独立尝试 → 元认知提问 → 概念性提示 → 指出相关法则 → 设置问题的一部分 → 演示中间的解题步骤 → 给出完整解法 → 学生解释 → 学生独立解决一个迁移问题。看过完整解法并不代表掌握了,所以在给予大量帮助之后,导师应当让学习者在无辅助的情况下尝试一个类似的问题。
避免无效的提示使用。 界面不应把无限次提示变成毫无摩擦的捷径,因为过早索取提示与浅尝辄止地阅读提示都与较低的学习收益相关。与其采用 [提示][提示][提示][显示答案],系统可以问“你试过什么”以及“哪一部分卡住了”(选择法则、列出方程、做代数运算、理解概念、其他),然后提供有针对性的协助。
支持概念性的微积分。 导师应当把符号运算与多种表征联系起来(公式、图像、表格、文字解释、物理上的变化率情境),以区分程序性的流利与概念性的理解。
教师仪表盘。 系统应当呈现汇总后的证据,而不是不透明的人工智能判断,例如“乘积法则:62% 展现掌握;常见模式:18% 遗漏一项,11% 把导数相乘”,并把个别诊断作为有证据支持的假设来呈现。
评价方案。 测量使用导师期间的表现、在没有它时解决类似问题的表现、延迟保持、向不熟悉问题的迁移、概念性解释质量、错误概念的纠正、恰当与过早的求助、答案泄露、诊断的假阳性/假阴性率,以及差异化的结果。关键的比较是有导师时的表现与之后没有导师时的表现:一个在有辅助时从 60% 升到 95%、但独立完成时仍停在 60% 的学生,并没有得到有效的辅导。
示例 2:设计一个 AI 写作教练
AI 写作教练需要不同的设计,因为写作没有唯一客观正确的答案。目标是帮助学习者在规划、起草、评价与修改自己的写作方面变得更好。本知识库把写作界定为一个认知、社会与修辞的过程,这意味着人工智能写作系统可以支持学习,却也可能恰好消除掉作业本要培养的那种思考。参见Writing、从规划到修改、是教练,不是拐杖与Feedback。
学习目标。 教练的学习者模型可以追踪论证(论点的具体程度、主张与证据的一致、反论)、组织(段落重点、逻辑推进、过渡)、证据(来源相关性、证据整合、解释)、修改(整体与句子层面的修改、反馈评价)以及风格(句子清晰度、语法、作者声音),也就是追踪写作能力,而不只是一个作文分数。
让教练以作业为依据。 检索作业说明、教师评分量规、课程阅读材料、引用要求、文体惯例、教师给出的示例以及人工智能使用政策,使反馈能够指向真实的作业(“你老师的评分量规要求你把每一条主要主张都与至少两份课程阅读材料中的证据联系起来”),而不是编造通用的期望。
区别对待写作的不同阶段。 人工智能在不同阶段的介入对“主人翁感”的影响不同:规划阶段的协助对主人翁感的削弱小于起草阶段的协助,而由人工智能生成草稿造成的削弱最大。因此教练可以对各阶段给出不同的许可:在规划阶段,它可以提问、比较立场、挑战假设、批评提纲,但不生成整个论证;在起草阶段,先由学习者写出文字(教练帮助其发展,而不是接管);在修改阶段,教练可以指出不清晰的主张、点出缺失的证据、检查证据是否支持某项主张、发现组织上的问题,并把草稿与评分量规对照,也就是先诊断,再重写;在编辑阶段(修改之后),它可以支持语法、标点、简洁性与引用格式。
示例互动。 对于一篇讨论是否应强制开设在线课程的文章,通用系统可能会把学生的段落改写成精致的文字,从而替学生完成了智力工作。写作教练则不同:它会指出哪些地方有效,点出主要问题(这一段给出了理由,却没有解释这些理由为何足以支持一项全校性的要求),提出一个修改问题,并要求学生用自己的话补全一句话,从而把论证的建构留给学习者。
反馈应当有优先级。 每一轮反馈可以包含一处值得保留的优点、一个影响最大的问题、一个需要写作者判断的问题,以及一个具体的修改目标,而不是用几十条评论把学习者淹没。
让学生评价人工智能反馈。 反馈素养本身就是一项学习目标;教练应当定期询问学习者是否同意某项建议以及为什么,并允许学习者拒绝人工智能的反馈,从而培养**评价性判断**,而不是服从。
保留作者的声音。 教练应当区分错误、清晰度问题、修辞选择与风格偏好,并且不应当自动“纠正”后两者,否则就有把写作同质化、趋同于模型偏好的那种风格的风险,对多语写作者与非标准修辞风格尤其如此。
基于修改历史的学习者模型。 系统不必只存储最终的文章,而可以从学生的修改中学习(例如反复出现“引入了证据但没有加以解释”的模式,并在多篇文章中逐渐改善),依据学习的证据来调整。
教师的参与。 教师掌控评分量规、作业目标、允许的人工智能协助形式、资料来源、引用期望、是否允许生成式起草,以及何时需要人工审核。教师仪表盘可以显示班级层面的模式(例如 41% 的学生在主张与证据的连接上需要支持),作为Formative Assessment信号。
评价写作教练。 测量有人工智能协助以及之后无辅助时写作的质量、识别不熟悉文章中的弱点的能力、修改质量、反馈的吸纳、解释修改的能力、学生的主人翁感、对人工智能文字的依赖、声音的保留、跨方言/多语写作者/群体的偏见、与教师判断的一致性,以及延迟迁移。一个有启发性的实验会比较三个组:独立写作组、由人工智能生成或修改文字的组,以及教练组;之后所有组都在不使用人工智能的情况下完成一篇新文章:如果人工智能生成组在练习中表现最好,在没有人工智能时却表现很差,那么这个系统改善的是表现,而不是学习。
两种设计的比较
| 设计问题 | 微积分导师 | 写作教练 |
|---|---|---|
| 主要学习对象 | 数学概念与问题解决 | 论证与写作过程 |
| 验证 | 往往可以客观检验 | 通常需要依赖情境的判断 |
| 确定性工具 | 符号数学引擎/计算器 | 语法、引用、量规检查 |
| 人工智能的主要角色 | 诊断并搭建推理的脚手架 | 诊断并搭建修改的脚手架 |
| 主要风险 | 把答案直接交出去 | 代学习者写出文字 |
| 重要的学习者行为 | 求解并解释 | 起草、评价与修改 |
| 学习者模型 | 概念、程序、错误概念 | 论证、证据、组织、修改 |
| 关键防护栏 | 先尝试,再给解法 | 先有学生自己的文字,再让人工智能重写 |
| 迁移检验 | 新的无人工智能微积分题 | 新的无人工智能写作任务 |
| 成功标准 | 独立的数学推理 | 独立的写作与评价性判断 |
这两个系统使用许多相同的 AI 技术,却体现了不同的教学策略,因为学科所要求的思维方式不同。共同的原则是:找出产生学习的认知活动,并让人工智能支持这项活动,而不是把它从学习者手中拿走,即在微积分中保留数学推理,在写作中保留作者身份、修辞决策、评价与修改。这一原则比任何特定的模型、提示、智能体框架或用户界面都更为根本。