本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

教育人工智能应当被设计成一个教学系统,而不只是一个带教育界面的通用模型。 本知识库中近期的设计研究把这一主张收得更具体:最强的系统是被建构成处在人类监督之下的受限专家,与将使用它们的教师和学习者共同设计,并且以可核验的内容为依据,而不是依赖模型的记忆。一套实用的设计规则如下:

  • 让系统与明确的学习目标对齐。
  • 提供脚手架,而不是代替完成目标认知工作。
  • 在事实可靠性重要时,把回应建立在教师认可或权威的内容之上。
  • 传达不确定性。
  • 提供一条人工升级路径
  • 让回应做到“友善但正确”,而不是一味附和用户。
  • 给教师有实质意义的配置权与监督权
  • 尽量减少不必要的学习者数据,只收集教学中确有必要的数据(参见Privacy)。
  • 从一开始就把Accessibility设计进去。
  • 测试它是否在不同学习者群体间表现不均(参见公平)。
  • 评估持续的多轮互动,而不是孤立的演示式提示。

教学安全

教学安全页面强调,常规的安全测试对教育来说并不足够。一个系统可以避开有害内容,却仍然造成教育上的伤害:过度直接给出答案、强化误解、压制反思、促成依赖,或者偏离教学目标。它建议进行有学科意识的多轮安全评估、人在环中的质量保障、以可核验内容为依据,并把系统对齐到提供引导而非直接提供答案。

SafeTutors这个Benchmark把那句警告变成了数字。在所有被测模型上,从 3.8B 开放权重模型到 GPT-5-mini,教学层面的伤害都是普遍存在的;模型规模的扩大并没有可靠地改善安全性;失败率从单轮互动中的 17.7% 上升到多轮对话中的 77.8%,而违规模式因学科而异。该基准的 11 个维度、48 项子风险分类体系(认知、认识论、元认知动机与情感、发展性与公平、教学对齐等)是一份可用的设计检查清单。对任何要定义教育软件的人来说,实际教训是:一个系统可以按常规指标既准确又“安全”,却在悄悄侵蚀学习,因此多轮、有学科意识的评估是一项要求,而不是最后一道关卡。

可及性与公平

可及性应当包含具体的可操作要求,例如键盘可操作性、屏幕阅读器兼容性、字幕与文字稿、合适的对比度、可用的文本替代方案,以及与辅助技术的兼容性;由人工智能生成的可及性功能仍然需要质量检查。参见Accessibility

公平性测试应当检查整条流程,并按语言、残障状况、文化以及其他相关的学习者特征分解行为表现,而不是只依赖总体的准确率。参见本知识库的Bias Mitigation指南,它与公平一同汇总。

为受限的授权而设计,而不是为自主性而设计

Reichert 及其同事与六位中学教师开展的参与式设计研究,是对“教育人工智能应当是一个自主代理”这一假设的有益纠正。在被要求用纸笔为课堂聊天机器人做原型时,每一位教师描述的都是一个受限专家,即在两个维度上把专门能力限定在严格定义的领域内、并在人类监督下运行。权限边界让教师保持最终控制权,因为对学生学习与安全的专业责任无法被委托出去;专长边界则反映了人工智能缺乏对个体学生、课堂动态和机构规范的语境知识。

他们勾画出的架构包含四个相互关联的组成部分,即内容范围界定、内容呈现、学生适配和教师监督,并建立在三层保护之上:限定范围的领域边界、支持安全个性化的内容过滤,以及针对模糊情形的教师推翻权。委托是有选择的:把它映射到 Gagné 的九大教学事件上,教师欢迎人工智能来呈现内容、提供练习题和给出形成性 Feedback,但拒绝让它设定目标或实施总结性 Assessment。值得注意的是,他们更看重行为层面的透明度,即可见的限制与不确定性提示,而不是模型解释;并且六位教师全都要求完整的对话记录、实时告警和推翻能力,这是对专业责任的表达,而不是不信任。

与利益相关者一起设计,而不只是为他们设计

另外两项研究把这一点向前推进。Ko 与 Hughes把价值敏感设计用于一个智能辅导系统,参与的社区大学学生与教师是一个历史上被排除在学习平台设计之外的群体;他们发现的是需要管理而非解决的持续价值张力:透明度与可解释性、隐私与教学洞察,以及学生能动性与系统引导的脚手架。比起模型的原始透明度,学生更喜欢协作式的、有人情味的解释;由此得到的原型在Explainable AI、人在环中与Privacy控制方面编码了 16 项与价值一致的功能。

Wang、Liu 与 Islam 对 28 项教师与人工智能共同设计的实证研究的综述,补充了一套设计词汇:生成式人工智能主要用于备课、生成提示词和创意构思,人工智能充当助手或内容生成器的频率远高于充当共同设计者;同时还有四种反复出现的可供性,即效率、响应性、创造力公平,教师可以用它们来判断哪种工具适合哪一类设计问题。两项研究都把设计视为人在环中协作,也就是可用性研究而不是宣传推广;并且两项研究都发现,被咨询的利益相关者提出的需求是任何准确率基准都捕捉不到的。

用可核验的内容作依据并加以验证,不要信任模型

以可核验内容为依据是一个架构决策,而不是一句提示词。EduGuard是一个安全检索增强导师,用于入门编程,它把教师认可的课程检索与一个架构上独立的断言验证器、显式的过度依赖控制,以及一份由教师编写的 600 条查询基准配对起来,该基准涵盖误解、调试、混合语言查询和对抗性的直接要答案提示,并在 GPT-4o-mini 与 Llama 苏格拉底式导师基线上有所改进。对设计者来说,这就是“把回应建立在教师认可的内容之上”的具体形态:让负责验证的组件与负责对话的组件分离,并针对那些主动试图套取答案的案例进行测试。参见幻觉风险

关于这些设计原则如何转化为一个实际搭建出来的导师系统,即诊断、提示阶梯、反馈与评估,参见开发有效的人工智能导师有哪些最佳实践?;关于决定一个搭建良好的工具能否被良好使用的教学默认设置,参见应当如何把人工智能设计进学习体验之中?

把学生提交的作品视为任何人工智能评分系统的不可信输入。 大多数设计建议忽略的威胁模型,是被评估作品内部的对抗性内容。Humble(2026)的对抗性红队评估测试了学生能否通过嵌入提交内容中的提示注入来操纵基于 LLM 的评分系统,结果发现这种操纵是有效的:那些指示、重新框定或要求扮演评分者的注入,会在不改变作业本身的情况下改变分数。设计上的后果遵循与上文验证架构相同的分离原则:把评分量规和指令放在学生可控的上下文窗口之外;剥离或标记提交内容中类似指令的部分;绝不让一份提交自己确立评判标准;并在任何有重大影响的评分上保留人工决定。一个人工智能评分者如果从它正在评判的同一段文本里读取自己的指令,就等于把量规交给了应试者。

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.