本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

教育中人工智能(AIED)领域最关键的空白在于:特定的教育设计是否会产生持久的好处、对谁产生、通过哪些机制、在什么条件下产生,而不只是人工智能能否完成教育任务。本知识库在记录有前景的干预的同时,也记录了在测量、因果推断、可推广性、实施与可复现性方面持续存在的薄弱之处。这些往往不是完全没有研究,而是证据在强度、具体性或适用性上的空白。参见人工智能教育研究中的局限

空白在领域内部也不相同。关于成熟的智能导师系统、预测性学习分析生成式人工智能与自主代理的证据,不应被当作可以互换的。同样,用人工智能支持学习,与教人们了解人工智能,涉及相关但不同的研究问题,教育中的人工智能的概述对此有说明。

1. 分离出人工智能在良好教学之外额外贡献了什么

严格的课堂实验是存在的,因此这一空白已不宜再被描述为“我们需要随机试验”。更精确的问题是:在额外的练习、更好的材料、及时的反馈或更多的教学支持之外,人工智能这一部分是否带来了额外价值

例如,《一键之遥:为期两年的学校实验中用 Khanmigo 进行的人工智能辅导》报告了 18 所中学的温和成绩提升,同时也报告了与这位导师的实质性互动有限。作者指出,这些提升与不使用人工智能的结构化练习所带来的提升相似。这确立了关于一个已实施的教学组合的证据,但并未干净地分离出其中人工智能部分的增量贡献。

底层的问题既是概念性的,也是实证性的。“ChatGPT”命名的是一种工具,而不是一种方法,Weidlich 等人(2025)审查了 19 项“ChatGPT 用于教育”的对照研究,以显示其代价:只有 4 项(21%)同时具备可复现的处理、可操作化的对照与有效的学习测量(74% 有界定清晰的处理,42% 有界定清晰的对照,53% 有一项学习结果)。他们更重要的观点是,当新的人工智能与新的活动、反馈或界面设计同时引入时,媒介与方法就被混淆了,任何效应都无法归因于人工智能。

因此,研究需要更多与强有力的、贴近现实的非人工智能替代方案进行的比较,并尽可能保持课程、练习机会与支持不变。独立重复研究应当检验这些好处在机构、教师、学科与模型发生变化后是否依然存在。正如效力研究方法所强调的,不同的方法回答不同的问题:质性研究与基于设计的研究有助于解释实施过程,而设计得当的实验则能加强因果主张。

2. 追踪持久的学与独立能力随时间的变化

在用人工智能时工作得更好,并不必然是支持撤除之后学习仍然持续的证明。学习增益认知卸载的综述反复区分受助表现与保持下来的知识、独立推理,以及向不熟悉任务的迁移。

《让人工智能辅导变得有成效》说明了测量上的难题。在一项涉及 6,000 多名中学生的随机实验中,一条“连续答对三次”的精熟规则提高了平台所定义的成功率,但其本身并未在一周后产生可检测到的学习增益。只有在人工智能被嵌入精熟流程、并且集中在练习过的材料上时,才出现了最强的延迟测验证据。

剩下的空白关乎能力的轨迹,而不只是一次额外的后测。 研究应当考察数月尺度的保持、跨任务的迁移、支持撤除之后的表现,以及学习者判断自己掌握了什么的准确性。它们还应当区分未能习得某项技能与已经建立的技能发生退化。关于卸载的研究应当检验委托何时支持这些轨迹,何时又在挤占发展这些轨迹所必需的练习。

3. 解释哪些教学成分在起作用,以及为什么

“人工智能支持的学习”往往合并了若干变化:新的反馈、额外的反思、同伴讨论、不同的任务顺序,以及改变了的评价激励。一个成功的组合并不能确立哪些成分是必需的,或者哪一种机制产生了好处。

多地点实验高等教育中以人为中心的生成式人工智能反馈设计提供了一个有用的进展。在 1,176 名一年级本科生中,反思型与混合型反馈设计在延迟的无人工智能迁移任务上优于直接的人工智能反馈。混合条件把自我评价、同伴反馈与人工智能批评结合起来。这支持去研究反馈是如何被组织与使用的,而不是把能否获得反馈当作干预本身。

进一步的研究应当分离出最初的独立尝试、自我解释、同伴输入、纠正性反馈、提示与逐步撤除支持各自的贡献与时机。它们应当检验这些成分如何与先前知识和任务难度相互作用。

伴随的理论空白同样重要:说出一种学习理论的名称,与检验它,是两回事。研究应当把理论预测与具体的系统行为和可测量的学习过程联系起来。统计中介分析可以为这种解释提供信息,但其本身并不能确立因果机制。参见教育中人工智能的理论发展Scaffolding

4. 验证测量、自动化判断与模拟学习者

诸如“投入度”“批判性思维”“人工智能素养”与“个性化”这类构念,其测量方式并不一致。自陈报告可以描述感知与体验,但不能替代表现出的能力。技术准确性、由专家评定的输出质量,以及学生的学习,也代表不同的评价目标。这些区分对于教育测量人工智能教育评价至关重要。

一个尤其重要的空白涉及用来评价其他人工智能系统的人工智能系统。在《模拟学生,还是迎合式解题?》中,模拟学生在收到纠正性反馈后常常放弃被指定的Misconceptions about AI,不论该反馈是否针对那个错误概念。因此它们的回应可能让无效的教学显得有效。有针对性的训练改善了该研究的忠实度指标,但在该指标上的改善并不等同于对照人类学习进行的效度验证。

研究需要确立哪些自动化分数与模拟行为能够预测真实学习者的结果,包括开发阶段未曾使用的学习者与情境。人的判断同样需要审视:评分者之间的一致并不自动构成所评构念正确的证据。

这一空白在于对评价链条的验证,从模型行为,到教学法判断,到学习者反应,再到教育结果。

5. 在人工智能能够生成与评价证据的情况下确立评价效度

人工智能带来两个相互关联的评价问题:它可以帮助产出被评价的作品,也可以影响该作品如何被评分。

本知识库的关于人工智能代理完成 LMS 中被评价任务的研究记录了代理在真实运行的本科课程中浏览并完成被评活动的情况。这些演示确立了一种能力,挑战了关于学生产出证据的假设;它们并未确立这种使用的普遍程度,也没有使所有异步评价失效。

研究问题是:哪些评价设计仍然支持关于学习者的站得住脚的结论作品档案、反思、分阶段提交与活动日志,本身都应当经过验证,而不能假定它们能确立作者身份或理解。研究应当把多种证据的组合与独立观察到的能力相对照,同时考虑可及性、工作量、隐私与学生焦虑。参见评价效度

对于自动化评分《大语言模型评分论文的方式与人类不同》报告了开箱即用的模型与人类评分者之间的系统性分歧。它的发现是特定配置下的,但说明了为什么内部一致性并不充分。

一个有用的概念区分来自《面向人工智能时代学习结果的人类能力测验》:评价学习者必须独立完成什么、可以借助人工智能完成什么,以及必须核实并为之辩护什么。这是一个需要实证验证的提议框架,而不是已确立的评价方案。

Karr 等人(2026)量化了为什么检测是一条死路。在 642 篇已发表的英文摘要上,两个商业人工智能检测器在 τ = 0.50 时,把符合指南的轻度人工智能编辑以 38–80% 的比例标为可疑,把未经修改的 2023–25 年原文以 9–15% 的比例标为可疑(非STEM远高于 STEM,p < 0.001),而在经过人化处理之后,被抓到的带人工智能标记的改写不足 4%(漏检率 > 96%)。一个惩罚诚实协助却漏掉规避行为的分数,不能成为关于学习者的站得住脚的结论的基础;它所暴露的空白,是那些不依赖此类分数的设计与过程证据。

6. 表明人工智能素养能转化为负责任的行为

人工智能素养干预研究已经足够多,可以做综合。《教育中的人工智能素养干预:效应与调节变量的元分析》纳入 59 项研究与 7,211 名参与者。它报告了正向的平均效应,但研究间差异很大,预测区间很宽且跨越零。以知识为核心的成果比技能、态度或伦理显示出更强的效应。

因此更尖锐的空白并不只是开发更多能力框架。而是要确定素养教学是否改变了人们在使用人工智能时的行为方式

学习者能否识别缺乏支持的主张、核实来源、拒绝误导性的建议、辨认不恰当的附和,并选择何时不委托出去?这些行为能否在时间压力下保持,并迁移到不熟悉的系统与学科?

研究应当把表现性评价与对实际决策的观察以及延迟的随访结合起来。它应当区分概念性知识、操作熟练度与批判性判断,而不是把它们当作可互换的。人工智能素养信任校准的综述为这些区分提供了有用的起点。

7. 理解可推广性与公平的结果,而不只是公平的可及性

来自某一门课程、某所机构、某种语言或某类学习者群体的发现,往往只能为其他地方的决策提供有限的依据。人工智能教育研究中的局限这一综述指出这是一个反复出现的问题。我们还需要更多证据,了解教学效应如何随发展阶段、学科、先前知识、残障状况、语言与资源条件而变化。

公平研究还必须区分可及性、技能与结果。数字鸿沟这一综述清楚地表明,提供设备或工具的可及性并不等于确立了同等受益的能力。

例如,《校内人工智能教育能缩小准备度差距吗?》跟踪了 752 名香港初中学生。心理准备度方面的差距缩小了,而在一项客观的人工智能素养测验上的差异依然存在。所有组都有改善,但整体改善并未消除不平等。由于先前的学习状况并非随机分配,该研究并未确立其因果效应。

本知识库自身的覆盖情况显示出群体层面的证据既稀薄又不均衡之处。不同学习者群体间的差异效应按研究所考察的对象做了统计:第二语言与多语学习者以及残障学生是最深的两条脉络,性别与神经多样性次之,而第一代大学生与国际学生在这一语料中各只有一项研究,天赋优异与成绩突出的学生作为一个群体实际上未被研究,难民、移民与流离失所的学习者则一项也没有出现。具有这种形态的证据基础无法通过汇总来回答公平问题,它必须被有意识地抽样。

研究的优先事项是找出哪些设计能缩小在表现出的能力、参与度与能动性上的差异。 研究应当考察亚组的结果与负担,而不只是平均增益。可及性研究应当区分消除参与障碍与替代学习者本应发展的能力。参见人工智能教育中的公平Accessibility

能力在单个国家体系内部也会以治理分类无法捕捉的方式发生变化。Adeniranye 等人(2026)对 45 所尼日利亚大学的人工智能整合情况打分,发现整体采纳程度仅为中等(M = 4.79,范围 1.83–7.83,采用 10 分制),在控制了校龄与地理位置之后,机构类型无法预测整合程度(校龄 β = 0.43;西南部位置 β = 0.31)。内部能力之间的相关为 r = 0.79–0.80,国际合作关系与业界伙伴关系之间的相关为 r = 0.74,因此联系广泛的机构会累积起叠加的优势。这一空白在于检验哪些能力建设设计能改变较新、联系较少的机构的结果。

8. 确定控制权应当如何在学习者、教师与代理之间分享

随着人工智能系统进行规划、发起行动、维持记忆并协调工具,教育问题就变得比“人机协作是否有益”更具体:谁应当控制学习过程的哪些部分,以及这种控制应在何时改变?

《教育中的代理式人工智能:范围综述》梳理了 474 项研究,发现纵向验证有限、集中在高等教育与 STEM,且与教育理论的整合薄弱。所审查的研究中只有 29% 明确借鉴了教育理论,这是关于那一语料的发现,而不是关于全部人工智能教育研究的发现。

研究应当比较不同的配置:由学习者还是代理发起帮助、设定目标、选择策略、监控进展并作出最终决定。它应当检验支持能否随能力发展而逐步撤除,以及学习者是否保有质疑系统的能力。

代理式人工智能人机协作的综述还提出了在多代理环境中关于教师介入与问责的问题。更大的自主性应当作为一种教学设计的取舍来评价,而不能被假定为教育上的进步。

9. 把教学安全与关系安全同真实的教育后果联系起来

教育安全所涵盖的,超出事实准确性、冒犯性内容或被禁止的请求。一位导师可以给出正确答案,同时削弱学习者推理的机会、强化某个底层错误概念,或鼓励不恰当的依赖。参见教学安全

《SafeTutors:人工智能辅导中的教学安全》识别出诸如过度披露答案与放弃脚手架之类的失败,在多轮测试下失败明显更多。这些是在特定测试条件下得到的Benchmark发现,而不是对课堂中危害的普遍程度或严重程度的估计。

尚未解决的问题是,这类失败在持续使用中如何影响真实学习者。哪些会带来暂时的困惑、持久的错误概念、动机下降,或独立能力被削弱?哪些防护措施能在不过度拒答或引起挫败的前提下降低这些风险?

更长期的研究还应当考察信任、寻求人类帮助的意愿、学习者能动性,以及与同伴和教师的关系。这些问题对儿童尤其重要,需要与年龄相称的研究,把系统行为与教育及关系方面的结果联系起来。

10. 解释实施、教师发展与成本如何影响结果

技术能力并不能确立某个工具会被富有成效地使用,也不能确立专业发展会改善学生的学习。缺失的一环往往从教师准备,经由课堂实践的改变,通向学生结果

《教学法优先,技术其次》中,一项涉及 46 位教师与 2,832 名学生的多层次研究发现,教学法方面的人工智能知识与学生的感知和意向相关,但所测量的两个教师知识成分都没有直接与学生的 AI 知识增长相关。这些关联并未确立某一特定的培训干预会导致更好的学习。

研究应当考察哪些培训辅导、课程对齐、审查程序、排课与机构支持的组合能带来持续的改进。它应当观察实际发生的教学,而不只是教师的信心或采纳意向。参见教师人工智能能力教育发展

可比的成本效益是另一个优先事项。评价应当包含核实、纠正、培训、监督、维护与实施时间,而不只是订阅费或模型使用成本,并把人工智能支持的供给与贴近现实的替代方案相比较。相关的问题是完整的安排以所需的资源换来了什么教育收益。

11. 评价治理、隐私与有意义的参与

伦理原则与治理框架是必要的,但它们的存在并不能确立它们改变了实践或保护了学习者。

《界定教育中人工智能的伦理价值与规范》审查了 25 篇文章,发现所审查的伦理文献中终端用户大体是被动的,学生的声音基本缺席。它还识别出价值之间的张力与利益相关方之间的权力不对称。这是对所审查文献的描述,不应被推广为“学生从不参与人工智能教育设计”的主张。

这一研究空白关乎哪些治理安排能带来可测量的差别。学生与教师的参与是否会改变采购、工具设计、评价规则或出错后的补救措施?人工审查程序是否能抓住有重大后果的错误?不使用人工智能的替代方案是否真的可用?

隐私研究同样应当考察额外数据收集的教育价值,而不是假定更细致的学习者监控是正当的。研究可以把数据最小化的设计与更具侵入性的替代方案相比较,同时评估学习与学习者自主性。参见人工智能治理Privacy

12. 建立可复现的研究与可信的累积证据

人工智能教育面临一个格外困难的可复现性问题。研究可能遗漏提示、模型版本、设置、代码或教学细节;专有系统也可能在干预期间或之后发生变化。这些问题记录在人工智能教育研究中的局限中。

可复现性既需要描述教学安排,也需要描述模型:学习任务、内容来源、允许的行动、界面、教师支持、评价条件,以及部署期间发生的变化。研究者应当区分复现某一种配置与检验其教学原则能否迁移到另一种配置。效力研究方法中关于报告方式的讨论回应了这种对透明描述的需要。

证据综合同样需要相应的谨慎。元分析与系统综述页面指出薄弱的一手研究、发表偏倚、异质性的干预与不可通约的结果,都是对汇总结论的限制。

一个单一的平均“人工智能效应”可能掩盖教育工作者最需要的那些区分。综述应当把受助表现与独立学习分开,区分干预类型与对照条件,并让编码与分析的决策可被审计。零结果、失败的实施与边界条件,都是对这一累积证据基础至关重要的贡献。

综合文献本身也是一个空白。O'Neill(2026)的取证式审计审查了 14 项高影响力元分析,发现没有一项为其主张提供了有效依据:没有连贯的构念(把工具当作单一干预来处理,并把多维度的结果汇总在一起)、14 项全部存在无效的发表偏倚评估、在每一项报告了该值的分析中 I² 都介于 77.2% 与 94.4% 之间(其中 12 项、共 13 项高于 80%),以及 61% 被随机抽查的一手研究带有效度问题。那 14 项分析累积了 2,000 多次引用,历时大约 16 个月,而一项被撤回的元分析在 60% 的撤稿后引用论文中仍被当作权威引用,且未说明该文已被撤回。不加批判的采纳并不限于被撤回的工作:在引用另一项被审计元分析的 14 篇论文样本中,那项元分析的摘要宣称“人工智能教育”有巨大效应,而实际上测量的是教学生了解人工智能,只有 2 篇恰当地引用了它,有 8 篇将其读作整合人工智能能改善学习的证据,另有 4 篇在其他方面存在错误。该审计的建议直接针对这条链条,要求期刊对元分析规定完整的数据透明(检索方案、编码的研究特征、提取的统计量与分析代码),要求编辑不要把发表记录当作审查能力的证明,并要求在任何一篇文章被发现、导出或被引用的地方都让撤稿信息可见。因此可复现性涵盖的是综合链条的诚信,而不只是单项研究的诚信。

希望获得这些关切在课堂层面的版本,也就是该用哪些测量与对照设计,教师可以遵循教师可以用哪些测量工具与研究方法去评价与人工智能相关的干预?中的方法指引。

总体要点

核心的研究需要并不只是更多表明学生喜欢人工智能、教师节省了时间或人工智能支持的作品得到更高分数的研究。而是更强的证据来回答:

哪一种教育设计,针对哪些学习者,在什么情境下,通过哪种机制,产生哪些持久的人类能力,以及收益、成本与危害的分布如何?

回答这个问题需要互补的方法:界定清晰的实验、纵向随访、经过验证的评价、质性与基于设计的探究、以公平为导向的抽样,以及透明的综合。目标是一个不仅能解释某项干预是否奏效,还能解释它为什么奏效、在何处可能失效,以及教育工作者可以负责任地带到另一情境中的东西的证据基础。

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.