本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

你正在撰写一项人工智能教育研究,而它的主张已经跑在了设计前面;或者你正在评审这样一项研究,需要判断那个标题数字到底有没有意义。无论哪种情况,决定性的都是同样六处遗漏:实际使用的是哪个人工智能系统、它被配置成做什么、它扮演了什么教学角色、输出是否由人设计或审核、结果测量真正捕捉到了什么,以及作者如何处理偏差、成本与局限。遗漏这些内容的作者交出的是一项无法被评估的研究;不去寻找这些内容的评审者,则无法分辨一项经过设计的干预与一次改头换面的工具演示。当这些内容缺失时,诚实的结论是“无法评估”,而不是“得到支持”,也不是“被否定”。

这些风险并非假设。O'Neill(2026)审计了 14 篇声称人工智能改善教育的同行评审元分析,发现其中没有一篇为其所提出的主张提供了有效依据。Bartoš 等人(2026)汇总了 1,840 个效应量(来自 67 项元分析),发现在对发表偏倚建模之后,平均效应降至已发表中位数的约三分之一(SMD = 0.196 对比 0.67)。Denny 等人(2026)核实了 30 条伪造的参考文献,分布在 14 篇计算教育论文之中,它们全部发表于 2025 年或 2026 年;这一缺陷之所以能抵达读者,恰恰是因为评审者无法核对参考文献列表中的每一条。报告规范决定这个领域的证据基础是否还能被使用。关于其下层的设计选择,参见人工智能教育研究方法;关于失效模式的清单,参见AIEd 研究的局限。至于读者这一侧,即实践者在一篇论文发表之后会怎么用它,参见解读与应用 AIEd 研究

简要版

有六个动作决定你的主张能否经得起评审:

  1. 把人工智能系统描述为一种处理条件,而不是一个厂商产品。 模型、版本、配置、提示词、角色,以及输出是否由人设计或审核。
  2. 说明教学依据与主动对照条件。 产品名称不是方法;照常教学也不是公平的对照。
  3. 让测量与主张相匹配。 工具捕捉到什么、它对该群体的效度如何,以及结果是否为延迟且无辅助条件下测得。
  4. 对每一项自动化判断进行验证。 说明金标准、校准目标,以及由谁裁定分歧。
  5. 报告分析的不确定性,而不只是点估计:相依效应、τ²、预测区间、子组规模、发表偏倚评估。
  6. 报告配重项:伦理与治理流程、算力与环境成本、你自己对人工智能的使用、零结果,以及只引用你亲自核实过的文献。

决定你要如何描述人工智能系统,并写到别人能够据此重建它

这是大多数投稿都没能通过的检查。RAISE 框架(Reporting AI Studies in Education,Allison 2026)是一份包含 30 个条目、覆盖十个主题领域的清单,其诊断性主张具体而不流于修辞:投稿常常遗漏所使用的是什么模型(GPT-4、Claude,还是自定算法)、它如何被配置(提示词、微调参数)、它扮演什么角色(反馈生成器、合著者、导师、评价者),以及输出是否由人类设计或审核。这给评审者留下了四个无法回答的问题:“人工智能究竟在做什么?”“它是否必要?”“这可以复现吗?”“学习方面的主张可信吗?”

它涵盖的范围从教育依据,到 API 层面的规格说明、学习者与人工智能的互动、可及性与文化适配、参与者与情境、人类参与、设计、伦理、透明度与可复现性,一直到局限。与之配套的伦理与风险矩阵覆盖对学习者Learner Agency公平、数据AI Governance和算法透明度的风险。Hwang、Xie、Wah 与 Gašević(2026)提出了一个精简的替代方案 TEP-AIED,它把透明度、伦理与教学法折叠成一个相互依存的整体结构,提供了一张对应论文七个章节的指南表,并要求作者增加一个名为“Transparency, Ethics, and Pedagogy Considerations”的方法小节;因为在他们看来,RAISE 虽然全面,但对于常规实证用途来说颗粒度太细。这一披露归入AI Use and Disclosure Statements,它正是让PrivacyEthics主张可被核查的东西。

判断你的处理条件是一种方法还是一个产品

教育依据是 RAISE 的第一个领域,因为人工智能不是中性工具:其价值取决于学习问题、理论依据,以及从目标到结果测量之间的映射是否彼此一致。O'Neill(2026)发现,受审查的元分析中除两篇之外,都把处理条件定义为一种工具,即 ChatGPT、GenAI 或“AI”;而产品名称不是Pedagogies and Teaching Strategies;把接触 ChatGPT 当作一种共同的干预来对待,就相当于把“纸”的效果拿来做元分析。Weidlich 等人(2025)对原始研究提出了同样的论点:他们审查了某项著名元分析背后的一部分比较,发现只有 21% 具备明确定义的处理条件、对照组和有效的学习测量,而所报告的效应量(g = 0.7)超过了专门构建的智能辅导系统(0.66):这是一个警示信号,说明那个“处理条件”是一种异质的秘方,而不是一个有名称的方法。

检验标准是:一位有能力的读者能否仅凭方法部分重建你的干预,并得到同样的东西?

判断你的工具测量的是什么,以及你的主张因此可以说什么

在 O'Neill 对 46 项随机抽取的原始研究的证据审查中,28 项(61%)存在效度问题,其中最常见的是因变量不匹配(n = 15),其次是自变量不匹配(n = 11)、实验设计问题(n = 7)、数据提取问题(n = 6)、缺少对照组(n = 6)以及非随机分组(n = 6)。多维度的结果被惯常地合并在一起,仿佛它们可以互换:考试成绩、作业质量、MotivationSelf-Efficacy、态度和投入度被压缩成一个“学业成就”数字。

有两种报告习惯可以防止这一点。说明工具测量的是哪个构念,以及它是否针对该群体做过效度检验:关于基于感知的测量在何处与行为发生偏离,参见Self-Report Measures;关于构念效度,参见Assessment Validity。然后报告一个不依赖于学习者对辅助工具之信念的结果,因为在辅助之下即时完成任务的表现并不是学习增益一项 2026 年的小型综述,涵盖 493 条记录与 14 项优先研究发现,没有一项研究把核实是否成功与随后的依赖决策放在一起,对照一个独立裁定的输出质量标准来测量,也很少有研究越过即时的表现去看延迟的保持或迁移。关于持久学习的证据仍然不一,而认知卸载是最有可能把两者区分开来的机制。

判断你的自动化判断是如何被验证的

AIED 评估越来越多地把评分交给模型,这使得验证流程成为结果的一部分,而不是附录。Khan Academy 对其人工智能导师指标的说明报告称,认知投入由一个Large Language Models (LLMs)评判者评分,该校准到与人类教学专家一致达到 F1 0.83,并且指标的变动来自五个月内 40 多次在线实验,而不是离线评估(Udeshi 等人 2026)。Tseng 等人(2026)表明,人与机器在前测题目质量上的分歧是系统性的而非随机的,并且评分量规的操作化比先讲理由的提示方式更重要。

与人类编码者的一致并不等于质量,把它当作质量来报告,正是评审者会攻击的地方。Liu 等人(2026)让一位独立专家在不告知来源的条件下评判 855 组配对编码集,发现人与 LLM 的一致度(平均 Jaccard 0.30)远低于人与人之间的一致度(0.52),而盲评者偏爱人类编码与机器编码的比率几乎无法区分(51.5% 对比 48.5%,p = 0.537)。请报告校准目标、金标准,以及由谁作出裁定。

判断对照是否公平,以及主张能传播多远

公平性与范围会以同样的方式失效:一个很大的效应,其含义却比看上去要小。受审查的元分析中有 11 篇(共 14 篇)没有设定人群边界,于是“学生”的范围从儿童一直延伸到医学受训者;单一课程、机构、学科或国家并不足以支撑一个普遍性主张,而且针对某一工具的结果很少能迁移到另一个工具。新奇效应、额外的任务时间,以及对照组接受的是照常教学而非主动对照,是对大效应的常见解释;因此要报告对照组实际做了什么、每个组分别花了多少时间,以及这个工具有多新颖。同样要说明人群边界,因为效应在不同学习者群体间存在差异,而边界未加说明,才会让一个合并后的数字代表所有人(参见学习者群体间的差异效应)。还要把工具当作移动靶:专有系统会在毫无通知的情况下发生变化,因此一项发现只绑定于某个模型版本,在某一发行版中令人惊艳的Benchmark,到了下一个版本可能就不成立了。

判断你的分析能支撑什么,并报告其不确定性,而不只是主线结果

对于综述性分析,要报告相依效应的处理方式、研究间方差、预测区间和发表偏倚评估,而不只是 I²。O'Neill 发现,所报告的异质性只要给出就都很严重(I² 从 77.2% 到 94.4%,覆盖 13 篇元分析,其中 12 篇高于 80%),而且从未得到解释(没有任何调节效应分析达到十项研究的子组规模下限);有 12 篇元分析把同一研究中的相依效应量当作独立处理,从而夸大了表面的证据;只有四篇报告了研究间方差(τ²),只有两篇给出了预测区间,而这两个区间都包含零。发表偏倚在任何地方都没有得到有效评估。

由于 I² 依赖于精确度,异质性数字必须与它所用的模型一起给出:AIEd 研究的局限记录了一项综述,其异质性在固定效应模型下为 I² = 82.98%,在随机效应下为 15.75%,因此只拿到第一个数字的读者无法判断这组文献到底有多不一致。请一并报告 τ² 与预测区间;关于综述一侧的惯例,参见元分析与系统综述,并相应地对你自己的主线结果打折扣:Bartoš 等人经偏倚调整后的平均值为 SMD = 0.196,预测区间从 −1.521 到 +1.908,对一项假想的新研究而言,这意味着从实质性损害到实质性收益的范围。

决定你要披露哪些关于伦理、成本、治理的内容,以及你自己对人工智能的使用

一项对所有 AIED 2025 会议论文的综述发现了“采用 LLM 却不披露”的模式:多数项目使用了 LLM,但报告资源消耗或碳足迹的不到寥寥几个。该论文提供了一套开源方法,包含针对本地和云端硬件的测量工具,以及一个用于估算参数规模未公开的前沿模型算力开销的公式,并主张不报告这些成本本身就是一项伦理问题。还要加上数据治理、知情同意以及可及性与文化适配(属于 RAISE 条目;Universal Design for LearningAccessibility):关于这些义务更完整的讨论,参见教育领域的人工智能研究应当如何纳入公平、无障碍、隐私、伦理与教学安全?

你在研究过程中自己对人工智能的使用也需要同样的披露。Zabaleta 与 Lin 的 PRISMA-LLM 分析考察了 888 篇综述自动化论文,显示这类报告有多么不均衡:自 2023 年以来,38.0% 的软件/产品类论文完全没有报告任何评估(LLM 类论文为 9.3%),报告丰富度的平均值在 LLM 类论文中为 6.3,在软件/产品类论文中为 3.3;84.1% 的 LLM 使用依赖专有或托管系统,仅 4.9% 是开放权重。他们的框架在五个披露层级上把实现层面的披露与对后果敏感的评估区分开来,这是一个可用的模板,用来描述工具在一篇综述中做了什么。Dai 与 Chan(2026)补充了作者一侧的图景:27 名研究生研究员(共 28 名)在构思、文献综述、解释、数据处理、编程、学术写作、编辑和翻译中使用过生成式人工智能,并根据事情的利害程度与学科规范来校准使用方式;同时指出机构政策针对的是教学与评估,而不是研究实践。

决定如何处理零结果与引文

Denny 等人核实了 30 条伪造的参考文献,分布在 14 篇论文之中,其中某技术研讨会上核实到的数量从 3 条(2025 年)上升到 17 条(2026 年,占该年会议论文集的 2.3%);而以 LLM 辅助的写作让一条看似可信的编造引文变得很容易生成。在引用这项审查时,其配重项很重要:多数被标记的参考文献其实无害,229 条是 ACM 元数据不匹配而 PDF 本身正确,188 条是有效的书目变体;因此伪造的数量是一个刻意的下界,而无害的多数也不是可以忽略的舍入误差。凡是你无法亲自核对的条目,都要核实。

报告零结果与阴性发现是同一枚硬币的另一面。Bartoš 等人(2026)发现了零结果被压制的强证据(每一次 Egger 检验 p < .0001)以及极端的异质性(τ = 0.869),并且没有任何结果变量、领域、层级或人工智能角色子组显示出稳定的增益。他们还发现,以 2023 年一月为界,前后发表的研究之间没有差异,这削弱了“现代生成式工具特别能带来增益”这一主张。

这个领域有据可查的弱点,用它自己的数字说话

用来衡量一项主张的基准比率:

  • 效度: 28 项经审核的原始研究(共 46 项,61%)存在效度问题;受审查的比较中只有 21% 具备明确定义的处理条件、对照组和有效测量。
  • 未获解释的异质性: I² 从 77.2% 到 94.4%(覆盖 13 篇元分析),其中 12 篇高于 80%;没有任何调节效应分析达到十项研究的下限;12 篇把相依效应当作独立处理;只有四篇综述给出了 τ²,只有两篇给出了预测区间。
  • 发表偏倚: 14 篇受审查的元分析均未评估;更大范围样本中的每一次 Egger 检验都显著(p < .0001),τ = 0.869。
  • 参考文献: 30 条伪造分布在 14 篇论文中,其中 17 条出现在某场 2026 年研讨会上,占该年会议论文集的 2.3%。

你会听到的反对意见

“评审者要的是新颖性,不是方法细节。” 期刊正在朝相反方向走:RAISE 与 TEP-AIED 给了编辑一个可以要求的构念,而 TEP-AIED 的方法小节是一个低摩擦的切入点。正是方法细节把一篇无法评估的论文变成一篇可被引用的论文。

“我们没有篇幅。” 五个披露层级是报告层级而非风险层级,因此流程的评估深度可以只是一两句话。版本、提示词和角色放在一小段里;成本与治理放在一句局限说明里。

“大家都是这么报告的。” 这正是发现本身,而不是辩护理由:61% 的经审核原始研究存在效度问题,有 12 篇元分析(共 13 篇)异质性高于 80%,38.0% 的软件/产品类论文没有任何评估。这种常态就是缺陷。

“我们的工具是专有的,所以无法报告模型。” 报告版本、访问日期、配置、你提供的提示词、角色与护栏。如果厂商不肯说明,这一限制应当写入局限部分,作为对主张的界定。

“报告零结果会伤害我们。” 被压制的零结果正是经偏倚调整后平均值 SMD = 0.196 背后有据可查的机制;把它们发表出来,才能让你的阳性结果仍然可读。

投稿前检查清单

  • 报告: 模型、版本、配置与提示词,以及人工智能在设计中的角色。检查: 你能否仅凭方法部分重建这项干预?
  • 报告: 教学依据与主动对照条件。检查: 处理条件是一个有名称的方法,还是只是一个产品名称?
  • 报告: 每项测量捕捉到什么、它对该群体的效度,以及延迟或无辅助条件下的结果。检查: 主线主张与因变量是否匹配?
  • 报告: 由谁裁定自动化判断、对照什么金标准、一致度如何。检查: 是否把准确率或一致度当作质量来使用?
  • 报告: 相依效应的处理、τ²、预测区间、调节变量子组规模与发表偏倚评估。检查: 异质性是否与它所用的模型和精确度一起给出?
  • 报告: 人类参与、数据治理、知情同意、可及性与文化适配,以及算力与环境成本。检查: 伦理主张是否由所描述的流程支撑,而不是仅仅宣示原则?
  • 报告: 研究过程内部对人工智能的使用,覆盖全部五个披露层级。检查: 综述或分析流程到底有没有经过评估?
  • 报告: 零结果、阴性结果与证伪结果,并与阳性结果一同给出。检查: 效应量是否已就可能存在的发表偏倚打过折扣?

什么才真正能提高标准

文献中提出的补救办法是制度性的,而非个人的。O'Neill 建议对元分析实行强制性的数据透明,包括完整的效应量表、依赖结构、τ² 与预测区间,再加上更强的评审与编辑把关以及一套运转正常的撤稿实践;其论点是,这些失败是把关失效的产物,而不是孤立的错误。PRISMA-LLM 提出把五个披露层级作为报告层级而不是风险层级,从而让综述流程的评估深度被明确说清;RAISE 与 TEP-AIED 则给期刊提供了一个可以要求投稿满足的构念。关于相关的领域,参见研究文献中的显著空白AIEd 研究的局限,以及评估人工智能相关干预的测量与方法。有一项低成本的补救办法落在作者身上:本知识库的每个文章页面现在都会把一项研究与这对实践意味着什么一节配对,并且通常还有局限一节;因此,把论文写到这两节都能被如实填写,即实践者能采取的行动以及对该行动的限制,既是一种写作习惯,也是一种报告习惯(参见解读与应用 AIEd 研究)。

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.