问答
教师可以用哪些测量工具与研究方法去评价与人工智能相关的干预?
本页是英文页面的机器翻译,尚未经母语者审校。
让方法与主张相匹配。 如果你想知道学生是否喜欢某项人工智能活动,问卷可以帮上忙。如果你想知道他们是否学到了东西,就要使用表现性测量。问卷是一种自陈式测量,对态度而言是正确的工具,对学习而言则是错误的工具,原因集中在该页面上。如果你想知道人工智能是否导致了改进,你需要一个可信的对照条件,最好是随机分配。
方法选项
人工智能教育中的研究方法页面区分了几种有用的选项:
- 随机实验提供最强的因果推断。
- 准实验的前后测或配对组设计在自然班级中往往更可行,但支持的因果主张较弱。
- **质性**访谈、焦点小组、观察与作品分析能揭示机制与意料之外的体验。
- 人工智能辅助的质性分析可以在几分钟内重新组织访谈或观察语料,因此可论证性与准确性或披露同等重要:记录下那些有据可查的重组过程,使读者能够审视、质疑并修正从数据到主张的路径。
- **混合方法**把结果证据与对效应成因的解释结合起来。
- **基于设计的研究**在教师于真实课程中迭代开发与改进某项干预时很有用。
无论使用哪种渠道,只有三个条件能让因果主张可被解读:描述精确的处理、界定清晰的对照条件,以及对持久学习的有效测量。Weidlich 等人(2025)依据的正是这几条标准审查了 19 项“ChatGPT 用于教育”的对照研究,发现只有 4 项(21%)同时满足这三条,其中 74% 有界定清晰的处理,42% 有界定清晰的对照组,53% 有一项称得上学习的结果。一种通用工具若与新的活动、反馈或界面设计同时引入,就把媒介与方法混在了一起,因此显著的结果不能归因于人工智能。
一项可操作的课堂评价
对于一项可操作的课堂评价而言,有用的最低配置是基线测量、干预、即时后测,以及之后在无辅助条件下的测量。只要可能,就加入一个对照条件,例如既有做法、不使用人工智能、不加约束的人工智能对上有脚手架的人工智能,或两种备选设计。把受助表现与独立学习分开测量。
人工智能教育评价这一综述推荐的结果指标包括:无辅助条件下的学习增益、延迟保持、迁移到新任务、推理质量、Misconceptions about AI、反馈采纳情况与亚组表现。投入度、满意度、人工智能使用日志、自我效能感与感知有用性可以是有价值的次级测量,但不应被当作学习的替代品。教师工作量与节省下来的时间也是正当的实施结果指标。
对结果的解读有两点告诫。第一,来自文献的平均效应对单个课堂而言是薄弱的指引:O'Neill(2026)的审计审查了 14 项高影响力元分析,发现没有一项为其主张提供了有效依据:汇总的“学业成绩”把测验分数、动机、Self-Efficacy与态度混入同一个估计值;所报告的异质性极高(I² 介于 77.2% 与 94.4% 之间,出现在所有报告了该值的分析中,即 13 项;其中 12 项、共 13 项高于 80%);14 项全部对发表偏倚做了无效评估;61% 被随机抽查的一手研究带有效度问题;而能够显示单项结果实际离散程度的统计量大多缺失(只有四项分析报告了研究间方差,只有两项报告了预测区间,且两者都包含零)。第二,一个方便的分数可能测错了构念:在对八个教学型人工智能代理的评价中,按平台自身分数排在第三的代理,在经专家验证的评分量规上却排在最后,因为平台分数反映的是互动过程中学生的表现,而不是代理的教学质量。任何单一的面板指标,都应当被当作一个有待用与预期培养能力相关的测量加以验证的假设。
关于现有证据说明了什么、没有说明什么,以及它在何处仍然薄弱,参见使用人工智能真的能帮助我的学生学习吗?与关于教育中人工智能的研究文献有哪些值得注意的空白?。