本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

关于人工智能素养干预在高等教育中的证据是有希望的,但在方法上仍不成熟。在本知识库中,最一致反复出现的发现是:人工智能素养通过与人工智能一起进行的主动、情境化实践,尤其是批评、比较、反思与协作,比仅靠工具演示或讲授发展得更有效。与此同时,相对较少的研究测量了持久的、能够独立展示的能力;许多研究依赖自我报告、短期干预、观察性比较或设计研究

干预研究文献在若干设计原则上趋于一致。

整体量化图景

一项涵盖 59 项实证研究的三水平元分析(172 个效应量、7,211 名参与者)给出了该领域最清晰的量化估计:人工智能素养干预呈现出较大的总体效应(g = 0.837,p < .001),但 95% 预测区间很宽 [−0.292, 1.966],说明其有效性在不同情境之间差异相当大,未必能统一推广。有两个调节变量达到显著:东亚和欧洲的干预优于北美,并且以知识为重点的干预优于以技能、态度或伦理为目标的干预。混合式或反思性教学法、GenAI 支持的工具以及表现性任务结果的效应更大(但不显著)。作者因此主张,人工智能素养教育应当超越知识,转向技能、实践、伦理与态度,借助整合的、反思性的教学法与 GenAI 支持的工具,并且需要文化相关的、情境敏感的干预。(AI Literacy Interventions in Education: A Meta-Analysis of Effects and Moderators

有两点对实践者很重要:(1) 你测量的结果决定了表面效应的大小,以知识为重点的干预看起来比以技能、态度或伦理为重点的干预更强,所以要评估你真正关心的东西;(2) 宽泛的预测区间意味着强平均效应并不能保证在任何一个具体的本地情境中都有强效应,这进一步支持了情境敏感设计的必要性。

批评人工智能,而不只是操作它

在本科心理学课程中,Richmond 与 Nicholls 让学生按照课程评分量规给一份由ChatGPT生成的媒体通稿打分、找出错误并加以修改。学生大多能看出该输出在文风上很精致,但在准确呈现研究目的、方法与结果方面很薄弱。与前一届采用Peer Assessment的班级相比,接受人工智能批评训练的班级在随后的脚本修改中表现略好(d = 0.36),但在最终视频上没有显著优势

这为以批评为基础的人工智能素养提供了令人鼓舞的证据,但历史比较使其无法得出强的因果结论。

来源:利用生成式人工智能促进本科心理学中的心理学素养、反馈素养与人工智能素养

把人工智能素养嵌入学科工作

Beck 与 Brodersen 的经济学做法是:先让学生自己解决或解释一个真实的经济学问题,然后获取 ChatGPT 的回答,比较两者,批评人工智能,进行反思,并与同伴讨论。该干预把人工智能素养与既有的主动学习方法(如 Think-Pair-Share)结合起来。

其主要贡献是一种可迁移的教学设计,而不是关于学习效应的强实验证据。

来源:在经济学中培养生成式人工智能素养

持续的体验,而不是一次性的工作坊

NC State 的人工智能素养连续体描述了从尚未参与不加批判地使用,经由知情使用批判性评估改进的进阶。其实施涉及课程与工作坊中的 330 多名参与者。

观察表明,简短的经验可以推动学生走向知情使用,而批判性评估与改进的证据在持续的、嵌入学科的体验中更为明显。不过,该研究没有经过验证的前后测测量或对照组,因此这属于基于实践的证据,而非因果证据。

来源:超越工具采用:高等教育中人工智能素养的实践性五阶段发展连续体

协作式与认知活跃的设计

Hingle 与 Johri 的系统综述ICAP 框架来组织人工智能素养活动:被动接受、主动操作、建构性生成与互动性共同建构。该综述发现四种模式都有相应干预,并反对把人工智能素养简化为一堂单向的信息传授课。

证据支持为学生设计创造、批评、解释并与同伴辩论人工智能输出的机会。

来源:促进人工智能素养的协作学习活动系统综述

教师教育:自信与已证明的能力

Le 等人的基于设计的 GenAI 素养干预先在 14 名硕士生中试点,又在 29 名教师教育学生中评估,结果显示报告的人工智能能力自我效能有所提升,并促使学生更批判性地从教学法角度考虑 GenAI。

然而,伦理方面的提升仅达到边缘显著,而这项规模很小的设计研究意味着关于客观能力的结论仍然有限。

来源:为教师教育学生开发并评估人工智能素养培训

人工智能素养培训并不能消除与人工智能相关的错误

一个特别重要的提醒是:训练学生更好地写提示或使用人工智能,并不等于让他们成为可靠地具有批判性的使用者。在情境性迎合实验中,人工智能素养与提示训练降低了模型镜像参与者推理错误的倾向,但并未消除错误的下游传播

这表明素养教育无法独自承担全部的安全责任;工具设计与系统层面的防护同样必要。

来源:情境性迎合的隐性代价:人机协作中的人工智能素养干预

测量人工智能素养很重要

测量文献进一步支持了这一提醒。经过验证的 GLAT 表现测试能够预测学生在人工智能辅助的高等教育任务中的表现,而自我报告的 ChatGPT 素养测量则不能。更广泛地说,本知识库记录了人们自报的人工智能能力与实际展示的能力之间存在明显差距。

因此,一项提升了信心、态度或自感素养的干预,不应被自动解读为提升了人工智能素养本身。这说明教育测量评价效度评估人工智能素养干预时非常重要。

更新的研究同时厘清了应当测量什么如何测量。Burriss 等人的课堂研究考察了 22 名十一年级学生创作关于人工智能伦理的视频公益广告,认为既有的人工智能素养量表与能力框架假定表现可以被单独测量,因而排除了协作性与创造性的表达;他们提出,学生的反思、多模态作品与公民话语应当补充常规测量。他们发现学生通过协作式的批判性教学法发展出对人工智能伦理的批判性理解,这对把人工智能素养理解为一份技能清单的观念构成挑战,也挑战了建立在这些清单基础上的测量工具。该研究还显示了趋势方向:15 份单元末回应确认了新的学习,而回应总共只有 18 份,同时作者指出这一项目难以用传统的总结性评价来评估。参见多模态创作作为批判性人工智能素养教学法的一种形式

另一个提醒来自接受度研究。Wang、Chuang 与 Wu 调查了 831 名台湾的K-12学生与教师,在他们使用按年龄分级的人工智能素养指南约 30 分钟之后施测,发现了一个稳定的四因子接受度结构,但感知趣味性是行为意向最强的相关因素,而且该研究测量的是短期接受度,而非学习收益伦理能力或实际使用情况。作者明确指出,接受度构念“不得被用来推断学习有效性或实施成功”。参见测量对按年龄分级的人工智能素养指南的接受度

来源:

先诊断,后教学:学生已有的人工智能认知

一项干预从哪里开始,与其内容同样重要。Şan 与 Orhan Karsak 对 436 名土耳其本科生使用心理语言学的词语联想测试(1,376 条编码反应,评分者间 κ = 0.87),以勾勒他们对人工智能的认知表征。联想集中在工具性效用上:便利(f = 145)与速度(f = 110),而算法透明性、隐私与治理等概念不仅少见,而且在结构上与占主导的效用聚类相隔离(Kendall's τ = −0.819)。作者认为,把一个伦理模块投放到没有任何现成图式可以接收它的认知结构中,很可能会失败:课程必须搭建明确的桥梁,把日常的工具知识与伦理和治理框架连接起来;微证书也应当对内容加以排序,以弥合这一结构性缺口,而不是重复学生已经知道的东西。这是干预设计中的需求评估论证,也是少数在教学之前提供数据驱动诊断的研究之一。参见知其名,而不知其本质

一种对照性的、情境化的观点来自 Dai 与 Chan 对 28 名研究生的七次焦点小组访谈:这些研究者在整个研究工作流中以不同方式践行人工智能素养,在低风险的流程性任务(排版、翻译、解释)中使用更多,而在涉及学术贡献时会明显更加谨慎,并自行划定辅助与替代自身推理之间的边界。他们的结论是:人工智能素养更适合被视为一种情境化能力,而不是一份静态的能力清单;负责任使用的指导应当在实际任务中脚手架式地支持每一个素养维度,而不是强制推行二元规则。参见通过面向人工智能素养的指南塑造研究中负责任的 GenAI 使用

证书与项目层面的评估

人工智能素养越来越多地通过证书与微证书来提供,而评估恰恰是最薄弱的一环。Wu 与 Li 为人工智能证书项目构建了一个由专家赋权的评估指标体系(AHP / Fuzzy-AHP,并用蒙特卡洛方法进行稳健性检验,18 位专家),发现教师专业能力的重要性与满意度之间的差距最大:感知重要性高(0.1976),而当前满意度低,这说明教学法转型的主要制约因素是教师能力,而不是技术基础设施;跨文化适应性获得的战略权重最低(0.0735),显示出早期证书化过程中的技术优先偏向。参见人工智能证书项目的评估指标体系。这凸显出一个干预研究几乎尚未检验的问题:一本证书究竟认证了持久的人工智能素养,还是仅仅记录了完成情况;以及颁发证书的教育者自己是否具备评判能力。

对证据的总体评估

总体而言,这些证据可以概括为:对教学设计原则的支持为中等,而对因果有效性的支持仍处于弱到中等之间

目前对高等教育而言最站得住脚的模式是:

  1. 把人工智能素养嵌入真实的学科任务之中。
  2. 让学生在使用人工智能之前先形成初步判断或解法。
  3. 要求对人工智能输出进行比较、核查与批评。
  4. 纳入同伴对话与反思。
  5. 让这些体验反复发生,而不是只依赖一次性工作坊。
  6. 需要独立评估与负责任判断的表现性任务来评价学生,而不是只依赖信心或自我报告问卷。

仍然存在重要的空白。文献还需要更多多机构随机实验或强准实验研究、经过验证的共同结果测量、关于保持与迁移的延迟测验,以及关于当学生遇到新的人工智能模型、学科或不熟悉的人工智能失效模式时素养收益是否持续的证据

简言之,当前证据支持把人工智能素养当作一种嵌入学科的批判性实践,而不只是关于人工智能的知识或写提示的熟练度。批评、比较、反思、协作与反复的真实练习在教学上的理由越来越自洽,但具体干预能够产生持久且可迁移的人工智能素养,这一点的证据仍不够确立。关于这一结论如何转化为具体的课程设计,参见我应当如何把人工智能素养融入我的课程?;关于证据基础本身仍然薄弱的地方,参见人工智能教育研究文献中值得注意的空白有哪些?

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.