问答
人工智能如何在我的课程中支持残障学习者与神经多样性学习者?
本页是英文页面的机器翻译,尚未经母语者审校。
你可能是刚刚收到无障碍安置函的教师,正在决定是否批准采购许可的无障碍负责人,或者必须在周五之前答复一项工具申请的无障碍服务协调员。你需要的不是一篇文献综述,而是一个站得住脚的决定:该采用什么、该拒绝什么,以及如何判断你批准的那件东西是否真的帮助了眼前这位学生。
结论如下,其中的保留条件一并保留:人工智能可以支持残障学习者与神经多样性学习者,但已被测量的范围很窄。大部分证据涉及一次只消除一项功能性障碍的工具;最强的定量结果来自 PK-12 特殊教育情境,且大多使用生成式之前的人工智能;而高等教育的情况更像是一张“尝试过什么”的地图,而不是一次“什么有效”的测量。这里的任何内容都不足以支持一刀切地采用。这里的一切都支持一种范围狭窄、有指导、针对具体障碍的采用方式,并点名了几种会失灵的做法。
从障碍出发,而不是从诊断出发
对残障学生与神经多样性学生而言,出问题的地方大多发生在任务层面,而不是诊断层面:一份假定学生能阅读印刷文本的阅读材料,一段假定学生能持续注意的视频,一个假定存在心照不宣的社交规则的小组项目。这些障碍在不同诊断之间反复出现,因此真正有用的问题不是哪种工具适合哪种状况,而是一件工具消除了哪一项功能性障碍。下文每一条建议都按这种方式组织,你的采购也应当如此。
该采用什么,按证据强度排序
1. 有实测效果的消障工具:中等把握,但来自 PK-12,且大多是较早的人工智能。 本页最强的定量结果也是最宽泛的一个。Zhang、Carter、Liu 与 Peng(2024)综合了 29 项针对残障学生的基于人工智能干预的(准)实验研究,即来自 41 个独立样本的 239 个效应量,发现其对学习结果有统计上显著的中等总体效应,Hedge's g = 0.588(95% CI [0.349, 0.826],p < .01),研究间异质性很高。学业表现为最大的结果子组(k = 80,g = 0.929),社会情感技能为最小(k = 144,g = 0.382)。计算机软件,即语音识别、专家系统与智能辅导系统,表现强劲(k = 74,g = 0.959),机器人为中等(k = 144,g = 0.509),而智能虚拟现实(g = 0.528)并不显著。发表偏倚确实存在(Egger's β = 2.837,p < .001);剪补法把估计值降至 g = 0.269,仍然显著。请如实看待这个把握度标签:所有研究都来自 PK-12,96.6% 在特殊教育或临床情境中使用基于步骤的教学,并且大多数使用的是较早的基于规则的人工智能,而不是生成式人工智能。这为谨慎采用结构化的教学软件提供了依据,但并不为向你推销的那个聊天机器人提供担保。
2. 具体、针对单一障碍的工具,研究规模很小:低把握度,样本量小。 有三项结果展示了单件工具能做到什么,每一项都只在少数学习者身上做了测试。在注意力方面,Pimenova、Begel 及其同事(2026)事后把教学视频切分为带有固定停顿的单指令片段;在 17 名患 ADHD 的学习者和 10 名不患 ADHD 的学习者中,它改善了所有人,并把 ADHD 参与者的错误与犹豫拉到与其他人相当的水平,这是一种来自轻量改造的拉平效应,而不是某个针对特定诊断的产品。在语言可及性方面,Chen 等人(2026)在大语言模型生成的基础问题集中加入了 Visual 问题(视觉信息很可能被误读的时间点)与 Emotion 问题(以往聋人与听障学习者报告感到挫败的时间点),共生成 30 个问题,每种策略十个;在 16 名学习者中,自我效能感在七点量表上平均为 5.70(SD = 1.12),聋人参与者比听障参与者更多地选择 Visual 问题。在读写方面,Rezazadegan 等人(2026)挖掘了有阅读障碍的学习者自己在论坛中的讨论,发现他们看重人工智能在读写支持上的价值,同时报告了不稳定的输出质量与公平合理便利的缺乏,而这种不一致本身就是一种障碍。请把这类工具当作低成本、可回退的试验来采用,而不是当作固定的基础设施。
3. 高等教育清单:一张地图,而不是一次测量。 对于高等教育,情况更像一张地图,而不是一次测量。Rempel、Heimann 与 Prilop(2026)从五个数据库的 766 条记录中筛选出 40 项发表于 2015 至 2025 年间的纳入研究。生成式人工智能出现在这 40 项中的 15 项里,虚拟现实出现在 11 项中。障碍覆盖并不均衡:读写(n = 13)与学习管理(n = 12)占主导,注意力(n = 4)与社会沟通(n = 5)被忽视,并且只有 6 项研究涉及不止一项障碍。该综述只涵盖高等教育,按设计排除了K-12与专门机构情境,因此它不是关于年龄更小学习者的证据。用它来看清哪些障碍在你所处的学段上已被处理、哪些几乎无人触及。
4. 结构与通用设计,有证据支持且免费。 学习者陈述的偏好本身就是设计任务书。Zastudil 等人(2026)调查了 24 名神经多样性计算机专业学生(自闭症和/或 ADHD)与 20 名神经典型同伴,并做了四次后续访谈:神经多样性群体对无结构或含糊的作业感到不适,强烈偏好规模较小、稳定合作、角色界定明确的团队,并以自我选择角色与策略性披露来应对。他们对人工智能介入的工作提出的警示是:工具的互动模式可能重现同样的结构性含糊。结构是这份清单上最便宜的干预,也是最常被遗漏的一项。
该避免什么,包括那些会适得其反的合理便利
- 不要把人工智能当作合理便利提供,却不教它怎么用。 最常见的失败不是选错了工具,而是工具没有被教过。案例 W.A. v. Clarksville/Montgomery County School System(2024)是有据可查的一例:一名学生被给予人工智能作为合理便利,毕业时却不会阅读,法院认定未提供免费适当的公立教育。
- 不要让一刀切的人工智能禁令拿走一件辅助工具。 Wright(2026)主张,把所有“使用人工智能”同等对待的规则属于过度涵盖,因为它们没有把语音转文字与 OCR 同生成式写作区分开来。受精细动作控制、手写可读性或打字准确性影响的学生,一直依赖 Dragon NaturallySpeaking 这类独立语音转文字产品和独立 OCR,其中若干产品已被停产或降级,而由人工智能驱动的转写填补了这一功能空缺,因此一条写成“不得使用人工智能”的规则可能撤走学生产出可读作业的主要手段,而这种替代的规模尚未被测量。应当把转写与 OCR 明确列为政策中点名的合理便利,而不是政策的牺牲品;由此产生的风险敞口属于Legal Issues and Risks的范畴。
- 不要只围绕诊断来组织支持。 该范围综述的核心发现是一条批评:文献由围绕正式诊断组织的个别合理便利与针对单一神经类型的工具主导,而它们所针对的功能差异横跨不同神经类型,并被诊断分类所遮蔽。有阅读障碍的学生往往因减少对纯书面材料的依赖而受益,而自闭症学生与患 ADHD 的学生都可能经历注意力的频繁波动,这使他们的表现对稳定的结构以及足够的任务切换时间很敏感。与标签相匹配的工具可能错过学生实际存在的障碍。同样的谨慎也适用于群体统计:本知识库中规模最大的元分析报告,患有特定学习障碍、智力与发展性障碍或聋人学生的效应量明显大于自闭症谱系障碍学生,而这一差异在其效应量之间被报告为不具有统计显著性(参见不同学习者群体之间的差异效应)。
- 不要把自我标识当作获得支持的前提。 合理便利要求学生自己表明需要特殊安排,这会带来污名;通用设计则去掉了这一步。
- 不要忽视反转效应。 聊天机器人过度依赖与沉浸式环境的认知超载作为反转效应已有记录,即加入技术反而降低了学习。一件只是把现有教学以数字形式复现的工具,应当预期只能带来有限的学习收益。
- 不要部署可靠性未经证明的工具。 使用人工智能获得读写支持的有阅读障碍的学生报告了真实的价值,同时也报告了不可靠的输出质量;一件无法依赖的工具会增加工作量,而不是减少它。
- 不要原样接受厂商交付的产品。 把通用设计与参与式开发写进采购要求,而不是接受别人卖给你的任何东西。该范围综述建议与神经多样性学生一起构建工具,而不是替他们构建,而它自己的样本显示这种做法何等罕见:40 项研究中只有 3 项把环境或神经典型同伴当作干预对象。
- 不要默认购买最沉浸式的选项。 虚拟现实是这一组里资源消耗最大的选项。辅助技术需要设备与网络连接,而在试点中免费的工具往往会退到付费墙之后。
- 不要让自动化偏误替代判断力。 LUDIA的作者指出了一个应当写进每份部署方案的限度:自动化偏误意味着,最容易接受糟糕建议的教育者,恰恰是那位相信该工具懂通用学习设计的人。也还没有人检验过它的输出是否存在文化或语言偏见。
如何判断一件工具是否帮助了这位学生
总效应只告诉你一个方向;它们不会告诉你这件工具下周在你班上的这位学生身上是否有效。有三种谨慎应当贯穿任何一次试用。
第一,子组排序只是提示性的,并非已经确立。这项 2024 年的元分析无法说明哪种设计选择更好:没有任何一类调节变量达到显著,因此诸如可教型智能体(g = 1.100)排在社交情感教练(g = 0.336)之前,或者二元互动排在三元互动之前(g = 0.973 与 g = 0.385 相比)这类排序,不应被视为已有定论。站得住脚的立场是:效应的方向有支持,而任何收益的大小、最佳设计与持久性都还没有。
第二,这些文献描述部署与感知,多于描述被测量的学习。注意力(n = 4)与社会沟通(n = 5)是研究最少的障碍,40 项研究中只有 6 项服务了不止一种障碍。(准)实验设计与纵向设计的稀缺,以及工具与结果的异质性,正是为什么高等教育部分是一项范围综述而不是元分析。覆盖范围偏向本科生与全球北方,检索限于英语的同行评审成果,研究生的代表性不足。请把投入度与满意度视为弱指标;测量你原本要消除的那项障碍。
第三,一件修好某项障碍的工具可能留下另一项。40 项研究中只有 6 项服务了不止一种障碍,因此请对照学生报告的具体困难来检查工具,无论是读写、学习管理、注意力还是社会沟通,并针对那项障碍来评价,而不是针对一份满意度调查。要问学生本人:Zastudil 等人的参与者与 Rezazadegan 等人论坛上的发帖者,都比为他们打造的产品更精确地描述了自己的需求。
你会听到的反对意见
“我们不能要求所有人都用某个工具。” 可以,只要这件工具是一种设计特征,而不是一项个人合理便利。带固定停顿的视频切分改善了所有学习者,不只是患 ADHD 的学习者,而把 ADHD 参与者的错误与犹豫拉到同等水平,正是那种能免去披露需要的通用设计结果。Pimenova 与 Begel 的结果是一种来自轻量改造的拉平效应,而不是针对特定诊断的产品。请把它与无障碍的默认设置配对:朗读、OCR 与文本分级工具反复出现在 Shin 等人(2026)经过验证的政策条目中,该研究用基于大语言模型的主题建模,并对 17 位专家开展两轮德尔菲调查,覆盖 2015 至 2025 年间 12 份美国人工智能教育政策文件,结果发现12 份文件中只有 2 份具体涉及学习障碍,而一般人工智能政策或其他残障政策中出现的 18 个议题,包括数据保护、法律风险管理与伦理准则在内,在特定学习障碍政策中都缺失。
“字幕和翻译不是学业支持。” 字幕只是一个开始,并不是语言可及性的全部。基于文本的提示与以手语为第一语言的群体并不匹配:应当把文字记录与视觉、情绪语境线索配对,并削减不必要的复杂性,就像 Chen 等人的 Visual 与 Emotion 问题所做的那样。而且政策专家自己的排序与这一反对意见相左:他们经过验证的 36 个条目分为五个主题,即包容与个性化学习(11 项,30.56%)、伦理、公平与包容(9 项,25.00%)、学生赋权与人工智能素养(6 项,16.67%)、评价与研究(6 项,16.67%)以及教育者准备(4 项,11.11%),并且他们把学生赋权与人工智能素养列为最重要的一项:教这些学生负责任地、独立地使用人工智能,同时防范过度依赖。
“学生必须独立。” 独立性正是教学的目的所在,这也是为什么没有教学的工具会成为失败模式。Shin 等人的教育者准备主题出于同样的原因而存在,而 LUDIA 的作者把这一障碍称为“知行之隔”:指导材料大量存在,却写得笼统,而障碍总是具体到这一间教室、这一周。需求的规模很容易被低估:全球约有 240 百万儿童患有残障,其中约一半在低收入和中等收入国家失学,而在 OECD 体系中约有三分之一的教师报告缺乏支持有特殊需求学生所需的能力。法律框架是美国《辅助技术法》(2004)与《IDEA》(2004),它们把辅助技术评估纳入每一份个别化教育计划,并要求提供免费适当的公立教育,然而没有任何正式的循证指南帮助教育者或家庭为这些学习者实施人工智能。建立在未教过的工具之上的独立性,正是判例法所惩罚的。
“我们负担不起。” 那就拒绝那个昂贵的默认选项。辅助技术领域集中在全球北方,其最沉浸式的工具最难以规模化,而虚拟现实是这一组里资源消耗最大的选项。LUDIA 是通用设计替代方案的一种具体做法:它在设计决策仍然开放的时候把教育者与通用学习设计连接起来,并通过架构消除访问障碍,包括零成本、无需账号或不存储聊天记录、符合 WCAG 2.2 AA 级,以及 13 种机器翻译语言,尽管非英语版本可能带有其来源英语的假设。它是一个思考伙伴,而不是解决方案引擎,它围绕“信任证明”而不是影响证明来组织自己的探究,并明确表示作者没有证据表明该工具能改善学习。请诚实地为另一项成本做预算:Shin 等人指出数字鸿沟问题,因为先进人工智能工具的价格可能拉大富裕学校与贫困学校之间的差距,此外还有算法偏见与教师培训缺口。
本周就做这些事
- 先给功能性障碍命名。 读写、学习管理、注意力、社会沟通,然后检查这件工具是针对这一障碍,还是只针对一个诊断。
- 使用有证据支持的做法。 带固定停顿的视频切分把 ADHD 的成绩差距缩小到同等水平,而朗读、OCR 与文本分级工具反复出现在经过验证的政策条目中。
- 把字幕当作开始,而不是语言可及性的全部。 把文字记录与视觉、情绪语境线索配对,并削减不必要的复杂性。
- 直接给出结构,而不是让学生去猜。 规模小且稳定的团队、明确的角色、清晰的期望与角色自选,是神经多样性计算机专业学生报告的偏好。
- 把无障碍要求写进采购。 把通用设计与参与式开发列为要求,优先选择免费且保护隐私的工具,并追问免费档期结束之后会怎样。
- 培训人,而不只是部署工具。 为学生学会使用工具、为教职工把它融入作业安排出时间;一项没有配套教学的合理便利在法庭上失败了。
- 为重叠而设计,并留意反转效应。 40 项研究中只有 6 项服务了不止一种障碍;聊天机器人过度依赖与沉浸式环境中的认知超载可能降低学习。
- 如实报告结果。 大部分证据描述的是部署与感知,也没有任何设计调节变量得到确立;请把投入度与满意度视为弱指标。
- 为培训与工作流程整合投入经费,正是这些把一件无障碍的工具变成可用的支持,并把设备与网络连接的成本写进计划。
接下来可以去哪里
本页是面向各类学习者的实用性入口:Universal Design for Learning涵盖在设计阶段就预防障碍出现的哲学,Assistive Technology涵盖学生使用的工具层,Accessibility涵盖一种格式究竟能否被感知与操作,而Neurodiversity涵盖把差异视为多样性而不是缺陷的视角,这些都在Inclusive Learning这一总括概念之下。
关于研究一侧的义务,参见把公平、无障碍、隐私、伦理与教学安全纳入 AIED 研究的做法。