问答
应当如何为人工智能设计真正改变教学实践的教师发展项目?
本页是英文页面的机器翻译,尚未经母语者审校。
如果你负责教师发展工作,你承受的压力大概是下面几种之一:教务长希望今年就上一个关于人工智能的项目;出席情况不错,但课堂里什么也没改变;或者最需要它的人根本不会来。这三者指向的是同一个设计失误。真正改变教师实践的,并不是了解一个工具能做什么,而是围绕他们自己课程中的某个问题投入有支持、有结构的时间,时间长到足以让新习惯取代旧习惯,并且机构明确表示支持这项实验,而不只是允许它。
简要版。 别再办工具演示会。把一种会议循环固定下来:每位参与者带来一件真实的课程作品,离开时带走一件经过修改的作品;把核实、披露与风险控制写进工作模板,而不是当作附加的伦理环节;把项目拉长到超过一天,并配上导师指导;按学科组织小组;并且衡量人们在延迟之后产出的作品,而不是他们在最后一天下午的自信程度。本页余下的内容,就是上述每一项选择的证据、决定它们能否成立的制度条件,以及当院长问“它有用吗”时你可以怎么回答。
为什么工作坊模式效果不佳
文献中最直接的比较来自Bi 等人(2026),他们调查了五所大学的 568 名教师,随后又对其中的 160 名做了准实验。两组都在连续几周内参加了四次 90 分钟的工作坊,接触时间、平台和主持人支持完全相同。差别在内容:一组接受常规的生成式人工智能教师发展培训,另一组则围绕一份包含七个组成部分的模板,进行结构化的循环训练,即提示词拟定、输出审查、课程材料修改和书面反思,模板涵盖目标、任务约束、评估标准、核实、披露和风险控制。结构化那一组在全部七个准备度维度上都得分更高,优势最大的是提示词设计,约为两个标准差;而且它也是唯一一组其提示词设计增益在延迟测试中依然保留的:常规组较小的增益到随访时已回落到基线以下。
另外两项结果解释了为什么演示无法迁移。Bai 与 Hsieh(2026)用AI-TPACK量表调查了 898 名大学教师,发现那些理解生成式工具如何运作、或者能熟练操作它们的教师,报告自己发明并实施新教学实践的可能性,并不高于那些做不到的人。整合性的 AI-TPACK 构念根本没有通往创新行为的直接路径:它的影响完全经由人工智能素养、教学Self-Efficacy和职业认同传递。换句话说,能力受到教师如何看待自己的中介,而这并不是一次工具走查能够解决的问题。
此外还有一个上限。在一项有 13 名高等教育教师参与的组内研究中,可以使用聊天机器人使达到两项或更多高阶布鲁姆任务的活动比例从 41.7% 上升到 91.7%(p = .01),并使感知到的认知努力中位数从 6.33 降到 3.33(p = .004);但叠加其上的教学提示词训练并没有进一步改善设计质量,反而略微增加了努力程度。而在一场有 60 名中学科学教师参与的工作坊中,真正起作用的环节是协作评审 ChatGPT 生成的评估题目,正是它暴露了概念精确性问题以及强化误解的风险。这两项研究的共同点是:学习来自对材料的批判与修改,而不是来自被展示材料。
应当改建成什么
与上述证据最贴合的设计架构是Dogan(2026)的 i-TPACK 框架,它建立在一次关于人工智能专业发展的 PRISMA 综述之上,并另做检索发现了 17 项进一步的研究。它把五个知识领域,即智能技术知识、技术内容知识、技术教学知识、整合性的 i-TPACK 与人工智能伦理,与四条循证路径对齐,即主动学习、示范与示例、教练与专家支持,以及反馈与反思;并由五条原则统摄,从“集体协同优于孤岛”到“结构之内保持灵活”。在你照搬任何人的项目之前,它对这个领域的批评值得认真对待:在许多现有项目中,伦理要么被浅尝辄止地处理,要么完全缺席。该框架的局限在于它是概念性的,没有项目层面的结果数据。
把它转化为一个你下学期就能开办的项目,意味着:
- 每次会议都以一件被修改过的作品收尾。 参与者带来一个目标、一份量规或一项评估任务,离开时它已经改变。Bi 等人(2026)测量的正是这个循环,而它正是在随访中依然成立的版本。
- 让模板承载那些困难的部分。 核实、披露与风险控制应当放进参与者整周都在使用的工作文档里,而不是放在收尾环节。这也让焦虑有处可去,这一点下文还会提到。
- 把评估设计当作收益最高的目标。 在Talebzadeh(2026)的八小时项目中,四次两小时的课程共有 163 名教师和职前教师参加,AI-PCK 总分从 151.65 上升到 220.14(d = 2.36,p < .001),分量中效应最大的是评估量规(d = 2.19),而它在前测中也是最薄弱的部分。教学方法上的差距比评估上的差距要小。
- 预算要超过一天,并加上导师指导。 同一项目中的职前教师比有经验的教师进步显著更大(p = .033),主要是在基于场景的任务设计和量规设计上。有经验的教师表示,八小时太短,不足以改变根深蒂固的习惯,并要求获得长期的、以导师为基础的支持。
- 给受众分群,而不是办一场面向所有人的工作坊。 Sutedjo、Chowdhury 与 Liu(2026)在 127 名受访者中发现,自我感知的教学内容知识较高(M = 4.70),内容知识接近上限(M = 5.15),而技术教学知识(M = 2.62)、技术内容知识(M = 2.75)和整体 TPACK(M = 2.55)明显更低。内容知识与任何技术整合领域都没有显著相关(r = .11–.15),因此学科专精并不会自动迁移;而这三个偏低的领域彼此之间的相关为 r = .81–.91,说明它们很可能是共享的同一项教学能力基础,而不是三个彼此独立的模块。
- 决定人际关系是否在项目范围之内。 Aponte 等人(2026)主张,只有当人工智能充当关系性基础设施时,它才会对教师的社会情感发展有所贡献,比如把时间保护起来用于导师指导、同伴对话和实践共同体;他们提出以关系性加密作为标准,衡量的对象是信任、支持的连续性和共同调节,而不是接触时长。其中两项主张可以直接转化:被释放出来的时间会被额外的需求重新吸收,除非机构以正式方式要求把它再投入;而对话式代理会悄悄成为低摩擦的替代品,取代那些能带来成长的、困难的人际协商。他们的框架是一种启发式,而不是经过检验的因果主张。
决定成败的是制度条件,而不是课程内容
这是值得带到领导层会议上的发现。在同一项研究中,哈萨克斯坦的教师在全部七个维度上都报告了比中国同行更高的基线准备度,差距最大的是学科迁移、提示词设计和基础理解。然而在层次回归中,一旦纳入此前的生成式人工智能使用、近期的人工智能培训、机构支持、被感知到的许可、多语种资源获取、政策清晰度和风险敏感度,哈萨克斯坦这一系数,本来单独看已明显显著,便降为不显著,降幅约为五分之四。机构支持与被感知到的许可带来的正向权重最大。风险敏感度是唯一一个与准备度方向相反的预测变量。报告在过去六个月内参加过人工智能相关培训的哈萨克斯坦教师,是中国教师的两倍多。
因此对项目负责人来说,可以撬动的都是本地而近旁的杠杆:动手实践、明确许可去实验、用你的教师实际工作中使用的语言提供的材料,以及来自所在单位看得见的支持。国家政策的框架本身并不能带来准备度。在风险敏感度发作的地方,答案不是把谨慎说服下去,而是给它一个得以施展的场所:量规设计与核实流程正是让紧张变成判断的方式。
还有两处实际的摩擦属于同一个话题。持续使用意愿是Bi 等人(2026)中评分最高的满意度维度,而工具的易用性是最低的,所以看起来像是不情愿的一部分其实是平台摩擦。而Aponte 等人(2026)指出了硬性上限:人工智能无法弥补长期过载、惩罚性的问责文化、弱领导力,或者受保护时间的缺失。如果你的处境就是这些,那么办一场更好的工作坊也解决不了。
怀疑者与焦虑者才是目标,而不是障碍
Laidlaw(2026)依据一份自我民族志式的叙述主张,抵触并不是技能不足。在生成式人工智能世界里追问教学意义何在的教师,问的并不是如何安全地使用工具;这个问题是本体论层面的。把生成式人工智能读作一个阈值概念,即具有变革性、麻烦性、不可逆性、整合性和边界性的概念,她得出结论:焦虑、抵触和困惑是跨越它的必要组成部分,而不是需要被纠正的问题;并且她的建议把标准工作坊颠倒过来:先用身份问题开场而不是演示,按学科组织小组,允许不同的时间表,并把基于学科价值的、有原则的不采用视为正当。她还警告,传达规则可能会滑向一种“执行幻觉”,用合规宣导替代真正的支持。
这里同样存在一个关于适配的设计论据。在Bai 与 Hsieh(2026)中,职业认同对创新行为的预测力,在不常使用人工智能的人身上几乎是对每日使用者的两倍;这是一个处于临界的结果,但它提示身份层面的工作对几乎不碰这些工具的人最有回报。Sutedjo 及其同事主张有意按学科组织项目,因为专长不会迁移;Laidlaw希望把按学科划分的小组作为身份对话的场所;而Bai 与 Hsieh建议按经验水平区分对待,使用有限的人需要基础性指导,频繁使用者则能从跨学科项目中获得更多。
对焦虑的参与者来说,Aponte 等人(2026)补充的是治理条件而不是激励条件:把身心健康支持与管理层评价分开、最小化数据、限定用途、保持参与自愿,并保障人工监督。正是这些条件,让一个人工智能中介的空间里承认不确定变得安全。
情感层面现在也有了自己的测量工具。 Vassallo(2026)调查了 109 名学者,识别出一种**“人工智能负罪情绪”:35% 的人担心使用人工智能会损害自己的可信度,26% 的人表示感觉自己是在“作弊”,而且对可信度的预期性内疚超过使用之后的悔意**,因此这种痛苦是社会职业性的,而不是私人的。研究浮现出四种画像,即坦然采纳者(27%)、有负罪感的非使用者(29%)、谨慎使用者(28%)和道德困扰型回避者(16%);这意味着同一个项目要应对四种不同的问题,而那 29% 虽不使用工具却感到内疚的人,需要的是演示以外的东西。这项机构任务的规模在AAC&U/Elon 对 1,057 名教师的调查(Watson 与 Rainie 2026)中可见一斑:68% 的人表示所在学校没有为教师做好使用生成式人工智能进行教学与指导的准备,在学术研究方面比例相近;26% 的受访者完全不使用这些工具,其中包括 40% 的艺术与人文学科教师;82% 的人把同事的抵触列为院系采纳的障碍。
向出钱的人证明它确实有效
值得对标的制度脚手架是Crompton、Burke 与 Nickel(2026)的工作,其基于设计的研究跨越两个宏观周期、共 114 名参与者,包括来自 28 所美国机构和 11 个国家的教师,以及教学中心主任和认证协调员,产出了六项标准,覆盖整个学术角色而不只是其中的教学部分:教师、协调者、领导者、研究者、学习者和贡献者。这个缺口确实存在:现有的框架和教育者标准针对的是K-12教师,或者只涉及教学。这类标准让发展中心能够把自己的供给与考核和认证对齐,而不是办一堆彼此脱节的工作坊,这也正是能在预算审查中站住脚的论证。
评估时要小心,因为这类文献大多测量的是自我报告。Bi 等人(2026)测量的是自我报告的准备度,而不是实际发生的教学或学生的学习;其分组来自自愿报名和机构排课,而不是随机分配,因此结果是关联而非因果估计。Bai 与 Hsieh(2026)是横断面的、自我选择的,取样自同一个国家的八所大学,并且在同一时间点从同一批受访者测量每一个构念;他们的创新量表还保留了通用创新测量的措辞。Sutedjo 及其同事无法确定因果方向,这一点很重要,因为他们最强的那个主张,即技术知识充当门径,恰恰是横断面设计无法判定的。Talebzadeh(2026)报告了非常大的效应,却没有随机化、没有随访、也没有按学科的分解,因此 d = 2.36 应当被读作短期效果,而不是持久实践的证明。Laidlaw(2026)是一份自我民族志式的反思,而Aponte 等人(2026)明确表示他们的框架是概念性的。
因此,站得住脚的评估衡量的是作品而不是意见:参与者修改过的课程材料、写出的量规、设计出的任务。它在延迟之后进行测试,因为Bi 等人(2026)中的差距只在随访时才出现,那时常规组已经衰减而结构化组没有。它把满意度和自信当作弱信号:Pishtari 及其同事(2026)指出,仅凭设计质量的提升并不能证明内化,因为设计质量的上升同样可能反映的是把日常工作委托出去,或者接受了人工智能生成的结构。并且它至少加入一项关系性指标,遵循Aponte 等人(2026)的建议,因为一边改进作品一边孤立参与者,并不是项目所宣称的目标。
三个反对意见的回应
“我们没有时间。” 那就换一种花法,而不是增加时长。Bi 等人(2026)中的比较把接触时间固定在四次 90 分钟的课程上;结构化组在同样的预算下表现更好。把六小时安排成作品循环,胜过六小时的演示;而把更短的时长花在评估量规上,正好针对Talebzadeh(2026)中最薄弱的领域。
“我们的教师不会来,或者怀疑者会把活动搅黄。” 不要把怀疑者招来听演示。先用身份问题开场,按学科组织小组,允许不同的时间表,并明说基于原则的不采用是一种正当立场:这正是Laidlaw(2026)的建议,它能把关于合规的争论从房间里移出去。按Bai 与 Hsieh(2026)的结论,可以预期身份层面的工作对不常使用者最有意义。
“我们没法让人真的照着做。” 大体上确实不能,但你可以改变机构发出的信号。在国家背景效应消失之后,被感知到的许可与机构支持在Bi 等人(2026)中带来了最大的正向权重,所以有用的动作都是成本很低的那些:明确说明实验是被认可的、以正式方式保护时间以免被重新吸收、用教师工作语言提供材料,以及消除平台摩擦,而它在同一项研究中正是评分最低的维度。
项目设计者检查清单
- 每次会议都以一件真实的课程作品为锚,即参与者自己带来、并在离开前修改过的目标、量规或评估任务。
- 把核实、披露与风险控制放进工作模板,而不是把伦理作为一个收尾单元加进去。
- 时长要够,并为项目配上以导师为基础的后续跟进;有经验的教职员反映,短期形式无法改变根深蒂固的习惯。
- 按学科组建小组,并按经验水平加以区分,而不是办一场面向所有人的工作坊。
- 在演示之前先用身份问题开场,并把基于原则的不采用视为正当的职业立场。
- 争取机构支持、被感知到的许可、受保护的时间,以及以教师工作语言提供的内容;这些比国家政策的框架更有分量。
- 用作品、延迟测量和至少一项关系性指标来评估;针对自我报告和横断面设计,如实报告效应量。
关于能力目标本身,参见在人工智能方面,教师需要具备哪些能力?;关于把人工智能结构化地融入一门课程而不是一场工作坊,参见应当如何把人工智能设计进学习体验之中?;关于更广阔的制度图景,参见在人工智能教育研究中,教师最应该了解的 10 项主要发现是什么?。