问答
我们如何撰写并落实一项机构层面的人工智能政策?
本页是英文页面的机器翻译,尚未经母语者审校。
你是教务长、院长、治理负责人、教学中心主任或委员会主席,必须拿出或为这项政策辩护,还要回应一位同事说它太严或太含糊。直接的要点是:发布一项政策是最容易的部分,而一份文件本身什么都改变不了。多数机构已经通过发布文件回答了“要不要有政策”这个问题,而由此形成的政策版图范围广却深度浅:多为建议而非强制,集中围绕学术诚信,而在数据、公平与能力这些决定人工智能使用能否走好的问题上则很单薄。把一份站得住脚的政策与一份积灰的文件区分开来的,是一个明确的负责人、一份审阅日程、一条通向课程的转化路径,以及一套奖励你所要求的行为的评价设计。
简版要点
在愿景上写短,在义务上写明确。审阅你的草稿,找出每一个你其实想说“必须”却写成“可以”“能够”的地方,并用一年级学生能照着操作的语言界定抄袭与禁止用途。在发布之前就指定一位高管负责人和一个审阅周期。说明 FERPA、GDPR、HIPAA、IRB 与研究诚信义务各自落在哪里,而不是把它们统统塞进来:一份同时承载数据保护、研究伦理、临床监管与学术行为的文件,会变得冗长、无人阅读且无法执行。把教职员能力与学生的使用条件放在一起资助,因为它们会一起失效。追问究竟有多少门课程真正把政策落地,并把数字低当作支持不足,而不是合规问题。把对人工智能使用的反思纳入评分作业,程度与它所要求的投入相称,并附上一份评估计划,因为在有人测量之前,谁都无权声称这项政策改善了任何东西。
先决定:你的文件管什么
Manikonda 与 Outlaw(2026)抓取了 149 所美国 R1 与 R2 大学的人工智能政策,核实出 130 项校级政策,覆盖 34 个州。这份清单是建议性的而非指令性的:95% 的政策在清晰度与强度上得分为负,因此弱化语言(“可以”“能够”)压过了指令(“必须”“禁止”)。校级政策优先考虑数据安全、风险缓解、采购与法律合规,教学方面的指引很少;而确实存在的院系级政策则聚焦教学与AI Literacy。只有八所商学院有本院系专属的政策,而这八项中有六项与其所属学校的框架不一致。作者给出的补救办法是分层结构:全校层面的风险管理层、院系层面的政策,以及由教师和学生组成的跨院系委员会。
这就给你一个要落笔写明的范围决定:宣布这份文件是一份风险管理工具,把操作细节放到院系层面,这同时也回应了“太含糊”的指责。
再决定:这些条款是否有约束力
看看在没有外力逼问时机构会发布什么。Eldredge 等人(2026)扫描了美国全部 48 个获得 CAHIIM 认证的健康信息学与健康信息管理硕士项目。四十个项目(83%)发布了至少一份与人工智能相关的文件;在可分析样本中,21 份文件(53%)是指南,9 份(23%)是信息性材料,只有 7 份(18%)是正式政策。学术诚信是出现频率最高的关键词(n = 139),排在引用(59)、Assessment(50)与抄袭(38)之前;披露人工智能使用与代写各出现一次;HIPAA 出现五次,FERPA 出现十一次,电子健康记录一次都没有。公平方面的词汇几乎缺席:包容(n = 9)、可及性(n = 9)、公平可及(n = 2)。这是有关注,却没有与之相称的有约束力的承诺。
这堂课的代价为零:数一数你的情态动词,在你想表达后果的地方写出后果。
再决定:谁来写,谁受约束
两项综述把弱点归在能力上,而不是意愿上。Ashiq(2026)综合了七十多份英国资料,发现只有少数机构维持着正式的人工智能治理计划,战略规划上的缺口会带来政策漂移与表演式合规,来自学生办公室(Office for Students)与 Jisc 的国家层面指引因缺乏具体性和强制力而受到批评,而且教职员的人工智能培训与基础设施投入集中在研究密集型机构,以教学为主的机构则面临能力约束。Baroudi(2026)综述了 19 份资料,发现尽管 49% 的机构把人工智能当作战略优先事项,只有 7% 设立了高级人工智能领导岗位,这一从理论到落地的差距由薄弱的政策框架与有限的数字基础设施造成,在全球南方尤为明显。写一份政策不是瓶颈,拥有它、为它配置资源并修订它才是。
所以在你起草之前就要决定谁主持、谁参与。Crompton 等人(2026)召集了来自六大洲 22 个国家与地区的德尔菲专家组,产出了一套包含八个核心领域的共识框架:学术诚信、合乎伦理且负责任的使用、隐私与保护、公平可及、GenAI 素养、整合策略、人工监督与问责,以及机构支持与基础设施;此外还有一套六部分的机制来让政策保持更新:多学科治理委员会(专家组过半成员)、定期审阅周期(半数成员)、专业发展、与所有Stakeholders的沟通、有效性评估以及对内外部动向的监测。把这套框架当作覆盖面清单,把这套机制当作运行模型。留意共识在哪里失衡,因为你的委员会也会同样倾斜:“合乎伦理且负责任的使用”被三分之二的专家提及,隐私被超过半数提及,而公平可及只被三分之一提及:公平正是共识过程首先低估的东西。半数专家坚持重要的 GenAI 输出必须由人审阅,并倾向于以过程为导向的评价与口头评价。
还有一项参与决策值得有意为之。Hingle 与 Johri(2026)让学生通过引导式探究共同设计一门 GenAI 课程政策;浮现出来的优先事项包括:为学生与教师提供培训、标准化的披露程序、更强的机构支持而不是依赖个别教师,以及在管辖自身学习的规则上拥有发言权;这支持的是让学生成为委员会成员,而不是做一轮咨询。Baroudi 发现赋权式与分布式领导风格与更高的教师参与度和变革开放度相关,并记录了Change Management工具(Valente 的传染模型、Rieber 与 Welliver 的五阶段框架)作为采纳的支持。按这份证据,领导风格本身就是政策的一部分。
Tan 等人(2026)提出了一个六维度的组织框架,其命题明确留待未来的实证检验。它是一份政策应当覆盖什么的清单,而不是什么有效的证据:用于搭建结构有用,若当作证据引用则属于过度主张。
实践中的缺口,存在于个人规则与机构规则之间。 AAC&U 与 Elon 对 1,057 名美国教员的调查(Watson 与 Rainie,2026)发现,87% 的人为学生自行制定了关于生成式人工智能使用的规则,而只有 48% 说自己的机构写过这类指引,35% 说自己的院系写过。在结构上,55% 报告设有工作组或监督小组,37% 报告开设了新的以人工智能为重点的课程,17% 报告有一个人工智能主修或辅修,16% 报告设立了新的学术领导办公室,而只有 13% 已把人工智能素养采纳为通识教育的学习成果。该样本不是科学性抽样,作者也说它不可推广,但这种不对称才是重点:学生真正遇到的规则,是由站在他们面前的教师写下的;也正因如此,把政策转化为课程比发布政策更重要。Coates、Croucher 与 Calderon(2025)为另一端提供了治理工具:一套为机构治理者打造的学术诚信指标框架,经由研究综述、多机构案例研究、原型设计与专家确认而成,并伴随对治理架构、人员与技术的改革。
再决定:数据、隐私与同意义务落在哪里
遵守基线法律并不等于合乎伦理的数据治理。Varadaraju 与 Vijayakumar(2026)认为,高等教育中的Learning Analytics治理一直停留在合规优先,中心是满足 FERPA 与 GDPR,并提出了 LEAGUE 框架:合法性、公平、能动性、治理、效用与设计伦理(Lawfulness, Equity, Agency, Governance, Utility and Ethics by Design),并以一个预警案例研究做了演示。德尔菲专家组独立地把隐私与数据保护列为超过半数成员认可的关键主题,而OECD《数字教育展望(2026)》的第三根政策支柱,是为可信 GenAI 打造有利环境,涵盖Privacy、安全、偏见测试与透明性。
健康信息学语料的教训是范围上的克制:它的人工智能文件几乎不提及 HIPAA、FERPA 或 IRB 指引,也从未提及电子健康记录,因为这些义务存在于更宽泛的合规政策之中。指明每项义务落在哪里,并要求学生在课程作业中遇到它。
再决定:政策如何抵达课堂
这是多数政策失败的那个决定,而且它是可以测量的。Ganguly 等人(2026)分析了来自 131 所 R1 大学的 116 项机构 GenAI 政策,以及来自 54 所 R1 机构的 98 份计算机科学课程大纲。机构层面多为鼓励使用 GenAI(73 项,63%),31 项(27%)表示不鼓励;在课程层面,90 份大纲(92%)给出了明确指引,但 49 份(50%)直接禁止使用 GenAI,40 份(41%)允许部分使用,只有 7 份(7%)表示鼓励。131 所机构中只有 47 所既有机构政策,又有可检测到的课程层面转化。按这份证据,治理意味着把政策转化为对教师的具体支持,否则教师会自行发挥,制定出可能与机构指引不一致的本地规则。
问你的委员会,有多少门课程能够被检测到把政策转化落地,并把答案当作支持指标,而不是合规指标。
再决定:能力、可及性,以及你承诺过的审阅
有两项常被遗漏的条款:教职员发展与公平可及。德尔菲专家组把机构支持与基础设施列为奠基性的使能条件;Baroudi 发现高级人工智能岗位罕见,并强调面向教师与员工的 AI 素养与实操培训。Ashiq 发现教职员的人工智能培训集中在研究密集型机构,从而扩大了Digital Divide。Adarkwah 等人(2026)分析了来自十个在 IMF 人工智能准备度指数上排名最前的国家、30 所高排名大学的 159 份文件,并对照 UNESCO 的八要素 GenAI 框架打分。四所大学因缺少可公开获取的政策而被排除,剩下 26 所,而德国各大学与塔林理工大学都找不到公开政策。核心伦理与治理原则被广泛采纳,而包容、公平、互联网接入、性别平等与环境影响常被忽略,许多条款仍停留在宣示层面而未经操作化保证:这与健康信息学语料发现的模式相同,那里的公平词汇几乎缺席。OECD 的第四根支柱是公平的数字基础设施,包括为低连通环境提供的离线小型语言模型。Tan 等人把能力维度从AI Literacy延伸到数据素养、数字伦理、战略思维、变革领导力与终身学习。
把这些放在一起做预算,并指定一位负责人:一项强制要求使用人工智能、却不资助设备、连通性、无障碍支持或培训的政策,是在派发一项它无法支撑的义务。
两项近期的政策研究给了你一件审计工具和一条关于支持的警告。 Gutowski 与 Hurley(2025)用明确的评分量规在五个维度上为机构政策打分:禁止性、许可性、教育整合、透明与问责,以及深度;他们发现所在领域的大多数机构总体上采取禁止立场,同时把裁量权留给个别教师,不存在单一被接受的做法,而清晰性本身被视为可辩护执法的前提。他们的建议刻意偏程序:无论立场如何都要有全面的指引、让利益相关方参与起草、主动提供培训、把治理设计成有弹性,以及审阅周期,理由是政策制定不是一次性事件。Qian(2026)从支持一侧得出同样的结构性结论:把机构区分开来的不只是规则本身,还有与规则一起发布的支持生态,包括教师发展、学生指引、评价支持与治理结构,这些让政策变得可运行。要把你的草稿读成一份附带规则的支持承诺,而不是反过来。
你会听到的四个反对意见
“我们已经有学术诚信政策了。”
它是必要的,但不充分,语料本身就是原因:诚信是最容易写的条款,所以它占据了关键词计数的大头,而公平词汇、可及性与数据义务则接近缺席。证据支持的是分工,而不是合并:行为规则留在学术诚信程序能够执行的地方,而人工智能政策承载诚信准则触及不到的东西:采购与数据安全、披露程序、无障碍与可及性、教职员培训,以及使诚信得以实现的评价条件。德尔菲专家组坚持对重要的 GenAI 输出进行人工审阅,并偏好以过程为导向与口头评价,这在诚信准则里无处安放。
“教师会无视它。”
有些人会,但这很少关乎意愿。Ashiq 的证据是能力:治理计划并不常见,规划缺口带来政策漂移与表演式合规,而培训与基础设施投入集中在研究密集型机构,以教学为主的机构面临约束。Baroudi 的证据是结构:49% 的机构把人工智能当作战略优先事项,却只有 7% 设立了高级人工智能领导岗位。Ganguly 等人的证据是转化:131 所机构中只有 47 所既有政策又有可检测到的课程层面落实。教师与其说是在无视政策,不如说是被单独留在政策旁边。对策是专业发展、范例与分布式领导,Baroudi 把它们与更高的教师参与度和变革开放度联系起来。
“学生不会读它。”
他们仍会对它做出反应,这才是更有用的事实。Braun 与 Khafizov(2026)调查了一所师范大学的 1,809 名学生、250 名教师与 62 名行政人员,发现学生报告的人工智能使用强度与有用性更高,而教师与员工报告的诚信担忧更强。在他们的合并模型中,感知有用性与Trust的标准化关联最强(β = 0.402),机构政策的清晰度为正但更弱(β = 0.223);学生报告的感知政策清晰度高于教师。这些都是横断面的自我报告关联,但这种排序提醒我们,不要把一份写得好的政策本身当作建立信任的工具。Ogbo 等人(2026)把学生的 AI 使用建模为一个协调问题,其中管束行为的是同侪规范而不是成文规则,并展示了阈值驱动的转变:反思性评价的回报必须超过某个临界水平,负责任的使用才会取代机会主义做法;回报必须与反思所要求的投入相称;同侪敏感度决定级联的速度。学生响应的是评价结构,而不是宣言,这支持以教学法为主导的治理,而不是监控。OECD 又补上一点:通用聊天机器人能提高输出质量,但在考试中一旦取消人工智能的使用权,这一优势就会消失、有时甚至反转,元认知参与度也随着工作被卸载而下降。把这项要求放进被评分评价里。
“我们没法管住它。”
你管不住,而证据表明你也不必。Ogbo 等人给出了这份语料中唯一一个形式化的结果:当评价激励错位时,仅靠政策宣言并不能改变机会主义做法,所以杠杆在于设计,而不是检测。Braun 与 Khafizov 测到的最强驱动因素是感知有用性,而不是政策清晰度,因此一项让学生觉得负责任的使用确实有用的政策,比一项威胁要检测的政策走得更远。在你确实要执行的地方,把它保持得窄而有程序:明确界定的禁止用途、学生能照着做的披露规则,以及半数德尔菲专家认可的人工审阅与口头评价做法。你真正的风险敞口是转化缺口,而不是学生规避:92% 的大纲给出了明确指引,而 50% 直接禁止 GenAI,相比之下 63% 的机构政策表示鼓励。学生遇到的不一致,是你的政策与你自己的课程之间的不一致。
在执法失败的地方,这更多是证据问题而不是检测问题,而机构的风险敞口正落在那里。Munoz 等人(2026)记录真实的指控案卷时发现,证据基础比政策所暗示的更薄:系统记录的痕迹只存在于有监督的评价中,过程证据(草稿、指导会面、演示)只存在于这些做法本来就被要求的地方,而自然正义要求学生被告知指控,并在任何判定之前有机会回应。检测器输出无法替代这些:Hadra 等人(2026)测出两款被广泛使用的商业工具准确率为 0.69 与 0.61,两者都在人机混合文本上失败,并且对 EFL 学生写作存在临界性的误判风险;而Bassett 等人表明,没有任何阈值能化解“标记诚实作业”与“漏掉隐蔽使用”之间的取舍。一个建立在无人能够追问的分数之上的认定,正是那种会产生申诉、投诉、偶尔还有索赔的案件。把证据标准写进政策,禁止把检测器输出当作独立证据,并把程序与Legal Issues and Risks上的义务连接起来。
证据还无法告诉你什么
这份语料中没有任何研究测量过某项机构的 AI 政策是否改变了学生行为、教职员做法或学习结果。存在的是描述性材料:Manikonda 与 Outlaw 发现政策语言薄弱且错位;Ashiq 记录了政策漂移;Baroudi 把纵向与因果证据的缺失列为一项缺口。Eldredge 等人提醒,只分析公开文件会产生可见性偏差,因此隐私或公平语言的缺席是关于已发布指引的发现,而不是关于实践的发现。Tran、Liu 与 Nguyen(2026)综述了 65 篇关于人工智能与社会情感学习的同行评议论文,发现近四分之三完全没有提及政策意涵,而提及的少数大多缺少真正政策制定所需的、针对具体行动者的细节:谁应当行动、就什么行动、为什么、何时以及如何。要把这一缺口当作给自己的政策配备测量工具的理由,而不是等待的理由。
站得住脚的立场是:政策不是交付物,机制才是。在你想表达约束的地方发布有约束力的条款,给文件指定负责人和审阅日程,把它转化为课程层面的支持,把合规义务放在学生能够遇到它们的地方,把教职员能力与可及性放在一起资助,并附上一份评估计划:在有人测量之前,谁都无权声称改善了任何东西。
本周可以做的事
- 数一数你的情态动词。 在草稿中查找“可以”与“能够”,把每一处你其实想说“必须”或“禁止”的地方改写过来,并明确界定抄袭与禁止用途。
- 指定一位负责人和一个日期。 一个常设治理委员会、一个定期审阅周期、一位具名的高管发起人,以及一行明确由谁负责监测内外部动向。
- 安排分层讨论。 召集院系层面的负责人,以及一个包含教师与学生成员的委员会,决定哪些条款属于全校、哪些由院系来写。
- 写下缺失的条款。 无障碍支持、可及性、设备与连通性假设以及语言覆盖,都属于那条要求使用人工智能的规则;然后指明 FERPA、GDPR、HIPAA、IRB 与研究诚信义务各落在哪里。
- 索取转化数字。 把含糊的回答当作支持失败,并为限制性规定配上范例。
- 改一项评价和一道评估问题。 把对人工智能使用的反思纳入评分作业,程度与它所要求的投入相称,然后说明你要测量什么、何时测量,以及由谁负责这一发现。
课程层面的对应工作,参见撰写课程人工智能政策并传达给学生。研究基础见机构治理研究、全球德尔菲框架与项目层面的政策审计;领导与实施维度参见Administrators与Change Management。Educational AI Policy汇集了行业层面的文献,AI Governance讨论权威与问责如何分配。