本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

你只有一份课程大纲、一份作业说明,而教室里坐满了早已就生成式人工智能为自己写下私人规则的学生。你发布出去的规则,必须既对守规矩的学生公平,也对不守规矩的学生公平,而且还必须是你真能套用到四十份提交作品上、既不变成老好人也不变成警察的规则。

要点是:写下的规则要比你想写的更少,把每条规则都系到你正在评估的具体事物上,指定一个统一的标准地点供学生申报人工智能使用情况,并且让执行所依据的证据是你亲眼能看到的东西,而不是检测工具给出的分数。一份能够自我解释的政策,同时在做评估设计与沟通两件事,这正是它只花一个下午、却能省下一整学期争执的原因。

本页讨论的是一个模块、一门课程或一个培养方向中课程层面的文件。通篇的前提是:你已经确定了自己在评估什么;问题在于如何把它说清楚,并让它真正落地。

课程政策目前的真实样貌

一项内容分析考察了来自 131 所美国 R1 高校的 116 份机构生成式人工智能政策,以及其中 54 所高校的 98 份计算机科学课程大纲,发现机构总体上倾向允许使用:63% 鼓励使用生成式人工智能,41% 提供详细的课堂指导,27% 表示不鼓励;而有一半课程大纲(50%)直接禁止,41% 允许在指定活动中部分使用,7% 表达了鼓励。Ganguly 等(2026)把这种现象称为自上而下与自下而上之间的落差:92% 的课程大纲给出了明确指引,但教师自行写下的本地规则可能与机构指导并不一致,只有 47 所高校能在两个层面都检测到规则。引注是两个层面唯一达成一致的事项,83% 的课程大纲要求它。学生最先遇到的正是你的本地规则,比所在机构更严格也很正常,但这是一项你要独自承担的承诺。

Chirikov(2026)追踪了得克萨斯州一所大型公立研究型大学 2021 至 2025 年间 31,000 多份课程大纲:相关规定从 ChatGPT 出现之前的近乎为零,上升到 2025 年秋季的 55% 课程,而完全限制性政策所占比例每年下降约 5 个百分点。到 2025 年秋季,教师最常限制的是起草与修改(79%)和推理与Problem Solving(65%),最常允许的是编辑与校对(83%)、学习支持与综合(80%)以及编程(75%);构思是最具争议的用途(46% 允许,54% 限制)。学术诚信方面的表述从 63% 降到 49%,而提及人工智能对学习影响的从 1% 升至 29%,要求注明出处的从 16% 升至 43%。教师正在从“不要作弊”的措辞转向“这条边界为什么保护你的学习”的措辞。

Nash 与 Burriss(2026)分析了 27 份由职前英语语言艺术教师撰写的课堂人工智能政策:27 份中有 26 份允许某种程度的人工智能使用,几乎总是限定在教师指定的条件、时段和场合,只有一份完全禁止。构思是允许范围最广的用途(27 份中 22 份),也最含糊;22 份不允许或未说明用人工智能生成句子、段落或文章;16 份允许语法检查和校对,同时有 16 份禁止生成大段人工智能文本;而27 份中有 22 份完全没有涉及阅读。反复出现的失误在于可操作性:有一份政策允许人工智能“帮你把思路启动起来”,并宣称“界线就应该画在这里”,却没有说线在哪里。这种含糊是缺陷,不是折中,它让学生无法遵从,也让你无法适用一致的标准。

写什么,写在哪里

从任务出发,而不是从理念出发。最清晰的示范方法是McCorkle(2025)的做法,他取代了一条学生并不认为适用于自己的一刀切禁令。问题在于错位,而不是反抗:学生并不觉得自己有不诚实的行为。他的方法是把学期项目中的每一项任务都清点出来,对每一项追问“我具体在评估什么?”,为每一项任务配上一个在职业场景中说得通的生成式人工智能用法,再逐项决定,在评估某项能力的需要与培养一项职业胜任力的价值之间权衡。由此得出的政策刻意地不整齐:允许头脑风暴,但不允许撰写具体、可测量的学习目标;允许挑选图片,但不允许设计幻灯片层面的信息表达;允许撰写脚本和旁白,但必须评价人工智能的输出。

写在课程大纲上: 简短的摘要,包括各项任务、每项任务允许的用法、申报方式,以及越界之后的结果。写在作业说明上: 单独标出,因为对复杂项目来说一份摘要过于笼统;McCorkle 的写法之所以奏效,是因为它用第二人称向学生给出理由,指明为每一项限制提供依据的评估。在课堂上: 在规则第一次适用的时候就把它大声说一遍,并把它与眼前的作品联系起来;学生独自第一次遇到的规则,也只能由他们独自去解读。

申报机制值得在课程大纲中单独占一段:通过引导式探究共同设计课程政策的学生,优先考虑的是对学生和教师的培训、标准化的申报流程、更强的机构支持,以及在人工智能相关决策中更大的参与度(Hingle 与 Johri(2026))。要说清楚学生以何种方式、在何处、以什么形式申报人工智能使用情况,而且只说一次。Pisan(2026)的对应做法是让提示词记录成为被评分的作品:当生产由模型完成时,提示词与交互记录才是值得做版本管理的东西。

只写你能执行的规则

要求逐项任务监控的规则,或者需要凭判断认定一次评估何时“开始”的规则,都会被不一致地执行,而不一致本身就是公平问题。以检测工具为基础的制度带来监视成本,这种成本落在不同人身上并不均匀,还会引发远程监考与数据留存方面的问题。Chirikov 发现学科之间、任务之间存在实质性差异,这支持采用那些在教师自身领域内赋予其自主权的框架,而不是一刀切的要求。

这里涉及公平维度:不透明的政策默认人人都具备关于署名、引注和学术工作规范的共同背景知识,因此对本来就不具备这些知识的学生打击最大。McCorkle 的论点是,透明能拆解一部分这样的隐性课程,并降低政策执行失败演变成纪律处分的可能性。以上这一切最省力的版本就是规则更少、更具体:你评估的任务、每项任务允许的用法、申报机制,以及越界的结果,并说明每条边界的理由。

怎样表达才能让学生遵守

申报规则本身并不构成合规机制;以为它们能起到这个作用,是最常见的设计失误。在一项针对 409 名本科生的混合方法研究中,Qu 与 Wang(2026)发现不申报是对感知到的同伴规范以及对学生而言较低的可解释Trust的策略性适应,而不是道德疏忽:感知到的同伴申报情况与和教师相处的舒适程度,是学生自己是否申报的最强预测因素,而道德推脱的影响较弱。关系氛围是一个可以设计的变量,仅靠强制要求并不够:学生认为同伴在做什么,以及他们是否相信你会公正地解读一份申报,比你的措辞有多严厉更能预测他们的诚实程度。

Kim 等(2026)指出,一门课程真正的政策存在于五个彼此不同的场域:教师意图、正式政策、学生解读、学生自我政策与学生实践,而它们之间存在系统性落差;此外还归纳出学生在学术写作中为人工智能使用辩解的六类共 23 种合理化说法,从“没有人类受害者”到“教师并不在意”。这些合理化是临时凑成、事后追认的:学生是在解释已经发生的行为,而不是事先推理,这正是为什么更清楚的措辞和更严厉的检测本身并不能弥合落差。有一位想遵守严格的人工智能禁用规则的参与者仍在继续使用,并说这项禁止“给我造成了冲突,因为我在违反规则”;禁令加剧了道德冲突,却没有阻止使用。如果一条规则只带来愧疚而不带来遵从,它就没有在发挥作用,而是在侵蚀你为获得申报所需要的那种关系。

注意你示范了什么:由于 Pisan 课程中大多数作业都申报了用于生成它们的提示词,有一名学生把这种透明解读为许可:“教师给分和出作业都依赖 ai,这也让人很难不在作业里以同样的方式使用 ai。”无论课程大纲怎么写,示范一种规范本身就是学生所体验到的政策的一部分。

一段可以改用的示范声明:

本课程中的人工智能使用。 我希望你离开这门课时能自己完成 X,所以我直接评估 X。你可以在[任务清单]上、为[允许的用途]使用人工智能;不得为[受限用途]使用它,因为那些正是我评分的内容。如果你在作业的任何环节使用了人工智能,请在[唯一指定的位置,例如每次提交上的一行申报]告诉我你用它做了什么,并粘贴提示词。申报绝不会降低你的分数;不申报才会。如果你不确定某种用法是否允许,请在提交前问我,而不是提交后再问。

最后这一句把决策点移到了动手之前。

会引发冲突的四种对话

用了人工智能却没有说的学生。 把这件事当作流程问题来处理,而不是人品问题。Mohamed 与 Temimi(2026)把评估建模为一个信息不完全的问题:学生知道作品是怎样产生的,而机构只能看到成品和部分痕迹。他们提出的响应区间模型比较了三种响应,即不使用人工智能、申报使用和隐藏使用,并追问每种机制会让哪一种最具吸引力。禁止划定了形式上的边界,但当学生认为检测能力薄弱时,隐藏使用仍然具有吸引力;监控提高了隐藏使用的预期成本,却没有增加申报;学生会变得谨慎,但不会变得透明。只有在诚实的成本足够低时,允许使用并要求申报才能让如实报告变得可行。实际做法是:先问这份作品本应评估什么,再请学生说明自己的过程,并把迟到的申报当作信息,而不是当作认罪。

什么都引用人工智能的学生。 这通常是穿着合规外衣的技能缺口。课程大纲中的注明出处要求从 16% 升到 43%,而学术诚信相关表述从 63% 降到 49%,说明这个领域要求的是引注,而不是认罪。把格式一次性规定清楚,写在作业说明上而不是课程大纲的脚注里。说明在你的学科里什么算充分的引注,并给出一个示范例子。如果真正的问题在于学生目前离开模型还做不了底层的活儿,那么答案在任务设计,而不在规则。

小组作业。 小组任务正是五个政策场域分叉最快的地方:五名学生可能对同一句话有五种不同解读,而只有一份提交会被评分。对每一项小组交付成果,都要事先决定并公布是否允许使用人工智能、由谁申报,以及当某位成员越界时如何处理,这些要在项目开始前定好,而不是在争执中决定。如果你说不出某位成员应为之负责的个人贡献是什么,就把这项任务当作纯小组作业来评分,而不是事后再去裁定作者归属。

你无法核实的申报。 有些申报会不完整,有些遗漏则无法证伪。不要把你无法达成的定论写进规则:Bassett 等(2026)主张在教育中完全不应使用人工智能检测,他们给出的三条理由直接关系到政策措辞。检测工具的输出是一种概率性估计,因真实文本的来源未知而无法独立核实,所以验证只能建立在循环论证之上。检测分数达不到学术诚信调查所需的盖然性权衡标准。而且对于人工智能共同创作、而非其创作的作品来说,人机二分本身没有意义。他们的结论是,检测“并不能保障学术诚信,反而在损害它”。他们还指出一个起草上的问题:限制“在评估中”使用人工智能的规则没有说明一次评估从何时开始,因此人工智能辅助的检索、规划或编辑算不算违规,取决于读规则的人是谁。应当改为指明你能观察到的过程性证据,例如提交的提示词与交互记录、在教室里完成的课堂练习、口头解释,并把已申报的人工智能使用当作背景信息。如果你所在机构仍然运行检测工具,上述作者关于数据存储、留存以及对学生作品的商业利用的警告同样适用;两位职前教师提出的Privacy异议,也正是你的学生会提出的异议。

“但是……”:你会听到的三种反对意见

“学生反正会把它藏起来。” 有些人确实会,而设计上的问题是:你的规则会诱惑哪些学生。威慑力取决于检测工具对隐藏使用与正当作品之间的区分能力,而不是它原始的抓出率;因此当额外提高灵敏度带来的新假阳性多于新真阳性时,更强的监控反而可能让隐藏相对更具吸引力,因为诚实的学生被惩罚的速度快于隐藏使用者被识别的速度。而且允许与申报是两个不同的杠杆:允许改变的是可接受使用的边界,申报改变的是可见程度。诊断你的任务会把哪类学生最强烈地推向隐瞒,并针对那类学生做设计,而不是针对最尽责的学生。

“我不想禁止我检测不出的工具。” 你不必禁止。禁止只是四种设计应对之一,另外三种是监控、允许使用并申报,以及重新设计。重新设计改变的是任务奖励什么,如果评分量规仍然主要在给最终成品打分,那它只会停留在表面。Pisan(2026)把这些选项明确列出,并按层级递进:入门编程课程禁止使用人工智能,因为把最初的循环外包出去就等于抽掉了要教的内容;数据结构课程的项目中鼓励使用(允许用 Copilot),但纸笔考试中禁止;高年级系统课程中作为学习与复习的辅助;而在人工智能课程本身则是必须使用,其中有一条边界承载了最大的分量,即模型可以写代码,但反思必须是学生自己的声音。评估则转移到模型无法悄悄代笔完成的作品上,考试被完全取消。

“我所在机构的政策已经覆盖了这些。” 覆盖面比你以为的要小。自上而下与自下而上之间的落差是双向的:92% 的课程大纲给出了明确指引,而本地规则却偏离机构指导,只有 47 所高校能在两个层面都检测到规则。采购、数据和审查流程属于《我们如何撰写并实施机构人工智能政策?》的范围,但课堂层面的转化是你的责任。Nash 与 Burriss 的结论是,机构必须让教师既能采纳也能拒绝,提供相应的指导与专业发展,使教师可以拒绝某一种具体的人工智能用法而不被贴上落伍的标签;他们研究中的参与者的技术决定论,与其自身的教学承诺相互矛盾。拥有机构政策,并不等于你的判断有了一顶保护伞。

你的第一周:一份行动清单

  • 在决定任何与人工智能有关的事情之前,先清点所有计分任务,并对每一项追问“我具体在评估什么?”
  • 逐项任务做决定,并检查这个决定会让哪一种应对对最想隐瞒的学生最有吸引力。
  • 不要用检测工具作为执行机制;改为指明你能观察到的过程性证据,例如记录、课堂作业、口头检查。
  • 说明学生以何种方式、在何处申报人工智能使用情况,指定一个统一的位置,并把申报当作背景信息而不是认罪书。
  • 把每条规则都写成一项理由,指明它所服务的评估,并在复杂项目上给出提醒。
  • 只写你能在整个评分周期内一致执行的规则,把做不到的删掉。

接下来可以看哪里

治理、数据政策、采购与审查流程属于《我们如何撰写并实施机构人工智能政策?》;机构与学区强制要求的规则见Educational AI PolicyAI Governance;重建任务本身,使分数仍能支持一项站得住脚的推断,则见我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.