本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

不要把它用作不端行为案件中的证据,也不要把它当作机构的第一道防线。检测分数无法用真值加以验证,无法接受质询,也达不到认定学术诚信问题所需的盖然性权衡标准。 更糟的是,它的错误是有规律的,而不是随机的:本知识库中最有力的对照研究发现,检测工具更容易标记诚实、符合规范的由人工智能编辑过的文本,而不易标记未经修改的学生原文,同时刻意规避则几乎不被触及;而且最有可能被标记的学生是以英语为非母语的写作者(Why AI Detection Fails for Academic IntegrityDetecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)。这正是人工智能系统错误率在不同学习者之间分布不均的若干情形之一,不同学习者群体间的差异效应记录了这一点。Bassett 等(2026)走得更远,主张在教育中完全不应使用检测,因为这项技术无法区分“人工智能共同创作的作品”和“人工智能创作的作品”。本页面向必须做决定的人:教师、学术诚信官员和管理者。设计层面的操作指南见《我怎样才能减少课程中的人工智能作弊?》

1. 准确率数字不足以支撑一项认定

三条相互独立的证据线指向同一个结论。

对正当作品而言,假阳性率很高,而且它惩罚的是透明。 一项对四个领域、两个时期共 642 篇已发表英文摘要的对照研究发现,在 0.50 的阈值下,两款商用检测工具把符合规范的轻度人工智能编辑标记出来的比例为 38–80%,把未经修改的 2023–25 年原文标出的比例为 9–15%(非STEM远高于 STEM,p<0.001),而在文本经过“人化”服务处理之后,只抓到不到 4% 的标注为人工智能的改写,假阴性率超过 96%。作者把这称为学术诚信上的 catch-22:申报并做过轻度编辑的学生恰恰是工具能抓到的,而刻意规避的学生却抓不到。他们的建议很明确:检测分数绝不应当作为独立的不端行为证据。(Why AI Detection Fails for Academic Integrity)

最好的独立基准测试也达不到可用的准确率。 在早期最全面的Benchmark中,十四款工具没有一款达到 80% 的准确率,而简单的改写、轻度编辑或“人化”服务会让这一表现再大致减半。在现实的基础发生率下,假阳性的数量超过真阳性。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)

而在最需要它的场合,它完全漏掉了整篇由人工智能生成的内容。 在一项隐蔽的实地研究中,研究者把完全由人工智能生成的提交作品注入到一个运行中的在线考试系统中,涉及五个心理学模块:94% 未被发现,而且这些人工智能作品的得分平均高于真实学生。合约作弊早就展示了同样的结构性问题,即它不留任何可靠痕迹可供查找。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)

准确率还会以政策无法预见的方式随任务而变化。研究者测试生成式人工智能能否可靠地识别自身输出时发现,对编程和较长的反思性写作,检测是可靠的,但对简短回答表现很差:模型常常认为自己生成的文本比真实的学生作品像人写的;而提示词的细微变化就会大幅降低准确率。(Distinguishing Artificial from Authentic: Evaluating LLMs for Detecting LLM-Generated Content) 你设定的任何阈值都会在一些作业上成立、在另一些作业上失效。

检测从未明显优于一位认真的人,而这点差距也不是重点。 Leaton Gray、Edsall 与 Parapadakis(2025)报告,机器对人工智能或改写文本的检出率约为 80%,人工评审者为 78.4%;他们并引用证据指出,人工智能生成的文本有高达 80% 的情形被当成人类所写而通过,他们认为这点差距太小,根本不足以支撑一项不端行为的认定,因为机器的优势消失在了人类自身带入的同一误差区间里。他们的综述还削弱了“检测能威慑有能力者”这一假设:Krou 等人的元分析发现,自我效能与作弊呈负相关,而实际能力与作弊根本不成反向相关,因此有能力完成作业的学生在认为评估不公时也可能作弊。所以检测既不是可靠的仪器,也不是显而易见的威慑手段。

2. 错误是有规律的,而且落到了不该落的学生身上

对任何负有公平责任的人来说,这一点就足以决定整个问题。

检测工具当作人工智能信号的那些特征,如长词符密度、学术词汇频率、风格统一,同时也是熟练的第二语言写作的特征,因此检测工具是系统性地、而非随机地误判以英语为非母语的人。误判的伤害于是落在本来就处于劣势的学生身上。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) 同样的偏斜也出现在学科之间:在摘要研究中,非 STEM 摘要被标记的比例远高于 STEM 摘要,这反映的是那些领域的写作惯例,而不是作者的行为。(Why AI Detection Fails for Academic Integrity) 实际上,检测工具就是一场风格测试,而它所惩罚的风格与语言背景、学科和语域相关,与学生是否使用过人工智能无关。

这首先是一个公平问题,其次才是技术问题,同时它也是一个Trust问题。由于检测工具不可靠,而正式程序又要求实际上无从获得的“检测级”证据,教师最终陷入一位实务工作者所说的“有怀疑却无救济”的处境,而学生为自己的使用找理由,案卷则停滞不前。(The Best Response to Student AI Use Is Not Detection, It Is Dialog)

3. 为什么一个分数撑不起一桩诚信案件

如果你要出席听证,这一节才是关键。

4. 应该改做什么

要求验证,而不是追溯来源。 大峡谷大学从“这名学生用了人工智能吗?”转向“这名学生能否展示对自己所提交内容的理解?”,采用简短谈话、早期草稿和录制讲解的方式,并于 2025 年秋季在全校实施。其论点是务实的:教师本来就有资格判断理解程度,这一转变恢复了他们的权威,而不是让他们一直等待永远不会到来的证据。(The Best Response to Student AI Use Is Not Detection, It Is Dialog)

至少让一项高风险任务在没有辅助的情况下完成。 异步口语评估,即时给出提示、用简短且限时的录制回答,并按内嵌量规评分,在一项研究中与线下选择题考试表现相当,在另一项研究中显著更好,学生报告准备更主动、感知到的职业相关性更高。对Administrators来说,关键特性是它无需监考即可规模化。(Asynchronous Oral Assessments: Enhancing Integrity, Engagement, and Communication in the AI Era)

重新设计任务,让走人工智能捷径不那么有吸引力。 一项针对本科经济学学生的案例研究发现,只有约三分之一的人报告使用过人工智能,而申报者更少;在政策含糊的情况下,不申报被理解为理性的谨慎,而不是不诚实。这些学生同样认为,采用真实世界、基于数据的任务是解决之道。(Beyond Detection: How Students Use—and Hide—AI in Online Assessments and What Authentic Tasks Can Do About It) 预期、申报并细查人工智能使用,胜过对它进行监管,因为真实性必须被设计出来,而不是靠强制实现。(Beyond Detection: Redesigning Authentic Assessment in an AI-Mediated World)

让诚实申报成为安全的选择。 含糊或惩罚性的政策会把人推向隐瞒;与认知阶段相绑定的具体申报框架,再加上“如实申报不会受罚”的保证,能从学生那里获得比监视更多的信息。(Addressing student non-compliance in AI use declarations: implications for academic integrity and assessment in higher)("Should I Tell My Teacher?" Student AI Disclosure Practices, Stigma, and Self-Regulated Learning in Higher Education)

5. 你会听到的反对意见

6. 如果你要撰写或修订政策,请把以下内容写进去

7. 学生被错误指控时的法律风险

当检测分数变成一项指控时,这就不再是教学问题了。机构面临风险敞口,不是因为有人被指控,而是因为指控是如何建立和处理的;这种敞口通常最先以内部申诉或监管投诉的形式出现,而不是以向法院提起的诉讼形式出现。

降低风险靠的是程序,而不是技术:绝不把检测工具的输出当作独立证据或自动触发条件;把你的流程所适用的证据标准记录下来;给出通知以及记录在案的真正回应机会;当案件仅凭风格成立时提供口头验证途径;把留存、训练用途和泄露条款写进采购要求;在政策范围中明确涉及辅助与转录工具;并保留能证明上述每一步都发生过的审计痕迹。本知识库对法律风险敞口本身的叙述见Legal Issues and Risks,而它对自身的局限也很诚实:它记录的是程序、证据类别和仪器可靠性,而不是已判决的结果。

本页与相邻常见问题页的区别

要点

不要把认定建立在检测分数之上,也不要买一款工具,指望它能守住你的评估。这些工具的实测行为与它们的营销宣传正好相反:它们抓到的是诚实、已申报、经过轻度编辑的作品和熟练的第二语言写作,而刻意规避有 96% 的时候能通过,完全由人工智能生成的提交有 94% 的时候能通过一个实时考试系统。(Why AI Detection Fails for Academic Integrity)(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) 你真正能够回答的诚信问题是:学生能否展示对自己所提交内容的理解。而这种教学能力,值得投入资金。

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.