问答
我们应当使用人工智能检测工具吗?
本页是英文页面的机器翻译,尚未经母语者审校。
不要把它用作不端行为案件中的证据,也不要把它当作机构的第一道防线。检测分数无法用真值加以验证,无法接受质询,也达不到认定学术诚信问题所需的盖然性权衡标准。 更糟的是,它的错误是有规律的,而不是随机的:本知识库中最有力的对照研究发现,检测工具更容易标记诚实、符合规范的由人工智能编辑过的文本,而不易标记未经修改的学生原文,同时刻意规避则几乎不被触及;而且最有可能被标记的学生是以英语为非母语的写作者(Why AI Detection Fails for Academic Integrity、Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)。这正是人工智能系统错误率在不同学习者之间分布不均的若干情形之一,不同学习者群体间的差异效应记录了这一点。Bassett 等(2026)走得更远,主张在教育中完全不应使用检测,因为这项技术无法区分“与人工智能共同创作的作品”和“由人工智能创作的作品”。本页面向必须做决定的人:教师、学术诚信官员和管理者。设计层面的操作指南见《我怎样才能减少课程中的人工智能作弊?》。
1. 准确率数字不足以支撑一项认定
三条相互独立的证据线指向同一个结论。
对正当作品而言,假阳性率很高,而且它惩罚的是透明。 一项对四个领域、两个时期共 642 篇已发表英文摘要的对照研究发现,在 0.50 的阈值下,两款商用检测工具把符合规范的轻度人工智能编辑标记出来的比例为 38–80%,把未经修改的 2023–25 年原文标出的比例为 9–15%(非STEM远高于 STEM,p<0.001),而在文本经过“人化”服务处理之后,只抓到不到 4% 的标注为人工智能的改写,假阴性率超过 96%。作者把这称为学术诚信上的 catch-22:申报并做过轻度编辑的学生恰恰是工具能抓到的,而刻意规避的学生却抓不到。他们的建议很明确:检测分数绝不应当作为独立的不端行为证据。(Why AI Detection Fails for Academic Integrity)
最好的独立基准测试也达不到可用的准确率。 在早期最全面的Benchmark中,十四款工具没有一款达到 80% 的准确率,而简单的改写、轻度编辑或“人化”服务会让这一表现再大致减半。在现实的基础发生率下,假阳性的数量超过真阳性。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
而在最需要它的场合,它完全漏掉了整篇由人工智能生成的内容。 在一项隐蔽的实地研究中,研究者把完全由人工智能生成的提交作品注入到一个运行中的在线考试系统中,涉及五个心理学模块:94% 未被发现,而且这些人工智能作品的得分平均高于真实学生。合约作弊早就展示了同样的结构性问题,即它不留任何可靠痕迹可供查找。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
准确率还会以政策无法预见的方式随任务而变化。研究者测试生成式人工智能能否可靠地识别自身输出时发现,对编程和较长的反思性写作,检测是可靠的,但对简短回答表现很差:模型常常认为自己生成的文本比真实的学生作品更像人写的;而提示词的细微变化就会大幅降低准确率。(Distinguishing Artificial from Authentic: Evaluating LLMs for Detecting LLM-Generated Content) 你设定的任何阈值都会在一些作业上成立、在另一些作业上失效。
检测从未明显优于一位认真的人,而这点差距也不是重点。 Leaton Gray、Edsall 与 Parapadakis(2025)报告,机器对人工智能或改写文本的检出率约为 80%,人工评审者为 78.4%;他们并引用证据指出,人工智能生成的文本有高达 80% 的情形被当成人类所写而通过,他们认为这点差距太小,根本不足以支撑一项不端行为的认定,因为机器的优势消失在了人类自身带入的同一误差区间里。他们的综述还削弱了“检测能威慑有能力者”这一假设:Krou 等人的元分析发现,自我效能与作弊呈负相关,而实际能力与作弊根本不成反向相关,因此有能力完成作业的学生在认为评估不公时也可能作弊。所以检测既不是可靠的仪器,也不是显而易见的威慑手段。
2. 错误是有规律的,而且落到了不该落的学生身上
对任何负有公平责任的人来说,这一点就足以决定整个问题。
检测工具当作人工智能信号的那些特征,如长词符密度、学术词汇频率、风格统一,同时也是熟练的第二语言写作的特征,因此检测工具是系统性地、而非随机地误判以英语为非母语的人。误判的伤害于是落在本来就处于劣势的学生身上。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) 同样的偏斜也出现在学科之间:在摘要研究中,非 STEM 摘要被标记的比例远高于 STEM 摘要,这反映的是那些领域的写作惯例,而不是作者的行为。(Why AI Detection Fails for Academic Integrity) 实际上,检测工具就是一场风格测试,而它所惩罚的风格与语言背景、学科和语域相关,与学生是否使用过人工智能无关。
这首先是一个公平问题,其次才是技术问题,同时它也是一个Trust问题。由于检测工具不可靠,而正式程序又要求实际上无从获得的“检测级”证据,教师最终陷入一位实务工作者所说的“有怀疑却无救济”的处境,而学生为自己的使用找理由,案卷则停滞不前。(The Best Response to Student AI Use Is Not Detection, It Is Dialog)
3. 为什么一个分数撑不起一桩诚信案件
如果你要出席听证,这一节才是关键。
- 证据标准不满足。 认定学术不端需要达到盖然性权衡的证据。检测分数,无论是单独使用,还是与语言标记、风格比较、Large Language Models (LLMs)判断或学生的沉默结合使用,都不满足这一标准。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 沉默与陈述都被误用。 学生保有沉默权;拒绝回应不应被用来对他们不利。正当的问题不是“你用了人工智能吗?”,而是学生能否展示学习,也就是Assessment声称要测量的东西,而口头回答可以回答这个问题。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 概率无法核实。 与垃圾邮件过滤器或医学检验不同,检测工具的输出无法独立核查:在真实提交作品中没有关于文本如何产生的真值,所以验证变成循环论证,而假阳性与假阴性指标只适用于受控测试。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 参照数据从构造上就已经过时。 检测工具是在生成式人工智能出现之前的人类写作上训练和测试的,Turnitin 自己的验证就使用了 700,000 篇 2019 年之前的论文,这假定该语料库能反映当前的学生文风。这一假定未经证实,而且会随每一次模型发布而改变。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 这项工具无法被质询。 检测工具不公布阈值或训练数据,也不允许独立复现,因此被标记的学生无法回应或质询这项指控。你无法为你解释不清的认定做辩护。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
- 二分本身就是错误的问题。 学生的作品常常是与人工智能共同创作、而非由其创作的,处于一种混合的连续谱上;而规定“在评估中”的政策很少界定一次评估从何时开始,于是执行依赖于主观判断而非有原则的标准。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 你要承担数据风险。 检测工具把学生作品存放在第三方服务器上,有时存放在Privacy保护更弱的海外,从而造成数据泄露、留存和商业利用方面的风险敞口,而这一风险由你所在机构承担。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 更强的监控可能适得其反。 威慑力取决于检测工具对隐藏使用与正当作品之间的区分能力,而不是它原始的抓出率。当额外提高灵敏度带来的新假阳性多于新真阳性时,更强的监控会让隐瞒相对更有吸引力;你消耗自身信誉去怀疑本没有做错的学生,速度超过你识别真正违规者的速度。(Assessment Design Under Imperfect Information: Generative AI, Disclosure, and Student Response in Higher Education)
4. 应该改做什么
要求验证,而不是追溯来源。 大峡谷大学从“这名学生用了人工智能吗?”转向“这名学生能否展示对自己所提交内容的理解?”,采用简短谈话、早期草稿和录制讲解的方式,并于 2025 年秋季在全校实施。其论点是务实的:教师本来就有资格判断理解程度,这一转变恢复了他们的权威,而不是让他们一直等待永远不会到来的证据。(The Best Response to Student AI Use Is Not Detection, It Is Dialog)
至少让一项高风险任务在没有辅助的情况下完成。 异步口语评估,即时给出提示、用简短且限时的录制回答,并按内嵌量规评分,在一项研究中与线下选择题考试表现相当,在另一项研究中显著更好,学生报告准备更主动、感知到的职业相关性更高。对Administrators来说,关键特性是它无需监考即可规模化。(Asynchronous Oral Assessments: Enhancing Integrity, Engagement, and Communication in the AI Era)
重新设计任务,让走人工智能捷径不那么有吸引力。 一项针对本科经济学学生的案例研究发现,只有约三分之一的人报告使用过人工智能,而申报者更少;在政策含糊的情况下,不申报被理解为理性的谨慎,而不是不诚实。这些学生同样认为,采用真实世界、基于数据的任务是解决之道。(Beyond Detection: How Students Use—and Hide—AI in Online Assessments and What Authentic Tasks Can Do About It) 预期、申报并细查人工智能使用,胜过对它进行监管,因为真实性必须被设计出来,而不是靠强制实现。(Beyond Detection: Redesigning Authentic Assessment in an AI-Mediated World)
让诚实申报成为安全的选择。 含糊或惩罚性的政策会把人推向隐瞒;与认知阶段相绑定的具体申报框架,再加上“如实申报不会受罚”的保证,能从学生那里获得比监视更多的信息。(Addressing student non-compliance in AI use declarations: implications for academic integrity and assessment in higher)("Should I Tell My Teacher?" Student AI Disclosure Practices, Stigma, and Self-Regulated Learning in Higher Education)
5. 你会听到的反对意见
- “我们的供应商宣称假阳性率只有 1%。” 范德堡大学授权使用的检测工具正是这么宣称的,而当校方试图验证这一数字时却无法验证,因为 1% 的 75,000 份年度提交意味着大约 750 名学生被错误标记,于是该校停用了这项工具。独立基准测试显示,没有任何一款工具超过 80% 的准确率。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
- “我们只把它当作一项证据。” 标准不是“有一些证据”,而是达到盖然性权衡的证据,而检测分数即便与语言标记、风格比较、大语言模型判断或沉默结合,也仍然不满足这一标准。如果这套推理你不会在听证会上大声说出来,那它就不是证据。(Heads We Win, Tails You Lose: AI Detectors in Education)
- “如果我们停止检测,作弊就会得逞。” 拦住下定决心者的并不是检测:注入的由人工智能生成的提交有 94% 通过了实时在线考试而未被察觉,“人化”处理在超过 96% 的情况下击败检测,而合约作弊本来就不留可靠痕迹。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) 检测工具确实能以可测量的可靠性抓到的,是诚实的轻度编辑和非母语写作。(Why AI Detection Fails for Academic Integrity)
- “我们只是在私下使用,用它来开启对话。” 这是危害最小的用法,但它仍然有代价:最有可能被标记的学生,恰恰是最不可能滥用人工智能的人,因此怀疑不成比例地落在了错误的人身上。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) 大峡谷大学的答案是干脆不再从怀疑出发。(The Best Response to Student AI Use Is Not Detection, It Is Dialog)
6. 如果你要撰写或修订政策,请把以下内容写进去
- 检测工具的输出绝不是独立证据,绝不自动触发后果,也绝不构成认定的依据。 要把这一点写进政策本身,而不是写进备忘录。(Why AI Detection Fails for Academic Integrity)
- 学生必须能够看到指控并作出回应,同时保留沉默权,并对任何仅凭风格提出的指控提供口头验证途径。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 采购条款应涵盖数据留存、用于模型训练、存储地点、泄露通知和申诉权利,因为风险在你所在机构身上,而不在供应商身上。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 为替代方案拨款。 有记录的教师抱怨是“有怀疑却无救济”,因此真正重要的预算科目是验证能力与指导,而不是一份检测工具许可。(The Best Response to Student AI Use Is Not Detection, It Is Dialog)
- 以书面形式索取错误率,然后尝试在本地验证它们。 如果宣传的错误率无法在你的提交作品上复现,正如范德堡大学所发现的那样,那就是你的答案。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
7. 学生被错误指控时的法律风险
当检测分数变成一项指控时,这就不再是教学问题了。机构面临风险敞口,不是因为有人被指控,而是因为指控是如何建立和处理的;这种敞口通常最先以内部申诉或监管投诉的形式出现,而不是以向法院提起的诉讼形式出现。
- 首先被检验的是程序。 自然公正原则要求,在作出任何判定之前,必须告知学生指控内容并给予其回应的机会,这一义务既写入监管标准,也写入健全的学术诚信政策;回应机会通常是一次调查会面或小组面谈,学生所说的任何内容都会成为证据记录的一部分。无论底层怀疑是否合理,缺少这一步得出的认定都经不起挑战。(How strong is the evidence in generative AI-related academic misconduct allegations? A mixed-methods analysis)
- 其次是证据标准。 认定不端行为需要达到盖然性权衡的证据,而检测工具的输出本身达不到这一标准:在真实提交作品中分数无法用真值验证,工具无法被质询其如何得出某一判断,学生也无法质询一个数字。如果你的案件离开检测分数就无法陈述,那么这个案件表面上就是薄弱的。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 有规律的错误把技术缺陷变成了公平与平等问题。 检测工具的错误不是随机的:本知识库中最有力的证据显示,标记集中在非母语英语写作上,以及某一学科的写作惯例相对于另一学科上;两款广泛使用的商用工具实测准确率分别为 0.69 和 0.61,而且二者在人机混合文本上都失败了。建立在一种按语言背景误判的仪器之上的认定,是一项会招致歧视主张的认定。(Evaluating the accuracy and reliability of AI content detectors in academic contexts)(Who wrote this? Evaluating the reliability of AI detection tools in higher education)
- 一刀切的“人工智能使用”禁令可能取消一项合理便利。 不把转录和光学字符识别与生成式起草区分开来的规则,可能把患有影响运动控制、字迹清晰度或打字准确度的状况的学生所依赖的辅助工具一并定罪,而其中若干工具已经停售,由人工智能转录填补了空缺。范围过宽的政策不仅是表述不精确,更是一种法律风险。(Transcription is not generation: Distinguishing non-generative AI tool use from academic misconduct in higher education assessment)
- 数据就是你的责任。 检测工具把学生作品存放在第三方服务器上,有时存放在Privacy保护更弱的海外,这就把数据泄露、留存以及后续的商业利用放进了你所在机构的风险清单,而不是供应商的营销宣传里。(Heads We Win, Tails You Lose: AI Detectors in Education)
- 供应商的说法保护不了你。 一款宣称假阳性率为 1% 的授权检测工具,在校方试图复现时未能通过验证,意味着 75,000 份年度提交中大约有 750 名学生被错误标记;那所机构停用了该工具。合同里的说法并不能把听证会上的风险转移出去。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
降低风险靠的是程序,而不是技术:绝不把检测工具的输出当作独立证据或自动触发条件;把你的流程所适用的证据标准记录下来;给出通知以及记录在案的真正回应机会;当案件仅凭风格成立时提供口头验证途径;把留存、训练用途和泄露条款写进采购要求;在政策范围中明确涉及辅助与转录工具;并保留能证明上述每一步都发生过的审计痕迹。本知识库对法律风险敞口本身的叙述见Legal Issues and Risks,而它对自身的局限也很诚实:它记录的是程序、证据类别和仪器可靠性,而不是已判决的结果。
本页与相邻常见问题页的区别
- 《我怎样才能减少课程中的人工智能作弊?》是教师的设计操作指南:带护栏的工具、评估重新设计、验证、申报、人工智能素养。本页回答的是更窄、也更靠前的问题:检测工具的输出到底能不能使用。
- 我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?深入讨论了评估的重新设计;本页只指出那些专门用来替代检测的重新设计举措。
- 我如何撰写课程人工智能政策并向学生说明?讨论课程政策的撰写与沟通;本页第 6 节讨论的是机构政策所需的检测相关条款。
- Legal Issues and Risks是第 7 节背后的概念页,把错误指控、监视、可及性和数据保护风险敞口放在一起讨论。
要点
不要把认定建立在检测分数之上,也不要买一款工具,指望它能守住你的评估。这些工具的实测行为与它们的营销宣传正好相反:它们抓到的是诚实、已申报、经过轻度编辑的作品和熟练的第二语言写作,而刻意规避有 96% 的时候能通过,完全由人工智能生成的提交有 94% 的时候能通过一个实时考试系统。(Why AI Detection Fails for Academic Integrity)(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) 你真正能够回答的诚信问题是:学生能否展示对自己所提交内容的理解。而这种教学能力,值得投入资金。