本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

知识库中最有力的方向,是少依赖检测,多依赖结构性的评价设计、明确的期望、学习验证与人工智能素养 学术诚信这一综合梳理报告称,人工智能文本检测存在重大局限,并主张在生成式人工智能时代,学术诚信越来越是一个评价设计问题,而不只是检测问题。检测工具既不可靠,在程序上也不公平。在一项对 642 篇已发表英文摘要的对照研究中,两款商业检测工具把符合指南的轻度人工智能编辑判为可疑的比例为 38–80%,把未经修改的 2023–25 年原创文本判为可疑的比例为 9–15%(非STEM 领域远高于 STEM,p<0.001);而在人工智能“人性化”处理之后,被标为人工智能改写的文本中只有不到 4% 被查出。这是一种诚信上的 catch-22:它惩罚诚实的帮助,却为刻意的规避开了口子。(Why AI Detection Fails for Academic Integrity) 在一项隐蔽现场研究中,注入五门心理学模块在线考试的全由人工智能生成的提交中有 94% 未被发现,而且人工智能作业的平均得分还高于真实学生;范德堡大学在无法验证其宣传的 1% 误报率之后停用了已授权的检测工具,那个误报率意味着大约有 750 名学生被错误标记,而每年有 75,000 份提交。(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) 因此,单靠检测是一个很弱的杠杆;更强的杠杆是我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?中完整阐述的那套评价设计论证。以下是一些具体、可操作的做法,大致按证据强度排序。

1. 受约束的人工智能工具:“只给提示,不给答案”

人工智能学生所使用的任何工具配置成起脚手架作用,而不是直接揭示答案。知识库中最强的因果证据是一项现场随机对照试验:一个无约束的 ChatGPT 式导师把有辅助练习的表现提高了 +48%,却使无辅助考试成绩下降−17%;而一个受约束的导师(给提示而不给答案,并加入教师编写的题目信息)完全消除了这种损害。(Generative AI without guardrails can harm learning: Evidence from high school mathematics) 一项覆盖 26,811 名学生的大型研究发现,把作业外包使作业成绩提高 18%,却使闭卷考试成绩在六个月内下降 20%,这正是防护栏与无辅助测量所要防止的那种损害。(The Generative AI Learning Penalty: Evidence from Chinese Secondary Education)

具体示例:

2. 评价设计改革:让作弊在设计中浮现(并受到威慑)

因为误用的伤害取决于评价方式,所以要改变什么算作成绩。减少人工智能误用这一综合梳理把它列为 Tier-1,即第一层级,因为无论学生是否选择正确行为它都有效:它约束的是环境,而不依赖动机。人工智能评价量表(AIAS)是用于此处的结构化框架:按人工智能使用程度为每份作业贴标签(例如“不使用人工智能”“仅用于头脑风暴”“使用人工智能并注明来源”“完全使用人工智能”),使期望明确且可执行。(A bit of chaos and madness: The AI Assessment Scale and the work of assessment reform)

一项覆盖 72 项研究的系统综述考察了生成式人工智能在计算机教育中的应用,它从另一套证据基础得出了相同结论:它把重新设计评为既可行又最具杠杆效应的做法,特别指出在每门课程中至少为一项高利害评价加入口头或其他使过程可见的环节,是最有效的单一干预,并指出检测是整篇综述中最薄弱的领域,只有 3 项研究,尽管它在院校层面的讨论中占据主导(Generative AI in computing education: A systematic review and a framework for responsible integration)。同一篇综述还报告称,60–80% 的计算机专业学生在课程作业中使用生成式人工智能,通常并未获得教师的明确许可;某项全国性教师样本中有 70% 的人明确要求获得关于抗人工智能评价设计的培训。

具体示例:

3. 学习验证:验证理解,而不是验证来源

与其试图证明一份提交是如何产生的,不如偶尔请学生展示他们学到了什么。“对学生使用人工智能最好的回应不是检测,而是对话”把简短的验证性谈话、早期草稿、反思和学生视频描述为可行的机制。

具体示例:

  • 用 2 分钟一对一或录制的形式讲解自己所提交的作品。
  • 就同一材料进行一次不使用工具的后续测验。
  • 请学生修改自己作品中的一部分,并解释所作的改动。

*说明:*这一来源是实践者的叙述,因此最好把它视为一种有前景的做法,而不是决定性的因果证据。

验证也正是让学术不端处理程序站得住脚的东西。 Munoz 等人(2026)分析了真实的生成式人工智能学术不端指控案卷,发现自然正义原则要求:在作出任何认定之前,学生必须被告知指控内容并有机会作出回应;这个回应机会通常是一次调查性会谈或小组面谈,而学生所说的内容会成为证据记录的一部分。他们对证据类别的划分也解释了为什么验证必须被建进课程,而不能在调查过程中临时拼凑:系统记录的行为痕迹只存在于有监督的评价中,而较弱的程序性证据,也就是草稿、督导会谈、演示,只存在于这些做法本来就已经到位的地方。验证流程就是你可以依赖的那种程序性证据。规则本身也必须精确:Wright(2026)表明,把语音转文字转录与生成式起草当作同一种“人工智能使用”来禁止,属于过度涵盖,会有处罚并未做出被禁行为的学生之虞,这首先是一个公平问题,其次才是法律问题(Legal Issues and Risks)。

4. 有脚手架的先后顺序:“先思考,再用人工智能,后反思”

与其禁止人工智能,不如教学生一套能让他们留在认知回路中的结构化流程。减少人工智能误用这一综合梳理概述了八条设计原则:保留认知摩擦,把人工智能定位为暂定的思考伙伴(而不是权威),嵌入评价检查点,并要求进行元认知日志记录与提示词留痕。

具体示例流程:

  1. 先思考:在任何人工智能使用之前,学生先独立进行头脑风暴、拟定提纲或起草。
  2. 再用人工智能:他们用人工智能对照自己的想法进行批评、扩展或生成替代方案。
  3. 后反思:他们记录自己用人工智能做了什么、接受或拒绝了什么以及原因(一份提示词加修改记录)。

5. 针对具体任务的人工智能使用声明

用把人工智能使用映射到认知环节(例如结构性规划与内容生成)的**领域特定声明框架**,取代“我使用了人工智能 ☐”这类通用勾选框。(Structuring Transparency: Developing Domain-Specific Generative AI Declaration Frameworks in Higher Education) 这迫使学生反思自己如何使用了人工智能,也澄清了可接受的帮助与学术不端之间的界限。要把它与明确的期望搭配起来,并向学生保证如实披露不会被惩罚:惩罚性或者含糊的政策会主动促使人们隐瞒。(Addressing student non-compliance in AI use declarations: implications for academic integrity and assessment in higher)("Should I Tell My Teacher?" Student AI Disclosure Practices, Stigma, and Self-Regulated Learning in Higher Education)

Mohamed 与 Temimi关于评价设计的建模解释了这一建议背后的机制。只有当诚实的代价维持在低位时,披露才会成为有吸引力的选项;而且由于检测工具的误报也会落在诚实的学生身上,只要额外的敏感度带来的新误报多于新真报,更强的监控就可能使隐瞒变得相对更有吸引力。应当把申报的使用情况当作语境来读,而不是当作认罪书,并且要针对最有可能想隐瞒的学生来设计,而不是针对平均水平的学生。

**具体示例:**一份封面说明,要求学生就每份作业说明:你是否使用了人工智能?用于哪些环节(头脑风暴/起草/修改/检查)?你用了什么工具和提示词?你如何评价它的输出?

6. 建设人工智能素养与诚实的期望

减少人工智能误用这一综合梳理把人工智能素养与提示词教学列为 Tier-2,即第二层级:一个K-12模块使用情境化提示词练习并配合大语言模型自动评分,提高了实际的提示词技能,也把“用人工智能来学习”的信心提升了 +10.4%,其中 87% 的学生报告说自己学会了负责任地使用人工智能。(Learning to Use AI for Learning: Teaching Responsible Use of AI Chatbot to K-12 Students Through an AI Literacy Module) 要明确说明什么算作弊、它为什么损害学习(即表现与学习之间的落差),以及学生怎样才能富有成效地使用人工智能。这回应了Is using artificial intelligence tools for academic work cheating? Student perceptions, ethics, and the impactIt's OK Because...": The Wild West of Student Rationalization of AI Use in Academic Writing中记录到的“大家都在这么做”的同伴规范与合理化问题。

学生调查支持这一判断方式。在 504 名社会学专业学生中,65% 曾在课程作业中使用生成式人工智能,但只有 3% 用它生成作业文本,2% 用它生成整篇草稿;同时 81% 的人得到过某种人工智能指导,而只有 46% 的人认为指导非常清晰(Student Use of and Views on GenAI for Writing)。实际存在的麻烦是含糊不清,而不是公然违抗,这也是为什么本页关于教学能力的那一部分与关于高等教育中的人工智能素养干预,有哪些证据?以及在人工智能教育研究中,教师最应该了解的 10 项主要发现是什么?中的干预排序相关联。学生描述这些工具的方式与政策并不一致:Mulisa 与 Mezgebu(2026)发现学生提出的问题是,生成式人工智能是一种助长作弊的工具,还是一位支持学习的伙伴;在界定期望时,他们对院校诚信规则与学生自身学习需求之间张力的描述,比再一次警告处罚更有用。

底线

结构性的底线(防护栏,加上无论动机如何都让作弊变得困难的评价设计改革)与教育性的能力建设(人工智能素养、使用声明、“先思考、再用人工智能、后反思”的流程)结合起来。单靠检测是最弱的杠杆;目标是让诚实、富有成效的人工智能使用成为阻力最小的那条路。

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.