本页内容

本页面已译为中文,但知识库本身(包括其中的文章页面、概念页面和常见问题页面)均以英文撰写。 阅读本页的英文版本

本页是英文页面的机器翻译,尚未经母语者审校。

本常见问题按利益相关方分组组织,并采用反驳式写法:先点出误解,再解释它为什么看起来合理,然后直接否定这一不准确的看法,并用一个更有用的心智模型取而代之。内容依据人工智能教育知识库,尤其是其中关于关于人工智能的误解人工智能素养认知卸载反驳文本的综合梳理。

核心信息并不是人工智能本身有益或有害。它的教育效果取决于谁在使用它、用于什么任务、人工智能承担了哪些思考、人类还保留哪些责任,以及学习是如何被评价的


面向学生与学习者的常见问题

“如果人工智能的回答听起来很自信、也很详细,我为什么不该相信它?”

**回答:**因为自信和流畅是输出本身的特征,并不是答案已经过核实的证据。生成式人工智能所做的是预测看起来合理的语言;它并不会自动把每一项主张与可靠证据对照检查。它可能编造来源、说错事实、忽略语境,或者自信地重复某种误解。

把人工智能的回答当作暂定的草稿或假设,而不是权威。找出这个回答所依赖的主张,查阅原始来源,检查计算过程,并把回答与课程材料或可信的参考资料作比较。

有一个有用的检验方法:*如果这句话是一个陌生人说的、而且没有出示任何证据,我会接受它吗?*如果不会,就不要仅仅因为文字读起来漂亮就降低标准。

参见关于人工智能的误解幻觉风险信任校准


“人工智能理解我、知道我的意思吗?”

**回答:**并不是以另一个人理解你的那种方式。人工智能能够对你的语言作出回应、利用当前对话中的信息,有时还会通过产品功能保留信息。这会让互动显得很有个人色彩。但模型并不具备人的意图、生活经验、关心或对语境的理解。

这一区分很重要,因为人工智能之所以赞同你,可能仅仅是因为你的提示词暗示了一个你偏好的答案。这种现象有时被称为谄媚:系统映照或肯定用户,而不是给出所需的纠正。

要求人工智能指出你推理中的弱点、提供反证,并说明在什么情况下它的答案会是错的。然后独立核实它的回应。人工智能的赞同并不能证明你的立场正确。

参见关于人工智能的误解人工智能谄媚人工智能素养


“如果人工智能帮我做出了一份好作业,难道不就说明我学会了这些内容吗?”

回答:不一定。一份好作品展示的是人机系统共同产出的结果,并不会自动说明你能够独立地解释、记住、迁移或完成它。

在一项涉及近 1,000 名高中数学学生的现场实验中,不受限制地使用生成式人工智能提高了有辅助练习时的表现,却降低了之后无辅助考试的成绩。一个只给出提示、不提供完整答案的受约束版本,则消除了所观察到的学习损害。这个教训并不是所有人工智能使用都会损害学习,而是有辅助时的表现与可持续的学习是两种不同的结果

使用人工智能之后,检查一下你能否:

  • 不看人工智能的回答就把推理讲出来;
  • 独立解决一个类似的问题;
  • 指出生成答案中的弱点;
  • 把这一想法迁移到新的情境中。

参见没有防护栏的生成式人工智能会损害学习认知卸载


“如果人工智能让我更快完成,难道不就是更高效的学习吗?”

**回答:**更快完成并不总是更快学习。人工智能可以有效地替你处理事务性工作、令人困惑的格式或不必要的重复。它也可能替你省掉正是知识与技能得以形成的那一环:检索、规划、起草、调试与修改。

关键的区分在于支持性卸载替代性卸载

  • 支持性卸载把注意力释放出来,用于更重要的思考。
  • 替代性卸载让本来要由你学会的那种思考由人工智能来完成。

一个有用的顺序是:

  1. 先自己尝试一次。
  2. 向人工智能索取反馈、提示、示例或比较。
  3. 用自己的判断进行修改。
  4. 完成一次简短的无辅助解释或应用。

目标并不是把难度最大化,而是保留那些能产生预期学习效果的认知工作。

参见认知卸载减少人工智能误用


“使用人工智能是不是都算作弊?”

**回答:**不是。但相反的说法,也就是“使用人工智能不可能算作弊,因为我没有抄袭某个人”,同样不正确。

学术诚信取决于作业的目的、教师的规定、人工智能介入的程度、是否注明来源,以及人工智能是否替代了被评价的那项能力。同一份作业可能允许用人工智能来做头脑风暴,另一份作业可能要求用它来做批评性审读,而在评价独立表现的场合则可能禁止使用。

在使用人工智能之前,先问一问:

  • 这份作业想要展示我能做什么?
  • 哪些形式的帮助是允许的?
  • 我仍然是作者和决策者吗?
  • 我能解释并为自己提交的作品辩护吗?
  • 我需要说明自己是如何使用人工智能的吗?

当期望不明确时,主动说明并针对具体任务去澄清,比假定一切使用都被禁止、或者假定一切使用都被接受更稳妥。

参见学术诚信人工智能使用与披露声明


“频繁使用人工智能才是主要问题吗?”

**回答:**频率本身并不能决定人工智能使用在教育上是否有成效。一个学生可能频繁使用人工智能来比较不同解释、生成练习题、挑战自己的推理并获得反馈,同时始终保持认知投入。另一个学生可能只用一次,就让人工智能生成某项作业本来要评价的核心论点或解法。

更有用的问题是:

我把哪一层的思考外包了出去,而我现在还能独立完成那一层思考吗?

把语法修改外包出去,与把一篇文章的主张、证据、推理和反驳外包出去,是完全不同的。被外包的认知层次越深,最终作品夸大你自身能力的风险就越大。

参见认知卸载人工智能素养


“写好一个提示词,不就应该得到正确答案吗?”

**回答:**不是。生成式人工智能的输出对提示词很敏感,而且往往是不确定的。措辞、语境、示例或假设上的细微变化,就可能产生差别很大的回应。

反复迭代可能让答案变好,但反复生成并不等于核实。五个相似的回应可能重复同一个错误的假设。因此,有效的迭代不只是再问一次,它还包括:

  • 明确目标与约束条件;
  • 要求模型暴露它自己的假设;
  • 索取不同角度的解释;
  • 用证据检验它的回应;
  • 检查当问题发生变化时答案是否仍然成立。

提示词是一项有用的技能,但它并不能免除对学科知识和批判性判断的需要。一项关于一名朴素学生在带回家的考试题上使用聊天机器人的示范表明,好的使用实际上需要多少来回互动:默认输出停留在 SOLO 分类法的多点结构水平,属于“漂亮但在教学上很单薄”;而要达到一个可用的学习回路,需要进行八轮元层面的干预,例如提示信息过载、要求简化、收窄范围。作者把这种所需的能力称为人工智能互动素养,即在生成式人工智能的迭代互动中进行引导、评价与学习的能力,并指出其中的公平隐忧:由于无指导的使用强加了一项分布并不均匀的互动管理技能,生成式人工智能“可能对本来就有优势的学生最有利”。

参见关于人工智能的误解提示词工程人工智能互动素养。关于其背后的自我调节要求,参见我们如何开发一个有效的人工智能导师?


“如果人工智能检测工具识别不出我的使用,那还有什么实际坏处吗?”

**回答:**最重要的问题不是软件能否检测到这种使用,而是你是否能展示出所提交作品声称代表的那种能力。

未被发现的代做,仍然可能让你无法解释这份作品、无法回答追问、无法把它迁移到新问题上,也无法在人工智能不可用时完成任务。它还可能让你得到的成绩与你实际的能力之间出现越来越大的落差。

这种落差可能一直隐藏着,直到之后某门课程、某场考试、某次实习、某个执照考核流程或某项工作任务要求你独立表现时才暴露出来。因此,学术诚信不只是避免受罚,它也是确保你的资历始终代表你真正能做到什么。

参见学术诚信评价效度真实性评价


给学生的核心信息

用人工智能扩展你的思考,而不是让你的思考变得不必要。一份优秀的人工智能辅助作品,应当让你更有能力去解释、评价、迁移和重现背后那项工作。


面向教师与高校教职人员的常见问题

“人工智能最终会让教师变得不必要吗?”

**回答:**人工智能可能自动化教学工作中的一部分任务,但把任务自动化并不等于取代教学的教育功能。

人工智能可以起草示例、生成初步材料、回答常规问题,并辅助提供反馈。教师仍然要负责理解学习者的需要、建立关系、营造在智识与情感上都安全的学习环境、把学科知识置于具体语境中、作出伦理判断,并决定什么时候人工智能生成的回应是不合适的。

教师的角色可能从唯一的信息来源,转变为教学的组织者、学习设计者、学科引导者,以及承担责任的最终人类决策者。这是专业工作的转变,而不是它的消失。

参见教学教学设计教师人工智能能力


“经验丰富的教师能可靠地识别出人工智能生成的学生作业吗?”

**回答:**可靠性不足以把直觉当作证据。人工智能生成的文字可以被编辑、与人写的文字混合、翻译、改写,也可以通过许多不同的系统产生。人的判断还可能受到写作风格、语言背景、残障状况,以及对某个学生“应该”写作成什么样子的预期的影响。

人工智能检测工具面临类似的局限,并且既可能产生误报,也可能产生漏报。检测工具的分数偶尔可以提示需要进一步查看,但它不应取代公正的证据程序。

更站得住脚的应对方式是学习验证:请学生解释自己的推理、讨论所用来源、修改一段文字、把这一想法应用到新案例中,或者出示过程证据。这直接评价了真正重要的东西,也就是学生的理解。

参见学术诚信人工智能检测


“全面禁止人工智能是不是我的课程最安全、最公平的政策?”

**回答:**并非自动如此。当被评价的能力就是独立表现时,例如在某些考试、基础练习或职业能力考核中,无人工智能的条件是合适的。但一刀切的禁止可能把使用赶到地下、让规则难以一致地执行,并让学生无法发展他们在课程之外可能需要的人工智能素养。

更清晰的做法是界定针对具体任务的条件:

  • **必须使用人工智能:**学生必须使用并批判性地评价人工智能。
  • **允许使用人工智能但须说明:**人工智能可以支持指定的环节。
  • **限制使用人工智能:**只允许特定的功能。
  • **禁止使用人工智能:**任何帮助都会使预期的学习主张失效。

当教师解释每种条件为什么存在,并在教学大纲、作业说明、反馈和评价中一致地执行它时,学生更有可能遵守边界。

参见为学生界定人工智能使用学术诚信教育人工智能政策


“如果我让学生使用一个强大的人工智能导师,学习不就会改善吗?”

**回答:**仅仅提供访问权限并不是教学设计。同一个底层模型,可以因为互动结构的不同而支持或损害学习。

人工智能导师在以下情况下可能支持学习:

  • 要求学生先自己尝试;
  • 提供提示而不是完整解答;
  • 要求学生解释自己的推理;
  • 在调整支持的同时不移除责任;
  • 谨慎地纠正误解;
  • 随时间逐步撤除帮助;
  • 包含一次无辅助的检查。

同一个系统在立即给出漂亮答案、替学生完成规划,或者鼓励寻求答案而非理解时,也可能损害学习。

教育价值不仅在于模型本身,还在于它周围的**教学法包装**。

参见教学设计Scaffolding减少人工智能误用


“如果学生喜欢人工智能生成的反馈,这不就说明反馈是有效的吗?”

**回答:**满意度是关于可接受性的有用证据,但它不足以证明学习有效性。

学生可能偏好即时、鼓励性、详细或容易看懂的反馈。但人工智能反馈仍然可能不准确、泛泛而谈、过于正面、优先级安排不当、对语境不敏感,或者与作业的学习目标不一致。

评价人工智能反馈时应当提出多个问题:

  • 它准确吗?
  • 它诊断出真正的问题了吗?
  • 它具体且可操作吗?
  • 它适合学习者的水平吗?
  • 学生是否有效地使用了它?
  • 修改后是否有所改进?
  • 之后的独立表现是否有所提高?

学生还需要反馈素养:即解读、评价并有选择地对反馈采取行动的能力,而不是自动接受它。

参见人工智能反馈质量反馈素养


“学会写好提示词就足以让教师做好准备了吗?”

**回答:**提示词只是一项操作性技能,并不等于教师人工智能能力的全部范围。

教育者还需要理解:

  • 人工智能系统能可靠地做什么、不能可靠地做什么;
  • 如何评价输出的准确性与偏见;
  • 人工智能如何影响评价效度;
  • 学生的卸载在什么时候变成了学习位移;
  • 隐私、可访问性与数据治理方面的要求;
  • 如何让人工智能使用与学科教学法保持一致;
  • 什么时候不该使用人工智能。

知识库中梳理的研究发现,当把自我报告与基于表现的测量作比较时,教师大幅高估了自己的人工智能能力。得到证实的实际能力和课堂整合之间的关系,远比单纯的信心更强。

参见人工智能素养评价:自我报告与表现之间的错位教师人工智能能力教育发展


“人工智能一定会摧毁批判性思维吗?”

**回答:**不会。人工智能既可以取代批判性思维,也可以成为批判性思维的对象与伙伴。

当学生向人工智能索取一个已经完成的解释、论证或解法并直接接受时,任务更有可能削弱参与。当学生必须完成以下任务时,任务则可以加强评价与元认知:

  • 在咨询人工智能之前先作出预测;
  • 把自己的推理与人工智能的回应作比较;
  • 找出错误或缺乏支持的主张;
  • 改进一个薄弱的人工智能生成答案;
  • 在多个选项中作出选择并说明理由;
  • 解释自己为什么拒绝了人工智能的建议。

恰当的区别并不只是用人工智能还是不用人工智能。关键在于人工智能发挥的是教练、挑战或评价素材的作用,而不是学习者推理的替代品。

参见批判性思维认知卸载教学设计


给教师的核心信息

不要只问“学生可以使用人工智能吗?”还要问“学生必须保留哪些思考,人工智能可以提供哪些支持,以及什么证据能表明学习真的发生了?”


面向管理者、院校领导与政策制定者的常见问题

“购买一个先进的人工智能平台,就会改变教与学吗?”

**回答:**平台提供的是能力,而不是教育变革。

有意义的改变需要在课程、评价、教师发展、技术支持、可访问性、隐私、治理、工作量与本地评估之间形成配合。缺少这些条件,院校可能买来一套精密的系统,却被不一致地使用、重复现有的工作、加重教师负担,或者只能产出令人印象深刻的演示,却看不到可测量的学习增益。

在采购之前,领导者应当明确:

  • 要解决的教育问题是什么;
  • 预期的使用者与使用场景有哪些;
  • 哪些结果才算成功;
  • 系统会收集哪些数据;
  • 需要什么样的人类监督;
  • 在什么条件下院校会调整或停止使用。

参见从管理者视角看人工智能人工智能治理人工智能教育评估


“基准测试分数高,是否能证明一个人工智能系统在教育上有效?”

**回答:**不能。基准测试展示的是在该基准所设定的特定条件下的表现,它并不会自动表明学生在真实课程中会学到更多。

一个模型可能能解决难题、生成流畅的解释,或者在辅导评分表上得分很高,但仍然无法提升记忆保持、迁移、自我调节或公平的结果。因此,基准表现应当与以下方面分开看待:

  • 技术可靠性;
  • 教学质量;
  • 安全性;
  • 可用性
  • 实施负担;
  • 课堂采纳程度;
  • 无辅助条件下的学习结果。

课堂有效性需要与真实学习者一起进行现场测试,需要相关的对照条件、合适的结局测量,以及对实施过程的关注。

参见人工智能教育评估Benchmark学习增益


“因为人工智能是数据驱动的,它的决策难道不比人更客观吗?”

**回答:**数据驱动并不意味着没有价值取向或没有偏见。偏见可能通过训练数据、标注、结局定义、提示词、语言假设、可访问性选择、决策阈值,以及工作人员解读输出的方式进入系统。

人类同样有偏见,但这并不能证明自动化决策就是中立的。自动化可能把偏见隐藏在技术界面之后,并以更大的规模施加它。

对于会产生重要后果的教育决策,院校应当要求:

  • 分组表现分析;
  • 记录训练与验证条件;
  • 报告不确定性;
  • 有意义的人工复核;
  • 学生申诉流程;
  • 部署后的持续监测;
  • 对差异化伤害的调查。

参见关于人工智能的误解偏见缓解人工智能治理


“如果每个学生都拿到相同的人工智能账号,我们不就解决了公平问题吗?”

**回答:**账号相同并不能保证机会相同或结果相同。

学生在先前学科知识、人工智能使用经验、语言、残障相关的可访问性、设备质量、可用时间、信心,以及评价人工智能输出的能力上都存在差异。经验更丰富的学生可能用人工智能来扩展自己的学习,而先前知识或元认知技能较弱的学生,更有可能接受错误的输出,或者把最需要自己练习的那部分交出去。

因此,公平规划至少要处理三个层面:

  1. **可及性:**谁能稳定地使用这套系统?
  2. **技能:**谁知道如何使用并评价它?
  3. **结果:**谁真正从中受益,谁又承受了新的伤害?

参见人工智能教育中的公平数字鸿沟人工智能素养


“一项全院统一的人工智能政策能消除不确定性吗?”

**回答:**政策是必要的,但仅有政策文本并不能创造共识。

学生和教职员工会通过多个来源来理解对人工智能的期望:院校层面的指导、专业或项目的规范、教学大纲、作业说明、教师的评语、同伴行为,以及以往的处分先例。当这些来源相互冲突时,人们会自行构建一套关于什么可被接受的解释。

因此,有效的政策架构要把以下各层连接起来:

  • 全院层面的原则;
  • 项目或学科层面的期望;
  • 课程政策;
  • 具体作业的说明;
  • 示例与情境;
  • 透明的披露与复核程序。

政策还应当解释限制或许可背后的教育理由。仅仅写明“允许”或“禁止”的规则,更难以促成有判断力的理解。

参见人工智能治理教育人工智能政策为学生界定人工智能使用


“人工智能检测与远程监考能解决学术诚信问题吗?”

**回答:**它们自己无法解决这个问题。检测所估计的是一件作品是否像机器生成的;而教育需要的是学习者确实具备其所声称能力的证据。

检测工具会产生误报与漏报,其表现也会随模型、语言、任务和编辑方式而变化。监考可能带来隐私、可访问性、焦虑与公平方面的新问题,却仍然无法确定学生究竟学到了什么。

现有证据已经具体到可以用数字说明的程度。一项程序正义分析报告称,十四种早期检测工具中没有一种达到 80% 的准确率;改写或轻度编辑会使本就不高的准确率大约减半;检测工具还会系统性地错判非英语母语写作者,因为被当作人工智能信号的那些特征,同样也是熟练的第二语言写作者的特征。在一项隐蔽现场研究中,注入五门心理学模块在线考试的全由人工智能生成的提交中有 94% 未被发现,而且这些人工智能作品的平均得分还高于真实学生。范德堡大学在无法验证其宣传的 1% 误报率之后停用了已授权的检测器,因为那个误报率意味着大约有 750 名学生被错误标记,而该校每年有 75,000 份提交;该校随后把人力转向透明的期望与评价设计

更持久的院校策略应当结合:

  • 清晰解释过的期望;
  • 适当的无人工智能评价条件;
  • 过程证据与分阶段完成的作品;
  • 口头或书面的学习验证;
  • 针对具体任务的披露;
  • 评价设计改革;
  • 比例适当、经人工复核的程序。

目标不只是检测到帮助行为,而是维护教育判断的效度。

参见学术诚信人工智能检测远程监考无法被检测的学术不端。关于设计层面的应对,参见人工智能时代应当如何重新设计评价?我们怎样才能减少人工智能作弊?


“教师的不情愿主要是一个缺少培训的问题吗?”

**回答:**有时是,但教师的准备状态比技术技能更宽泛。

不情愿可能反映的是工作量、职业认同、学科价值观、对评价效度的担忧、缺少院校支持、对隐私的不确定,或者是一种有理由的判断,即某项特定的人工智能应用并不服务于学生。

因此,教师发展应当处理:

  • 知识与实践能力;
  • 教学整合;
  • 职业认同与目标;
  • 时间与工作量;
  • 政策与治理;
  • 学科特定的使用方式;
  • 有原则地选择不采用的机会。

一次性的功能演示,不太可能解决一个社会技术与专业变革层面的问题。

参见教育发展教师人工智能能力教学


给院校领导的核心信息

不要购买一个“人工智能成果”。要去建设这样一些院校条件:让某项具体的人工智能能力能够被负责任地使用、在本地得到评估、在必要时得到改进,并在它无益于学习时被停用。


面向教学设计者、教育技术开发者与供应商的常见问题

“如果人工智能导师给出正确答案,它不就是个好导师吗?”

**回答:**能解决问题的系统,未必是能教学习者的系统。

一个技术上正确的答案,可能来得太早、透露得太多、绕过合意困难,或者让学习者没有机会练习解释与提取。评价一个导师,应当看它促使学生注意到什么、尝试什么、解释什么、修改什么,以及最终能独立完成什么

在教学上更强的导师可能会:

  • 先诊断再介入;
  • 提问而不立即作答;
  • 只给出最小的有用提示;
  • 要求解释;
  • 针对误解作出回应;
  • 逐步撤除支持;
  • 检查之后的无辅助表现。

正确性仍然是必要的,但教育质量还涉及时机、脚手架、认知投入与学习迁移

参见教学设计智能导师系统教学安全


“更多的自动化与个性化总是更好吗?”

**回答:**不是。个性化学习可以支持学习,但也可能变成过度迁就。

当一个系统替学习者完成规划、监测进度、决定什么重要,并完成困难步骤时,学习者可能效率更高,但自主性与自我调节能力发展得更少。设计问题不是把所有难度都降到最低,而是在移除不必要障碍的同时,保留与学习目标相关联的那份努力。

有用的设计特征包括:

  • 强制学习者先尝试;
  • 解释提示;
  • 延迟给出提示;
  • 可调节的帮助水平;
  • 脚手架撤除;
  • 对人工智能建议的反思;
  • 定期的无辅助练习;
  • 清晰的可覆盖系统的机会。

参见智能体式人工智能能动性认知卸载


“单轮测试足以证明一个教育聊天机器人是安全的吗?”

**回答:**不能。教育伤害可能在整段互动中日积月累地出现。

一个系统可能对某个孤立的提示作出恰当回应,却逐渐开始提供答案、强化某种误解、鼓励依赖,或者偏离它原本的辅导角色。知识库中总结的 SafeTutors 基准发现,当系统在多轮对话而非单次交流中被评估时,教学伤害类失败会急剧增加。

基准证据并不等于课堂学习效应的估计,但它说明了教育测试为什么应当包括:

  • 持续的对话;
  • 学生反复犯错;
  • 试图直接获取答案的尝试;
  • 涉及情感与关系的场景;
  • 对抗性提示;
  • 学习者依赖程度随时间的变化。

参见教学安全人工智能导师的安全与教学伤害


“更大或能力更强的模型会自动成为更安全的导师吗?”

**回答:**不会。通用模型能力并不等同于教学质量。

一个更大的模型可能能解决更困难的问题,却仍然无法:

  • 选择恰当的教学策略;
  • 识别何时应当拒绝给出答案;
  • 适应发展水平;
  • 保留有益失败
  • 传达不确定性;
  • 避免不恰当的情感影响;
  • 与教师的学习目标保持一致。

教学行为应当被明确地设计出来,以学习理论为依据,在不同学习者群体中测试,并在持续使用中受到监测。模型选择很重要,但教学设计这一层仍然不可或缺。一项与六位中学教师共同开展的参与式设计研究提示,安全性来自范围与监督,而不是规模:这些教师各自设计了“有边界的专家”,即把人机监督之下、严格限定在某一领域的专门能力作为系统边界,并由此划出两条边界线(权限边界,因为对学生学习与安全的责任无法委托出去;专长边界,因为人工智能缺乏对个别学生和课堂规范的语境知识)与三层保护(领域边界、带有标准化拒绝的内容过滤,以及教师覆盖)。他们要求的是完整的对话记录与实时告警,而不是更好的模型解释。

参见教学设计教学导向的大语言模型训练教学安全有边界专家的聊天机器人设计


“人工智能生成的反馈越多越好吗?”

**回答:**不是。反馈可能变得过量、泛泛而谈、时机不当、不准确,或者在认知上令人不堪重负。

有效的反馈应当帮助学习者找出最重要的下一步。一份对所有可能问题都加以评论的长回复,可能不如一次聚焦的介入有用。系统应当依据学习目标、学习者的准备程度和可能产生的影响,对反馈排出优先级。

要评价的不只是反馈的数量与速度,还应当测量:

  • 学生是否理解了这些反馈;
  • 他们是否能判断反馈的质量;
  • 修改之后是否有所改进;
  • 误解是否减少;
  • 之后的独立表现是否提高。

参见人工智能反馈质量Feedback反馈素养


“人工复核只是等模型改进之前的暂时要求吗?”

**回答:**人类监督不只是纠错的补丁,它同时也是一种问责、语境化和治理功能。

教育者要判断某项输出对特定的学习者、课程、文化或会产生重要后果的决策是否合适。他们解读例外情况、考虑模型并不掌握的信息,并为影响学生的行动承担责任。

有意义的“人在回路”设计应当明确:

  • 谁复核输出;
  • 复核者能看到哪些证据;
  • 复核在什么时候进行;
  • 有多少时间可用;
  • 复核者能否覆盖系统;
  • 谁对最终行动负责;
  • 学习者如何申诉。

一个名义上存在、却缺乏时间、权限或相关信息的复核者,算不上有意义的监督。

参见人在回路的人工智能人工智能治理


“可访问性、隐私与公平能否在产品核心功能跑通之后再补上?”

**回答:**它们应当被当作核心设计需求,而不是上线之后的附加项。

输入方式、阅读水平、语言假设、设备要求、数据留存、个性化与模型偏见,都会影响谁能使用一套系统、谁可能因它受损。事后改造可能改善界面,却让底层的工作流程、数据模型和决策逻辑保持不变。

设计团队应当尽早让受影响的学习者和教育者参与,用多样化的用户进行测试,尽量减少数据收集,提供可访问的替代方案,并检查差异化结果。如果一套系统的收益无法被平等地获取,或者它的伤害分布不均,就不能认为它在教育上是有效的。

参见Accessibility通用学习设计Privacy人工智能教育中的公平


给设计者与开发者的核心信息

要优化的目标是学习者能力的增长,而不只是任务顺利完成。当学习者变得更有能力,而不是永久地更加依赖这套系统时,一个辅导系统才是在教育上成功的。


面向教育研究者与评估者的常见问题

“如果学生在使用人工智能时表现更好,这不就说明他们学会了吗?”

**回答:**不能。它说明的是有辅助时的表现。学习需要的是学习者自身能力发生变化的证据。

研究应当区分:

  • 人工智能可用时的表现;
  • 紧接着的无辅助表现;
  • 延迟后的记忆保持;
  • 向新问题的迁移;
  • 解释与策略使用;
  • 对持续帮助的依赖程度。

如果没有无辅助条件下的测量,研究者可能误把人工智能系统的贡献归给学习者。当工具能够生成结局测量所奖励的解法、推理或文字时,这一点尤其重要。

参见学习增益评价效度认知卸载


“自我报告的人工智能素养、信心与学习情况是足够的结局指标吗?”

**回答:**它们有助于理解感知、接受度、焦虑与自我效能,但不足以衡量实际表现出的能力。

人们可能既有信心又判断错误,也可能能力很强却缺乏信心。应当把自我报告与基于表现的测量搭配使用,例如:

  • 找出人工智能输出中的错误;
  • 核实一个来源;
  • 选择合适的运用策略;
  • 识别偏见或谄媚;
  • 修改一份有缺陷的回应;
  • 说明在什么情况下不应使用人工智能;
  • 让信心与准确性相互校准。

知识库中关于教师人工智能素养研究的综合梳理报告称,自我评估与实际测量表现之间存在显著差距,这进一步说明两者都需要评价。

参见人工智能素养评价:自我报告与表现之间的错位人工智能素养


“基准表现可以当作课堂有效性的证据吗?”

**回答:**没有额外证据就不行。基准测试确立的是在限定范围内的技术或行为表现。课堂学习取决于学生、教师、激励结构、课程一致性、实施质量、实际采用情况以及相互竞争的资源。

一条负责任的证据路径可能是:

  1. 技术与基准测试;
  2. 可用性与安全性研究;
  3. 小规模课堂试点;
  4. 受控的有效性研究;
  5. 实施研究;
  6. 更长期、多站点的评估。

研究者应当明确说明一项研究处理的是这条链条上的哪一环,而不是把基准结果泛化为关于学习的结论。

参见Benchmark人工智能教育评估人工智能教育证据基础的局限


“如果一个人工智能评分系统是可靠的,不就说明它有效吗?”

**回答:**不是。可靠性关乎一致性,效度关乎对分数的解释与使用是否正当。

一个系统可以一致地测量错误的构念、遗漏重要维度、对某个亚群体不利,或者产生被人误用的分数。效度验证应当考察:

  • 构念的覆盖程度;
  • 与相关的人类判断的比较;
  • 亚群体表现;
  • 错误模式;
  • 不确定性;
  • 使用带来的后果;
  • 人工智能输出是否改变了人的决策;
  • 申诉与复核程序。

高度一致是证据的一种形式,但它并不是完整的效度论证。一项英国的大型基准研究直接展示了这种分离:在 761 篇真实的本科心理学论文中,人工智能与人类评分在学位等级上只有 35–65% 的时间一致(某院校为 63%,第二所为 53%,第三所为 35%),而可靠性却近乎完美,重评的组内相关最高达到 1.00。各系统之间的一致程度远高于它们与人类的一致程度(三个模型的 ICC = 0.91),当要求三个模型全部同意时,它们只在 56% 的提交上对等级取得一致;而分数整体向中间压缩(压缩分数 0.47–0.82),因此在区分一等与二等一、或者及格与不及格的那些边界上,人工智能恰恰最不准确。人工智能给出的反馈也比 100–200 词的人类平均水平长三到八倍:数量并不等于质量。

参见评价效度教育测量自动化评价大学论文的自动化评分


“大语言模型生成或被模拟的学生,能替代真实学习者用于教育研究吗?”

**回答:**它们可能对制作原型、压力测试、生成情境或探索假设有用。但在未经验证的情况下,不应假定它们能复现人类的学习过程。

一个模型可以模仿困惑或误解的语言,却并不表现出真实学习者所具有的坚持、动机、先前知识、情感或发展轨迹。知识库中梳理的研究发现,被模拟的学生经常在受到极轻微的纠正后就放弃了被指定的误解,这使人怀疑它们是否忠实地体现了人类的概念转变。

因此,基于被模拟学习者的论断,在被用于支持教学或政策结论之前,应当先与人类行为作对照验证。

参见模拟学生模拟学生还是在谄媚地解决问题?


“平均效应为正,是否意味着这项干预对学生的总体有益?”

**回答:**不是。平均效应可能掩盖在先前知识、年龄、学科、语言、残障状况、元认知技能、可及性、教师实施方式或人工智能使用类型上的重要差异。

研究者应当考察:

  • 处理效应的异质性;
  • 亚群体的不确定性,而不只是亚群体的点估计;
  • 实施的真实程度;
  • 实际发生的人工智能互动模式;
  • 缺失数据与流失方面的差异;
  • 收益在人工智能撤出后是否仍然存在;
  • 是否一些学习者有所收获,而另一些变得更依赖。

一个很小的平均增益,可能掩盖了某一群体身上有价值的效应,以及另一群体身上受到的伤害。一个很大的平均增益,也可能依赖于其他院校无法复现的条件。

参见人工智能教育证据基础的局限人工智能教育研究方法人工智能教育中的公平


给研究者的核心信息

要在人工智能不再帮忙之后测量学习者,并报告实施条件、学习者差异与效度局限,因为正是它们决定了结果的实际含义。


面向家长、家庭、公众与媒体传播者的常见问题

“人工智能会彻底变革教育,还是会摧毁教育?”

**回答:**这两种说法都夸大了技术在自行发挥作用时的力量。

人工智能可以扩大获得解释、翻译、练习、反馈与辅助支持的机会。它也可能带来错误信息、隐私风险、偏见、过度依赖和新的诚信问题。后果取决于系统是如何设计的、教师和学生被要求用它做什么,以及院校如何治理它的使用。

一个更有用的公共问题是:

对哪些学习者、哪些任务和哪些结果,以及在什么条件下,这种人工智能使用带来的教育收益大于伤害?

这个问题鼓励人们去评估,而不是去炒作或恐慌。

参见教育中的人工智能关于人工智能的误解


“年轻人是数字原住民,不就已经具备人工智能素养了吗?”

**回答:**熟悉数字产品,并不等于有能力理解并批判性地评价人工智能。

学生可能很熟练地打开聊天机器人、生成一张图片或者直接索取答案,却仍然无法:

  • 核实一项主张;
  • 识别被编造的证据;
  • 察觉偏见或谄媚;
  • 保护个人信息;
  • 判断哪些思考不该被交出去;
  • 说明人工智能如何影响了自己的作品。

知识库中综合的一项研究显示,对日常技术的信心并没有转化为在算法推理、技术创造或对人工智能的批判性评价方面相当的能力。

人工智能素养必须被教授和展示,而不应从年龄或技术使用的频率中推断出来。

参见人工智能素养能力的错觉


“使用人工智能的学生只是懒惰或不诚实吗?”

**回答:**确实有学生误用人工智能,但道德标签既不能充分解释这种行为,也无法有效预防它。

学生的选择受到作业的价值、时间压力、信心、同伴规范、政策的清晰程度、对失败的恐惧、先前的可及性,以及作业是否看起来与有意义的学习相关联等因素的影响。他们对头脑风暴、编辑、解释和整篇生成也会有不同的看法。

有效的应对要结合:

  • 清晰且一致的期望;
  • 有意义的评价;
  • 关于负责任使用的指导;
  • 披露的机会;
  • 对学习的验证;
  • 比例适当的问责。

把所有人工智能使用都当作人品不佳的证据,只会把使用推向秘密状态,让坦诚的讨论更不可能发生。

参见学术诚信为学生界定人工智能使用


“人工智能基本上就是另一种计算器吗?”

**回答:**这个类比在某一点上有帮助:两者都能卸载一部分工作。但生成式人工智能能够卸载的认知活动范围要广得多。

计算器通常执行一项被明确定义的数学运算。生成式人工智能可以产出解释、论证、方案、来源摘要、代码、反馈,以及整份作业。它的运作方式也更不透明,其输出可能很有说服力却是错的。

这意味着教育者必须对允许学生交出去的内容作出更细致的判断。把常规计算卸载出去,可能让学习者专注于解读;而把解读本身也卸载出去,可能就把预期的学习一并移除了。

参见认知卸载生成式人工智能


“只要聊天机器人屏蔽了有害或露骨内容,它对儿童就是安全的吗?”

**回答:**内容审核是必要的,但它并未覆盖全部教育风险。

一个系统可能保持礼貌,同时却在:

  • 过快给出答案;
  • 强化误解;
  • 鼓励情感依赖;
  • 收集不恰当的数据;
  • 给出不适合其发展阶段的建议;
  • 作出会造成使用障碍的假设;
  • 取代人的支持;
  • 减少富有成效的努力。

面向儿童的人工智能应当就内容安全、教学安全、隐私、可访问性、关系性影响,以及反复互动带来的效应进行评价,而不只是检查是否出现被禁止的词语或话题。

参见K–12 人工智能教育教学安全Privacy


“富有同理心的人工智能真的关心学生吗?”

**回答:**人工智能可以生成听起来专注、支持性或有情感回应的语言。这有时可能帮助学习者把问题说清楚,或者让他在一项低风险任务中继续下去。但同理心的表象不应与人的关心、责任或照护义务相混淆。

人工智能无法独立承担教师、辅导员、家长或照护者的责任。它可能误解情境、强化使用者原有的框架,或者在听起来很体贴的同时作出不恰当的回应。

学生应当知道自己在什么时候是在与人工智能互动、哪些数据可能被保留,以及系统在什么时候应当把他们引向有资质的人。

参见关于人工智能的误解对话式人工智能人工智能治理


给家庭与公众的核心信息

人工智能不是一股自主的教育力量。它的后果由设计、教学、院校决策、家庭支持,以及学习者仍然保留的责任共同塑造。


面向雇主与劳动力合作伙伴的常见问题

“人工智能素养主要就是会写好的提示词吗?”

**回答:**提示词有用,但真正持久的素养要宽泛得多。

一个有能力的员工必须能够:

  • 恰当地界定问题;
  • 判断什么该交出去、什么不该交出去;
  • 在提供相关语境的同时不暴露敏感数据;
  • 评价证据与不确定性;
  • 识别偏见与失败;
  • 修改或拒绝输出;
  • 记录会产生重要后果的使用;
  • 对最终决定承担责任。

提示技巧会随产品的演进而改变。判断力、核实能力、领域理解、伦理推理与责任感,则是更具迁移性的能力。

参见人工智能素养人机协作


“一份漂亮的人工智能辅助工作成果能证明专业能力吗?”

**回答:**它证明的是人机系统的表现,但未必能说明个人能做什么。

要评价专业能力,雇主与教育者应当考察这个人是否能够:

  • 界定背后的问题;
  • 解释各项假设;
  • 核实证据;
  • 察觉细微的错误;
  • 在条件变化时作出调整;
  • 为最终建议辩护;
  • 在没有不恰当帮助的情况下作出关键判断。

在许多职业中,负责任地使用人工智能本身就是一项正当的能力。但评价必须把有效的工具使用与由工具造成的专业假象区分开来。

参见真实性评价评价效度职业发展与准备度


“人工智能能检索或生成基础知识,所以学科基础知识正在变得过时吗?”

**回答:**不是。监督人工智能的能力,恰恰依赖于过度自动化可能让人不再去发展的那部分专业知识。

如果领域知识不足,使用者可能无法识别:

  • 一个貌似合理却错误的结论;
  • 一个缺失的约束条件;
  • 一项危险的推荐;
  • 一项无效的比较;
  • 一条被编造的引文;
  • 一个带有偏见的假设;
  • 一种不应再信任人工智能的情形。

课程可能需要重新考虑哪些知识应当被记住、哪些工具应当可用。但不应仅仅因为人工智能能给出答案,就取消基础性的理解。专家的监督需要一个内在的判断依据。

参见认知卸载先前知识信任校准


“教学生批判性、合乎伦理地使用人工智能,会与工作场所的生产力冲突吗?”

**回答:**负责任的评价是可持续生产力的一部分。

未经核实的自动化会带来返工、安全事件、歧视性决策、法律风险、声誉损害与虚假的自信。批判性的人工智能素养并不意味着拒绝自动化,而是知道自动化在什么时候增加价值、什么时候需要监督,以及什么时候应当拒绝输出。

最强的毕业生或员工未必是在最多任务上使用人工智能的人,而是能够在人与人工智能之间明智地分配工作,同时保持质量、保密性、问责与专业判断的人。

参见人工智能素养人工智能治理人机协作


给雇主的核心信息

要评价的是人们能否带着判断力、核实与问责来使用人工智能,而不只是他们能否快速产出漂亮的工作成果。


面向所有传播人工智能相关误解的人的常见问题

“为什么仅仅告诉人们关于人工智能的正确事实还不够?”

**回答:**误解并不总是知识上的空缺。它们往往是稳定而看似合理的心智模型。一个人可能反复观察到人工智能听起来很自信、产出高质量的工作或者节省时间。这些经验看起来印证了诸如“人工智能是理解的”“人工智能是准确的”或者“完成任务就意味着我学会了”之类的信念。

因此,有效的纠正应当不止于陈述一个事实,它应当:

  1. 点出这个误解;
  2. 承认它为什么看起来合理;
  3. 明确地否定它;
  4. 解释它为什么站不住脚;
  5. 提供一个替代性的模型;
  6. 给这个人一个把替代模型用起来的方法。

参见关于人工智能的误解反驳文本


“有效的反驳听起来是什么样的?”

**回答:**它应当直接,但不居高临下。

例如:

误解:“一份好的人工智能生成作业说明学生学会了。” 反驳:“这并不一定成立。作品展示的是学生与人工智能共同产出的东西,却并未揭示学生自己完成了哪些推理。” 替代模型:“当学生能够解释、迁移、调整并重现这项能力时,学习才得到了更好的证明。” 应用:“在人工智能辅助的工作之后,补上一次解释、口头答辩、过程记录或一次无辅助的应用。”

替代模型至关重要。如果传播者只是移除误解,人们可能因为没有更好的解释而回到原来的想法。

参见反驳文本


“教育者如何在不羞辱人的前提下纠正误解?”

**回答:**要针对那个信念及其后果,而不是给人贴标签。

避免“只有懒惰的学生才使用人工智能”或者“相信聊天机器人的人都很愚蠢”这类说法。这些说法威胁到身份认同,会引发防御心理或隐瞒。

更有成效的做法是:

  • 承认这个信念为什么看起来有道理;
  • 展示一处不一致,例如一次自信却错误的人工智能回答;
  • 在揭示纠正之前先邀请对方作出预测;
  • 让参与者比较有辅助与无辅助时的表现;
  • 给他们一套适用于未来情境的策略;
  • 在多种活动中反复强化新的模型。

当人们可以在不被当作愚昧或不道德的前提下修正自己的想法时,误解更容易被重新考虑。

参见为学生界定人工智能使用人工智能素养反驳文本


“什么样的经历最有可能改变关于人工智能的错误信念?”

**回答:**那些让误解的失败变得可见的经历。

例如:

  • 请学习者找出一个自信却虚构的引文;
  • 比较同一个提示词得到的几个相互矛盾的答案;
  • 在人工智能辅助练习之后,完成一次无辅助的问题;
  • 观察人工智能如何映照一个错误的假设;
  • 比较直接给答案的导师与只给提示的导师;
  • 就姓名、方言或情境审查输出中的偏见;
  • 请参与者用一手证据为人工智能生成的建议辩护。

这些活动把抽象的警告转化为可观察的证据。它们也让参与者练习核实、信任校准,以及关于认知卸载的判断。

参见人工智能素养信任校准认知卸载


“利益相关方应当记住哪一个核心想法?”

回答:

人工智能是一种会犯错的认知资源,而不是权威、不是人类心智,也不是学习已经发生的证据。负责任的教育性使用让人保持问责,保留学习所需的思考,核实会产生重要后果的输出,并以持久且公平的能力来判定成功,而不是只看流畅度、速度、参与度或任务是否完成。

嵌入此页

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.