问答
我应当如何处理小组与合作作业中的人工智能?
本页是英文页面的机器翻译,尚未经母语者审校。
你布置了一项小组作业,提交上来时就带着两种失败模式:一份作品打磨得精致连贯,却没有任何成员能解释它;以及一个团队,其中一名学生把工作交给生成式人工智能跑了一遍,另外三人则搭了共享成绩的便车。文件里没有任何东西能告诉你到底是哪一种。
这两者在成为诚信问题之前先是评分问题,而在这两者之前又是设计问题:小组作业同时提出两项主张,即团队产出了什么,以及每位成员学到了什么;人工智能对这两者都施加压力,改变了工作被分割的难易程度、贡献融合的顺畅程度,以及判断提交物中是谁的思考有多难。
底线是:按任务、而不是按课程来决定人工智能的位置;让小组就人工智能使用所做的协商成为他们提交、你来评分的产物;设计工作使其无法被拆成并行的聊天机器人会话;并至少保留一项每位成员必须独自作答的内容。这一切都不需要监控工具,而是需要设计任务。
简版
- 有意地允许,并说明允许的范围。 指明哪些部分可以让人工智能介入,如想法生成、语言润色、排版、脚本撰写,以及哪些部分应当不用它来完成。
- 保护小组建立共同理解的环节,即界定框架、出现分歧、达成调和的过程,因为以人工智能为中介的效率恰恰压缩的正是这些环节。
- 要求提交一份简短、由小组共同撰写的人工智能使用说明,并对其中的推理评分。 这把同伴规范变成可审查的判断。
- 让过程可见:中间交付物、共享的规划文档、每位成员的反思、对贡献的同伴评价。
- 在小组分数之外保留个人责任,例如口头答辩,或由成员解释自己未起草的任何部分。
- 有意识地选择接入方式。 共享同一个界面会产生经过协商、可见的人工智能使用;私下提问则产生不透明的流程和悄悄去标签化的输出。
- 仔细解读一个小组的克制:不使用人工智能可能是刻意的自我调节,也可能只是不熟悉,而这两者需要不同的回应。
决定人工智能在这项作业中的用途
文献并未把许可问题当作许可问题来解决,而且它反对这样对待它。Chen 与 Zou(2026)研究了由三到五人组成的小组,他们要在机构“须明确致谢方可使用”的政策下完成一项占成绩 30% 的演示,其中生成式人工智能被明确允许用于想法生成、语言润色、视觉排版与脚本撰写。在同一条宽松政策之内,学生们得出了相反的结论,而各方都有站得住脚的推理,并且是设计决定了某个小组得出哪一种结论。课程层面的规则并不能决定一个小组会做什么,任务才能决定。
所以要把许可写在作品的层面:说明哪些阶段对人工智能开放、哪些不开放,并告诉学生原因。范围综述的设计逻辑指向同一方向:如果以人工智能为中介的沟通压缩了协商与集体意义建构,那么需要保护的就是小组建立共同理解的这些环节。不过要如实说明依据:这两篇综述都没有声称不使用人工智能能改善学习结果。这一论点是建立在取舍的结构之上,而不是建立在某项测量过的比较之上。
把任务设计成小组无法直接分割
Wei 与 Perkins(2026)是一项遵循 PRISMA 的范围综述,涵盖 18 项英文研究,发表于 2023 年至 2025 年之间,采用反思性主题分析进行分析并映射到八个主题,它给出了账目的两面。好处是:小组知识发展、想法生成、支持反思性思考、沟通效率、任务协调与反馈。风险是:在过度依赖下同伴互动与投入度下降,此外还有隐私、透明度与准确性的顾虑。他们的判断很直接:好处有实证支持,而隐私、透明度、偏见与准确性方面的风险大多只是在概念层面被讨论;并且许多研究是短期或概念性的,关于小组动态或认知发展的纵向研究很少。
这一取舍支配着设计。该综述报告说,小组工作随着沟通、协商与集体意义建构需求的减少而变得更有效率,这是综述内引用的 Lin 等人的发现,因此效率上的收益与互动上的损失可能是同一个机制。除非你把协商作为必需的工作重新装回去,否则无法只要速度而不要损失。该综述的结论是,基于小组的评价应当把重心从产品转向过程。
Chen 与 Zou 展示了要做到这一点有多容易失手:他们的三种Learner Agency模式同时朝不同方向运行。合作导向的能动性(五个小组)加大了使用强度以维持工作不散,常常把同伴的贡献喂给聊天机器人去解读,并据此调整自己的部分,其中一个小组把工作流重建成“讨论 → 外化给生成式人工智能 → 集体审阅 → 再讨论”。规范导向的能动性(七个小组)刻意克制使用,判定任务需要人工智能无法触及的情境化知识,“人工智能只知道你打字的那一刻”,或者把人工智能生成的段落视为对将要承担它们的同伴不公平。未实施的能动性(三个小组)什么也没有改变,把工作拆成离散的子任务并放在“各自的平台”上完成,而个别学生以从未贡献给团队的方式使用生成式人工智能。
评分量规本就要求在一个多元文化主题下做到整合与连贯、每位成员的反思性洞见要与其自身的课堂贡献相关联,并展现出小组协作,而仍然有三个小组分而治之。一条关于连贯性的评分标准本身并不会产生协作。
接入方式也是其中一部分。Xu 等人(2026)观察了六个三人小组共 18 名学生,在同一个共享的 ChatGPT-4 界面上工作约 45 分钟,另外访谈了九名学生了解异步团队协作的情况。在使用共享、可见的界面时,团队共同建构“集体提示”,运行反复出现的“显现、评估、内嵌”循环,把对话当作共享的外部记忆,并公开协商人工智能的角色。在异步工作中,私下提问与输出的“去标签化”产生了不透明、私有化的信息流,提高了维持共同认知模型的成本。生成式人工智能的角色也发生了转变,从从属的助手变成了有争议的队友,而系统虽然在认知上参与其中,却对团队不断转移的关注点缺乏情境感知。
让每位成员的贡献变得可见
Korchak、Costley 与 Fanguy(2026)补充了一个应当让评价者警觉的细节。在一门科学写作课程中,通过对 10 名年龄在 23 至 39 岁之间(均值 27.7)的研究生进行访谈发现,各小组或通过预先规划的策略使用生成式人工智能,或通过开放、由个人驱动并在共享文档中协调的互动来使用它;一种有特色的用法是把生成式人工智能当作编辑整合者,把并行的各部分合并成连贯的文本。他们最尖锐的观察是:学生的叙述有时与他们自己写下的反思相矛盾,一名学生否认小组有策略,却在书面材料中描述了一个策略。小组策略并不总是对每位成员同样可见,因此对你来说也不可靠地可见。
有能力但从未成为团队实践的个人使用,是同一现象的另一个方向。两项研究都指向同一个对策:把可见性设计进交付物,加入决策日志、你可以打开的共享文档,以及每位成员写的一份简短说明,交代自己贡献了什么、还有哪些部分自己仍然无法解释。
评价小组而不丢掉个人
Chen 与 Zou 的核心设计论点在于,就可接受的生成式人工智能使用进行协商,本身就应当成为一个明确、可评价的学习成果:团队应当集体论证并记录生成式人工智能会如何被使用、不会如何被使用,而不是把规范交给同伴压力或对风险的感知。那是一件可评分的产物,只有小组真的谈过才会存在,它把一条无法执行的规则转变为可审查的学生判断。
把它与个人环节配对使用,例如对自己理解的口头答辩,或对自己未起草的任何部分做出书面解释。这也是对搭便车问题的诚实回答:它评的是理解,而不是作者的归属,而理解本就是小组分数一直以来的代理指标。
Martínez-Peláez 等人(2025)在 Web of Science 核心合集中筛查了 203 项 2023 至 2024 年的研究,共纳入 22 项,依据的是在 PROSPERO 注册的 PRISMA 2020 方案。他们报告说,大语言模型可充当协作的催化剂,如想法生成、组织、同伴反馈、模拟的基于量规的评价与专家评审、更低的参与门槛;在问题解决方面,则有助于探索备选方案、跨学科视角与真实情境。他们还指出一个有用的反转:大语言模型常常给出不完整或错误的回答,这会促使学生去质疑、核实并改进信息,而这正是你在个人检查点中希望看到的人工智能用法。
他们的局限会随任何引用一同传递:只使用单一数据库、仅限期刊论文、未关注伦理或隐私、只覆盖该技术的最初两年,且未使用任何偏倚风险工具。请把“催化剂”当作对已观察到的做法的描述,而不是一项测量到的结果。
有两件不该做的事。不要用检测来区分个人贡献:这六项研究都没有在小组情境中检验检测器,而检测在个人层面的问题在本知识库的其他地方已有记录。也不要在不辨明究竟是哪一种的情况下,把某个小组的克制读成认可或问题:Chen 与 Zou 提醒说,克制可能反映的是不熟悉或规避风险,而非刻意的自我调节。
处理团队内部关于人工智能的分歧
披露不只是你在最后要问的一个问题;它是小组必须自行定下的规范,而定下规范的过程正是有意思的失败所在。Chen 与 Zou 识别出加强使用的两种理由。表现压力:学生读了评分标准和同伴的水平参照,用人工智能来保住自己在共享成绩中的那份,这是对共享分数的一种理性反应。通过规范获得的安全感:宽松的集体氛围降低了对误用风险的感知,于是小组更公开地使用该工具,在合作导向的案例中甚至更依赖它。如果你想要透明度,明确说出的课堂规范比一句警告更有效。
一个把关于人工智能使用的分歧带到你面前的小组,通常已经完成了最难的部分。给他们一个结构:要求人工智能使用说明既记录小组决定不做什么,也记录它做了什么,并对论证评分。Chen 与 Zou 关于集体能动性的观点正落在这里:个人能力不会自行变成集体能力,所以协商必须被要求,而不能指望它自然发生。
你实际会听到的三种反对意见
“小组作业本来就不公平,人工智能只是让它更糟。” 人工智能改变的是问题的形态,而不是问题的存在。公平方面的抱怨本就存在于小组之中:Chen 与 Zou 研究中那些克制使用人工智能的学生,把用人工智能生成自己那部分视为对将要承担它的同伴不公平,而表现压力那一理由也显示学生是在保住自己在共享成绩中的份额。这里没有任何研究显示人工智能让搭便车变得更糟,也没有显示任何干预减少了它。个人责任与可见的过程是依据设计论证站得住脚的,而不是作为已被证明的解决办法。
“人工智能让协作更好,所以我应该鼓励使用。” 部分如此,而这个“部分”很重要。Martínez-Peláez 等人描述了真实的协作支持,如想法生成、组织、同伴反馈、模拟的基于量规的评价、更低的参与门槛,但那是基于对已观察做法的综述,且带有上述局限,而 Wei 与 Perkins 发现好处有实证支持,风险一侧则大多处于概念层面。他们引用的随机实验证据是最尖锐的告诫:人工智能产生了更具创新性的建议,却没有显著提升参与者的整体创新性,还可能使想法趋同并招致认知卸载。模拟研究并没有填补这一空白。Fang(2026)在真实参与者的对话上微调大语言模型代理(在 LLaMA 3.2–3B 上使用 LoRA/QLoRA 适配器),为 48 名参与者、3,824 个话语轮次和六个主题编码建模,然后用认知网络分析比较真实与模拟话语;模拟网络与实证网络的距离为 0.17,低于 0.30 的阈值,置换检验的 p 值为 0.65,在统计上无法区分,不过模拟略微高估了“技术约束与设计”的联结,并低估了“数据与性能参数”。这是一篇置信度中等的框架性论文:它只支持一个主张,即针对具体参与者的代理能够再现逼真的协作话语,而没有表明学生从模拟队友那里学到更多。
“我无法对过程评分。” 你其实已经在为它的代理指标评分,并把它称为作品质量。该做的不是评得更多,而是去评那件只有过程真的发生才会存在的产物:经过协商的人工智能使用说明、决策日志、个人答辩。这三者都范围明确且可核查。你不应声称的是这些做法已经得到验证:能动性的模式来自一项质性研究,涉及一门课程中的 52 名职前教师,作者说应当把它们读作对设计可能作出的反应,而不是你班上可以预期的分布。写作研究的 10 名参与者是擅长人工智能的研究生,其作者也称这些发现是特定情境下的,而不是一套分类体系。
证据不支持的内容
生成式人工智能并不能改善没有辅助的协作:那项范围综述所说的好处关乎过程与产品,它明确呼吁开展关于小组动态与认知发展的纵向研究,而在人工智能支持的小组工作中测得的增益,尚未被证明能迁移到没有该工具的协作之中。检测无法区分小组内部的贡献。而且这里没有任何研究把带人工智能的小组任务与不带它的同一任务相比较,所以“不使用人工智能的小组作业产生更多学习”是一个设计论证,而不是你可以引用的发现。
本周就做的事
在十分钟内,在下一次作业发出去之前: 要求提交一页由小组共同撰写的说明,交代这个团队会如何使用、不会如何使用生成式人工智能,以及原因,并在评分量规中加入一个个人环节。
在一节课的时间里: 用 Xu 等人的检验方法来试一遍这个任务,也就是这项工作能否被切成互相独立的部分再重新拼起来。如果能,就调整顺序,使至少有一个阶段需要整个团队,并把共享的界面或文档放在它的中心。告诉全班哪些环节应当不使用人工智能,以及原因。
这个学期: 按任务决定人工智能的许可,保护界定框架与达成调和的阶段,并把任何小组的克制读作需要解读的信号,而不是需要纠正的立场。
小组作业的实用清单
- 把协商写进任务。 要求每个团队提交一份简短、共同撰写的说明,交代会如何使用、不会如何使用生成式人工智能,并对其推理评分。
- 让过程可见,而不只是产品。 中间交付物、对贡献的同伴评价、共享的规划文档与反思性贡献,会创造出规范得以协商的那些互动。
- 在小组分数之外保护个人责任。 保留一项每位成员必须独自作答的内容,例如对自己理解的口头答辩,或对自己未起草的任何部分做出个人解释。
- 有意识地选择接入方式。 一个共享界面会产生集体提示、共享记忆与经过协商的角色;私下提问则会产生不透明的流程与去标签化的输出。
- 把任务设计得无法被分割。 评分量规中一条关于连贯性的要求本身并不会产生协作;工作流必须要求共同完成。
- 说明哪些部分不使用人工智能。 如果协商与集体意义建构是重点,就指明小组不使用该工具的那些环节,并告诉学生原因。
- 分配角色,尤其是对需要角色的学习者。 明确的角色定义、结构化的分工与稳定的小规模团队,是人工智能协作工具往往无法满足的要求。
- 仔细解读克制。 一个不使用生成式人工智能的小组,可能是在刻意行使自我调节,也可能是在防范不熟悉与风险;两者需要不同的回应。
- 保持证据标准诚实。 投入度、愉悦感与满意度都是薄弱的指标;在宽松政策下使用生成式人工智能的小组工作若伴随同伴互动减少,并不是学习的证据。
底层证据见Group Work与Collaborative Learning概念页面。