问答
我该如何重新设计评价,使成绩仍然能够可靠地说明学生知道什么、能做什么?
本页是英文页面的机器翻译,尚未经母语者审校。
先明确说出成绩究竟应当代表哪一项能力。 你是在评价学生独立能完成什么、在人工智能辅助下能够恰当地完成什么、他们评价与指挥人工智能的能力,还是其中若干项的组合?本知识库的评价效度把这一点当作效度问题来处理:一份打磨精致的作品,已不再足以证明学生具备该作品表面上展现的能力。这是同一论证在评价一侧的另一半;执行一侧的另一半见我怎样才能减少课程中的人工智能作弊?,而一般性的效度框架贯穿于教师可以用哪些测量工具与研究方法去评价与人工智能相关的干预?。
构念替换的风险
《从真实作品到经认证的过程》把由此产生的风险称为构念替换:评价者把经人工智能介入的作品归功于学生,从而无意中测量了工具的能力,而不是学生的能力。它建议的应对方式,是让学生的推理、判断、核实、迭代与责任变得可见,可借助分阶段提交、带注释的决策依据、过程记录、反馈使用说明、口头答辩以及其他形式的经认证的过程证据。
Mohamed 与 Temimi把同一个问题重新表述为信息不完全的问题,而不是道德问题:学生知道作品是如何产生的,机构却只能看到作品加上部分痕迹,于是设计问题就变成每一种评价环境最容易诱使学生作出哪一种反应。他们的反应区域模型比较三种选择,即不使用人工智能、披露使用与隐藏使用,并表明规则、监控、披露与重新设计经由不同的渠道起作用,只有当最有吸引力的反应与评价目的相一致时才会奏效。有两项结果与架构直接相关。威慑发挥作用靠的是检测器对隐藏使用与正当工作之间的区分度,而不是它的原始命中率;因此当假阳性比真阳性上升得更快时,更强的监控反而可能让隐瞒相对地更有吸引力。而重新设计只有在评分量规真正奖励过程证据时,才会把学生推向负责任的使用;否则它始终只是表面功夫。他们的实用法则是:要针对最有可能隐瞒的学生来设计,而不是针对最尽责的学生。
一个强有力的评价架构
在实践中,一个强有力的评价架构往往把人工智能支持的真实任务与某种形式的独立核验结合起来。视学科而定,这可能包括简短的口头解释、课堂内的应用、现场演示、带注释的作品档案、简短的独立完成部分,或就关键决策进行的提问。
真实性评价这一概念还强调逼真的智力工作、认知挑战、学生能动性、反馈,以及社会或职业层面的真实性,而不仅仅是想办法让常规作业对人工智能来说更难完成。口头与现场环节需要仔细顾及焦虑、残障便利、语言差异与评价者偏见。
一种流行且无需监控的架构是按学生生成任务变体,即每位应试者拿到同一任务在表面上不同、但在构念上等价的版本,使答案无法被有效地共享。这种架构是有能力前提的,并非免费可得。VARIA是一项包含 600 个生成变体、覆盖 60 个条件单元的Benchmark,它发现前沿模型在综合诚信得分上紧密聚拢(0.81–0.88),而非前沿参照模型却跌落到 0.50–0.55,并且没有任何单一的提示策略能够同时优化表面多样性与构念等价性。规模化的变体生成无法仅凭提示就假定成立,因此机构应当先验证自己的模型与提示组合,再把这一保证当真。
重新设计也很少能一份作业一份作业地推进。在一项针对某所澳大利亚大型大学 12 位教师与 17 名学生的质性研究中,Nicola-Richmond 等人发现两组人都同意评价必须改变,却都强调系统性阻力,包括较长的筹备周期、大规模认证的约束、工作量与成本,并得出结论说重新设计需要全村之力,也就是一个覆盖培养方案层面的团队,融合评价设计、生成式人工智能、学科内容、行业与证据方面的专长,并在整个资格培养过程中有策略地设置生成式人工智能素养与学习保障的节点。使这件事变得可行的任务层面方法,正是McCorkle所记录的方法:把学生执行的每一个步骤都清点出来,对每一步追问“我具体在评价什么?”,并依据答案推导出人工智能的边界;这也是让我怎样才能减少课程中的人工智能作弊?背后的期望变得明确且可执行的方式。
目的与机制同样重要。El Khoury 与 Ma认为,仅围绕防止不当行为来组织改革过于防御性,并提出令人愉悦的评价,即安全、在情感上有回应、赋予学生力量并支持其Learner Agency,在这种评价中诚信是良好设计的结果,而不是它的起点。他们给出的实例使用由教师构建的人工智能代理,在作出评判之前让学生演练,并生成与评分量规一致的证据报告,但分工说得很清楚:人工智能整理证据,教师解读证据。