Conceptos
Juicio evaluativo
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
Juicio evaluativo — la capacidad de emitir juicios sólidos sobre la calidad del trabajo propio y del trabajo ajeno, según criterios sobre los que se puede razonar y no solo recitar. En la era de la IA generativa ha pasado de ser un atributo deseable del egresado a una capacidad que soporta peso: cuando una herramienta puede producir un trabajo acabado verosímil, la capacidad que distingue a quien aprende de forma competente es la de valorar esa salida — juzgar qué está bien, qué está mal, qué aceptar, qué rechazar y por qué. Esto convierte el juicio evaluativo en un objeto legítimo de evaluación por derecho propio, y en el eje práctico para llevar a las instituciones de la detección hacia un diseño de la evaluación centrado en la validez y auténtico.
Preguntas para reflexionar
- Piense en algo que juzga bien. ¿Cómo aprendió ese juicio — se lo enseñaron explícitamente o lo absorbió haciendo y comparando —, y qué implica eso para cómo debería evaluarse?
- Una rúbrica puede aplicarse mecánicamente o comprenderse. Si un estudiante sigue los criterios correctamente pero no sabe decir por qué un trabajo es mejor que otro, ¿qué capacidad ha medido realmente la evaluación?
- Cuando un modelo de lenguaje redacta una solución verosímil, el trabajo que le queda a quien aprende es en gran medida juicio: qué conservar, qué corregir, qué descartar. ¿Es esa una tarea disminuida o una más exigente que producir el borrador?
- Un estudiante puede aceptar una sugerencia de la IA porque se lee bien o porque resiste su propio escrutinio. Desde fuera, la entrega puede parecer idéntica: ¿qué permitiría a quien evalúa ver la diferencia?
- Un experimento en varios centros encontró que la retroalimentación directa de la IA produjo las mayores ganancias de revisión, pero arriesgaba una externalización pasiva del juicio. ¿Qué sugiere ese equilibrio sobre cómo diseñaría la retroalimentación para construir el juicio en lugar de eludirlo?
- La revisión entre pares y con IA puede entrenar la calibración, pero ambas pueden volverse performativas. ¿Cómo diseñaría la evaluación para que ejercer el juicio sea obligatorio y no una representación?
Introducción
Las evaluaciones que piden al estudiantado producir trabajo presuponen que puede distinguir el trabajo bueno del malo, primero en los demás y con el tiempo en el suyo propio. Ese presupuesto ya no es fiable: cuando la IA generativa puede generar prosa, código y análisis competentes a demanda, la capacidad de producir un producto es una señal débil de aprendizaje, mientras que la capacidad de juzgarlo es una señal fuerte. El juicio evaluativo nombra esa capacidad, y la investigación sobre evaluación de la base de conocimiento no deja de llegar a ella cuando pregunta qué sigue siendo evaluable y merece la pena evaluar. Se sitúa donde confluyen la retroalimentación, la evaluación formativa y el aprendizaje autorregulado, porque el juicio se desarrolla comparando el trabajo con los estándares y actuando sobre la diferencia, y es lo que hace posible una implicación genuinamente crítica con la salida de la IA, en lugar de un anhelo.
Qué es el constructo
El juicio evaluativo es la capacidad de valorar la calidad — el trabajo propio, el de los pares y, cada vez más, el de un sistema de IA — usando criterios sobre los que se puede razonar y no solo recitar. Tres rasgos lo distinguen de ideas afines.
- Trata de la calidad, no de la corrección. Responder correctamente exige conocimiento; juzgar si una respuesta es buena exige estándares que un generador no puede aportar en nombre de quien aprende.
- Se desarrolla, no se transmite. El juicio crece mediante actos repetidos de comparación — con ejemplos modelo, criterios explícitos y enfoques distintos de los pares —, y por eso los ejemplos modelo, los ejercicios de calibración y la evaluación entre pares son sus pedagogías naturales.
- Está situado en un dominio. Se ejerce dentro de los estándares de evidencia y argumentación de una disciplina, de modo que no puede evaluarse de forma genérica más de lo que puede suponerse la transferencia.
Está estrechamente relacionado con la autenticidad en la evaluación, pero es más estrecho: la evaluación auténtica pregunta si una tarea se parece a trabajo valioso del mundo real; el juicio evaluativo pregunta si quien aprende distingue el trabajo bueno del malo. La autoevaluación valora el trabajo, la competencia o el progreso propios frente a criterios, mientras que el juicio evaluativo extiende esa valoración también al trabajo de los pares y a la salida de un sistema de IA.
Por qué la IA generativa lo volvió central
Cuatro argumentos convergen.
- El producto deja de ser evidencia. Completar una tarea ya no demuestra la capacidad que la tarea debía certificar, porque una herramienta puede completar buena parte de ella. Lo que queda es el razonamiento que produce, verifica y da cuenta del producto: el juicio, en suma.
- Es la capacidad que gobierna el uso de la IA. Decidir si una sugerencia de la IA merece aceptarse, adaptarse o rechazarse es juicio evaluativo aplicado a la salida de una máquina. Los cursos que no logran hacerlo visible no pueden distinguir el uso responsable de la sustitución, y por eso los estudiosos de la integridad tratan cada vez más el uso crítico de la IA como un resultado evaluable y no como una norma que haya que vigilar.
- Es el eje del paso de la coerción al diseño. Donde no puede detectarse el uso prohibido, Teichmann (2026) sitúa el cultivo del juicio evaluativo entre las tres líneas de diseño que trasladan a las instituciones de la coerción basada en la detección a una evaluación centrada en la validez: porque donde la institución no puede detectar, la capacidad que sobrevive a la inspección es si el estudiante puede dar cuenta del trabajo y de su calidad.
- Convierte la declaración de confesión en evidencia. Cuando una tarea pide al estudiantado explicar para qué usó la IA, qué sugerencias aceptó o rechazó y cómo refleja la entrega final su propio juicio, la declaración se convierte en una demostración de juicio y no en una admisión que interpretar de forma punitiva — que es lo que reduce el coste de la honestidad que de otro modo empuja la declaración a la clandestinidad.
Hay una capa adicional que se refiere al origen de un juicio, y no solo a su contenido. AlGhamdi (2026) da a esa capa un vocabulario más preciso: sus 13 estudiantes saudíes de informática emitieron dos juicios independientes dentro de un mismo acto de evaluación — si la retroalimentación era útil y si su origen tenía autoridad para calificar. Todos aceptaron la retroalimentación de ChatGPT basada en la rúbrica como clara y específica, mientras reservaban de forma abrumadora la calificación para el docente («estoy de acuerdo, pero con una condición: que el doctor revise la retroalimentación»), lo que sugiere que el juicio evaluativo en la evaluación mediada por IA debe incluir ahora el razonamiento sobre la propia autoridad evaluativa, y no solo sobre la calidad de la retroalimentación recibida.
Sharma (2026) da al constructo su ubicación más sólida en la literatura sobre integridad. Extendiendo el encuadre del posplagio de Eaton (2023) desde una orientación ética hacia el diseño de la evaluación, sostiene que los modelos de integridad basados en la detección y la verificación están desalineados con un trabajo en el que el juicio humano y la generación automática están entrelazados, y reencuadra la integridad como una práctica pedagógica que se ejerce mediante el juicio evaluativo — la capacidad de quien aprende de sopesar opciones, justificar decisiones académicas y asumir responsabilidad bajo incertidumbre epistémica. Sus cuatro prácticas (rastros de decisión anotados, verificación y rendición de cuentas, defensa oral y rendición de cuentas dialógica, diferencias entre borradores con historial de versiones) hacen ese juicio visible como evidencia en lugar de inferirlo del artefacto, y separa el juicio de los constructos en los que a menudo se lo disuelve: la práctica reflexiva considera el propio pensamiento de forma retrospectiva, la metacognición es la conciencia y la regulación de los procesos cognitivos, mientras que el juicio evalúa opciones frente a estándares y acepta consecuencias bajo incertidumbre. También nombra el modo de fallo que esta página rastrea: exigir razonamiento documentado arriesga «la sustitución de un régimen de cumplimiento por otro», ya que el juicio como evidencia «sigue siendo relacional y situado, y no verificable mecánicamente».
Evidencia: cómo se desarrolla el juicio y qué le hace la IA
La literatura de la base de conocimiento sobre el aprendizaje colaborativo y la evaluación aporta evidencia convergente de que el juicio evaluativo es aprendible, desplazable y diseñable, y de que la IA corta en ambos sentidos.
-
El entrenamiento basado en la comparación lo construye de forma medible. En un estudio de 14 semanas con 28 futuros docentes, los ejemplos modelo fuertes, medios y débiles generados por IA anclaron una comparación iterativa de los borradores del estudiantado con puntos de referencia; el foco de la evaluación se amplió desde rasgos superficiales del lenguaje hacia el contenido, la organización y la coherencia, pero el razonamiento siguió siendo escaso, con la justificación basada en ejemplos duplicándose mientras el razonamiento comparativo más sofisticado seguía siendo raro. El juicio puede andamiarse hasta que exista; no aparece a demanda, y la calidad de los puntos de referencia importa.
-
El diseño de la retroalimentación decide si sobrevive la agencia. Un experimento de campo multisitio, aleatorizado por conglomerados, con 1.176 estudiantes de primer año en 48 secciones comparó cuatro condiciones de retroalimentación para la argumentación científica: solo pares, IA generativa directa, IA generativa reflexiva (autoevaluarse y luego criticar) e híbrida (autoevaluarse + pares + IA generativa). La condición híbrida produjo la mayor ganancia en calidad de la argumentación; la retroalimentación directa de la IA generativa arriesgaba una adopción pasiva — con el estudiantado externalizando el juicio evaluativo en el sistema —, mientras que los diseños reflexivo e híbrido preservaban la agencia epistémica al obligar al estudiante a evaluar primero su propio trabajo. El hallazgo central de los autores es que el valor educativo de la IA generativa depende menos del acceso a la IA que de si el entorno de retroalimentación preserva la agencia, el juicio y la apropiación durante la revisión.
-
La revisión estructurada entre pares y con IA escala la calibración. El modelo PAIRR (Sperber et al., 2025) combina la revisión entre pares con la revisión con IA y la reflexión estructurada, y se probó en el mayor estudio hasta la fecha sobre el uso de la retroalimentación de IA por parte del estudiantado (654 estudiantes, diez cursos de escritura). Trata la comparación entre el juicio propio, el de los pares y el de la IA como el terreno de entrenamiento, y sitúa el juicio evaluativo como un resultado de aprendizaje explícito y no como un subproducto implícito.
-
La retroalimentación de la IA solo ayuda cuando ya existe alfabetización. Un marco conceptual de referentes en alfabetización en retroalimentación (Boud, Dawson y Yan) analiza la retroalimentación en las fases de elicitación, procesamiento y puesta en práctica, usando dos casos contrastantes de IELTS con ChatGPT: un estudiante con baja alfabetización en retroalimentación usó un prompt vago, recibió una salida genérica y confió en ella o la copió en exceso, mientras que un estudiante alfabetizado usó la IA de forma crítica y aprendió. La IA generativa reduce las barreras cognitivas y emocionales para buscar retroalimentación, pero puede ella misma alucinar, sesgarse o ser genérica — y por eso se sostiene que los docentes deben modelar la planificación evaluativa y entrenar el juicio, no solo el diseño de prompts.
-
La brecha es un juicio sostenible, no una retroalimentación momentánea. Una revisión de alcance sobre evaluación auténtica (Zhan, Boud y Du) encontró retroalimentación formativa con IA abundante, pero retroalimentación sostenible — transferible a contextos futuros — presente en solo 4 de 23 estudios formativos. La retroalimentación que cierra la tarea actual pero deja a quien aprende incapaz de juzgar el trabajo futuro es el fallo del juicio evaluativo en su forma más clara.
-
La evaluación puede diseñarse para premiar el juicio en lugar de la producción. El modelo de región de respuesta formaliza por qué: el rediseño reduce el beneficio de la externalización oculta y eleva el valor del razonamiento visible, la explicación y la crítica. Pedir al estudiantado que explique qué sugerencias de IA aceptó y rechazó convierte la propia decisión en evidencia evaluable.
-
El juicio de la propia institución carece de los criterios que exige al estudiantado. Munoz et al. (2026) valoraron el valor probatorio de 1.855 elementos de prueba en 1.162 denuncias de mala conducta con IA generativa y encontraron que la calidad de la prueba no guardaba una relación fiable con el resultado de los casos, porque ninguna etapa del procedimiento fijaba un umbral probatorio mínimo ni exigía a quienes investigaban sopesar el valor probatorio antes de dar curso a una denuncia — los tribunales sopesaban la prueba mediante un juicio profesional no estructurado. La salida de los detectores fue la categoría más débil de ese corpus (las salidas de detectores por sí solas, de credibilidad totalmente baja), y Hadra et al. (2026) muestran que el instrumento no puede establecer el hecho que afirma un hallazgo — precisión macro de 0,69 y 0,61 en 192 textos, un fracaso casi total en la escritura híbrida humano-IA y una preocupación de sesgo limítrofe para quienes escriben en inglés como lengua extranjera —, y por eso la recomendación de los propios autores es el juicio humano, una política más clara y tareas mejor especificadas en lugar de la vigilancia. «Mejor especificadas» importa por partida doble: Wright (2026) sostiene que las normas redactadas según la identidad de la plataforma y no según la función son excesivamente inclusivas por un accidente definicional, sancionando a un estudiante que no hizo lo que la norma pretendía evitar, de modo que el juicio de quien evalúa debe aplicarse a lo que hizo una herramienta y no a qué plataforma se usó. Un juicio ejercido sin criterios compartidos no puede enseñarse, calibrarse ni auditarse — el problema de consistencia que esta página reporta para el estudiantado, llegando al nivel de la institución. El juicio del evaluador también conlleva una dirección medible propia: cinco responsables de admisiones que separaban 50 ensayos de admisión humanos de 50 escritos por IA alcanzaron un AUC de 0,70 (IC del 95% [0,65; 0,75]), y sus valoraciones de calidad bajaban a medida que subía la probabilidad percibida de IA, una asociación que se mantuvo tras ajustar por la calidad valorada por máquina, la procedencia real y las características de los solicitantes (−0,109; p < 0,05). Como nadie filtró las solicitudes, ese juicio sin ayuda fue todo el mecanismo de aplicación de la norma, y cada ensayo señalado conllevó 1,5 puntos porcentuales menos de probabilidad de admisión, 2,6 una vez mantenida constante la calidad del ensayo (Isley, Gaebler y Goel 2026).
-
Se están proponiendo indicadores indirectos del juicio a nivel de aula. Austin (2026) añade dos señales conductuales a una secuencia de tareas rediseñada: la tasa de discernimiento de UnBlooms™, la proporción de salidas de IA que quien aprende interroga, cuestiona o revisa en lugar de aceptar, y la tasa de aceptación en el primer intento. Ninguna está validada — ambas se ofrecen como diagnósticos baratos por tarea —, pero hacen observable el constructo dentro de la calificación ordinaria, donde una tasa de discernimiento cercana a cero en varias tareas se lee como una señal de diseño de la tarea y no como un déficit individual.
Cómo el mal uso desplaza el juicio
El riesgo más claro es el desplazamiento, y está evidenciado en la literatura sobre retroalimentación y no solo teorizado. Cuando la herramienta aporta la rúbrica, la retroalimentación y el seguimiento, la práctica metacognitiva y evaluativa de quien aprende se desplaza en lugar de recibir apoyo: la evaluación se convierte en una representación del juicio que el estudiante nunca ejerció, el mismo modo de fallo que la dependencia cognitiva expresado en el registro de la evaluación. La retroalimentación directa de la IA generativa en el experimento multisitio empujó exactamente hacia esa externalización pasiva. La presión de la calificación lo agrava: cuando la autoevaluación o la reflexión sobre el uso de la IA se califican, el estudiantado puede producir la reflexión que la rúbrica quiere en lugar del razonamiento, de modo que un juicio genuino exige hacer consecuente el ejercicio — una decisión que se manifiesta en trabajo posterior, una explicación oral o una justificación documentada que a su vez se examina.
Implicaciones para la práctica
- Declararlo como resultado. Si lo que importa es valorar la calidad del trabajo — incluida la salida de la IA —, escríbalo en los resultados de aprendizaje y evalúelo, en lugar de dejarlo como subproducto de la tarea.
- Evaluar la decisión, no solo el artefacto. Pida al estudiantado que justifique qué conservó, cambió o rechazó; esto convierte el pensamiento en evidencia y hace visible la sustitución sin vigilancia.
- Usar ejemplos modelo y calibración de forma deliberada. El juicio comparativo frente a ejemplos fuertes, medios y débiles es el mecanismo que respalda la evidencia, y la IA abarata generar esos ejemplos: uno de sus usos pedagógicos más claros.
- Preferir la retroalimentación híbrida y reflexiva a la salida directa. La autoevaluación antes de la crítica de la IA, o la combinación de uno mismo, pares e IA, preserva la agencia que la retroalimentación directa de la IA erosiona; diseñe el entorno de retroalimentación y no solo añada una herramienta.
- Avanzar hacia un juicio sostenible, no hacia arreglos momentáneos. La retroalimentación que no se transfiere a la tarea siguiente no entrena nada duradero.
- Combinarlo con proceso y defensas orales. Los artefactos de proceso y las breves explicaciones orales muestran el juicio en acción donde un producto final no puede, y esa es una razón central por la que el rediseño de la evaluación en la era de la IA se apoya en ellos.
Conceptos conectados
- IA en la educación — la IA en la educación (paraguas)
- Validez de la evaluación
- Retroalimentación
- Alfabetización en retroalimentación
- Evaluación formativa
- Autoevaluación
- Evaluación auténtica
- Integridad académica
- Aprendizaje autorregulado
- Metacognición
- Pensamiento crítico
- Evaluación
- Detección de IA
- Agencia de quien aprende
- Educación superior
Artículos conectados
-
Unravelling undergraduates' development of evaluative judgments through AI-supported internal feedback — Cómo la retroalimentación interna apoyada en IA desarrolla los juicios evaluativos, y dónde el razonamiento sigue siendo escaso
-
Human-centered GenAI feedback design in higher education: a multisite experiment on direct, reflective, and hybrid approaches to scientific argumentation — La retroalimentación híbrida de uno mismo, pares e IA preserva mejor la agencia y el juicio que la retroalimentación directa de la IA
-
Peer and AI Review + Reflection (PAIRR): A Human-Centered Approach to Formative Assessment — Revisión entre pares y con IA con reflexión estructurada como calibración a escala
-
Generative artificial intelligence as an enabler of student feedback engagement: a framework — Cómo la alfabetización en retroalimentación determina si la retroalimentación de IA enseña o sustituye
-
Designing for Authentic Assessment: A Scoping Review — La brecha de sostenibilidad en la retroalimentación de IA
-
Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI — El juicio evaluativo como una de las líneas de diseño que sustituyen la coerción basada en la detección
-
Assessment Design Under Imperfect Information: Generative AI, Disclosure, and Student Response in Higher Education — Hacer del razonamiento y el juicio visibles aquello que premia la rúbrica
-
Enhancing learner-centered feedback with AI: teachers'' practices and perceptions — El juicio evaluativo del profesorado con herramientas de retroalimentación de IA
-
Beyond Detection: Redesigning Authentic Assessment in an AI-Mediated World — Más allá de la detección: la autenticidad rediseñada en lugar de vigilada
-
Coauthorship integrity: Reconceptualising assessment validity for the age of generative artificial intelligence — Reconceptualizar la validez de la evaluación para la era de la IA generativa
-
Epistemic Dependence in AI-Mediated Learning — Contestabilidad, recuperabilidad y los criterios que separan la dependencia funcional de la dependencia
-
Rethinking AI-assisted writing instruction: feedback literacy scripts, calibration training, and student writing development — Alfabetización en retroalimentación para la escritura asistida por IA
-
Who Should Grade My Work? Student Perspectives on Transparent AI-Assisted Writing Assessment in Higher Education — ¿Quién debería calificar mi trabajo? Perspectivas del estudiantado sobre la evaluación transparente de la escritura asistida por IA en educación superior
-
Educational integrity in GenAI-augmented assessment: making judgment visible — El juicio como núcleo evaluativo de la integridad: rastros de decisión anotados, defensa oral, historial de versiones (Sharma 2026)
-
How strong is the evidence in generative AI-related academic misconduct allegations? A mixed-methods analysis — Tribunales que sopesan pruebas sin estándares codificados: el propio problema de juicio de la institución (Munoz et al. 2026)
-
Evaluating the accuracy and reliability of AI content detectors in academic contexts — La imprecisión de los detectores y el fracaso en la escritura híbrida: el juicio humano como sustituto recomendado del veredicto (Hadra et al. 2026)
-
Transcription is not generation: Distinguishing non-generative AI tool use from academic misconduct in higher education assessment — La función, no la plataforma: juzgar qué hizo una herramienta y no qué es (Wright 2026)
-
When AI Agents Can Complete the Assignment: Practical Strategies for Designing Tasks That Still Require Human Thinking — UnBlooms y la tasa de discernimiento: calificar el rastro de razonamiento detrás del trabajo asistido por IA (Austin 2026)
-
Can large language models reproduce higher education grade bands? Cross-model study of calibration and grading bias in authentic student writing — ¿Pueden los modelos de lenguaje grandes reproducir las bandas de calificación de la educación superior? Estudio entre modelos sobre la calibración y el sesgo de calificación en la escritura auténtica del estudiantado
-
AI-written admissions essays are widespread but penalized — Los ensayos de admisión escritos por IA están muy extendidos pero se penalizan
-
Designing Authentic Assessments with Generative AI: A Pilot Study of Assessment Authentifire in Higher Education — Diseñar evaluaciones auténticas con IA generativa: un estudio piloto de Assessment Authentifire en educación superior
-
Co-Constructing AI Boundaries: Agency, Judgment, and Ethical Literacy in AI-Mediated Meaning-Making — la comprobación de agencia (creíble, relevante, aceptable, matizada) que estructura cada interacción con la IA
-
Who Acts, Who Knows, Who Answers? A Corpus-Assisted Discourse Analysis of Agency, Epistemic Responsibility, and Accountability in Generative AI Higher Education Research — ¿Quién actúa, quién sabe, quién responde? Análisis del discurso asistido por corpus sobre agencia, responsabilidad epistémica y rendición de cuentas en la investigación sobre IA generativa en educación superior
-
Open Questions Towards Skill-Sustaining Reliance in Reflective AI Engagement — Preguntas abiertas hacia una dependencia que sostenga las capacidades en la implicación reflexiva con la IA
-
AI Can Do Your Homework. Now What? Report from an online workshop on computing assessment in the age of generative AI — La IA puede hacer tus deberes. ¿Y ahora qué? Informe de un taller en línea sobre la evaluación en informática en la era de la IA generativa
-
Judgment-Centred Software Engineering Education: A Post-Hype Review and Framework for AI-Augmented Learning — Una revisión pos-hype y un marco para la educación en ingeniería de software aumentada con IA