Conceptos
Evaluación auténtica
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
La evaluación auténtica — el diseño de evaluaciones que examinan el desempeño del estudiantado en tareas intelectuales valiosas y realistas, en lugar de ítems de examen aislados y estandarizados. Nacida con Wiggins (1990) como contrapeso a las pruebas estandarizadas, la evaluación auténtica ha evolucionado desde la réplica de tareas del mundo laboral hacia un marco multidimensional que abarca la autenticidad profesional, digital, personal y social. La IA generativa ha vuelto la evaluación auténtica más necesaria que nunca: cualquier tarea que un modelo de lenguaje pueda simular de forma verosímil en un entorno para llevar a casa pierde su validez como evidencia de una competencia original del estudiantado, así que las formas auténticas deben rediseñarse en torno a lo que la IA no puede falsificar de forma verosímil.
Preguntas para reflexionar
- La evaluación auténtica examina el desempeño en tareas intelectuales valiosas y realistas, y no en ítems de examen aislados. Antes de leer, ¿daba por supuesto que una tarea «auténtica» se limita a replicar un escenario real o del mundo laboral? Esta página sostiene que la autenticidad ha evolucionado mucho más allá de la mera réplica: ¿qué otras formas puede adoptar?
- Una afirmación central es que cualquier tarea que un modelo de lenguaje pueda simular de forma verosímil en un entorno para llevar a casa pierde su validez como evidencia de una competencia original del estudiantado. ¿Qué evaluación de su propia docencia o de su propio estudio consideraría ahora «falsificable», y qué le lleva a pensarlo?
- La página destaca una brecha llamativa: solo 3 de 37 estudios abordaron la autenticidad social, es decir, si la evaluación ayuda al estudiantado a contribuir a la transformación social. ¿Por qué cree que la dimensión social de la autenticidad está tan desatendida, y cómo podría llegar a evaluarse?
- La base de conocimiento sostiene que la autenticidad debe «rediseñarse, no vigilarse». Cuando el estudiantado coautoriza las rúbricas, elige qué y cómo entregar y participa en interacción en tiempo real, el uso de IA pasa a ser esperado y declarado en lugar de oculto. ¿Cómo cambiaría eso la relación entre el estudiantado y quien evalúa?
- Los exámenes orales y los portafolios basados en procesos se ofrecen como formas auténticas resistentes a la IA. Pero la reflexión calificada y la autoevaluación corren el riesgo de volverse performativas: el estudiantado escenifica la reflexión que cree que se espera de él. ¿Cómo diseñaría para una reflexión genuina y no para una actuación?
- Cuando la IA aporta la rúbrica, la retroalimentación y el seguimiento, la página advierte de que la práctica metacognitiva del estudiantado puede quedar desplazada. Si la herramienta hace la evaluación, ¿qué le queda por practicar o aprender de verdad a quien aprende?
Introducción
La evaluación auténtica está en el centro de cómo se repiensa la evaluación en la era de la IA. Se conecta con la validez de la evaluación (¿mide la evaluación lo que dice medir?), con la evaluación formativa (tareas auténticas que informan el aprendizaje) y con la integridad académica (pasar de la detección a diseñar tareas en las que el uso de IA sea esperado y declarado). Es una respuesta central en la literatura de rediseño de la evaluación de la base de conocimiento.
La evolución de la autenticidad
- Orígenes en la década de 1990 — tareas intelectuales valiosas: Wiggins (1990) propuso la evaluación auténtica como examen directo del «desempeño del estudiantado en tareas intelectuales valiosas», un contrapeso a las pruebas estandarizadas.
- Adopción a finales de la década de 1990 — réplica del mundo laboral: Joughin (1998) enmarcó la autenticidad como el grado en que la evaluación replica la práctica profesional o la vida real, una visión que dominó durante dos décadas.
- Crítica de la década de 2020 — más allá de la réplica: McArthur (2023) sostuvo que la evaluación auténtica debe permitir al estudiantado «influir en el futuro y transformar la sociedad» en lugar de limitarse a replicar tareas existentes; Ajjawi et al. (2024) ampliaron la autenticidad a formas contextuales, de tarea y personales que reflejan la experiencia del estudiantado.
- La IA generativa como desafío existencial: Zhan, Boud y Du (2025) señalan que la IA generativa vuelve vulnerable de nuevo la autenticidad entendida como réplica del mundo laboral, lo que impulsa un giro hacia la alfabetización digital, la colaboración en tiempo real, la contribución social y la construcción de significado individual que la IA no puede falsificar de forma verosímil.
Un modelo de diseño de seis dimensiones
La revisión de alcance de Zhan, Boud y Du (2025) de 37 estudios empíricos (2000-2024) propone seis dimensiones de diseño: (1) autenticidad en la evaluación (autenticidad de la evaluación, profesional, digital, personal y social; solo 3 de 37 estudios abordaron la autenticidad social, una brecha crítica), (2) desafíos cognitivos, (3) criterios de evaluación (con un estudiantado que suele ser receptor pasivo y no coautor de las rúbricas), (4) retroalimentación (predominantemente formativa, pero con escasa retroalimentación sostenible), (5) agencia del estudiantado (la elección de qué, cómo, cuándo y dónde entregar era poco frecuente) y (6) colaboración social. También propone un modelo cíclico de codiseño — negociar objetivos, crear contexto, codiseñar criterios, planificar la retroalimentación — que las herramientas de IA podrían operacionalizar.
La evaluación auténtica en la era de la IA
La literatura de rediseño de la evaluación de la base de conocimiento sostiene que la autenticidad debe rediseñarse, no vigilarse:
- Más allá de la detección sostiene que la autenticidad no puede imponerse por vigilancia; hay que diseñarla, posicionando la IA como colaboradora declarada en lugar de como aplicación para hacer trampas, y priorizando la evaluación auténtica y basada en procesos por encima de la vigilancia.
- La evaluación responsable reencuadra la evaluación en torno a evidencia de validez y tareas auténticas que reflejan el trabajo futuro del estudiantado.
- Productos auténticos, procesos autenticados examina cómo la educación superior rica en IA puede evaluar tanto los productos genuinos como los procesos que los produjeron.
- El marco invariante a la herramienta aboga por evaluar métodos y procesos computacionales en lugar de productos específicos de una herramienta, mediante defensa oral y verificación.
- Reconsiderar los exámenes orales sitúa el examen o la evaluación oral como alternativa auténtica de baja tecnología e intrínsecamente resistente a la IA: su diálogo en tiempo real e interactivo pone a prueba la comprensión, el pensamiento crítico y el razonamiento (no la memorización), refleja la práctica profesional e impide que el estudiantado use IA para generar y memorizar respuestas. Ofrece un conjunto concreto de recomendaciones prácticas (rúbricas claras, contenido estandarizado, formación de quienes evalúan, directrices de prompting y mitigación de sesgos) para reintroducir la evaluación oral en la secundaria y en la educación superior.
- La evaluación mediante portafolios electrónicos es otra forma auténtica y basada en procesos que resiste la fabricación con IA: Zhan, Boud y Du (2025) identifican los portafolios de contribución social entre las formas auténticas más robustas frente a la IA generativa, y Más allá de la detección recomienda portafolios anotados y recorridos grabados que sondean el razonamiento en tiempo real. Ni y Lam (2026) y Laksana et al. (2026) muestran que la IA generativa puede asistir el proceso del portafolio — retroalimentación, redacción, reflexión — mientras los rastros de razonamiento y los borradores del portafolio preservan la autenticidad.
- Los criterios de autenticidad pueden contener por sí mismos el uso de IA. Chen y Zou (2026) encontraron que una rúbrica que exigía al estudiantado fundamentar una presentación de grupo en su propia experiencia docente de primera mano, y reflexionar sobre observaciones de aula compartidas, llevó a siete de quince grupos de estudiantes a reducir deliberadamente su uso de IA generativa. El estudiantado argumentaba que la herramienta no podía satisfacer la exigencia epistémica — «la IA solo conoce el momento en que escribes» — porque carecía del conocimiento longitudinal y situado que tenían sus compañeros y el profesorado. Importaban ambas capas: la autenticidad de la tarea y la autenticidad relacional de aportar el propio pensamiento a un grupo, lo que reencuadró el uso intensivo de IA como aprovecharse del trabajo de los compañeros. La implicación de diseño es que los criterios auténticos y anclados en la experiencia hacen trabajo evaluativo incluso sin aplicación coercitiva: aportan una razón para la contención que las declaraciones de política no pueden dar.
Sharma (2026) sostiene que el diseño orientado a la integridad y el diseño auténtico no son lo mismo, y que la diferencia es epistémica y no estilística. La autenticidad pregunta si una tarea refleja una práctica valiosa del mundo real; el diseño orientado a la integridad pregunta si quienes aprenden pueden justificar sus decisiones y asumir responsabilidad con respecto a los estándares disciplinares, lo que convierte la integridad en un criterio explícito y evaluable integrado en la arquitectura de la tarea y no en un subproducto incidental del realismo. Las prácticas que propone — rastros de decisiones anotados, verificación de las afirmaciones aportadas por IA generativa, defensa oral y responsabilidad dialógica, diferencias entre borradores con historial de versiones — son formas reconocibles de evaluación auténtica, pero se seleccionan por el juicio que hacen visible y no por su realismo, lo que es una corrección útil para tareas que parecen auténticas y siguen siendo falsificables en el fondo. Su advertencia corresponde también a esta página: exigir razonamiento documentado privilegia a quienes aprenden con más fluidez en el discurso reflexivo, y el juicio como evidencia «sigue siendo relacional y situado en lugar de verificable mecánicamente», así que el diseño carga con su propia responsabilidad de fiabilidad interpretativa.
Thapa y Lewis (2026) reencuadran la misma pregunta al nombrar qué debería autenticar una tarea en lugar de si parece real: autenticidad epistémica, el grado en que la evaluación captura una implicación genuina con la interpretación, el juicio evaluativo, el razonamiento y la construcción de conocimiento. Su argumento es que la autenticidad por sí sola no sobrevive a la IA generativa, porque una tarea auténtica cuya evidencia es un único producto no supervisado queda expuesta al mismo problema de sustitución que el ensayo al que reemplazó. Hacer visible el razonamiento exige en cambio entregas por etapas, justificación reflexiva, implicación dialógica y transparencia evaluativa. Llevan la advertencia anterior al diseño: las tareas reflexivas y dialógicas pueden privilegiar al estudiantado con confianza en la autoexpresión académica si no se diseñan y se andamian de forma inclusiva, y el trabajo relacional intensifica el trabajo emocional del personal docente en entornos grandes o con recursos limitados.
Cuando la práctica docente se repliega a los formatos vigilados
La base de conocimiento sostiene que la autenticidad debe diseñarse y no vigilarse, y Goldstein, Marae-Haj y Zidan (2026) aportan la contraevidencia desde la práctica: tras una crisis de confianza en la que futuros docentes entregaron trabajo generado por IA sin editar como propio, formadores de docentes de siete colegios israelíes rediseñaron la evaluación en torno a evidencia de proceso (prompts, historial de versiones de documentos, contribuciones de grupo monitorizadas) y al desempeño en clase, pero varios describieron también haber recurrido, como último recurso, a exámenes supervisados y a defensas orales previstas sobre las tesis, y una persona participante calificó la vuelta a los exámenes de personalmente dolorosa aunque inevitable. Leído frente a la posición que prioriza el diseño, el hallazgo señala un modo de fallo y no una solución: cuando la autenticidad no se rediseña de antemano, la respuesta práctica ante un trabajo entregado no evaluable es reinstaurar el control — la vigilancia con otro nombre —, lo que reintroduce precisamente los formatos que la literatura sobre evaluación auténtica intenta superar. También muestra el coste sentido de la alternativa: las personas participantes informaron de que sus evaluaciones escritas para llevar a casa ya no podían evidenciar aprendizaje alguno, y que la documentación de procesos exigía trabajo real para establecerse.
El repliegue conlleva un coste probatorio que la evidencia de los expedientes hace visible. Munoz et al. (2026) codificaron 1.162 acusaciones de mala conducta con IA generativa y encontraron que los tipos de evidencia más sólidos los genera la investigación o la supervisión y no la acusación, y que la evidencia de proceso — como borradores, reuniones de supervisión y presentaciones — solo aparece donde esas prácticas ya existen; así que en una evaluación sin rediseñar la evidencia de proceso que recomienda esta literatura simplemente no está disponible, y los casos se apoyan en categorías más débiles. Lo que la sustituye es el material más débil de su corpus: la salida del detector obtuvo las valoraciones probatorias más bajas de todas las categorías, y Hadra et al. (2026) muestran por qué, con una precisión macro de 0,69 (Originality) y 0,61 (Turnitin) en 192 textos, un fallo casi total en la escritura híbrida humano-IA y una tendencia limítrofe a malinterpretar el trabajo del estudiantado de inglés como lengua extranjera como IA. Wright (2026) añade la dimensión del diseño de reglas: las prohibiciones redactadas según la identidad de la plataforma y no según su función son sobrerrestrictivas por accidente definicional, así que un formato vigilado puede sancionar a un estudiante que no hizo lo que la regla pretendía impedir, y la sanción recae con más fuerza sobre quienes dependían de herramientas de transcripción por accesibilidad. Leído en conjunto, el repliegue sustituye la evidencia menos probatoria disponible por la evidencia de proceso que el diseño auténtico habría generado desde el principio.
- Aprendizaje autorregulado: la agencia del estudiantado en la evaluación auténtica (elección, autorreflexión, codiseño) refleja el ciclo de previsión → desempeño → autorreflexión, aunque la reflexión calificada corre el riesgo de volverse performativa.
- Metacognición: la metacognición es necesaria para que el estudiantado evalúe su trabajo con rúbricas codiseñadas; cuando la IA aporta la rúbrica, la retroalimentación y el seguimiento, la práctica metacognitiva del estudiante puede quedar desplazada.
- Retroalimentación formativa y sostenible: la evaluación auténtica pone el énfasis en la retroalimentación formativa y orientada al futuro que se transfiere a contextos posteriores.
Implicaciones para la IA en la educación
- Tipos de evaluación resistentes a la IA: las demostraciones en vivo, los portafolios de contribución social, los artefactos cocreados con procedencia auditable y la interacción corporeizada en tiempo real son más resilientes a la IA generativa que los ensayos para llevar a casa o las preguntas de opción múltiple.
- Codiseño a escala: las herramientas de IA podrían permitir el codiseño de rúbricas y la cocreación de parámetros de evaluación por parte del estudiantado a escala de aula o de MOOC, aunque la agencia mediada por máquinas debe diseñarse con cuidado.
- Abordar la brecha de autenticidad social: solo 3 de 37 estudios abordaron cuestiones sociales; las herramientas de evaluación con IA deberían ayudar al estudiantado a contribuir a la transformación social, no solo a simularla.
- Retroalimentación sostenible: la retroalimentación con IA debe diseñarse para transferirse a contextos futuros, no solo para ofrecer correcciones reactivas y momentáneas.
- La evaluación auténtica encaja en campos orientados a la práctica. Mesny, Roberge-Maltais y Galy (2026) encuentran que la evaluación auténtica encaja especialmente bien en la educación en gestión: las tareas que reflejan problemas profesionales reales (proyectos de consultoría en vivo, cuadros de mando con informes para la dirección) se alinean con el enfoque del campo, orientado a la práctica y a la empleabilidad, y pueden sostener alternativas inclusivas y preservadoras de la integridad frente a una evaluación centrada en exámenes en la era de la IA generativa. Sin embargo, en su revisión de 58 artículos de cuatro revistas de educación en gestión, la evaluación auténtica aparecía sobre todo a través de simulaciones mediadas por tecnología y a menudo se confundía con el aprendizaje experiencial, una brecha terminológica que puede oscurecer su valor y su adopción más amplios.
Conceptos conectados
- Identidad de quien aprende — identidades de quien aprende en evolución: disciplinar, profesional, creativa y académica
- Portafolio electrónico
- Aprendizaje basado en problemas
- Evaluación
- Validez de la evaluación
- Evaluación formativa
- Evaluación automatizada
- Integridad académica
- Detección de IA
- Aprendizaje autorregulado
- Metacognición
- Evaluación de la IA en educación
- Educación superior
- IA generativa
- IA en la educación
- Retroalimentación
- Evaluación sumativa — Evaluación sumativa: formatos resistentes a la IA (orales, supervisados, exámenes a libro cerrado)
- Educación en artes, diseño y medios
Artículos conectados
- Preserving epistemic authenticity: process-oriented assessment in the age of generative AI — evaluación orientada a procesos y autenticidad epistémica como aquello que una tarea debería autenticar
- Evaluation in the Age of AI: Output as Evidence of Learning — La evaluación en la era de la IA
- The Integrity of Psychology Assessments in the AI Age: A Critical Examination — Lo que la IA no pudo superar: presencia, artefactos visuales y los propios datos del estudiante (Ivory et al. 2026)
- The Paternalistic Filter: Epistemic Injustice and Differential Refusal in LLM-Mediated History Education for Marginalized Romanian Students — Uso paternalista de la IA e identidad del estudiantado en la enseñanza de la historia
- Coauthorship integrity: Reconceptualising assessment validity for the age of generative artificial intelligence
- Teaching with Generative Artificial Intelligence: Enhancing Critical Thinking and Ethical Awareness in Academic Writing
- From Classroom Design to Newsroom Practice: Assessment Intervention Designing GenAI
- Raising Ethical Awareness of GenAI Use Through Student Self-Assessment in the Transition to Higher Education
- Reimagining Success and Failure: Equitable Assessment Practices in an Age of Artificial Intelligence
- Aligning ChatGPT with E-Portfolio Assessment as EFL Learning Model: Its Effect on Students' Speaking Performance and Feedback Literacy
- It Takes a Village... Program-Wide Approaches to Redesigning Assessment in a Time of Generative Artificial Intelligence (GenAI)
- Students' Perceptions of Multiliteracies Development Using AI-Assisted Portfolio Assessment
- Mapping the Integration of AI into Business Education: Insights from a Decade of Research
- Using Generative AI to Simulate Patient History-Taking in a Problem-Based Learning Tutorial: A Mixed-Methods Study
- Problem-Based Learning and the Structural Conditions for Productive AI Integration
- The Best Response to Student AI Use Is Not Detection, It Is Dialog
- Designing for Authentic Assessment: A Scoping Review — Diseñar para la evaluación auténtica: una revisión de alcance
- Beyond Detection: Redesigning Authentic Assessment in an AI-Mediated World — Más allá de la detección: evaluación auténtica
- Responsible Assessment in the AI Era: Key Insights from a Future-Focused Conference — La evaluación responsable en la era de la IA
- From authentic products to authenticated processes: a systematic conceptual review of authentic assessment in AI-rich — Productos auténticos, procesos autenticados
- A Tool-Invariant Framework for Teaching and Assessing Computational Methods in the Age of Agentic AI — Marco invariante a la herramienta para enseñar y evaluar métodos computacionales
- Confidence Estimation in Automatic Short Answer Grading with LLMs — Calificación automatizada de respuestas cortas consciente de la confianza
- The LLM Fallacy: Misattribution in AI-Assisted Cognitive Workflows — La falacia del LLM y la atribución errónea de competencia
- The University AI Didn''t Replace: Rethinking Universities in the AI Era — Repensar las universidades en la era de la IA
- Reassessing Academic Integrity in the Age of AI: A Systematic Literature Review on AI and Academic Integrity — Múltiples métodos de evaluación para contrarrestar la mala conducta con IA
- Reconsidering the Use of Oral Exams and Assessments: An Old Way to Move Into a New Future — Reconsiderar los exámenes orales como evaluación auténtica y resistente a la IA
- Assessment twins: An approach for strengthening assessment validity in the age of generative AI — Gemelos de evaluación para reforzar la validez de la evaluación en la era de la IA generativa (Roe, Perkins y Giray 2026)
- Assuring quality learning in a gen AI-integrated future: The role of adaptive capabilities. TEQSA, June 2026 — Capacidades adaptativas para asegurar un aprendizaje de calidad en un futuro integrado con IA generativa (Lodge et al. 2026)
- Heads We Win, Tails You Lose: AI Detectors in Education — Cara gano yo, cruz pierdes tú: los detectores de IA en la educación (Bassett et al. 2026)
- Asynchronous Oral Assessments: Enhancing Integrity, Engagement, and Communication in the AI Era — Evaluaciones orales asíncronas en la era de la IA (Pentland 2026)
- Assessing students' DRIVE: A framework to evaluate learning through interactions with generative AI — DRIVE: evaluar el aprendizaje a través de la interacción con IA generativa (DRI + experiencia visible)
- Innovative assessment and grading practices in higher education: A critical exploration for management educators
- Students' Agency in GenAI-Mediated Group Assessment: An Ecological-Emergent Perspective — Criterios de autenticidad que llevaron a grupos de estudiantes a reducir su uso de IA generativa
- Pioneering Teacher Educators Navigating AI Integration in Pre-Service Teacher Preparation: Strategies and Challenges — La crisis de confianza en la IA que empujó a formadores de docentes de vuelta a exámenes supervisados y defensas orales (Goldstein et al. 2026)
- Educational integrity in GenAI-augmented assessment: making judgment visible — El diseño orientado a la integridad distinguido de la evaluación auténtica: hacer visible el juicio (Sharma 2026)
- How strong is the evidence in generative AI-related academic misconduct allegations? A mixed-methods analysis — Qué contienen de verdad como evidencia los expedientes de acusaciones de mala conducta, y la evidencia de proceso que les falta (Munoz et al. 2026)
- Evaluating the accuracy and reliability of AI content detectors in academic contexts — Precisión de los detectores y fallo en la escritura híbrida: por qué la detección es una evidencia de respaldo débil (Hadra et al. 2026)
- Transcription is not generation: Distinguishing non-generative AI tool use from academic misconduct in higher education assessment — Prohibiciones de IA sobrerrestrictivas: la transcripción no es generación (Wright 2026)
- Designing Authentic Assessments with Generative AI: A Pilot Study of Assessment Authentifire in Higher Education — Diseñar evaluaciones auténticas con IA generativa: un estudio piloto de Assessment Authentifire en educación superior
- AI Can Do Your Homework. Now What? Report from an online workshop on computing assessment in the age of generative AI — La IA puede hacer tus deberes. ¿Y ahora qué? Informe de un taller en línea sobre la evaluación en informática en la era de la IA generativa