En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

La evaluación auténtica — el diseño de evaluaciones que examinan el desempeño del estudiantado en tareas intelectuales valiosas y realistas, en lugar de ítems de examen aislados y estandarizados. Nacida con Wiggins (1990) como contrapeso a las pruebas estandarizadas, la evaluación auténtica ha evolucionado desde la réplica de tareas del mundo laboral hacia un marco multidimensional que abarca la autenticidad profesional, digital, personal y social. La IA generativa ha vuelto la evaluación auténtica más necesaria que nunca: cualquier tarea que un modelo de lenguaje pueda simular de forma verosímil en un entorno para llevar a casa pierde su validez como evidencia de una competencia original del estudiantado, así que las formas auténticas deben rediseñarse en torno a lo que la IA no puede falsificar de forma verosímil.

Preguntas para reflexionar

  • La evaluación auténtica examina el desempeño en tareas intelectuales valiosas y realistas, y no en ítems de examen aislados. Antes de leer, ¿daba por supuesto que una tarea «auténtica» se limita a replicar un escenario real o del mundo laboral? Esta página sostiene que la autenticidad ha evolucionado mucho más allá de la mera réplica: ¿qué otras formas puede adoptar?
  • Una afirmación central es que cualquier tarea que un modelo de lenguaje pueda simular de forma verosímil en un entorno para llevar a casa pierde su validez como evidencia de una competencia original del estudiantado. ¿Qué evaluación de su propia docencia o de su propio estudio consideraría ahora «falsificable», y qué le lleva a pensarlo?
  • La página destaca una brecha llamativa: solo 3 de 37 estudios abordaron la autenticidad social, es decir, si la evaluación ayuda al estudiantado a contribuir a la transformación social. ¿Por qué cree que la dimensión social de la autenticidad está tan desatendida, y cómo podría llegar a evaluarse?
  • La base de conocimiento sostiene que la autenticidad debe «rediseñarse, no vigilarse». Cuando el estudiantado coautoriza las rúbricas, elige qué y cómo entregar y participa en interacción en tiempo real, el uso de IA pasa a ser esperado y declarado en lugar de oculto. ¿Cómo cambiaría eso la relación entre el estudiantado y quien evalúa?
  • Los exámenes orales y los portafolios basados en procesos se ofrecen como formas auténticas resistentes a la IA. Pero la reflexión calificada y la autoevaluación corren el riesgo de volverse performativas: el estudiantado escenifica la reflexión que cree que se espera de él. ¿Cómo diseñaría para una reflexión genuina y no para una actuación?
  • Cuando la IA aporta la rúbrica, la retroalimentación y el seguimiento, la página advierte de que la práctica metacognitiva del estudiantado puede quedar desplazada. Si la herramienta hace la evaluación, ¿qué le queda por practicar o aprender de verdad a quien aprende?

Introducción

La evaluación auténtica está en el centro de cómo se repiensa la evaluación en la era de la IA. Se conecta con la validez de la evaluación (¿mide la evaluación lo que dice medir?), con la evaluación formativa (tareas auténticas que informan el aprendizaje) y con la integridad académica (pasar de la detección a diseñar tareas en las que el uso de IA sea esperado y declarado). Es una respuesta central en la literatura de rediseño de la evaluación de la base de conocimiento.

La evolución de la autenticidad

  • Orígenes en la década de 1990 — tareas intelectuales valiosas: Wiggins (1990) propuso la evaluación auténtica como examen directo del «desempeño del estudiantado en tareas intelectuales valiosas», un contrapeso a las pruebas estandarizadas.
  • Adopción a finales de la década de 1990 — réplica del mundo laboral: Joughin (1998) enmarcó la autenticidad como el grado en que la evaluación replica la práctica profesional o la vida real, una visión que dominó durante dos décadas.
  • Crítica de la década de 2020 — más allá de la réplica: McArthur (2023) sostuvo que la evaluación auténtica debe permitir al estudiantado «influir en el futuro y transformar la sociedad» en lugar de limitarse a replicar tareas existentes; Ajjawi et al. (2024) ampliaron la autenticidad a formas contextuales, de tarea y personales que reflejan la experiencia del estudiantado.
  • La IA generativa como desafío existencial: Zhan, Boud y Du (2025) señalan que la IA generativa vuelve vulnerable de nuevo la autenticidad entendida como réplica del mundo laboral, lo que impulsa un giro hacia la alfabetización digital, la colaboración en tiempo real, la contribución social y la construcción de significado individual que la IA no puede falsificar de forma verosímil.

Un modelo de diseño de seis dimensiones

La revisión de alcance de Zhan, Boud y Du (2025) de 37 estudios empíricos (2000-2024) propone seis dimensiones de diseño: (1) autenticidad en la evaluación (autenticidad de la evaluación, profesional, digital, personal y social; solo 3 de 37 estudios abordaron la autenticidad social, una brecha crítica), (2) desafíos cognitivos, (3) criterios de evaluación (con un estudiantado que suele ser receptor pasivo y no coautor de las rúbricas), (4) retroalimentación (predominantemente formativa, pero con escasa retroalimentación sostenible), (5) agencia del estudiantado (la elección de qué, cómo, cuándo y dónde entregar era poco frecuente) y (6) colaboración social. También propone un modelo cíclico de codiseño — negociar objetivos, crear contexto, codiseñar criterios, planificar la retroalimentación — que las herramientas de IA podrían operacionalizar.

La evaluación auténtica en la era de la IA

La literatura de rediseño de la evaluación de la base de conocimiento sostiene que la autenticidad debe rediseñarse, no vigilarse:

  • Más allá de la detección sostiene que la autenticidad no puede imponerse por vigilancia; hay que diseñarla, posicionando la IA como colaboradora declarada en lugar de como aplicación para hacer trampas, y priorizando la evaluación auténtica y basada en procesos por encima de la vigilancia.
  • La evaluación responsable reencuadra la evaluación en torno a evidencia de validez y tareas auténticas que reflejan el trabajo futuro del estudiantado.
  • Productos auténticos, procesos autenticados examina cómo la educación superior rica en IA puede evaluar tanto los productos genuinos como los procesos que los produjeron.
  • El marco invariante a la herramienta aboga por evaluar métodos y procesos computacionales en lugar de productos específicos de una herramienta, mediante defensa oral y verificación.
  • Reconsiderar los exámenes orales sitúa el examen o la evaluación oral como alternativa auténtica de baja tecnología e intrínsecamente resistente a la IA: su diálogo en tiempo real e interactivo pone a prueba la comprensión, el pensamiento crítico y el razonamiento (no la memorización), refleja la práctica profesional e impide que el estudiantado use IA para generar y memorizar respuestas. Ofrece un conjunto concreto de recomendaciones prácticas (rúbricas claras, contenido estandarizado, formación de quienes evalúan, directrices de prompting y mitigación de sesgos) para reintroducir la evaluación oral en la secundaria y en la educación superior.
  • La evaluación mediante portafolios electrónicos es otra forma auténtica y basada en procesos que resiste la fabricación con IA: Zhan, Boud y Du (2025) identifican los portafolios de contribución social entre las formas auténticas más robustas frente a la IA generativa, y Más allá de la detección recomienda portafolios anotados y recorridos grabados que sondean el razonamiento en tiempo real. Ni y Lam (2026) y Laksana et al. (2026) muestran que la IA generativa puede asistir el proceso del portafolio — retroalimentación, redacción, reflexión — mientras los rastros de razonamiento y los borradores del portafolio preservan la autenticidad.
  • Los criterios de autenticidad pueden contener por sí mismos el uso de IA. Chen y Zou (2026) encontraron que una rúbrica que exigía al estudiantado fundamentar una presentación de grupo en su propia experiencia docente de primera mano, y reflexionar sobre observaciones de aula compartidas, llevó a siete de quince grupos de estudiantes a reducir deliberadamente su uso de IA generativa. El estudiantado argumentaba que la herramienta no podía satisfacer la exigencia epistémica — «la IA solo conoce el momento en que escribes» — porque carecía del conocimiento longitudinal y situado que tenían sus compañeros y el profesorado. Importaban ambas capas: la autenticidad de la tarea y la autenticidad relacional de aportar el propio pensamiento a un grupo, lo que reencuadró el uso intensivo de IA como aprovecharse del trabajo de los compañeros. La implicación de diseño es que los criterios auténticos y anclados en la experiencia hacen trabajo evaluativo incluso sin aplicación coercitiva: aportan una razón para la contención que las declaraciones de política no pueden dar.

Sharma (2026) sostiene que el diseño orientado a la integridad y el diseño auténtico no son lo mismo, y que la diferencia es epistémica y no estilística. La autenticidad pregunta si una tarea refleja una práctica valiosa del mundo real; el diseño orientado a la integridad pregunta si quienes aprenden pueden justificar sus decisiones y asumir responsabilidad con respecto a los estándares disciplinares, lo que convierte la integridad en un criterio explícito y evaluable integrado en la arquitectura de la tarea y no en un subproducto incidental del realismo. Las prácticas que propone — rastros de decisiones anotados, verificación de las afirmaciones aportadas por IA generativa, defensa oral y responsabilidad dialógica, diferencias entre borradores con historial de versiones — son formas reconocibles de evaluación auténtica, pero se seleccionan por el juicio que hacen visible y no por su realismo, lo que es una corrección útil para tareas que parecen auténticas y siguen siendo falsificables en el fondo. Su advertencia corresponde también a esta página: exigir razonamiento documentado privilegia a quienes aprenden con más fluidez en el discurso reflexivo, y el juicio como evidencia «sigue siendo relacional y situado en lugar de verificable mecánicamente», así que el diseño carga con su propia responsabilidad de fiabilidad interpretativa.

Thapa y Lewis (2026) reencuadran la misma pregunta al nombrar qué debería autenticar una tarea en lugar de si parece real: autenticidad epistémica, el grado en que la evaluación captura una implicación genuina con la interpretación, el juicio evaluativo, el razonamiento y la construcción de conocimiento. Su argumento es que la autenticidad por sí sola no sobrevive a la IA generativa, porque una tarea auténtica cuya evidencia es un único producto no supervisado queda expuesta al mismo problema de sustitución que el ensayo al que reemplazó. Hacer visible el razonamiento exige en cambio entregas por etapas, justificación reflexiva, implicación dialógica y transparencia evaluativa. Llevan la advertencia anterior al diseño: las tareas reflexivas y dialógicas pueden privilegiar al estudiantado con confianza en la autoexpresión académica si no se diseñan y se andamian de forma inclusiva, y el trabajo relacional intensifica el trabajo emocional del personal docente en entornos grandes o con recursos limitados.

Cuando la práctica docente se repliega a los formatos vigilados

La base de conocimiento sostiene que la autenticidad debe diseñarse y no vigilarse, y Goldstein, Marae-Haj y Zidan (2026) aportan la contraevidencia desde la práctica: tras una crisis de confianza en la que futuros docentes entregaron trabajo generado por IA sin editar como propio, formadores de docentes de siete colegios israelíes rediseñaron la evaluación en torno a evidencia de proceso (prompts, historial de versiones de documentos, contribuciones de grupo monitorizadas) y al desempeño en clase, pero varios describieron también haber recurrido, como último recurso, a exámenes supervisados y a defensas orales previstas sobre las tesis, y una persona participante calificó la vuelta a los exámenes de personalmente dolorosa aunque inevitable. Leído frente a la posición que prioriza el diseño, el hallazgo señala un modo de fallo y no una solución: cuando la autenticidad no se rediseña de antemano, la respuesta práctica ante un trabajo entregado no evaluable es reinstaurar el control — la vigilancia con otro nombre —, lo que reintroduce precisamente los formatos que la literatura sobre evaluación auténtica intenta superar. También muestra el coste sentido de la alternativa: las personas participantes informaron de que sus evaluaciones escritas para llevar a casa ya no podían evidenciar aprendizaje alguno, y que la documentación de procesos exigía trabajo real para establecerse.

El repliegue conlleva un coste probatorio que la evidencia de los expedientes hace visible. Munoz et al. (2026) codificaron 1.162 acusaciones de mala conducta con IA generativa y encontraron que los tipos de evidencia más sólidos los genera la investigación o la supervisión y no la acusación, y que la evidencia de proceso — como borradores, reuniones de supervisión y presentaciones — solo aparece donde esas prácticas ya existen; así que en una evaluación sin rediseñar la evidencia de proceso que recomienda esta literatura simplemente no está disponible, y los casos se apoyan en categorías más débiles. Lo que la sustituye es el material más débil de su corpus: la salida del detector obtuvo las valoraciones probatorias más bajas de todas las categorías, y Hadra et al. (2026) muestran por qué, con una precisión macro de 0,69 (Originality) y 0,61 (Turnitin) en 192 textos, un fallo casi total en la escritura híbrida humano-IA y una tendencia limítrofe a malinterpretar el trabajo del estudiantado de inglés como lengua extranjera como IA. Wright (2026) añade la dimensión del diseño de reglas: las prohibiciones redactadas según la identidad de la plataforma y no según su función son sobrerrestrictivas por accidente definicional, así que un formato vigilado puede sancionar a un estudiante que no hizo lo que la regla pretendía impedir, y la sanción recae con más fuerza sobre quienes dependían de herramientas de transcripción por accesibilidad. Leído en conjunto, el repliegue sustituye la evidencia menos probatoria disponible por la evidencia de proceso que el diseño auténtico habría generado desde el principio.

  • Aprendizaje autorregulado: la agencia del estudiantado en la evaluación auténtica (elección, autorreflexión, codiseño) refleja el ciclo de previsión → desempeño → autorreflexión, aunque la reflexión calificada corre el riesgo de volverse performativa.
  • Metacognición: la metacognición es necesaria para que el estudiantado evalúe su trabajo con rúbricas codiseñadas; cuando la IA aporta la rúbrica, la retroalimentación y el seguimiento, la práctica metacognitiva del estudiante puede quedar desplazada.
  • Retroalimentación formativa y sostenible: la evaluación auténtica pone el énfasis en la retroalimentación formativa y orientada al futuro que se transfiere a contextos posteriores.

Implicaciones para la IA en la educación

  • Tipos de evaluación resistentes a la IA: las demostraciones en vivo, los portafolios de contribución social, los artefactos cocreados con procedencia auditable y la interacción corporeizada en tiempo real son más resilientes a la IA generativa que los ensayos para llevar a casa o las preguntas de opción múltiple.
  • Codiseño a escala: las herramientas de IA podrían permitir el codiseño de rúbricas y la cocreación de parámetros de evaluación por parte del estudiantado a escala de aula o de MOOC, aunque la agencia mediada por máquinas debe diseñarse con cuidado.
  • Abordar la brecha de autenticidad social: solo 3 de 37 estudios abordaron cuestiones sociales; las herramientas de evaluación con IA deberían ayudar al estudiantado a contribuir a la transformación social, no solo a simularla.
  • Retroalimentación sostenible: la retroalimentación con IA debe diseñarse para transferirse a contextos futuros, no solo para ofrecer correcciones reactivas y momentáneas.
  • La evaluación auténtica encaja en campos orientados a la práctica. Mesny, Roberge-Maltais y Galy (2026) encuentran que la evaluación auténtica encaja especialmente bien en la educación en gestión: las tareas que reflejan problemas profesionales reales (proyectos de consultoría en vivo, cuadros de mando con informes para la dirección) se alinean con el enfoque del campo, orientado a la práctica y a la empleabilidad, y pueden sostener alternativas inclusivas y preservadoras de la integridad frente a una evaluación centrada en exámenes en la era de la IA generativa. Sin embargo, en su revisión de 58 artículos de cuatro revistas de educación en gestión, la evaluación auténtica aparecía sobre todo a través de simulaciones mediadas por tecnología y a menudo se confundía con el aprendizaje experiencial, una brecha terminológica que puede oscurecer su valor y su adopción más amplios.

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.