En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

La evaluación sumativa — la evaluación que se usa para valorar y certificar lo que quien aprende ha aprendido al final de una unidad, un curso o un programa, en contraste con la evaluación formativa, que apoya el aprendizaje durante la enseñanza. La evaluación sumativa suele adoptar la forma de exámenes de alto riesgo —escritos, orales, supervisados o con libros cerrados— que asignan notas, condicionan la progresión y certifican la competencia. En la era de la IA, la evaluación sumativa se ha convertido en un campo de batalla central en torno a la integridad académica y la validez: la IA generativa puede inflar el rendimiento en tareas no supervisadas o para hacer en casa, lo que convierte la elección del formato sumativo —y su resistencia a la sustitución por IA— en una decisión de diseño fundamental.

Preguntas para reflexionar

  • La evaluación sumativa certifica lo que el estudiantado ha aprendido al final de un curso, mientras que la evaluación formativa apoya el aprendizaje durante el curso. ¿Dónde ha visto difuminarse la línea entre ambas, y por qué puede importar que cumplan funciones distintas?
  • La página enmarca la IA generativa como una fuerza que remodela la evaluación sumativa en dos direcciones a la vez: la IA puntúa exámenes y el estudiantado usa la IA para eludir la medición basada en exámenes. ¿Cuál de estas dos presiones cree usted que es la mayor amenaza para la validez, y por qué?
  • Si las tareas no supervisadas o para hacer en casa pierden validez porque la IA puede producir las respuestas, ¿qué implica eso para cómo deberían diseñarse las evaluaciones, y qué podría sacrificarse en el proceso?
  • La investigación citada en la página encuentra que los LLM no califican los ensayos como lo hacen las personas. Si la puntuación automatizada es rápida y consistente pero califica de otra manera, ¿es un problema de equidad, una oportunidad o ambas cosas?
  • ¿Qué significa un resultado de alto riesgo (una nota, una credencial, la admisión) si el trabajo que hay detrás podría haber sido producido por IA? ¿Cómo diseñaría usted una evaluación en la que pudiera confiar de verdad?

Introducción

La evaluación sumativa cumple una función fundamentalmente distinta de la evaluación formativa: mide y certifica el logro en lugar de orientar los siguientes pasos. Incluye pruebas de final de unidad, exámenes finales, pruebas estandarizadas y de alto riesgo (por ejemplo, exámenes de admisión), defensas orales y evaluaciones acumulativas del desempeño. Como los resultados sumativos conllevan consecuencias reales (notas, progresión, credenciales, admisión a la universidad), afrontan presiones particulares en la era de la IA, tanto como objetivos de la puntuación automatizada como en calidad de medidas vulnerables que el estudiantado puede intentar burlar con IA generativa.

Lo que está en juego en la era de la IA: validez e integridad

La investigación de la base de conocimiento documenta cómo la IA generativa ha remodelado de raíz el panorama de la evaluación sumativa en dos direcciones: la IA se usa para puntuar exámenes a escala, y el estudiantado puede usar la IA para eludir la medición basada en exámenes de su propio aprendizaje.

Formatos sumativos resistentes a la IA

Un tema clave de la base de conocimiento es que el formato sumativo determina la resistencia a la IA: cuanto más exige una tarea un desempeño en vivo, presencial e indagado individualmente, más difícil le resulta al estudiantado sustituir con IA su propio aprendizaje.

Evaluación sumativa de alto riesgo y estandarizada

La evaluación sumativa de alto riesgo —exámenes de admisión, pruebas estandarizadas y certificación— conlleva consecuencias desproporcionadas y es un foco de preocupación en la era de la IA. El estudio sobre la penalización de aprendizaje de la IA generativa midió los resultados en los exámenes de admisión de secundaria (Zhongkao) y de acceso a la universidad (Gaokao), y encontró que las puntuaciones de admisión cayeron entre un 18% y un 24% tras un uso prolongado de la IA. La trampa sin esfuerzo y la investigación sobre rendimiento frente a aprendizaje advierten de que las ganancias en tareas asistidas por IA no se transfieren a las medidas de alto riesgo sin asistencia.

Sumativa frente a formativa en la era de la IA

La literatura sobre evaluación de la base de conocimiento insiste en que la evaluación es más eficaz cuando combina funciones formativas y sumativas, pero la era de la IA agudiza la distinción. Como la IA infla el rendimiento en tareas de bajo riesgo, no supervisadas y con el proceso oculto, las medidas sumativas (especialmente las supervisadas, con libros cerrados y presenciales) se convierten en la comprobación crucial de si el aprendizaje se produjo de verdad. Esto motiva un rediseño de la evaluación que mantenga tareas sumativas auténticas y resistentes a la IA (exámenes orales, entrevistas de revisión de código, exámenes supervisados, portafolios basados en el proceso) como ancla de la integridad, a la vez que usa la evaluación formativa para apoyar el aprendizaje por el camino. Véase evaluación auténtica para la respuesta de diseño constructiva.

Implicaciones para la IA en la educación

  • El formato sumativo es una palanca de validez e integridad: los formatos sumativos resistentes a la IA (orales, supervisados, con libros cerrados, presenciales) preservan la conexión entre el desempeño evaluado y el aprendizaje real.
  • Las medidas supervisadas y sin asistencia son la señal fiable: cuando el estudiantado usa IA, los exámenes sumativos sin asistencia —y no los deberes— revelan el aprendizaje genuino.
  • La puntuación automatizada necesita escrutinio psicométrico: usar LLM para calificar exámenes de alto riesgo exige evaluar la fiabilidad, la equidad y la validez, y no solo la exactitud.
  • La IA también puede generar exámenes: la generación de exámenes y tareas asistida por IA es una aplicación emergente del diseño sumativo que a su vez necesita evaluación de calidad.
  • Replantear el propósito de la calificación, no solo el formato. Mesny, Roberge-Maltais y Galy (2026) critican la calificación sumativa tradicional y referida a la norma por fomentar un aprendizaje superficial y fragmentado, dar al estudiantado poco control o transparencia, dañar la motivación intrínseca, alimentar el estrés y la ansiedad y perpetuar desigualdades, mientras evalúa en gran medida el recuerdo y no la aplicación en el mundo real. Sitúan la reevaluación, la calificación basada en estándares y la descalificación como innovaciones centradas en la calificación que pueden suavizar una práctica muy cargada de sumativa, aunque reconocen que siguen siendo marginales en la educación en gestión por barreras normativas —la calificación en curva, la señalización externa (rankings, prácticas, acreditación) y la mentalidad instrumental del estudiantado— y recomiendan una experimentación incremental con apoyo institucional.

Conceptos conectados

Artículos conectados

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.