Conceptos
Evaluación
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
La evaluación: el proceso de reunir e interpretar evidencia sobre lo que el estudiantado sabe y puede hacer, y los métodos que se emplean para valorar el aprendizaje. La IA en la educación ha transformado la evaluación de raíz: impulsa la corrección y la puntuación automatizadas, genera y adapta ítems de evaluación y plantea preguntas de fondo sobre qué miden de verdad las evaluaciones cuando el estudiantado puede usar IA. La evaluación es el concepto paraguas que organiza la cobertura que hace la base de conocimiento de la Evaluación formativa, la corrección automatizada, la validez y la Educational Measurement.
Preguntas para reflexionar
- La evaluación se define aquí como la reunión y la interpretación de evidencia sobre lo que el estudiantado sabe y puede hacer. Antes de leer, ¿cómo completaría usted la frase «una evaluación es válida si…», y qué cambiaría en esa respuesta si todo el estudiantado pudiera usar IA en secreto para producir su trabajo?
- La página afirma que cómo usa el estudiantado la IA generativa (integración evaluativa frente a una adopción acrítica como atajo) predijo el rendimiento, mientras que con qué frecuencia la usó no predijo nada. ¿Qué sugiere esto sobre el instinto habitual de regular la IA limitando su uso?
- Quien aprende puede entregar un trabajo de nivel profesional que no podría reproducir sin la herramienta, lo que rompe la inferencia entre el rendimiento y la capacidad subyacente. ¿Se ha encontrado con una «competencia» otorgada por un trabajo que el estudiante en realidad no podía hacer sin ayuda? ¿Qué reveló eso?
- La pregunta constructiva que ofrece la página no es «¿cómo impedimos que el estudiantado use IA?», sino «¿cómo habilitamos un uso reflexivo en contextos que se parecen a su trabajo futuro?». ¿Cómo sería la evaluación en su campo si ese fuera el objetivo?
- El marco DRIVE propone evaluar la calidad de la implicación del estudiantado con la IA generativa, y no solo el artefacto, fijándose en si dirigen las indicaciones de forma estratégica e integran sus propias ideas. ¿Qué miraría usted para distinguir una interacción con la IA profunda y reflexiva del consumo superficial?
- La evaluación mediada por IA se está diversificando hacia exámenes orales, portafolios y formatos conversacionales que reducen la ansiedad y resultan profesionalmente pertinentes. ¿Qué formato de evaluación de su propia experiencia le parece más «resistente a la IA», y es la resistencia lo mismo que el valor educativo?
Introducción
La evaluación es central para la IA en la educación por dos razones. Primero, la propia IA se usa para evaluar al estudiantado: califica ensayos, código, respuestas breves y exámenes a escala. Segundo, la IA en el aula cambia lo que las evaluaciones pueden medir válidamente, ya que el estudiantado puede usar IA generativa para producir su trabajo. El campo abarca, por tanto, tanto las herramientas que automatizan la evaluación como las cuestiones de validez e integridad que plantea la IA.
Cómo se usa la IA en la evaluación
- Evaluación automatizada: la evaluación basada en IA abarca múltiples modalidades (opción múltiple, respuesta breve, ensayo, código y evaluación basada en el desempeño) mediante corrección automatizada, Automated Essay Scoring y Automated Question Generation.
- Evaluación formativa: los sistemas de IA generan, validan y adaptan ítems de evaluación formativa a escala, e informan la instrucción continua en lugar de limitarse a la evaluación sumativa.
- Analítica del aprendizaje y medición: Analítica del aprendizaje y Educational Measurement conectan los datos de evaluación con los procesos de aprendizaje, y usan la Item Response Theory, el Knowledge Tracing y el Learner Modeling and Adaptive Instruction para interpretar el rendimiento. Razavi y Powers (2026) demuestran la estimación de la dificultad de los ítems con LLM como insumo de medición: en 5,170 ítems de matemáticas y lectura de K-5 calibrados con el modelo IRT de Rasch, las valoraciones de GPT-4o en zero-shot correlacionaron de moderada a fuertemente con las dificultades verdaderas (r = 0.83 en matemáticas, r = 0.81 en lectura), pero variaron según el curso, mientras que un enfoque basado en características (características extraídas por LLM introducidas en modelos de árboles) alcanzó correlaciones de hasta r = 0.87. El estudio ofrece un flujo de trabajo práctico de siete pasos para los profesionales de la medición y advierte, al mismo tiempo, de que la generalizabilidad más allá de las matemáticas y la lectura de K-5 no está clara.
- Bucles de retroalimentación: la evaluación con IA alimenta cada vez más los bucles de retroalimentación que cierran el ciclo de la evaluación al aprendizaje.
- Evaluación por portafolio electrónico: los portafolios electrónicos reúnen el trabajo y las reflexiones del estudiantado a lo largo del tiempo como una forma de evaluación basada en procesos y robusta frente a la IA. La IA generativa puede ayudar en el proceso del portafolio (generar retroalimentación, andamiar la reflexión y, con un diseño de rúbrica adecuado, apoyar la evaluación), mientras que el énfasis del portafolio en los rastros de razonamiento y los borradores resiste la fabricación con IA. La evaluación por portafolio asistida por IA y ChatGPT + portafolio electrónico para la expresión oral en EFL muestran que la IA puede mejorar tanto la experiencia del portafolio como la alfabetización en retroalimentación de quien aprende.
- La fiabilidad de la corrección abierta depende del modelo: Pecuchova, Benko y Drlik (2025) compararon once modelos de IA generativa y de incrustaciones de frases con dos evaluadores expertos en 1,885 respuestas abiertas de ingeniería de software: solo GPTo1 alcanzó un acuerdo casi perfecto (kappa de Fleiss 0.82), mientras que los modelos basados en referencias penalizaron respuestas correctas pero formuladas de otro modo. Como GPTo1 fue el único modelo considerado desplegable sin supervisión, pero con costes de API propietaria, los autores recomiendan estrategias híbridas que combinen modelos avanzados con opciones asequibles o con supervisión humana en entornos con recursos limitados. Una revisión sistemática guiada por PRISMA de 42 estudios empíricos (de 2023 a 2025) corrobora esta imagen de fiabilidad condicional en todo el campo de la corrección: los LLM igualan a los evaluadores humanos en tareas cerradas y de respuesta breve, pero no pueden sustituir del todo el juicio humano en trabajos complejos, abiertos o subjetivos, y no emergió un sesgo de corrección uniforme, ya que los modelos fueron a veces más indulgentes y a veces más estrictos, y a menudo evitaron las puntuaciones extremas (Can ChatGPT Replace the Teacher in Assessment? A Review of Research on the Use of Large Language Models in Grading and Providing Feedback). El refinamiento iterativo de las rúbricas puede acercar la puntuación abierta de los LLM a una fiabilidad casi humana en contextos médicos de alta exigencia: Olvet et al. (2026) encontraron que, una vez que el profesorado revisó repetidamente rúbricas analíticas y holísticas sobre el análisis de patrones de error, GPT-4 alcanzó un acuerdo de sustancial a casi perfecto con los evaluadores docentes en tres de las cuatro preguntas del periodo preclínico (kappa ponderada de hasta 0.94), mientras que el ítem restante con rúbrica holística se quedó en un acuerdo solo moderado (κw = 0.54), lo que muestra tanto el rendimiento de la ingeniería de rúbricas con intervención humana como sus límites en tareas sintéticas y holísticas.
- Evaluación oral y de desempeño asistida por IA. Un estudio de diseño de formación profesional y vocacional (TVET) desplaza la evaluación de los formatos centrados en el texto hacia una evaluación oral interactiva apoyada en un LLM: en cuatro cohortes, 21 de 33 estudiantes valoraron la tarea de voz como realista y ninguno estuvo en desacuerdo con que hablar en tiempo real reflejaba mejor la competencia que un portafolio escrito, mientras que el número de palabras para preguntas idénticas varió entre cinco y ocho veces entre cohortes, y nueve estudiantes respondieron en dos a trece palabras y acertaron todas. El sistema funcionó sin conexión en un solo portátil que atendía hasta 12 estudiantes simultáneos con Mistral 7B y faster-whisper, eliminó las grabaciones a los 90 días y dejó los juicios de puntuación en manos de quienes evalúan, un caso de diseño de evaluación con IA con intervención humana (HITL) para cualificaciones orientadas al mundo laboral. (Designing AI-Supported Oral Assessment in TVET)
Retos de validez y de medición
La IA plantea preguntas fundamentales de validez: ¿las evaluaciones corregidas por IA miden el aprendizaje del estudiantado o la habilidad para hacer indicaciones a la IA? ¿Invalida el uso de la IA por parte del estudiantado las evaluaciones tradicionales? Entre los retos clave están:
- Validez de constructo: La investigación sobre la educación basada en competencias muestra que la IA generativa ha roto la inferencia entre el rendimiento y la capacidad subyacente: quien aprende puede entregar un trabajo de nivel profesional que no puede reproducir sin la herramienta. Esto motiva reconceptualizar qué competencias se evalúan.
- Coautoría e integridad: La integridad de la coautoría propone una nueva fuente de evidencia de validez que se vulnera cuando el estudiantado entrega contenido generado por IA que no comprende, y explora los «vivas de IA» conversacionales como respuesta.
- Calidad psicométrica: Psychometrically Aware AI y la evaluación consciente de la confianza trabajan para mantener la puntuación con IA fiable, sin sesgos e interpretable.
- Evaluación de los evaluadores de IA: AI Ed Evaluation aporta los métodos y los puntos de referencia para determinar si los evaluadores automatizados funcionan de verdad (en fiabilidad, pedagogía y equidad), y no solo por su precisión de titular.
- Fiabilidad dependiente de la calidad en la corrección con IA y entre pares (2026): al comparar la corrección con ChatGPT, entre pares y del profesorado de los mismos trabajos en grupo de grado, Usher y Faraon (2026) mostraron que la coincidencia de la corrección con el profesorado es condicional a la calidad del trabajo del estudiantado: ChatGPT infló más las entregas de baja calidad y coincidió mejor con el profesorado en los trabajos de alta calidad, mientras que los pares coincidieron mejor en los trabajos más flojos y puntuaron a la baja los proyectos sólidos. El hallazgo cuestiona el marco binario de «fiable o no fiable» y apunta a modelos de fiabilidad condicional en los que los evaluadores alternativos se ajustan a la tarea y al nivel de desempeño.
- La corrección humana también está cargada de valores (2026): Luo y Dawson (2026) muestran que incluso la corrección humana de trabajos asistidos por IA generativa no es un acto neutral basado en criterios. Entrevistas basadas en escenarios con 33 docentes universitarios revelaron decisiones de calificación guiadas por valores orientados a la persona (honestidad, diligencia), a la capacidad (independencia, habilidad con la IA generativa, dominio disciplinar), a la relación (confianza) y a la justicia (equidad, beneficencia), que se extienden más allá de la tarea hacia las conjeturas del profesorado sobre el estudiante. El estudio reformula la pregunta de la evaluación desde «¿usar IA generativa es hacer trampa?» hacia «¿cómo moldean las calificaciones los juicios de valor del profesorado, y son esos valores pertinentes para los resultados que se evalúan?», y pone en primer plano la validez y una «transparencia bidireccional» sobre cómo afectará el uso de IA generativa a las calificaciones.
La integridad y el debate sobre la detección
La IA en la evaluación ha intensificado la conversación sobre la integridad. Una línea se centra en la detección de texto generado por IA, mientras que un cuerpo creciente de investigación sostiene que la detección es una herramienta limitada y situacional, no una estrategia de primera elección. Más allá de la detección y La evaluación responsable sostienen que la autenticidad no se puede imponer a base de vigilancia: hay que rediseñarla, situando la IA como colaboradora declarada y priorizando la evaluación auténtica y basada en procesos por encima de la vigilancia. Walton et al. (2025) anclan esto en evidencia sobre cómo juzga realmente el estudiantado su camino por la evaluación con IA generativa: entrevistas con retroceso de pantalla (scroll-back) con 26 estudiantes revelaron un espectro de seis eventos de juicio, desde evaluar críticamente el conocimiento de la IA y aprender a través de sus limitaciones hasta adoptar ideas sin crítica y juzgar mal las aportaciones de la IA como propias. Stamatoulis et al. (2026) añaden una contraparte cuantitativa: en 157 estudiantes, cómo se usa la IA generativa (integración evaluativa para apoyar la comprensión frente a una adopción como atajo con poca verificación) predijo el rendimiento, mientras que la simple frecuencia de uso no predijo ni el rendimiento ni la autoeficacia académica. Juntos, estos estudios reformulan la pregunta de la evaluación desde si el estudiantado usa IA hacia cómo juzga y pauta ese uso.
El rediseño de la evaluación en la era de la IA
La pregunta constructiva en la literatura sobre evaluación de esta base de conocimiento no es «¿cómo impedimos que el estudiantado use IA?», sino «¿cómo habilitamos que la use con criterio en contextos que se parecen a su trabajo futuro?». Esto replantea la evaluación en torno a:
- Tareas auténticas y basadas en procesos que hagan visible y evaluable el uso de la IA. La evaluación auténtica, es decir, examinar el desempeño del estudiantado en tareas valiosas y realistas, es la respuesta principal al reto de la IA: cualquier tarea que un Grandes modelos de lenguaje (LLM) pueda simular de forma creíble pierde validez, así que la autenticidad debe rediseñarse en torno a la colaboración en tiempo real, la contribución digital y social y la construcción individual de significado. Esto conecta con los marcos de diseño para la evaluación auténtica, productos auténticos y procesos autenticados y la evaluación del proceso invariante a la herramienta.
- Diseño responsable de la evaluación anclado en evidencia de validez (Responsible Assessment in the AI Era: Key Insights from a Future-Focused Conference)
- Permisos de IA a nivel de tarea derivados de lo que se evalúa: McCorkle (2025) muestra el trabajo de diseño de evaluación que precede a una política sobre IA: inventariar cada tarea de un proyecto, especificar qué se evalúa y contra qué objetivo, y permitir o prohibir la IA tarea por tarea sobre esa base (se permiten la lluvia de ideas y la selección de imágenes; no, redactar los objetivos de aprendizaje ni diseñar las diapositivas). El mismo ejercicio de alineación sirve además como control de la inferencia que sostiene la evaluación, porque obliga a quien enseña a nombrar el desempeño que una calificación pretende avalar (Validez de la evaluación).
- Coautoría y declaración como parte del contrato de evaluación
- La producción como competencia: evaluar la capacidad de quien aprende para dirigir herramientas y producir trabajo de nivel profesional (Knowledge, Skills, Attitudes, Production: Competency-Based Education After Generative AI)
- Evaluar el proceso de interacción, y no solo el artefacto: el marco DRIVE (Directive Reasoning Interaction + Visible Expertise) trata la calidad de la implicación del estudiantado con la IA generativa como el constructo evaluado. Distingue el consumo superficial de la interacción profunda y reflexiva fijándose en si el estudiantado dirige las indicaciones de forma estratégica (DRI) e integra y desarrolla sus propias ideas disciplinares a través del intercambio (VE), y ancla los criterios centrados en el proceso en teorías del aprendizaje autodirigido y de la implicación cognitiva en la línea de la jerarquía ICAP. Esto convierte DRIVE en un ejemplo de evaluación auténtica mediada por IA: una rúbrica para valorar cómo se asocia quien aprende con la IA generativa, y no una herramienta de detección.
Una propuesta de esta literatura va más allá del rediseño dentro del marco actual. El Khoury y Ma (2026) sostienen que una reforma organizada en torno a prevenir la conducta indebida o detectar el uso de IA reduce la imaginación educativa al control y el cumplimiento, y proponen en su lugar la evaluación gozosa: una evaluación segura, emocionalmente receptiva, empoderadora y favorable a la agencia del estudiantado, con la seguridad como condición que lo sostiene todo, porque sin ella la sintonía emocional se vuelve actuación, el empoderamiento se vuelve presión y la agencia se vuelve riesgo. Su marco invierte la agenda de la detección (la integridad pasa a ser una consecuencia de diseñar evaluaciones en las que el estudiantado quiera participar, y no su punto de partida) y sitúa los agentes de IA construidos por el profesorado (GPT personalizados, Gems, agentes de Copilot Studio) como un espacio de ensayo de bajo riesgo donde el estudiantado practica antes del juicio, con la afirmación de que la IA organiza la evidencia mientras quien enseña la interpreta.
Implicaciones para la IA en la educación
-
La evaluación y el aprendizaje son inseparables: una buena evaluación con IA debería apoyar el aprendizaje (retroalimentación formativa) tanto como valorarlo.
-
Hay que reconceptualizar la validez: cuando la IA puede producir el trabajo del estudiantado, las evaluaciones deben medir procesos, juicio y producción auténtica, y no solo productos.
-
La automatización debe evaluarse con rigor: los evaluadores automatizados necesitan evaluación psicométrica y de equidad, y no solo afirmaciones de precisión.
-
La integridad pasa de la detección al diseño: la respuesta más robusta a la IA en la evaluación es diseñar tareas en las que el uso de IA sea esperado, declarado y escrutado.
-
Las prácticas innovadoras pueden abordar varios problemas a la vez. Mesny, Roberge-Maltais y Galy (2026) sostienen que un conjunto de cinco prácticas que se refuerzan entre sí (la evaluación auténtica, la autoevaluación y la evaluación entre pares, la reevaluación, la calificación basada en estándares y el ungrading, es decir, la evaluación sin calificaciones) alineadas con el paradigma de la «evaluación para el aprendizaje» pueden contrarrestar los daños de la calificación tradicional, con mucho peso sumativo y referida a normas (aprendizaje superficial, motivación intrínseca erosionada, estrés y ansiedad, inequidad e integridad comprometida) en la era de la IA generativa. Encuentran que la adopción es desigual entre campos (dominan la autoevaluación y la evaluación entre pares, mientras que las innovaciones centradas en la calificación siguen siendo marginales) e instan al profesorado a implicarse de forma más activa y recíproca con la innovación en evaluación y calificación, respaldado por la experimentación incremental y el apoyo institucional.
-
La evaluación mediada por IA se está diversificando. AIvaluate muestra que un agente conversacional aumentado con LLM redujo la ansiedad del estudiantado durante evaluaciones basadas en el desempeño; Pentland (2026) encuentra que las evaluaciones orales asíncronas ofrecieron una mayor implicación y se percibieron como profesionalmente pertinentes; los ITS basados en grafos usan un seguimiento adaptativo del estado de conocimiento para informar la evaluación.
Conceptos conectados
- Learners — El estudiantado: el paraguas de los conceptos del lado de quien aprende
- Pedagogical Partnerships — Alianzas pedagógicas
- Evaluación formativa — Evaluación formativa: ítems generados por IA, validados y adaptativos a escala
- Automated Assessment — Corrección y puntuación automatizadas en todas las modalidades de evaluación
- Authentic Assessment — Tareas auténticas basadas en procesos y robustas frente a la IA
- Validez de la evaluación — Validez de las evaluaciones con IA generativa
- Educational Measurement — La teoría de la medición que sostiene la evaluación con IA
- Automated Essay Scoring — Corrección automática de ensayos
- Automated Question Generation — Generación automática de preguntas
- Oral Assessment — Evaluación oral: formatos en vivo y grabados que resisten la sustitución por IA
- Summative Assessment — Evaluación sumativa: formatos resistentes a la IA (orales, supervisados, con libros cerrados)
- Item Response Theory — TRI para interpretar las respuestas de evaluación en la era de la IA
- Psychometrically Aware AI — Puntuación con IA consciente de la psicometría
- Analítica del aprendizaje — Analítica que conecta los datos de evaluación con el aprendizaje
- Retroalimentación — Bucles de retroalimentación que cierran el ciclo de la evaluación al aprendizaje
- Feedback Literacy — Alfabetización en retroalimentación de quien aprende
- Integridad académica — Integridad y el debate sobre la detección de IA
- AI Detection — Detección de texto generado por IA
- AI Ed Evaluation — Métodos y puntos de referencia para evaluar a los evaluadores automatizados
- E-Portfolio — Evaluación por portafolio electrónico basada en procesos
- Speech and Voice Technologies
- Peer Assessment
Artículos conectados
- AI Agents, Joyful Assessment, and Third Space: Rethinking Assessment in the GenAI Era — Agentes de IA, evaluación gozosa y tercer espacio
- Designing an Aligned Generative AI Course Policy: An Equitable and Transparent Learner-Centered Approach — Permisos de IA a nivel de tarea derivados de lo que se evalúa (McCorkle 2025)
- Who grades best? Comparing ChatGPT, peer, and instructor evaluations across varying levels of student project quality — Comparar la corrección con ChatGPT, entre pares y del profesorado según el nivel de calidad del proyecto (Usher y Faraon 2026)
- Responsible Assessment in the AI Era: Key Insights from a Future-Focused Conference — La evaluación responsable en la era de la IA
- Beyond Detection: Redesigning Authentic Assessment in an AI-Mediated World — Más allá de la detección: la evaluación auténtica
- Coauthorship integrity: Reconceptualising assessment validity for the age of generative artificial intelligence — La integridad de la coautoría y la validez de la evaluación
- Knowledge, Skills, Attitudes, Production: Competency-Based Education After Generative AI — La educación basada en competencias después de la IA generativa
- Generative AI as a Design Variable: An Evidence-Centered Framework for Principled Governance in STEM Assessment — Gobernanza de la IA generativa en la evaluación centrada en la evidencia
- Confidence Estimation in Automatic Short Answer Grading with LLMs — Corrección automática de respuestas breves
- Reassessing Academic Integrity in the Age of AI: A Systematic Literature Review on AI and Academic Integrity — Revisión sobre integridad y IA: la detección debe ir acompañada de un rediseño de la evaluación
- Reconsidering the Use of Oral Exams and Assessments: An Old Way to Move Into a New Future — Repensar los exámenes orales como evaluación auténtica y resistente a la IA
- Heads We Win, Tails You Lose: AI Detectors in Education — Cara gana, cruz pierdes: los detectores de IA en la educación (Bassett et al. 2026)
- Exploring student anxiety and experience in performance-based assessments using AIvaluate: an LLM-augmented emotionally — AIvaluate: evaluación de la ansiedad del estudiantado aumentada con LLM (2026)
- Intelligent tutoring in dynamic domains: a graph-based system for comparative analysis of adaptive algorithms — Tutoría inteligente basada en grafos para dominios dinámicos (2026)
- Asynchronous Oral Assessments: Enhancing Integrity, Engagement, and Communication in the AI Era — Evaluaciones orales asíncronas en la era de la IA (Pentland 2026)
- Assessing students' DRIVE: A framework to evaluate learning through interactions with generative AI — DRIVE: evaluar el aprendizaje a través de la interacción con IA generativa (DRI + Visible Expertise)
- A Decade of Reflection and Thematic Review on Artificial Intelligence's Impact on Educational Measurement — La IA que reconfigura la práctica de la evaluación
- How university students work on assessment tasks with generative AI: matters of judgement — El juicio del estudiantado al trabajar con IA generativa en tareas de evaluación (26 estudiantes, scroll-back)
- Same tool, different work: patterns of generative AI use and academic outcomes — Patrones de uso de la IA generativa (integración evaluativa frente a adopción con poca verificación) y resultados
- Exploring value judgements in grading: will teachers mark down student work assisted by GenAI, and should they? — Juicios de valor al calificar trabajos asistidos por IA generativa: honestidad, confianza, validez y transparencia bidireccional (Luo y Dawson 2026)
- Estimating Item Difficulty Using Large Language Models and Tree-Based Machine Learning Algorithms — Estimar la dificultad de los ítems con LLM y aprendizaje automático basado en árboles
- Automated Grading of Open-Ended Questions in Higher Education Using GenAI Models
- Innovative assessment and grading practices in higher education: A critical exploration for management educators
- Can Generative Artificial Intelligence Reliably Score Open-Ended Question Assessments in Undergraduate Medical Education?
- Can ChatGPT Replace the Teacher in Assessment? A Review of Research on the Use of Large Language Models in Grading and Providing Feedback
- AI Can Do Your Homework. Now What? Report from an online workshop on computing assessment in the age of generative AI — La IA puede hacer tus deberes. ¿Y ahora qué? Informe de un taller en línea sobre la evaluación en informática en la era de la IA generativa
Preguntas frecuentes relacionadas
- ¿Cómo puedo rediseñar la evaluación para que una calificación siga diciéndome algo defendible sobre lo que el estudiante sabe o puede hacer?
- ¿Cómo puedo reducir las trampas con IA en mi curso?
- ¿Cómo redacto una política de IA para un curso y la comunico al estudiantado?
- ¿Cómo debería manejar la IA en los trabajos grupales y colaborativos?
- ¿Cómo deberíamos diseñar y facilitar cursos en línea asíncronos cuando la IA puede hacer el trabajo?