En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

La validez de la evaluación: si las evaluaciones miden lo que afirman medir. IA en la educación plantea preguntas de validez fundamentales: ¿las evaluaciones calificadas por IA evalúan el aprendizaje del estudiantado o la habilidad de hacer prompts con IA? ¿El uso de la IA invalida los supuestos de la evaluación tradicional?

Preguntas para reflexionar

  • La validez pregunta si una evaluación mide lo que afirma medir. Antes de leer, si viera a un estudiante entregar un ensayo pulido que sospecha que fue asistido por IA, ¿pensaría que el problema mayor era hacer trampa, o que la tarea ya no medía lo que usted creía que medía?
  • Esta página plantea una pregunta incisiva: cuando el estudiantado usa IA, ¿refleja la puntuación el conocimiento del estudiante o su habilidad para hacer prompts con IA? ¿Se le ocurre alguna evaluación que haya diseñado o realizado en la que la puntuación podría estar diciéndole hoy más sobre la herramienta que sobre quien aprende?
  • Un hallazgo clave es que una misma entrada de quien aprende puede recibir respuestas semánticamente distintas según cuál sea el LLM subyacente, lo que introduce una «varianza irrelevante para el constructo» que amenaza la fiabilidad y la equidad. Si dos estudiantes reciben un apoyo de IA distinto solo por el modelo que hay detrás, ¿qué tan justa es la comparación resultante?
  • La página sostiene que, incluso cuando un LLM puntúa bien, transferir las interpretaciones humanas de las puntuaciones exige similitud en la estructura latente de las respuestas, y que los LLM divergen de las personas en ese punto. ¿Qué sugiere esto sobre confiar en una IA que «aprueba» un examen diseñado para personas?
  • En lugar de intentar detectar el uso de IA, la base de conocimiento aboga por rediseñar las evaluaciones para que sigan siendo válidas con estudiantado capaz de usar IA. ¿Por qué rediseñar la tarea podría ser una estrategia que preserva mejor la validez que vigilar si se usó IA?
  • La IA ahora actúa como examinando, diseñadora de exámenes, calificadora y analista, lo que vuelve opaca la cadena interpretativa. Cuando todos los papeles de una evaluación los cubre la IA, ¿qué significa siquiera decir que una evaluación es «válida» para la persona que aprende y que está en medio de ella?

Introducción

Desafíos de validez

  • Validez de constructo: cuando el estudiantado usa IA en las evaluaciones, ¿refleja la puntuación el conocimiento del estudiante o la capacidad de la IA? El rendimiento frente al aprendizaje y la investigación en AIED lo abordan directamente.

  • Varianza irrelevante para el constructo entre LLM en la evaluación basada en conversación: Hao (2026) muestra que, incluso para un solo turno conversacional, el contenido semántico de las respuestas generadas por un Grandes modelos de lenguaje (LLM) varía entre modelos y entre condiciones del contexto conversacional. La similitud dentro de un mismo modelo supera sistemáticamente la similitud entre modelos (0,715-0,795 frente a 0,443-0,604), y añadir el historial de chat cambia de forma significativa el contenido de la respuesta (similitud mediana entre historiales ~0,40-0,45). Como una misma entrada de quien aprende puede recibir respuestas semánticamente distintas según el modelo subyacente, ni el prompt ni el contexto por sí solos bastan para preservar la consistencia de las respuestas, lo que introduce una posible varianza irrelevante para el constructo que amenaza la validez, la fiabilidad y la equidad. Mantener condiciones de evaluación consistentes a medida que evolucionan los LLM es, por tanto, un desafío de infraestructura (reglas simbólicas, plantillas de respuesta, capas de validación), y no solo de ingeniería de prompts.

  • Evidencia que está presente pero nunca llega a quien califica: Abreu, Stari y Martí (2026) nombran una amenaza irrelevante para el constructo que precede a cualquier razonamiento: en la revisión con IA de informes de laboratorio de física experimental, una ecuación, un gráfico, una tabla o una unidad pueden estar correctamente incluidos en un informe y aun así no recuperarse del contenido procesado con el que trabaja el modelo, y, como un signo, un valor o una unidad cambiados alteran la interpretación física, un desacuerdo con el docente no tiene por qué indicar un error de razonamiento. Su remedio es procedimental: PDF de alta resolución en lugar de escaneos fotografiados, ecuaciones escritas en un editor de ecuaciones, ejes y unidades legibles dentro de las figuras, e instrucciones que exijan una cita concreta para cada puntuación, porque la calidad del documento fija el techo de cualquier afirmación de validez que sostenga la puntuación resultante.

  • Validez de la estructura latente entre las personas y los LLM: Strugatski et al. (2026) añaden una condición de validez más profunda: incluso cuando un LLM puntúa bien, transferir las interpretaciones humanas de las puntuaciones exige similitud en la estructura latente de las respuestas. Al comparar seis LLM multimodales con cohortes humanas en instrumentos de química y de razonamiento cuantitativo, encuentran que las estructuras factoriales LLM-persona divergen sistemáticamente (la congruencia LLM-persona queda por debajo de la línea base persona-persona), de modo que el rendimiento en un examen normado con personas es evidencia débil sobre las capacidades de los LLM en los constructos que los ítems pretendían medir.

  • Validez consecuencial: ¿tienen las evaluaciones mediadas por IA consecuencias justas? Los estudios sobre sesgo lingüístico muestran que la calificación con IA puede perjudicar a hablantes no nativos.

  • El alcance de la regla es en sí mismo una propiedad de validez: Wright (2026) sostiene que las prohibiciones escritas en la educación superior desde 2023 prohíben la «IA generativa» sin la precisión técnica necesaria para separar la generación de contenido evaluado de la conversión de un formato, ya que el reconocimiento óptico de caracteres, el reconocimiento de texto manuscrito y el paso de voz a texto son tecnologías de reconocimiento que infieren lo que ya está presente en lugar de producir contenido nuevo. Cuando una regla se ata a la identidad de la plataforma y no a la función, es demasiado inclusiva por un accidente de definición: captura el uso de una herramienta multifunción solo para transcribir y sanciona a un estudiante que no hizo lo que la regla pretendía evitar, y recae con más dureza sobre quienes aprenden y dependen de esas herramientas por accesibilidad, una inferencia que la evaluación no puede sostener sobre el constructo que afirma medir. Propone una redacción basada en funciones más cuatro criterios operativos (fidelidad, no aumento, trazabilidad y atestación) para los casos límite, y trata la dependencia de la salida de los detectores y de las heurísticas de estilo como evidencia de lo débil que es la propia base probatoria de la regla.

  • La finalización agéntica elimina el supuesto de producción humana: Hadjisolomou y El-Haddad (2026) amplían el análisis de validez de la asistencia generativa a la finalización agéntica: los agentes de IA autónomos ya pueden entrar en un LMS, leer los materiales y completar de principio a fin trabajo asíncrono sin supervisión (demostrado en un curso real: un cuestionario puntuado 10/10 en menos de 5 minutos, y una reflexión de foro fabricada pero creíble). Al situar un «supuesto de producción humana» en la base de la cadena de inferencias basada en argumentos de Kane, muestran que la finalización por agentes elimina en silencio el respaldo de la inferencia de puntuación, sobre la que descansan la generalización, la extrapolación y las inferencias de decisión, de modo que toda puntuación asíncrona sin supervisión, incluidas las obtenidas con honestidad, pierde su apoyo interpretativo porque la autoría no es verificable. Su movimiento decisivo es clasificarlo como un fallo de validez y no de integridad: una institución puede sancionar la mala conducta y seguir sin fundamento para las puntuaciones que comunica. La detección es estructuralmente insuficiente (los clasificadores son poco fiables y sesgados; la monitorización del LMS ve los mismos clics que haría un estudiante), así que el remedio es rediseñar la evaluación para verificar la presencia humana (un componente oral breve, borradores con proceso visible, referencias específicas de la sesión de clase), con un menú de opciones que preserve la equidad en lugar de un mandato de supervisión remota.

  • Varianza irrelevante para el constructo en la calificación humana de trabajos asistidos por IA generativa: Luo y Dawson (2026) ofrecen una demostración empírica directa de que la calificación humana de trabajos asistidos por IA generativa está atravesada por varianza irrelevante para el constructo. En entrevistas basadas en escenarios con 33 docentes universitarios, las decisiones de calificación se guiaron por valores orientados a la persona (honestidad y diligencia del estudiante), a la capacidad (independencia respecto de la IA, habilidad con la IA generativa, dominio disciplinar), a la relación (confianza construida con el estudiantado) y a la justicia (equidad, beneficencia), todos los cuales pueden mover la nota por factores ajenos a los resultados evaluados. Penalizar un trabajo asistido por IA generativa está justificado, sostienen, si y solo si el uso de la IA impidió al estudiantado demostrar los resultados evaluados; de lo contrario, calificar movido por valores amenaza la validez. El estudio ancla el marco de validez en la práctica real del profesorado y reclama una «transparencia bidireccional»: que el profesorado aclare cómo afectará a las notas el uso de IA generativa, y no solo que el estudiantado declare ese uso.

  • **La inflación de notas impulsada por la IA como amenaza para la validez:**no solo que el estudiantado declare su uso.

  • La variación a escala exige generar variantes equivalentes en constructo: VARIA (Lee 2026) somete la premisa de la «variación a escala» de la Evaluación Auténtica Integrada con IA (AIAA), es decir, sustituir la supervisión mediante vigilancia por una variación de la tarea para cada estudiante, a una comprobación empírica y falsable. Como cada examinando recibe una tarea de desempeño única pero equivalente, la garantía de integridad es condicional a que los LLM generen variantes que sean a la vez distintas en la superficie, equivalentes en constructo, aplicables con la rúbrica y equiparables en dificultad. Al comparar tres familias de modelos de frontera con cuatro estrategias de prompting sobre 600 variantes, VARIA encuentra que los generadores de frontera cumplen los criterios conjuntos de integridad solo al límite (puntuación conjunta 0,81-0,88), mientras que las referencias no de frontera se derrumban (0,50-0,55), y ninguna estrategia de prompting domina las cuatro propiedades, de modo que «la variación a escala no puede resolverse solo con prompts» si el umbral de diversidad se fija de forma agresiva, y las instituciones deben validar su par específico de modelo y prompt.

  • El sesgo a la baja en la calificación con IA con intervención humana es una característica de validez, no un defecto: Curi et al. (2026) muestran que, en una evaluación nacional de escritura a gran escala, el sesgo sistemáticamente conservador (a la baja) de un calificador LLM, aunque problemático como decisión final, es precisamente lo que permite delegar con seguridad: las respuestas marcadas por la IA como «aprobadas» pueden aceptarse con confianza, mientras que las marcadas como «suspensas» (entre el 15,3% y el 16,5% de los casos) se derivan a revisión experta, lo que mantiene la amenaza de validez del error de la IA fuera del resultado final. Su canalización basada en TRI y Bookmark hace legible el impacto de la calificación con IA sobre el nivel de competencia en lugar de tratar la coincidencia de puntuaciones brutas como la única señal de validez.

  • La inflación de notas impulsada por la IA como amenaza para la validez: Chirikov (2026) identifica un mecanismo nuevo, impulsado por la tecnología, de inflación de notas que opera antes de la calificación, en la producción del trabajo que se califica. En un estudio de diferencias en diferencias sobre más de 500.000 notas en 319 asignaturas (2018-2025), las asignaturas con más tareas expuestas a la IA (escritura, programación) vieron subir la proporción de sobresalientes en 13 puntos porcentuales tras el lanzamiento de ChatGPT, con una compresión de la distribución de notas. Un análisis de triple diferencia muestra que el efecto se concentra en asignaturas con mucha carga de deberes, evidencia de que el desplazamiento de tareas por la IA (la IA realizando tareas calificables antes de que el profesorado las observe) infla las notas sin un aumento correspondiente de la competencia. Esto reduce la comparabilidad de las notas entre asignaturas y erosiona el valor informativo de los expedientes de formas difíciles de detectar solo a partir de las distribuciones de notas.

  • Susceptibilidad a aprobar o suspender a escala de titulación, y los criterios de calificación que la fijan: Ivory et al. (2026) juzgaron la salida de ChatGPT para cada evaluación de curso de un grado de psicología de tres años (40 evaluaciones, 16 tipos) con un aprobado o suspenso binario, la decisión que de hecho toma quien califica en una primera lectura: 36 de 40 aprobaron. Se siguen dos implicaciones de validez. Primera, la variable operativa es el umbral de aprobado, no la detección: una calificación que premia la fluidez estructural y la elección correcta del análisis y a la vez tolera valores incorrectos deja que estadísticas fabricadas y referencias alucinadas superen el umbral, de modo que la evaluación certifica la salida de la herramienta como comprensión del estudiante por cómo se califica y no porque alguien se haya dejado engañar. Segunda, los ítems de opción múltiple filtraban sus propias respuestas: ChatGPT respondió correctamente a preguntas de estadística sin que se le mostraran la figura ni la tabla de salida que se daban al estudiantado, porque el enunciado y las opciones implicaban la respuesta, lo que convierte el diseño de las opciones de respuesta en una propiedad de validez del ítem y no en una propiedad de la IA.

  • Exactitud y concordancia como señales de validez distintas: Falahat, Das, Bhaumik y Thambi (2026) calificaron un examen de farmacia de 21 ítems con ChatGPT-5 y encontraron que una exactitud porcentual moderada coexistía con frecuencia con coeficientes de correlación de concordancia bajos, una distinción metodológica entre exactitud de la puntuación y concordancia que limita la fiabilidad de la IA como sustituto de quien califica incluso cuando la exactitud bruta parece aceptable. La concordancia fue fuerte en ítems objetivos (CCC 0,935-1,000) pero casi nula en respuesta breve y modesta en ensayo (0,341-0,854), y facilitar la rúbrica no cerró la brecha de forma consistente.

  • Validez de los ítems generados por IA: Assessing AI-Generated Exams muestra que las preguntas generadas por IA, validadas mediante TRI bayesiano, alcanzan dificultad y discriminación comparables a las de ítems de exámenes estandarizados escritos por expertos (fiabilidad 0,79 frente a 0,72), lo que respalda la validez de las evaluaciones generadas por IA y adaptadas al curso cuando se apoyan en una evaluación psicométrica.

  • Evaluación auténtica: Authentic Assessment y la Escala de Evaluación con IA proponen rediseños de la evaluación que preservan la validez.

  • Confianza y calibración: los sistemas conscientes de la confianza mejoran la validez al señalar las evaluaciones inciertas.

  • Evidencia corporeizada y multimodal: la evaluación solo de habla puede confundir la fluidez verbal con el conocimiento conceptual; Morphew et al. muestran que el análisis de gestos por visión artificial combinado con el análisis del habla por LLM aumenta la validez de constructo y la equidad al capturar la comprensión expresada mediante gestos, y no solo con palabras, lo que reduce el sesgo contra quienes aprenden y expresan su comprensión de forma no verbal.

  • Los deberes dejan de certificar la capacidad cuando un modelo puede resolver la tarea: Mikhasenko et al. (2026) documentan una invalidación concreta de los deberes como medida de capacidad en un curso de física de partículas en Bochum: una vez que un modelo generativo puede producir una solución correcta, una derivación entregada ya no establece que el estudiante sepa resolver el problema por sí mismo. Su respuesta separa las dos funciones: deberes de corte investigador, con IA permitida, mantenidos como trabajo exploratorio que da puntos extra, y un examen escrito sin herramientas convertido en el único determinante de la nota final, una división del trabajo guiada por la validez y no un régimen de detección.

  • Validez orientada a la decisión para la calificación con IA a escala: Curi et al. (2026) ilustran una visión de la validez orientada a la decisión en la evaluación nacional de escritura Acredita EB: en lugar de preguntar solo si las puntuaciones de la IA coinciden con las humanas, preguntan si los errores de la IA pueden cambiar una decisión de certificación. Los puntos de corte automáticos de TRI/Bookmark reprodujeron de cerca los puntos de corte operativos, y el sesgo sistemático a la baja de la IA se neutralizó derivando los resultados de suspenso de la IA a revisión humana, y todo ello frente a un estándar de referencia que es en sí mismo discutido, ya que diez evaluadores expertos que puntuaron los mismos 50 textos nunca alcanzaron la unanimidad en ningún ítem de la rúbrica.

  • Preocupaciones de validez del lado del estudiantado sobre la IA como calificadora: AlGhamdi (2026) añade la voz de quien aprende a la pregunta por la validez: 13 estudiantes de informática cuya tarea de escritura a mano fue puntuada por ChatGPT cuestionaron si una calificadora de IA puede interpretar válidamente la intención, el esfuerzo y las normas institucionales de calificación; uno de ellos preguntó con agudeza: «Si ChatGPT [es] quien revisa los exámenes, ¿para qué vamos a la universidad?».

  • El permiso por sí solo no degrada la tarea, y las tasas de uso son la señal de validez equivocada: Zou et al. (2026) encuestaron a 85 futuros docentes cuyas evaluaciones permitían explícitamente la IA generativa y encontraron una implicación alta con la evaluación y estadísticamente no afectada por si el estudiantado la usaba o no (media 4,21/5, DE 0,46; Mann-Whitney U = 781,5, r = 0,07, p = 0,536). Con un 62,4% (53) que decidió no usar IA generativa en absoluto y con el uso de quienes la adoptaron limitado en gran medida a la corrección de pruebas (43,8%) y a comprobar la claridad (34,4%), la tasa de adopción aporta poca información sobre si la evaluación seguía justificando una inferencia sobre el aprendizaje, y el no uso motivado por el miedo a una acusación injusta de plagio (el 41,5% de quienes no la adoptaron) tampoco es evidencia de validez.

  • Validez del marco de muestreo cuando un test de centro se lee como evidencia de sistema: Restrepo Morales et al. (2026) dan un tratamiento cuantitativo a la inferencia que va de las puntuaciones a afirmaciones sobre un sistema. Una evaluación piloto con 1.198 estudiantes voluntarios de 171 centros salvadoreños con el Test for Schools basado en PISA produjo resultados anunciados como comparables a los de Alemania y Suecia, pero el instrumento produce estimaciones para un centro y no se administra bajo el marco de muestreo nacional con sus estándares de tasa de respuesta, límites de exclusión y ponderaciones, de modo que una comparación entre una estimación de centro y una media de país arrastra al menos tres fuentes de incertidumbre no declaradas (el error de muestreo del centro, el error de muestreo de la media del país y el error de enlace del equiparado de la escala). En lugar de poner a prueba la afirmación sobre el aprendizaje, los autores la acotan: con el 5,5% superior de la distribución salvadoreña de matemáticas igualando la media alemana bajo un aprendizaje nulo, y con la participación voluntaria entendida como un sesgo al alza en las pruebas de rendimiento, la evidencia publicada no puede separar un efecto real de una muestra seleccionada. Es un fallo de la inferencia de validez de la comparación, no de los estudiantes ni del instrumento.

Una propuesta conceptual plantea un límite de validez que se aplica a todas las evaluaciones mediadas por IA de esta página: El Khoury y Ma (2026) sostienen que la velocidad no es validez, y que los prompts, los ejemplos y los informes basados en transcripciones generados por IA todavía deben probarse en cuanto a exactitud, sensibilidad cultural, accesibilidad, interpretabilidad y alineación con los resultados del curso. También amplían lo que cuenta como evidencia: cuando el diálogo se convierte en el artefacto evaluado, la transcripción es un registro del proceso en el que el juicio, la empatía, la clarificación y la toma de decisiones compartida se despliegan en contexto, y la pregunta de diseño pasa a ser si esa evidencia sostiene la inferencia que se extrae de ella, la misma pregunta que afronta la calificación automatizada, respondida por la alineación entre la tarea, la retroalimentación y la evidencia de aprendizaje y no por la novedad tecnológica.

  • Los metadatos de ítems asignados por IA no son evidencia psicométrica. En un estudio de 10 semanas de ciencia de datos sobre 311 ítems de opción múltiple desplegados, las valoraciones de dificultad del LLM seguían sus propias etiquetas de Bloom (rho = 0,90) pero no la dificultad empírica de los ítems (rho = 0,06), así que la dificultad de un ítem debe establecerse a partir de los datos de respuesta y no de las etiquetas del modelo que lo generó (An y Wang, 2026).

Rediseño en lugar de detección

La base de conocimiento sostiene que mantener la validez de la evaluación exige rediseñar las evaluaciones para estudiantado capaz de usar IA, y no detectar el uso de IA. Un problema de validez paralelo recorre la medición en la investigación: muchas afirmaciones sobre IA en la educación se apoyan en datos de autoinforme, que no pueden sostener una inferencia sobre el aprendizaje o la competencia por bien que se valide el instrumento. Los enfoques que van más allá de la detección y la evaluación representan un pensamiento orientado a la validez.

Productos para llevar a casa y la división cualitativa y cuantitativa. Brunnström y Palmqvist (2026) dan al argumento del rediseño una propuesta concreta anclada en la taxonomía SOLO. Al trabajar con un chatbot una pregunta de examen para llevar a casa de ciencias cognitivas, encuentran que la IA generativa es más fuerte justo donde la taxonomía es más baja, produciendo contenido amplio, fluido y de tipo factual en el nivel cuantitativo (multiestructural), mientras que el nivel cualitativo (relacionar, evaluar, generalizar) solo emergió mediante una calibración repetida y dirigida por quien aprende. Su recomendación se diferencia, por tanto, según el constructo: las evaluaciones para llevar a casa deberían enfatizar la evidencia de comprensión cualitativa, mientras que el conocimiento cuantitativo basado en el recuerdo se evalúa mejor en clase, donde la IA generativa no está disponible. La demostración subraya además que un artefacto entregado y pulido es evidencia débil en cualquiera de las dos direcciones, y que un rediseño válido debe tener en cuenta lo exigente que resulta un aprendizaje legítimo apoyado por IA (evaluación sumativa, integridad académica).

Una contraparte en el plano del diseño viene de la misma población que el argumento del rediseño suele ignorar. Zou et al. (2026) encontraron que las tareas reflexivas y personalizadas se juzgaban mayoritariamente demasiado personales para la ayuda de la IA, mientras que una evaluación cargada de conocimiento en otra asignatura suscitó una fuerte intención de usar IA generativa para las referencias, de modo que lo que el estudiantado hacía con la IA seguía al constructo que la tarea le pedía evidenciar. La lección para la validez es precisa y no celebratoria: el diseño puede eliminar el beneficio de la sustitución genérica, pero el mismo estudio advierte contra leer una cohorte que se autoexcluye como prueba de que lo logró, ya que una parte sustancial del no uso se atribuyó al miedo a una acusación injusta de plagio y no a que la tarea resistiera a la IA.

Sharma (2026) aporta un argumento de rediseño desde el lado de la integridad que convierte la evidencia de integridad en evidencia de validez. Extendiendo el marco del posplagio de Eaton (2023) al diseño de la evaluación, sostiene que los modelos de integridad basados en la detección y la verificación están desalineados con un trabajo en el que el juicio humano y la generación automática están entrelazados, y reencuadra la integridad como una práctica pedagógica que se ejerce mediante el juicio evaluativo, la capacidad de sopesar opciones, justificar decisiones académicas y asumir responsabilidad en condiciones de incertidumbre epistémica. La consecuencia de diseño es que la integridad debería evidenciarse en lugar de inferirse: los rastros de decisión anotados, la verificación de las afirmaciones aportadas por IA generativa, la defensa oral y el historial de versiones se ofrecen como artefactos de integridad, y es explícito en que la diferencia con la evaluación auténtica es epistémica: la autenticidad pregunta si una tarea refleja la práctica del mundo real, mientras que el diseño orientado a la integridad pregunta si quien aprende puede justificar sus decisiones y asumir responsabilidad frente a los estándares de la disciplina, de modo que la integridad se convierte en un criterio evaluable incrustado en la arquitectura de la tarea. Nombra el riesgo de validez de su propia propuesta en lugar de dejarlo implícito: exigir razonamiento documentado privilegia a quienes dominan el discurso reflexivo y arriesga «la sustitución de un régimen de cumplimiento por otro», porque el juicio como evidencia «sigue siendo relacional y situado, y no verificable mecánicamente», el mismo problema de fiabilidad interpretativa que esta página registra para toda evaluación mediada por IA.

Weidlich (2026) reencuadra el rediseño como la pregunta de qué inferencia pretende proteger un cambio. Partiendo de la validez basada en argumentos de Kane, separa cinco presiones que el debate tiende a fundir en una: subrepresentación del constructo, varianza irrelevante para el constructo, atribución del desempeño, extrapolación condicional y uso no respaldado de las puntuaciones. El uso de IA no es automáticamente una amenaza, porque el uso de herramientas es pertinente cuando el constructo previsto es el juicio profesional apoyado por IA, y esquiva el desempeño objetivo cuando lo previsto es el razonamiento sin ayuda, así que el constructo y las condiciones de uso de la IA deben especificarse juntos. De ahí su cautela ante el rediseño, ya que las intervenciones intercambian una presión por otra: las defensas orales pueden reforzar la atribución y a la vez reducir la fiabilidad o la accesibilidad.

Conexiones

La validez de la evaluación se conecta con la evaluación auténtica, la calificación automatizada, la evaluación con IA consciente de la confianza, la evaluación formativa, la integridad académica y los ensayos controlados aleatorizados (que dependen de medidas de resultado válidas).

La IA desafía la validez en el plano epistémico: Hathcoat, Slotnick y Miller (2026) sostienen que, cuando los LLM actúan como examinandos, diseñadores de exámenes, calificadores y analistas, la cadena interpretativa se vuelve opaca y el objeto de medición pierde definición, lo que reencuadra la validez como algo que exige un juicio «cyborg» competente en IA, y Green et al. (2026) muestran que las puntuaciones de la IA pueden alinearse con las de evaluadores humanos (87% en la lista de verificación) mientras la justificación subyacente diverge, sobre todo en la calidad de la medición y en los informes débiles.

Cuando la IA genera el artefacto evaluable. Kumar, Wongsirichot y Nanthaamornphong (2026) dan al problema de validez su caso disciplinar más nítido: en la educación en informática la IA produce el artefacto que se califica, el código fuente, así que el uso de la herramienta, el aprendizaje y la evaluación se funden en una sola interacción, y un repositorio de código entregado ya no separa el aprendizaje de la delegación. En 72 estudios encuentran ganancias de eficiencia que no se transfieren al desempeño sin ayuda (21 estudios), conocimientos previos que moderan si la ayuda de la IA se convierte en habilidad (6 estudios) y una investigación sobre detección prácticamente ausente del corpus de evidencia (3 estudios), mientras que el rediseño de la evaluación está comparativamente bien evidenciado (25 estudios). Su conclusión para la práctica es específica del constructo y de baja tecnología: añadir un componente oral u otro elemento de proceso visible al menos a una evaluación de alto impacto por asignatura, la intervención de mayor palanca de toda la revisión, y exigir una implicación crítica con la salida de la IA como componente calificado y observable, y no como disposición opcional (integridad académica, evaluación).

La validez bajo información imperfecta

El reencuadre reciente más agudo trata el problema de la IA generativa como un problema probatorio. El estudiante sabe cómo se produjo un trabajo; la institución observa el artefacto y, en el mejor de los casos, rastros parciales del proceso, una brecha entre producto y proceso que Mohamed y Temimi (2026) formalizan como validez de la evaluación bajo información imperfecta. Desde este enfoque la pregunta no es si se incumplió una norma, sino si la evaluación sigue generando evidencia creíble del razonamiento, el esfuerzo y el juicio del estudiante, y cada mecanismo institucional (prohibición, monitorización, declaración, rediseño) se evalúa por la respuesta del estudiantado que vuelve más atractiva. La lente de la validez también disuelve una falsa separación: la integridad y la validez son el mismo problema visto desde extremos distintos, porque una conclusión de mala conducta es en sí misma una afirmación de validez sobre lo que el trabajo evidencia.

Un marco del lado de quien aprende nombra los objetivos de inferencia que un artefacto no puede resolver por sí solo. Sak (2026) propone la validez atribucional para los juicios sobre el potencial de estudiantes con altas capacidades a partir de trabajo asistido por IA: la relación entre capacidad y producto es de muchos a uno, porque la competencia de quien aprende, la capacidad del modelo, la dirección que imprime la persona, el ajuste entre persona y IA y el contexto se combinan de formas distintas para dar artefactos equivalentes, así que el producto no puede identificar la capacidad que hay detrás. El marco separa cuatro objetivos de inferencia (competencia independiente, agencia intelectual, capacidad híbrida y transferencia evolutiva) y nombra tres errores que se siguen cuando la evidencia de un objetivo se lee como la de otro: sobre atribución, ilusión evolutiva y equivalencia de capacidad presupuesta. Su exigencia sobre el registro refleja la disciplina probatoria que esta sección toma de la literatura sobre mala conducta: nombrar la capacidad sobre la que trata el juicio, documentar cómo se produjo el trabajo (modelo y versión, interfaz, funciones permitidas, mediación adulta, condiciones de acceso) y exigir evidencia posterior de transferencia antes de leer el desempeño asistido como un cambio en quien aprende.

Teichmann (2026) extrae la consecuencia procedimental: cuando el uso prohibido no puede detectarse, un régimen que aun así acusa basándose en las puntuaciones de un detector no puede respaldar la inferencia que extrae, y por tanto produce injusticia sin eficacia. Aboga por sustituir la pregunta forense (¿usó el estudiante IA?) por una pregunta de validez (¿demostró el estudiante la capacidad que la tarea pretendía certificar?), lo que reubica el esfuerzo institucional en la evaluación a escala de titulación a lo largo de tareas enlazadas, en elementos orales y supervisados en los puntos de certificación, y en el juicio evaluativo como objeto explícito de evaluación.

La misma sección del corpus de evidencia aporta la contraparte de los expedientes de caso, y resulta más incómoda que la literatura sobre detección por sí sola. Munoz et al. (2026) codificaron todos los casos de mala conducta con IA generativa de una universidad regional australiana a lo largo de tres años (1.162 casos con 1.855 elementos de evidencia distintos) y valoraron cada elemento por su valor probatorio en cuanto a relevancia, credibilidad y fuerza inferencial. Las categorías más fuertes fueron las que no dependen de una clasificación probabilística del texto (admisiones del estudiantado, conducta prohibida observada en examen y referencias fabricadas verificadas de forma independiente), mientras que la salida de los detectores obtuvo las valoraciones más débiles de todas las categorías: los informes de similitud o de Turnitin fueron del todo débiles en fuerza inferencial y las salidas de detectores por sí solas, del todo bajas en credibilidad, pasando del 8,8% de los elementos en 2024 al 0,5% en 2025. El fallo de validez es procedimental tanto como instrumental: ninguna etapa de la canalización fijó un umbral probatorio mínimo ni exigió a quienes investigaban ponderar el valor probatorio antes de dar curso a una acusación, así que la calidad de la evidencia no mostró una relación fiable con el desenlace de los casos, que es exactamente el problema de estándar probatorio catalogado en cuestiones legales y riesgos. Su propuesta de aplicar un marco de credenciales en el momento de la acusación y no solo en la determinación es una exigencia de validez: una acusación es una afirmación sobre lo que el trabajo evidencia, y debería estar respaldada por materiales capaces de sostenerla. Hadra, Cambridge y Mesbah (2026) muestran lo lejos que está el instrumento de ese estándar, con una exactitud macro de 0,69 (Originality) frente a 0,61 (Turnitin) en 192 textos, un fallo casi total en escritura híbrida persona-IA (sensibilidad 0,02 y 0,31), una exactitud que decae con la longitud del texto y en escritura científica, y una tendencia límite a clasificar como IA la escritura de estudiantes de inglés como lengua extranjera, de modo que la puntuación de un detector no puede establecer el hecho que afirma una conclusión de mala conducta.

El punto de referencia de la calificación humana y su techo

La comparación de OpRaise de tres modelos de frontera con 761 ensayos auténticos de tres universidades del Reino Unido hace que el punto de referencia forme parte del argumento de validez. Las notas humanas se usaron como verdad de referencia con el argumento explícito de que el juicio académico es el estándar socialmente aceptado, mientras los autores reconocen que quienes califican a mano coinciden entre sí solo de forma moderada, lo que fija un techo a la concordancia IA-persona que cabría exigir razonablemente y significa que una correlación no puede leerse como un listo o no listo sin un punto de referencia. Dentro de ese marco, los fallos aparecieron como estructura sistemática y no como error aleatorio: las notas se comprimían hacia el centro de la escala, de modo que los mejores y los peores ensayos eran los peor juzgados; la concordancia era más débil en las fronteras entre notas; y las notas de la IA seguían la amplitud de vocabulario, los conectores y la complejidad oracional, a los que las notas humanas eran en general insensibles. La lección práctica es de doble filo, porque el mismo estudio encontró una fiabilidad excelente: recalificaciones idénticas a lo largo del tiempo y una concordancia alta entre modelos. Un argumento de validez a favor de la calificación automatizada no puede, por tanto, apoyarse en la estabilidad ni en la concordancia media; tiene que mostrar la ausencia de desviación sistemática, que es exactamente lo que esta evidencia no encontró.

  • La concordancia y el error del punto de referencia se disfrazan de aprendizaje. Dos estudios de 2026 muestran rutas distintas por las que una puntuación puede parecer válida mientras establece otra cosa. Un estudio de escritura de marketing de respuesta abierta encontró una concordancia absoluta LLM-persona de solo ICC(2,1) ,435 y un híbrido significativamente peor que el LLM por sí solo, con una composición de anclaje que movió la concordancia de ,338 a ,902 (Agreement and error in automated scoring of student marketing posts). Una auditoría experta de seis puntos de referencia de física atribuyó el 95,20% de los rechazos auditados a ítems o calificadores defectuosos y no a error del modelo, moviendo la media@5 de CritPt del 32,29% al 87,50% (How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks). En ambos casos la amenaza es varianza irrelevante para el constructo y ajena al modelo que se puntúa.
  • La concordancia entre codificadores LLM es consistencia, no validez. En un corpus de diálogo educativo etiquetado por expertos, un filtro de concordancia entre modelos retuvo solo 33 de 74 afirmaciones conductuales derivadas del corpus y 11 de 48 derivadas de constructos, y los errores compartidos por los modelos sobrevivieron al filtro, así que la concordancia entre modelos no puede sustituir a la validez de constructo (Bernado et al., 2026).

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.