Conceptos
Medición educativa
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
Medición educativa: la teoría y los métodos psicométricos para cuantificar y validar el aprendizaje y sus constructos, que recorre las páginas de teoría de respuesta al ítem, seguimiento del conocimiento y validez de la evaluación de la base de conocimiento. La era de los LLM obliga a la medición a conciliar la psicometría clásica con los nuevos flujos de respuestas generados por IA: la puntuación automatizada, la dificultad predicha por IA y las trazas multimodales deben validarse contra principios de medición establecidos para preservar la fiabilidad y la validez.
Preguntas para reflexionar
- Un LLM predice que un ítem de examen es fácil, pero los datos empíricos de la prueba dicen que al estudiantado le resulta difícil. ¿A cuál de los dos confiaría, y qué le convencería para confiar en la estimación de la máquina?
- La medición educativa consiste en convertir observaciones del aprendizaje en afirmaciones cuantitativas defendibles. Cuando una IA califica un ensayo o puntúa una respuesta, ¿es una «puntuación» automáticamente una medición, o hay algo que debe validarse antes? ¿El qué?
- Alguna investigación sugiere que los instrumentos de evaluación pueden no medir lo mismo en las personas que en los LLM: la estructura latente diverge. Si los constructos difieren realmente entre personas e IA, ¿qué implica eso para las calificaciones o las valoraciones de dificultad generadas por IA?
- La IA puede puntuar, generar ítems y predecir la dificultad a una escala sin precedentes. ¿Es «más medición» lo mismo que «mejor medición»? ¿Qué hace que una puntuación sea fiable y válida, y pueden preservarse esos estándares cuando la medición la hace un modelo generativo?
- Las referencias comparativas y las puntuaciones generadas por IA están por todas partes. ¿Qué necesitaría ver antes de tratar una evaluación basada en IA como evidencia sobre la comprensión real de quien aprende y no solo como un número?
Introducción
La medición educativa es la disciplina que convierte observaciones sobre el aprendizaje —respuestas, comportamientos, puntuaciones— en afirmaciones cuantitativas defendibles. Abarca la definición de constructos, el diseño de ítems y pruebas, el escalamiento, la fiabilidad y la validez. En la IA en la educación, las cuestiones de medición están por todas partes: ¿mide una puntuación de referencia lo que creemos? ¿Es fiable y válida una calificación generada por IA? ¿Coinciden las dificultades de ítem predichas por IA con las estimadas empíricamente?
Cómo aparece la medición educativa en la investigación
-
Una década de reconfiguración del campo por la IA: Xiong y Li (2026) trazan el impacto de la IA en tres eras (Formativa 2015–2018, Expansión 2019–2022, Generativa 2023–presente) mediante un marco de Eficiencia–Mejora–Transformación, que abarca la IA en la puntuación y la generación de ítems, el modelado psicométrico, la innovación en evaluación y los datos de proceso, y la justicia, la ética y la equidad. Defienden un nuevo paradigma que integre la teoría de la medición con los métodos de IA, y una reconceptualización de los constructos en el contexto de la interacción entre personas y IA: la misma frontera que la comparación de estructuras latentes sondea empíricamente.
-
Dificultad predicha por IA y calibración: la calibración de dificultad con LLM y la predicción de dificultad de ítems usan LLM para estimar la dificultad de los ítems, lo que debe validarse contra las estimaciones psicométricas (véase teoría de respuesta al ítem). Razavi y Powers (2026) añaden una prueba a gran escala de K-5 de esta premisa: en 5.170 ítems de matemática y lectura calibrados bajo el modelo TRI de Rasch, las valoraciones de dificultad de GPT-4o en cero disparos se correlacionaron de moderada a fuertemente con las dificultades verdaderas (r = 0,83 en matemática, r = 0,81 en lectura), pero fueron desiguales entre cursos y no mejores que un regresor ficticio de media por curso para los cursos K y 1. Un enfoque basado en características —características cognitivas y lingüísticas extraídas por LLM e introducidas en modelos basados en árboles— alcanzó correlaciones de hasta r = 0,87, con el nivel de curso y el recuento de palabras como mejores predictores. El estudio ilustra tanto la promesa como los límites de la dificultad predicha por IA como insumo de medición, y ofrece un flujo de trabajo práctico de siete pasos para los profesionales de la evaluación.
-
Conciencia psicométrica en la evaluación con IA: la IA consciente de la psicometría es el estándar de que la evaluación basada en IA se alinee con la teoría de la medición: calibrada, consciente de la incertidumbre y preservadora de la validez (véase evaluación automatizada consciente de la confianza).
-
Puntuación automatizada y validez: la puntuación con IA y el sesgo lingüístico y la estimación multimodal de parámetros de ítem examinan cómo afectan la puntuación automatizada y los datos multimodales a la calidad de la medición.
-
Marcos de validez: la validez de la evaluación y el PLN educativo aportan los estándares y las herramientas para validar la medición basada en LLM.
-
Comparación de estructuras latentes: Strugatski et al. (2026) extienden la medición educativa al entorno de los LLM al comprobar si los instrumentos de evaluación muestran la misma estructura factorial en personas y en LLM. Mediante análisis factorial exploratorio, congruencia factorial y remuestreo, muestran que las estructuras latentes de los LLM y de las personas divergen sistemáticamente en instrumentos de química y de razonamiento cuantitativo, lo que implica que los constructos medidos difieren entre poblaciones: una comprobación necesaria antes de dar por supuesto que la evidencia de validez humana se transfiere a la IA.
-
La IA como evaluador con error medible: Cvengros y Kortemeyer tratan los puntos asignados por IA como observaciones falibles con múltiples fuentes de error (ítems, ejecuciones, tareas) bajo la teoría de la generalizabilidad y la validez basada en argumentos de Kane. El análisis de fiabilidad de un examen manuscrito de química general con 296 estudiantes mostró una alta estabilidad de las puntuaciones totales en cinco ejecuciones de IA (ICC(A,1) = 0,967, W de Kendall = 0,959, coeficiente de repetibilidad del 95 % de 5,33 sobre 60 puntos) con una estabilidad menor a nivel de ítem (ICC(A,1) = 0,836): los errores no sistemáticos se cancelan parcialmente al sumar (un efecto de agregación de Spearman–Brown que eleva la concordancia de la puntuación total a R² = 0,91), mientras que una pequeña ordenada en el origen positiva con pendiente < 1 reveló un sesgo de compresión de puntuaciones de «calificador tímido». Esto enmarca el promedio de ejecuciones y la agregación como decisiones de diseño de la medición, y motiva filtros de confianza calibrados al riesgo de la TRI como salvaguarda de validez antes de confiar en las medidas automatizadas.
-
Una calibración que escala con datos nuevos y no con todo el historial: Jewsbury et al. (2026) afrontan la consecuencia operativa de la generación de ítems por IA: bancos más grandes, más dispersos y actualizados con más frecuencia que los convencionales, donde reajustar todos los datos de respuesta acumulados en cada actualización es costoso y puede exceder la memoria disponible. Su calibración por consenso combina periodos trimestrales calibrados de forma independiente mapeando las extracciones posteriores de cada periodo a una métrica común con un enlace Haebara robusto por extracción (de modo que la incertidumbre del enlace se propague en lugar de tratarse como una transformación fija), y luego agrega como producto de posteriores gaussianas del que se resta la previa estimada y jerárquica de cada periodo y se reinstaura una previa de consenso. Sobre datos operativos del Duolingo English Test en cuatro periodos, el agregado igualó a una referencia agrupada de una sola ejecución en las medias posteriores (r = 0,998 para la dificultad y 0,991 para el logaritmo de la discriminación) y en las desviaciones estándar (r = 0,970 y 0,920), con una subdispersión residual de 0,91–0,98 en la razón de DE de consenso frente a agrupada en los terciles de exposición, concentrada en el tercil de ítems más disperso, donde el recuento excesivo de la previa muerde con más fuerza. La lección de medición es doble: una previa estimada no puede manejarse con los dispositivos estándar de previa por subconjunto de la computación bayesiana paralela, y la dispersión posterior —la incertidumbre que consumen la selección adaptativa y la puntuación— es tanto un objetivo de la corrección como la media posterior.
-
Identificar la dispersión de un sistema a partir de dos cifras publicadas: Restrepo Morales et al. (2026) muestran que la desviación estándar de una distribución de rendimiento puede recuperarse solo a partir de estadísticos resumen publicados —la media y la proporción de estudiantes en el umbral o por encima de un punto de corte fijo de competencia— porque bajo un supuesto distribucional σ = (c − μ) / z(1 − p). Aplicado a PISA 2025 de El Salvador (media de matemática 346, 12,28 % en el corte de nivel 2 de 420,07 o por encima), la σ implícita es 63,8 (lectura 76,8, ciencias 63,8), muy por debajo de la referencia internacional de 100, como cabe esperar de una distribución apretada contra el suelo de la escala; las tres estimaciones se obtuvieron de pares independientes de cifras y se sitúan a unos 13 puntos unas de otras, una comprobación leve de consistencia interna. La proporción en el nivel 2 se publica para todos los sistemas PISA y sustenta el indicador 4.1.1 de los ODS, así que la identificación no necesita microdatos, y el mismo artículo demuestra el problema del denominador en los tamaños del efecto al informar de una brecha en matemática de tres maneras —129 puntos, 1,29 desviaciones estándar internacionales o 2,02 desviaciones estándar de la propia distribución salvadoreña— con el argumento de que los tamaños del efecto estandarizados divididos por la dispersión de su propia muestra no son legítimamente comparables entre estudios.
Instrumentos de medición en la base de conocimiento
Una función central de la medición educativa es el desarrollo, la validación y el uso de instrumentos: las escalas, pruebas y esquemas de codificación concretos que operacionalizan los constructos. Los artículos de la base de conocimiento documentan una amplia gama de instrumentos para constructos de IA en la educación, que pueden clasificarse por lo que miden y por su enfoque de medición.
Instrumentos de alfabetización en IA y en IA generativa
La alfabetización en IA es el constructo con la cobertura de instrumentos más rica de la base de conocimiento. Existen dos grandes familias: las pruebas basadas en el desempeño (objetivas, menos susceptibles al sesgo del autoinforme) y las escalas de autoinforme (subjetivas, que capturan la competencia percibida). Los compromisos de esa segunda familia son el tema de las medidas de autoinforme: el autoinforme llega a las actitudes y las percepciones a bajo coste, pero no puede sostener una afirmación sobre competencia o comportamiento, y la base de conocimiento documenta una brecha de sobreestimación del 40 % cuando se comparan medidas paralelas de autoinforme y de desempeño.
- Medidas basadas en el desempeño (objetivas). La insignia es GLAT (Generative AI Literacy Assessment Test), un instrumento de 20 ítems de opción múltiple construido sobre un plano de 25 conceptos en cuatro dimensiones (Saber y comprender, Usar y aplicar, Evaluar y crear, ética) y validado con TCT + TRI 2PL en 355 estudiantes (RMSEA = 0,03, CFI = 0,97, α = 0,80, ω = 0,81). De forma crítica, las puntuaciones de GLAT predijeron el desempeño en tareas asistidas por IA allí donde el autoinforme no lo hizo: evidencia de que la medición basada en el desempeño supera al autoinforme en alfabetización en IA. Un trabajo relacionado en el desajuste en la evaluación de la alfabetización en IA cuantifica la brecha entre la alfabetización en IA autoinformada y la basada en el desempeño (el profesorado sobreestima en torno a un 40 %), y el rastreo de los patrones de interacción traza patrones reales de interacción entre el estudiantado y la IA en lugar de depender del uso declarado.
- Escalas de autoinforme. SAIL operacionaliza la alfabetización en IA en tres dominios (Conceptos de IA; Habilidades de aplicación y técnicas; Ciudadanía digital con IA) y cuatro niveles andamiados; el heptágono de la alfabetización en IA estructura siete dimensiones (técnica, de aplicación, pensamiento crítico, ética, impacto social, integración, legal y regulatoria) con cuatro niveles de competencia alineados con Bloom. El bypass de habilidades con IA generativa mapea trayectorias divergentes de alfabetización en IA para el estudiantado y el personal, y Panciroli et al. fundamentan la evaluación de la alfabetización en episodios de aprendizaje situado. El desarrollo de instrumentos para quienes aprenden más jóvenes también avanza: el Cuestionario de Autoevaluación de Alfabetización en IA (AIL-SAQ) de Thianwan y Srikoon (2025) es una escala de autoinforme de 15 ítems para estudiantes de 4.º a 6.º curso, organizada en torno a Aprender sobre la IA, Aprender cómo funciona la IA y Aprender para la vida con IA, validada con análisis factorial exploratorio en 335 estudiantes y análisis factorial confirmatorio en 579 más, con un alfa de Cronbach global de 0,934.
- Alfabetización en IA específica del dominio. Teacher education for artificial intelligence literacy through a self-determination theory perspective desarrolla medidas de alfabetización en IA para el profesorado dentro de un marco de teoría de la autodeterminación (382 docentes, validadas factorialmente); Conceptualizing pre-service teachers' readiness for AI integration into teaching practices: An intelligent-TPACK approach mide la preparación del profesorado en formación para la IA mediante el TPACK inteligente; AI literacy alone is not enough: Student AI readiness and career adaptability in business and management education evalúa la preparación en IA del estudiantado y su adaptabilidad profesional en la educación empresarial; y Can Large Language Models Foster Critical Thinking, Teamwork, and Problem-Solving Skills in Higher Education?: A Literature Review revisa instrumentos para resultados de pensamiento crítico y trabajo en equipo apoyados por LLM. Extendiendo la medición hacia el personal educador, la Escala de Alfabetización en IA del Profesorado (TAILS) operacionaliza las seis dimensiones del marco ED-AI para medir la alfabetización en IA específicamente en la formación de profesorado de idiomas (validada con análisis factorial), lo que cubre una carencia de evaluaciones dirigidas al estudiantado o a usuarios generales.
Instrumentos de actitudes, aceptación y motivación
- Aceptación tecnológica. Los instrumentos basados en TAM/UTAUT miden la utilidad percibida, la facilidad de uso y la intención conductual de usar IA. Véanse el modelo de aceptación tecnológica y su aplicación en Acceptance of AI-Assisted English Language Learning Tools in Higher Education: Psychological Correlates Across Disciplinary and Proficiency Groups (herramientas de aprendizaje de inglés asistidas por IA, validación psicométrica entre grupos disciplinares y de nivel) y las trayectorias de adopción de la IA generativa.
- Autoeficacia y motivación. Los instrumentos de autoeficacia y las escalas de motivación (por ejemplo, las medidas basadas en la autodeterminación de autonomía, competencia y vinculación en Teacher education for artificial intelligence literacy through a self-determination theory perspective) capturan los antecedentes y las consecuencias motivacionales del uso de la IA. Conectan con la medición de la implicación y de los conocimientos previos.
- Percepciones del aprendizaje basado en proyectos. Zhu y Kong (2026) desarrollan y validan una escala de aprendizaje basado en proyectos con IA contextualizada (AI-PBLS) que mide las percepciones del estudiantado sobre el ABP cuando usa IA para la resolución de problemas en asignaturas de alfabetización en IA (EFA y CFA en 1.027 estudiantes de secundaria y universidad, 446 completos), y su aplicación de SEM demuestra cómo el empoderamiento y la conciencia ética median las relaciones entre ABP y satisfacción: un instrumento robusto para evaluar las experiencias percibidas de ABP en aplicaciones de IA.
Instrumentos de calidad de la evaluación y validez
- Instrumentos de puntuación automatizada y rúbricas. HARMOGEN-R genera rúbricas de evaluación; AI-assisted, instructor-supervised grading and feedback in higher education: Design and evaluation of an end-to-end pipeline evalúa la calidad de la calificación con IA contra criterios de retroalimentación elaborada; A bit of chaos and madness: The AI Assessment Scale and the work of assessment reform aborda cómo la IA altera las escalas de evaluación tradicionales.
- Diseños que refuerzan la validez. Los gemelos de evaluación emparejan una tarea vulnerable a la IA generativa con una equivalente menos vulnerable que evalúa los mismos resultados, y mapean las amenazas en las seis vertientes de evidencia de validez de Messick.
- Codificación del discurso y de la implicación. Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents extiende el marco ICAP a un esquema de codificación de la implicación cognitiva de 7 puntos, comparando la anotación humana (κ = 0,906–0,998) con el etiquetado basado en LLM (κ = 0,541–0,609): un estudio de instrumento de medición que muestra que la codificación automatizada todavía va por detrás de personas entrenadas. La codificación automatizada también avanza mediante prompts conscientes del contexto, que modelan dependencias contextuales y fusionan habilidades cognitivas y sociales para codificar habilidades de resolución colaborativa de problemas a partir de datos de proceso con un desempeño superior al de referencias sólidas, lo que permite una evaluación a gran escala y en tiempo real a la vez que aborda la intensidad de trabajo de la codificación manual.
- Extracción de habilidades. Principal Trait Analysis: Towards Deriving 'Skills' in Human-AI Collaboration deriva «habilidades» en la colaboración entre personas e IA mediante análisis de rasgos principales: una medición basada en datos de la competencia de colaboración.
El enfoque de medición importa
La evidencia de la base de conocimiento muestra repetidamente que cómo se mide un constructo cambia las conclusiones. La alfabetización en IA autoinformada diverge marcadamente de las medidas basadas en el desempeño (How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures); la anotación de la implicación por LLM diverge de la codificación humana entrenada (Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents); y las estructuras latentes difieren entre personas y LLM (Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis). Por tanto, la validación rigurosa de instrumentos —fiabilidad, validez estructural, validez externa o predictiva— no es una formalidad, sino el fundamento de una evidencia fiable sobre la IA en la educación, y conecta con la validez de la evaluación y con la IA consciente de la psicometría. Un estudio reciente a nivel de material muestra cuánto trabajo de validación hay detrás de una simple afirmación de aceptación: Wang, Chuang y Wu (2026) usaron un diseño de mitades divididas (EFA en una muestra de desarrollo y CFA en la otra mitad reservada) para dos guías de alfabetización en IA por franjas de edad, e informan de KMO = 0,820, 67,3 % de varianza explicada, un ajuste estudiantil aceptable (CFI = 0,943, RMSEA = 0,059, SRMR = 0,059), una fiabilidad compuesta de 0,84 a 0,90 y una invarianza de medición entre ediciones; después documentan dónde se tensa el instrumento, con valores HTMT de hasta 0,950 y una correlación restringida entre ludicidad e intención que tuvo que comprobarse para la unidad. Sus comprobaciones complementarias de funcionamiento diferencial del ítem son un modelo de la honestidad que esta página defiende: la invarianza se mantuvo, pero los patrones de respuesta de baja variación entre el estudiantado más joven hicieron que una diferencia de grupo se debilitara al excluir a esos respondientes, y el artículo lo informa junto al resultado principal y no en lugar de él.
- Los coeficientes de concordancia son propiedades del corpus, y las puntuaciones son productos conjuntos. Una validación de puntuación automatizada de 60 publicaciones de marketing informó de una concordancia absoluta ICC(2,1) de 0,435 para un LLM, 0,266 para un híbrido de reglas más LLM y 0,091 para reglas deterministas, con incertidumbre estimada a partir de 2.000 muestras bootstrap por conglomerados de redactores y un MAE de 6,28-17,22 puntos; añadir anclas redactadas por los investigadores movió la concordancia entre evaluadores de 0,338 a 0,902, lo que muestra hasta qué punto estas estimaciones dependen del conjunto de referencia (Agreement and error in automated scoring of student marketing posts). Una auditoría de recalificación por expertos de referencias de física plantea el punto complementario a nivel de instrumento: el 95,20 % de los rechazos auditados eran errores de la referencia o del calificador y no fallos del modelo, así que una puntuación medida debe informarse como propiedad conjunta del banco de ítems, la rúbrica y el calificador (How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks).
La fiabilidad es en parte recuperable del propio modelo. Organisciak y Acar (2026) evalúan tres mejoras baratas en la puntuación basada en LLM sobre más de 20.000 respuestas al Test de Usos Alternativos: leer la confianza a nivel de token del propio modelo, tomar una media ponderada por probabilidad sobre sus n mejores puntuaciones predichas en lugar de una única mejor conjetura, y hacer un ensamblado entre modelos. Cada una mejoró la concordancia con las puntuaciones humanas (la correlación sube de r = 0,781 a 0,823 y el RMSE cae de 0,599 a 0,498 en la mejor configuración), y sus diagnósticos localizan un fallo concreto de la puntuación de una sola pasada: la confianza expresada por el modelo se relacionaba negativamente con su exactitud (β = −0,602). Este es un resultado sobre el enfoque de medición y no sobre el modelo: el mismo modelo, puntuado de otra manera, es un instrumento más fiable, y se sitúa junto a la evidencia de concordancia a nivel de corpus anterior.
Una valoración de 2026 de 33 instrumentos de alfabetización en IA del profesorado muestra dónde está maduro el desarrollo de instrumentos y dónde no. Zainal, Mohd Matore y Maat (2026) calificaron los instrumentos contra una matriz de decisión adaptada de COSMIN y de Terwee et al. (2007) y encontraron que la consistencia interna era el dominio más fuerte (28 de 33 con grado A, 84,8 %) y la equidad el más débil, con solo cinco instrumentos (15,2 %) que informaban de evidencia de invarianza de medición o de funcionamiento diferencial del ítem. La validez estructural era sólida, con 24 instrumentos (72,7 %) en grado A mediante CFA, PLS-SEM o modelado TRI, pero la validez de contenido se apoyaba sobre todo en la revisión cualitativa, con 21 instrumentos (63,6 %) en grado B por carecer de estadísticos cuantitativos de acuerdo entre expertos.
Problemas y limitaciones: qué puede dejar pasar o hacer mal la medición
La medición educativa es potente pero falible. Entender sus modos de fallo es esencial para leer críticamente la evidencia sobre IA en la educación, y para reconocer dónde una aparente ganancia de aprendizaje o una afirmación sobre un constructo puede ser un artefacto de la medición y no un efecto real.
- Límites de fiabilidad. La medición nunca es perfectamente fiable; la varianza de error siempre está presente. Cuando los instrumentos tienen baja consistencia interna o baja estabilidad test-retest, las diferencias observadas pueden ser ruido. En contextos de IA, nuevos modos de fallo se suman a esto: las respuestas generadas por LLM pueden puntuarse con una alta concordancia entre máquinas y aun así divergir de la puntuación humana (Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents), y la puntuación automatizada puede ser internamente consistente y estar sistemáticamente equivocada: precisión sin validez. Los límites de la medición de la investigación en AIED documentan los instrumentos poco fiables como una debilidad transversal.
- La concordancia entre evaluadores fija el techo práctico. Una validación a gran escala de Acredita EB en Uruguay, con intervención humana, encontró que la concordancia entre evaluadores humanos fija por sí misma el techo práctico de la puntuación con IA: entre diez expertos que puntuaron de forma independiente 50 textos, ningún ítem de la rúbrica alcanzó el acuerdo unánime con el consenso, el evaluador más divergente solía quedar por debajo del 80 % de concordancia mientras que el mejor superaba el 90 %, y el kappa de Cohen fue solo leve o aceptable en varios ítems sesgados que casi todas las respuestas satisfacen. Los autores, por tanto, juzgan las puntuaciones automatizadas contra un estándar de referencia que es a su vez imperfecto —diez evaluadores, una única puntuación operativa para la mayoría de las respuestas y varios ítems en la zona convencional de aceptabilidad del 70 %—, una cautela para cualquier afirmación de medición construida sobre etiquetas operativas de un solo evaluador.
- Validez: medir lo equivocado. La validez pregunta si un instrumento mide el constructo que dice medir. Los fallos comunes incluyen la infrarrepresentación del constructo (una prueba de alfabetización en IA que solo muestrea conocimiento técnico y omite la ética) y la varianza irrelevante al constructo (un ítem que recompensa la fluidez lectora en lugar de la habilidad objetivo). La puntuación con IA y el sesgo lingüístico muestra cómo las características superficiales —lengua, formulación, estilo— pueden determinar puntuaciones automatizadas de maneras ajenas al constructo pretendido. La validez de la evaluación es la barrera de protección contra estas amenazas.
- La brecha del autoinforme. Las medidas de autoinforme capturan la competencia percibida, no la competencia real. La base de conocimiento muestra repetidamente que la alfabetización en IA autoinformada diverge marcadamente de las medidas basadas en el desempeño (How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures, en torno a un 40 % de sobreestimación por parte del profesorado) y que el autoinforme no logra predecir el desempeño real asistido por IA allí donde las pruebas de desempeño sí lo consiguen (GLAT). Las medidas que dependen del autoinforme pueden sobrestimar sistemáticamente los constructos y ocultar brechas reales de habilidad.
- Constructos que no se transfieren entre poblaciones. Strugatski et al. muestran que los instrumentos de evaluación pueden tener una estructura factorial distinta en personas y en LLM, lo que significa que los mismos ítems pueden no medir el mismo constructo latente entre poblaciones. Incluso entre personas, los instrumentos validados en un grupo (por ejemplo, educación superior occidental y con recursos) pueden no generalizarse a otros (Sur global), una preocupación para la generalizabilidad de las medidas de IA en la educación.
- Qué puede dejar pasar la medición. Algunos de los constructos más centrales para el aprendizaje con IA en la educación son los más difíciles de medir bien, y por tanto los más fácilmente omitidos o distorsionados por los instrumentos:
- Proceso y estrategia. Las medidas estándar de resultado capturan el producto del aprendizaje, no el proceso. Pueden dejar pasar cómo se implica realmente el estudiantado con la IA: dependencia excesiva, aceptación irreflexiva o verificación crítica. El rastreo de los patrones de interacción usa trazas de interacción precisamente porque el autoinforme y las pruebas de resultado dejan pasar estas dinámicas.
- Aprendizaje longitudinal y duradero. Un único postest puede mostrar un rendimiento inflado por la asistencia de la IA y a la vez dejar pasar la erosión del conocimiento duradero y sin ayuda (la brecha entre rendimiento y aprendizaje). La medición en un solo momento puede inducir activamente a error sobre el aprendizaje.
- Equidad y acceso. Los instrumentos que presuponen un acceso uniforme a dispositivos y conectividad, o que están normados en muestras privilegiadas, pueden dejar pasar —o medir sistemáticamente de menos— las capacidades de quienes aprenden con pocos recursos, al atribuir erróneamente las brechas de acceso a brechas de capacidad.
- Estados afectivos y motivacionales. La implicación, la motivación y la autoeficacia se miden a menudo por autoinforme, heredando la brecha del autoinforme anterior; pueden no capturar las dinámicas situadas y momentáneas que impulsan el aprendizaje.
- La medición automatizada puede estar equivocada con confianza. La combinación de una alta confianza de la máquina y una puntuación opaca es un riesgo distintivo de la era de la IA: un calificador o anotador LLM puede producir puntuaciones muy autoconsistentes que están sistemáticamente sesgadas, y la apariencia de rigor (N grande, alta concordancia entre LLM) puede enmascarar la falta de validez. Los marcos de evaluación de la IA educativa y de IA consciente de la psicometría son el antídoto: exigen calibración, conciencia de la incertidumbre y evidencia de validez antes de confiar en las medidas automatizadas.
En resumen, la medición educativa puede dejar pasar lo que no muestrea (proceso, durabilidad, acceso, afecto) y puede hacer mal lo que muestrea deficientemente (autopercepción, características superficiales, constructos entre poblaciones). Leer los hallazgos sobre IA en la educación exige por tanto preguntar no solo qué se midió, sino cómo, y qué pudo haber dejado de capturar el instrumento.
- Una codificación auditable separa el error de definición del error del modelo. EduBehaviors descompone un constructo en comportamientos observables anotados por separado más una regla de agregación explícita, de modo que quien revisa puede ver qué evidencia produjo una etiqueta y volver a derivar las etiquetas tras un cambio de regla sin nuevas llamadas al modelo; alcanzó un macro-F1 de 0,673 en Teacher TalkMoves, competitivo con el prompting directo de LLM (Bernado et al., 2026).
Conexiones
La medición educativa es el fundamento de la teoría de respuesta al ítem, la validez de la evaluación, el seguimiento del conocimiento y el modelado del estudiantado. Conecta con la analítica del aprendizaje (medición de datos de aprendizaje), el PLN educativo (medir el lenguaje) y la IA consciente de la psicometría (IA alineada con la teoría de la medición). Sus preocupaciones de validez y fiabilidad sustentan la evaluación de la IA educativa y los límites de la medición del campo. Por los constructos que mide, se cruza con la alfabetización en IA, el modelo de aceptación tecnológica, la autoeficacia, la motivación y la implicación del estudiantado.
- Modelado causal de las intervenciones de apoyo (2026): un protocolo de modelado causal estructural lleva la evaluación educativa más allá de la actualización de creencias asociativa de la teoría de respuesta al ítem hacia el razonamiento interventivo y contrafactual (por ejemplo, el efecto de las pistas), con ecuaciones estructurales elicitadas de expertos mediante información puramente lógica, ilustrado con tareas de habilidades algorítmicas de la escuela obligatoria (Causal Modelling of Support Interventions for Student Competency Assessment).
Conceptos conectados
- Interpretar y aplicar la investigación en AIED
- Teoría de respuesta al ítem
- Validez de la evaluación
- IA psicométricamente consciente
- Seguimiento del conocimiento
- Modelado del estudiantado e instrucción adaptativa
- PLN educativo
- Analítica del aprendizaje
- Evaluación de la IA en educación
- Evaluación automatizada
- Limitaciones de la investigación en AIEd
- Alfabetización en IA
- Modelos de adopción tecnológica
- Autoeficacia
- Punto de referencia
- Medidas de autoinforme
- Motivación
- Implicación del estudiantado
Artículos conectados
- A Human-in-the-Loop Framework for AI-Assisted Scoring in Large-Scale Writing Assessment — Un marco con intervención humana para la puntuación asistida por IA en la evaluación de escritura a gran escala
- Semantic Variability of LLM-Generated Replies Across LLMs: Implications for Designing Conversation-Based Assessment
- Causal Modelling of Support Interventions for Student Competency Assessment — Modelado causal de intervenciones de apoyo para la evaluación de la competencia del estudiantado
- Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis — ¿Miden los instrumentos de evaluación lo mismo en personas y en LLM? (Strugatski et al. 2026)
- GLAT: The Generative AI Literacy Assessment Test — GLAT: prueba de alfabetización en IA generativa validada con TRI (Jin et al. 2025)
- Benchmarking the Pedagogical Knowledge of Large Language Models — Referencia de conocimiento pedagógico de los LLM (CDPK + SEND)
- Validating AI-generated classroom observations: Reliability, accuracy, and limits of LLM-based pedagogical judgment — Fiabilidad y exactitud de la observación de aula con LLM (Melo et al. 2026)
- Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents — Medir la implicación cognitiva con un marco ICAP extendido
- Assessment twins: An approach for strengthening assessment validity in the age of generative AI — Gemelos de evaluación para reforzar la validez de la evaluación ante la IA generativa
- The AI Literacy Heptagon: A Structured Approach to AI Literacy in Higher Education — El heptágono de la alfabetización en IA
- How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures — Desajuste entre la alfabetización en IA autoinformada y la basada en el desempeño
- Teacher education for artificial intelligence literacy through a self-determination theory perspective — Alfabetización en IA del profesorado a través de la teoría de la autodeterminación
- Acceptance of AI-Assisted English Language Learning Tools in Higher Education: Psychological Correlates Across Disciplinary and Proficiency Groups — Medidas de aceptación de la IA para herramientas de aprendizaje de inglés
- From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations — De los modelos evaluados a las ayudas a la evaluación
- Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction — Evaluación cognitiva de la predicción de dificultad de ítems con LLM
- Multimodal Item Parameter Estimation using Simulated Response Probabilities — Estimación multimodal de parámetros de ítem
- AI-based scoring systematically underestimates conceptual understanding of linguistically weak students' explanations in physics — Puntuación con IA y sesgo lingüístico en física
- Analyzing Undergraduate Problem-Solving in Physics Through Interaction With an AI Chatbot — Chatbot socrático de física
- From Student Risk Prediction to SC2R: Semantics-Constrained Counterfactual Recourse for Educational Decision Support — De la predicción del riesgo del estudiantado al SC2R: recurso contrafactual
- The End of Assessment? Disruption and Transformation in the Age of AI
- Automating Learner Assessment: Benchmarking Machine Learning and Deep Learning Models for EEG-Based Familiarity Prediction — Automatizar la evaluación de quien aprende: predicción de familiaridad basada en EEG
- The AI Writes the Code, the Student Writes the Model: A Theory and Measurement Programme for Learning by Construction with Generative AI — Autoría del modelo: teoría y medición del aprendizaje por construcción con IA generativa
- Assessing students' DRIVE: A framework to evaluate learning through interactions with generative AI — DRIVE: evaluar el aprendizaje a través de la interacción con IA generativa (DRI + pericia visible)
- A Decade of Reflection and Thematic Review on Artificial Intelligence's Impact on Educational Measurement — Revisión temática de una década de IA en la medición educativa
- Design and Validation of a Questionnaire on Teachers' Uses of Generative Artificial Intelligence — Cuestionario sobre los usos del profesorado de la IA generativa (Pérez-Montesdeoca et al. 2026)
- Enhancing AI Literacy Course Satisfaction Through Empowerment in AI Problem-Solving and Ethical Awareness: Development and Validation of an AI Project-Based Learning Scale — Escala AI-PBLS; el empoderamiento y la conciencia ética como mediadores entre ABP y satisfacción en asignaturas de alfabetización en IA (Zhu y Kong 2026)
- Context-aware prompting for collaborative problem solving skill identification — Prompts conscientes del contexto para la codificación automatizada de habilidades de resolución colaborativa de problemas
- An Exploratory Machine Learning Approach to Understanding Determinants of Future ChatGPT Use in Higher Education — Determinantes ML/SHAP del uso futuro de ChatGPT en la educación superior
- Personalized neural cognitive architecture search — Búsqueda AutoML de arquitecturas cognitivas neuronales personalizadas para perfiles de quien aprende
- Language teachers’ AI literacy: A psychometric study based on the ED-AI framework — Estudio psicométrico de la Escala de Alfabetización en IA del Profesorado (TAILS) (marco ED-AI)
- Estimating Item Difficulty Using Large Language Models and Tree-Based Machine Learning Algorithms — Estimar la dificultad de los ítems con LLM y aprendizaje automático basado en árboles
- Assisting the grading of a handwritten general chemistry exam with artificial intelligence
- Measuring Acceptance of Age-Tiered AI Literacy Guidebooks: A Developmentally Informed Study of K-12 Students and Teachers — Validación EFA/CFA de mitades divididas con invarianza, HTMT y comprobaciones de DIF, incluida una rendición honesta del solapamiento entre los constructos de ludicidad e intención
- ProIQA: A Process-Based Framework for Fine-Grained Math Item Quality Assessment — ProIQA: evaluación de la calidad de ítems de matemática basada en procesos
- Beyond AI Literacy: A Structured Review and Exploratory Meta-Analysis of Measures for Competent Generative-AI Use — Más allá de la alfabetización en IA: revisión estructurada y metaanálisis exploratorio de las medidas del uso competente de la IA generativa
- Towards Scalable Measurement of Durable Skills — Hacia una medición escalable de las habilidades duraderas
- Bayesian Consensus Calibration of Continuously Evolving IRT Item Banks — Calibración bayesiana por consenso: recalibración de divide y vencerás de un banco de ítems TRI en evolución continua (Jewsbury et al. 2026)
- How much selection would be enough? Bounding the learning claim of El Salvador's artificial intelligence tutoring pilot — Acotar la afirmación de aprendizaje del piloto de tutoría con IA de El Salvador (Restrepo Morales et al. 2026)
- Know When to Trust: Making AI Scoring More Reliable for Educational Assessment — Saber cuándo confiar: la autoconfianza del modelo, la puntuación probabilística y los ensamblados como palancas de fiabilidad de la puntuación
- The AIR Scale: Development and Validation of a Measure of Motivations for Using AI During Reading — La escala AIR: desarrollo y validación de un instrumento para las motivaciones de usar IA al leer
- Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation for Multiple-Choice Questions — criterios de calidad de los distractores y las estrategias de razonamiento que hay detrás
- Development of an AI literacy self-assessment questionnaire in upper primary school students — Un cuestionario de autoevaluación validado de 15 ítems para la alfabetización en IA en primaria superior (Thianwan y Srikoon 2025)
- Assessing teachers' AI literacy: a systematic review of measurement tools — Valoración sistemática de 33 instrumentos de alfabetización en IA del profesorado en dominios de calidad al estilo COSMIN (Zainal et al. 2026)
- Can large language models reproduce higher education grade bands? Cross-model study of calibration and grading bias in authentic student writing — ¿Pueden los grandes modelos de lenguaje reproducir los intervalos de calificación de la educación superior? Estudio entre modelos de la calibración y el sesgo de calificación en escritura estudiantil auténtica
- Mental Health Literacy Across Psychology Students and Large Language Models — Alfabetización en salud mental en estudiantes de psicología y grandes modelos de lenguaje
- StudentBench: AI and human tutoring yield equivalent GRE learning gains — StudentBench: la tutoría con IA y la humana producen ganancias de aprendizaje equivalentes en el GRE
- Student Use of LLMs and the Limits of AI-Generated Question Difficulty in Data Science Courses — El uso de LLM por parte del estudiantado y los límites de la dificultad de pregunta generada por IA en cursos de ciencia de datos
- EduBehaviors: Assertion-based Schemas for Auditable Coding of Educational Dialogues — EduBehaviors: esquemas basados en aserciones para una codificación auditable de diálogos educativos
- From Sentiment Classification to Actionable and Responsible Feedback: A Scoping Review and Evidence Map of NLP in Student Evaluation of Teaching, 2015–2026 — De la clasificación de sentimiento a la retroalimentación accionable y responsable: revisión de alcance y mapa de evidencia del PLN en la evaluación docente por el estudiantado, 2015–2026
- What Fidelity Metrics Miss: A Structural Check on Synthetic Educational Data — Lo que las métricas de fidelidad dejan pasar: una comprobación estructural de los datos educativos sintéticos
- Evaluation of pre-trained models for pedagogical assessment of novel AI-assisted educational questions — Evaluación de modelos preentrenados para la valoración pedagógica de preguntas educativas novedosas asistidas por IA