En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

Medición educativa: la teoría y los métodos psicométricos para cuantificar y validar el aprendizaje y sus constructos, que recorre las páginas de teoría de respuesta al ítem, seguimiento del conocimiento y validez de la evaluación de la base de conocimiento. La era de los LLM obliga a la medición a conciliar la psicometría clásica con los nuevos flujos de respuestas generados por IA: la puntuación automatizada, la dificultad predicha por IA y las trazas multimodales deben validarse contra principios de medición establecidos para preservar la fiabilidad y la validez.

Preguntas para reflexionar

  • Un LLM predice que un ítem de examen es fácil, pero los datos empíricos de la prueba dicen que al estudiantado le resulta difícil. ¿A cuál de los dos confiaría, y qué le convencería para confiar en la estimación de la máquina?
  • La medición educativa consiste en convertir observaciones del aprendizaje en afirmaciones cuantitativas defendibles. Cuando una IA califica un ensayo o puntúa una respuesta, ¿es una «puntuación» automáticamente una medición, o hay algo que debe validarse antes? ¿El qué?
  • Alguna investigación sugiere que los instrumentos de evaluación pueden no medir lo mismo en las personas que en los LLM: la estructura latente diverge. Si los constructos difieren realmente entre personas e IA, ¿qué implica eso para las calificaciones o las valoraciones de dificultad generadas por IA?
  • La IA puede puntuar, generar ítems y predecir la dificultad a una escala sin precedentes. ¿Es «más medición» lo mismo que «mejor medición»? ¿Qué hace que una puntuación sea fiable y válida, y pueden preservarse esos estándares cuando la medición la hace un modelo generativo?
  • Las referencias comparativas y las puntuaciones generadas por IA están por todas partes. ¿Qué necesitaría ver antes de tratar una evaluación basada en IA como evidencia sobre la comprensión real de quien aprende y no solo como un número?

Introducción

La medición educativa es la disciplina que convierte observaciones sobre el aprendizaje —respuestas, comportamientos, puntuaciones— en afirmaciones cuantitativas defendibles. Abarca la definición de constructos, el diseño de ítems y pruebas, el escalamiento, la fiabilidad y la validez. En la IA en la educación, las cuestiones de medición están por todas partes: ¿mide una puntuación de referencia lo que creemos? ¿Es fiable y válida una calificación generada por IA? ¿Coinciden las dificultades de ítem predichas por IA con las estimadas empíricamente?

Cómo aparece la medición educativa en la investigación

  • Una década de reconfiguración del campo por la IA: Xiong y Li (2026) trazan el impacto de la IA en tres eras (Formativa 2015–2018, Expansión 2019–2022, Generativa 2023–presente) mediante un marco de Eficiencia–Mejora–Transformación, que abarca la IA en la puntuación y la generación de ítems, el modelado psicométrico, la innovación en evaluación y los datos de proceso, y la justicia, la ética y la equidad. Defienden un nuevo paradigma que integre la teoría de la medición con los métodos de IA, y una reconceptualización de los constructos en el contexto de la interacción entre personas y IA: la misma frontera que la comparación de estructuras latentes sondea empíricamente.

  • Dificultad predicha por IA y calibración: la calibración de dificultad con LLM y la predicción de dificultad de ítems usan LLM para estimar la dificultad de los ítems, lo que debe validarse contra las estimaciones psicométricas (véase teoría de respuesta al ítem). Razavi y Powers (2026) añaden una prueba a gran escala de K-5 de esta premisa: en 5.170 ítems de matemática y lectura calibrados bajo el modelo TRI de Rasch, las valoraciones de dificultad de GPT-4o en cero disparos se correlacionaron de moderada a fuertemente con las dificultades verdaderas (r = 0,83 en matemática, r = 0,81 en lectura), pero fueron desiguales entre cursos y no mejores que un regresor ficticio de media por curso para los cursos K y 1. Un enfoque basado en características —características cognitivas y lingüísticas extraídas por LLM e introducidas en modelos basados en árboles— alcanzó correlaciones de hasta r = 0,87, con el nivel de curso y el recuento de palabras como mejores predictores. El estudio ilustra tanto la promesa como los límites de la dificultad predicha por IA como insumo de medición, y ofrece un flujo de trabajo práctico de siete pasos para los profesionales de la evaluación.

  • Conciencia psicométrica en la evaluación con IA: la IA consciente de la psicometría es el estándar de que la evaluación basada en IA se alinee con la teoría de la medición: calibrada, consciente de la incertidumbre y preservadora de la validez (véase evaluación automatizada consciente de la confianza).

  • Puntuación automatizada y validez: la puntuación con IA y el sesgo lingüístico y la estimación multimodal de parámetros de ítem examinan cómo afectan la puntuación automatizada y los datos multimodales a la calidad de la medición.

  • Marcos de validez: la validez de la evaluación y el PLN educativo aportan los estándares y las herramientas para validar la medición basada en LLM.

  • Comparación de estructuras latentes: Strugatski et al. (2026) extienden la medición educativa al entorno de los LLM al comprobar si los instrumentos de evaluación muestran la misma estructura factorial en personas y en LLM. Mediante análisis factorial exploratorio, congruencia factorial y remuestreo, muestran que las estructuras latentes de los LLM y de las personas divergen sistemáticamente en instrumentos de química y de razonamiento cuantitativo, lo que implica que los constructos medidos difieren entre poblaciones: una comprobación necesaria antes de dar por supuesto que la evidencia de validez humana se transfiere a la IA.

  • La IA como evaluador con error medible: Cvengros y Kortemeyer tratan los puntos asignados por IA como observaciones falibles con múltiples fuentes de error (ítems, ejecuciones, tareas) bajo la teoría de la generalizabilidad y la validez basada en argumentos de Kane. El análisis de fiabilidad de un examen manuscrito de química general con 296 estudiantes mostró una alta estabilidad de las puntuaciones totales en cinco ejecuciones de IA (ICC(A,1) = 0,967, W de Kendall = 0,959, coeficiente de repetibilidad del 95 % de 5,33 sobre 60 puntos) con una estabilidad menor a nivel de ítem (ICC(A,1) = 0,836): los errores no sistemáticos se cancelan parcialmente al sumar (un efecto de agregación de Spearman–Brown que eleva la concordancia de la puntuación total a R² = 0,91), mientras que una pequeña ordenada en el origen positiva con pendiente < 1 reveló un sesgo de compresión de puntuaciones de «calificador tímido». Esto enmarca el promedio de ejecuciones y la agregación como decisiones de diseño de la medición, y motiva filtros de confianza calibrados al riesgo de la TRI como salvaguarda de validez antes de confiar en las medidas automatizadas.

  • Una calibración que escala con datos nuevos y no con todo el historial: Jewsbury et al. (2026) afrontan la consecuencia operativa de la generación de ítems por IA: bancos más grandes, más dispersos y actualizados con más frecuencia que los convencionales, donde reajustar todos los datos de respuesta acumulados en cada actualización es costoso y puede exceder la memoria disponible. Su calibración por consenso combina periodos trimestrales calibrados de forma independiente mapeando las extracciones posteriores de cada periodo a una métrica común con un enlace Haebara robusto por extracción (de modo que la incertidumbre del enlace se propague en lugar de tratarse como una transformación fija), y luego agrega como producto de posteriores gaussianas del que se resta la previa estimada y jerárquica de cada periodo y se reinstaura una previa de consenso. Sobre datos operativos del Duolingo English Test en cuatro periodos, el agregado igualó a una referencia agrupada de una sola ejecución en las medias posteriores (r = 0,998 para la dificultad y 0,991 para el logaritmo de la discriminación) y en las desviaciones estándar (r = 0,970 y 0,920), con una subdispersión residual de 0,91–0,98 en la razón de DE de consenso frente a agrupada en los terciles de exposición, concentrada en el tercil de ítems más disperso, donde el recuento excesivo de la previa muerde con más fuerza. La lección de medición es doble: una previa estimada no puede manejarse con los dispositivos estándar de previa por subconjunto de la computación bayesiana paralela, y la dispersión posterior —la incertidumbre que consumen la selección adaptativa y la puntuación— es tanto un objetivo de la corrección como la media posterior.

  • Identificar la dispersión de un sistema a partir de dos cifras publicadas: Restrepo Morales et al. (2026) muestran que la desviación estándar de una distribución de rendimiento puede recuperarse solo a partir de estadísticos resumen publicados —la media y la proporción de estudiantes en el umbral o por encima de un punto de corte fijo de competencia— porque bajo un supuesto distribucional σ = (c − μ) / z(1 − p). Aplicado a PISA 2025 de El Salvador (media de matemática 346, 12,28 % en el corte de nivel 2 de 420,07 o por encima), la σ implícita es 63,8 (lectura 76,8, ciencias 63,8), muy por debajo de la referencia internacional de 100, como cabe esperar de una distribución apretada contra el suelo de la escala; las tres estimaciones se obtuvieron de pares independientes de cifras y se sitúan a unos 13 puntos unas de otras, una comprobación leve de consistencia interna. La proporción en el nivel 2 se publica para todos los sistemas PISA y sustenta el indicador 4.1.1 de los ODS, así que la identificación no necesita microdatos, y el mismo artículo demuestra el problema del denominador en los tamaños del efecto al informar de una brecha en matemática de tres maneras —129 puntos, 1,29 desviaciones estándar internacionales o 2,02 desviaciones estándar de la propia distribución salvadoreña— con el argumento de que los tamaños del efecto estandarizados divididos por la dispersión de su propia muestra no son legítimamente comparables entre estudios.

Instrumentos de medición en la base de conocimiento

Una función central de la medición educativa es el desarrollo, la validación y el uso de instrumentos: las escalas, pruebas y esquemas de codificación concretos que operacionalizan los constructos. Los artículos de la base de conocimiento documentan una amplia gama de instrumentos para constructos de IA en la educación, que pueden clasificarse por lo que miden y por su enfoque de medición.

Instrumentos de alfabetización en IA y en IA generativa

La alfabetización en IA es el constructo con la cobertura de instrumentos más rica de la base de conocimiento. Existen dos grandes familias: las pruebas basadas en el desempeño (objetivas, menos susceptibles al sesgo del autoinforme) y las escalas de autoinforme (subjetivas, que capturan la competencia percibida). Los compromisos de esa segunda familia son el tema de las medidas de autoinforme: el autoinforme llega a las actitudes y las percepciones a bajo coste, pero no puede sostener una afirmación sobre competencia o comportamiento, y la base de conocimiento documenta una brecha de sobreestimación del 40 % cuando se comparan medidas paralelas de autoinforme y de desempeño.

Instrumentos de actitudes, aceptación y motivación

Instrumentos de calidad de la evaluación y validez

El enfoque de medición importa

La evidencia de la base de conocimiento muestra repetidamente que cómo se mide un constructo cambia las conclusiones. La alfabetización en IA autoinformada diverge marcadamente de las medidas basadas en el desempeño (How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures); la anotación de la implicación por LLM diverge de la codificación humana entrenada (Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents); y las estructuras latentes difieren entre personas y LLM (Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis). Por tanto, la validación rigurosa de instrumentos —fiabilidad, validez estructural, validez externa o predictiva— no es una formalidad, sino el fundamento de una evidencia fiable sobre la IA en la educación, y conecta con la validez de la evaluación y con la IA consciente de la psicometría. Un estudio reciente a nivel de material muestra cuánto trabajo de validación hay detrás de una simple afirmación de aceptación: Wang, Chuang y Wu (2026) usaron un diseño de mitades divididas (EFA en una muestra de desarrollo y CFA en la otra mitad reservada) para dos guías de alfabetización en IA por franjas de edad, e informan de KMO = 0,820, 67,3 % de varianza explicada, un ajuste estudiantil aceptable (CFI = 0,943, RMSEA = 0,059, SRMR = 0,059), una fiabilidad compuesta de 0,84 a 0,90 y una invarianza de medición entre ediciones; después documentan dónde se tensa el instrumento, con valores HTMT de hasta 0,950 y una correlación restringida entre ludicidad e intención que tuvo que comprobarse para la unidad. Sus comprobaciones complementarias de funcionamiento diferencial del ítem son un modelo de la honestidad que esta página defiende: la invarianza se mantuvo, pero los patrones de respuesta de baja variación entre el estudiantado más joven hicieron que una diferencia de grupo se debilitara al excluir a esos respondientes, y el artículo lo informa junto al resultado principal y no en lugar de él.

  • Los coeficientes de concordancia son propiedades del corpus, y las puntuaciones son productos conjuntos. Una validación de puntuación automatizada de 60 publicaciones de marketing informó de una concordancia absoluta ICC(2,1) de 0,435 para un LLM, 0,266 para un híbrido de reglas más LLM y 0,091 para reglas deterministas, con incertidumbre estimada a partir de 2.000 muestras bootstrap por conglomerados de redactores y un MAE de 6,28-17,22 puntos; añadir anclas redactadas por los investigadores movió la concordancia entre evaluadores de 0,338 a 0,902, lo que muestra hasta qué punto estas estimaciones dependen del conjunto de referencia (Agreement and error in automated scoring of student marketing posts). Una auditoría de recalificación por expertos de referencias de física plantea el punto complementario a nivel de instrumento: el 95,20 % de los rechazos auditados eran errores de la referencia o del calificador y no fallos del modelo, así que una puntuación medida debe informarse como propiedad conjunta del banco de ítems, la rúbrica y el calificador (How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks).

La fiabilidad es en parte recuperable del propio modelo. Organisciak y Acar (2026) evalúan tres mejoras baratas en la puntuación basada en LLM sobre más de 20.000 respuestas al Test de Usos Alternativos: leer la confianza a nivel de token del propio modelo, tomar una media ponderada por probabilidad sobre sus n mejores puntuaciones predichas en lugar de una única mejor conjetura, y hacer un ensamblado entre modelos. Cada una mejoró la concordancia con las puntuaciones humanas (la correlación sube de r = 0,781 a 0,823 y el RMSE cae de 0,599 a 0,498 en la mejor configuración), y sus diagnósticos localizan un fallo concreto de la puntuación de una sola pasada: la confianza expresada por el modelo se relacionaba negativamente con su exactitud (β = −0,602). Este es un resultado sobre el enfoque de medición y no sobre el modelo: el mismo modelo, puntuado de otra manera, es un instrumento más fiable, y se sitúa junto a la evidencia de concordancia a nivel de corpus anterior.

Una valoración de 2026 de 33 instrumentos de alfabetización en IA del profesorado muestra dónde está maduro el desarrollo de instrumentos y dónde no. Zainal, Mohd Matore y Maat (2026) calificaron los instrumentos contra una matriz de decisión adaptada de COSMIN y de Terwee et al. (2007) y encontraron que la consistencia interna era el dominio más fuerte (28 de 33 con grado A, 84,8 %) y la equidad el más débil, con solo cinco instrumentos (15,2 %) que informaban de evidencia de invarianza de medición o de funcionamiento diferencial del ítem. La validez estructural era sólida, con 24 instrumentos (72,7 %) en grado A mediante CFA, PLS-SEM o modelado TRI, pero la validez de contenido se apoyaba sobre todo en la revisión cualitativa, con 21 instrumentos (63,6 %) en grado B por carecer de estadísticos cuantitativos de acuerdo entre expertos.

Problemas y limitaciones: qué puede dejar pasar o hacer mal la medición

La medición educativa es potente pero falible. Entender sus modos de fallo es esencial para leer críticamente la evidencia sobre IA en la educación, y para reconocer dónde una aparente ganancia de aprendizaje o una afirmación sobre un constructo puede ser un artefacto de la medición y no un efecto real.

  • Límites de fiabilidad. La medición nunca es perfectamente fiable; la varianza de error siempre está presente. Cuando los instrumentos tienen baja consistencia interna o baja estabilidad test-retest, las diferencias observadas pueden ser ruido. En contextos de IA, nuevos modos de fallo se suman a esto: las respuestas generadas por LLM pueden puntuarse con una alta concordancia entre máquinas y aun así divergir de la puntuación humana (Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents), y la puntuación automatizada puede ser internamente consistente y estar sistemáticamente equivocada: precisión sin validez. Los límites de la medición de la investigación en AIED documentan los instrumentos poco fiables como una debilidad transversal.
  • La concordancia entre evaluadores fija el techo práctico. Una validación a gran escala de Acredita EB en Uruguay, con intervención humana, encontró que la concordancia entre evaluadores humanos fija por sí misma el techo práctico de la puntuación con IA: entre diez expertos que puntuaron de forma independiente 50 textos, ningún ítem de la rúbrica alcanzó el acuerdo unánime con el consenso, el evaluador más divergente solía quedar por debajo del 80 % de concordancia mientras que el mejor superaba el 90 %, y el kappa de Cohen fue solo leve o aceptable en varios ítems sesgados que casi todas las respuestas satisfacen. Los autores, por tanto, juzgan las puntuaciones automatizadas contra un estándar de referencia que es a su vez imperfecto —diez evaluadores, una única puntuación operativa para la mayoría de las respuestas y varios ítems en la zona convencional de aceptabilidad del 70 %—, una cautela para cualquier afirmación de medición construida sobre etiquetas operativas de un solo evaluador.
  • Validez: medir lo equivocado. La validez pregunta si un instrumento mide el constructo que dice medir. Los fallos comunes incluyen la infrarrepresentación del constructo (una prueba de alfabetización en IA que solo muestrea conocimiento técnico y omite la ética) y la varianza irrelevante al constructo (un ítem que recompensa la fluidez lectora en lugar de la habilidad objetivo). La puntuación con IA y el sesgo lingüístico muestra cómo las características superficiales —lengua, formulación, estilo— pueden determinar puntuaciones automatizadas de maneras ajenas al constructo pretendido. La validez de la evaluación es la barrera de protección contra estas amenazas.
  • La brecha del autoinforme. Las medidas de autoinforme capturan la competencia percibida, no la competencia real. La base de conocimiento muestra repetidamente que la alfabetización en IA autoinformada diverge marcadamente de las medidas basadas en el desempeño (How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures, en torno a un 40 % de sobreestimación por parte del profesorado) y que el autoinforme no logra predecir el desempeño real asistido por IA allí donde las pruebas de desempeño sí lo consiguen (GLAT). Las medidas que dependen del autoinforme pueden sobrestimar sistemáticamente los constructos y ocultar brechas reales de habilidad.
  • Constructos que no se transfieren entre poblaciones. Strugatski et al. muestran que los instrumentos de evaluación pueden tener una estructura factorial distinta en personas y en LLM, lo que significa que los mismos ítems pueden no medir el mismo constructo latente entre poblaciones. Incluso entre personas, los instrumentos validados en un grupo (por ejemplo, educación superior occidental y con recursos) pueden no generalizarse a otros (Sur global), una preocupación para la generalizabilidad de las medidas de IA en la educación.
  • Qué puede dejar pasar la medición. Algunos de los constructos más centrales para el aprendizaje con IA en la educación son los más difíciles de medir bien, y por tanto los más fácilmente omitidos o distorsionados por los instrumentos:
    • Proceso y estrategia. Las medidas estándar de resultado capturan el producto del aprendizaje, no el proceso. Pueden dejar pasar cómo se implica realmente el estudiantado con la IA: dependencia excesiva, aceptación irreflexiva o verificación crítica. El rastreo de los patrones de interacción usa trazas de interacción precisamente porque el autoinforme y las pruebas de resultado dejan pasar estas dinámicas.
    • Aprendizaje longitudinal y duradero. Un único postest puede mostrar un rendimiento inflado por la asistencia de la IA y a la vez dejar pasar la erosión del conocimiento duradero y sin ayuda (la brecha entre rendimiento y aprendizaje). La medición en un solo momento puede inducir activamente a error sobre el aprendizaje.
    • Equidad y acceso. Los instrumentos que presuponen un acceso uniforme a dispositivos y conectividad, o que están normados en muestras privilegiadas, pueden dejar pasar —o medir sistemáticamente de menos— las capacidades de quienes aprenden con pocos recursos, al atribuir erróneamente las brechas de acceso a brechas de capacidad.
    • Estados afectivos y motivacionales. La implicación, la motivación y la autoeficacia se miden a menudo por autoinforme, heredando la brecha del autoinforme anterior; pueden no capturar las dinámicas situadas y momentáneas que impulsan el aprendizaje.
  • La medición automatizada puede estar equivocada con confianza. La combinación de una alta confianza de la máquina y una puntuación opaca es un riesgo distintivo de la era de la IA: un calificador o anotador LLM puede producir puntuaciones muy autoconsistentes que están sistemáticamente sesgadas, y la apariencia de rigor (N grande, alta concordancia entre LLM) puede enmascarar la falta de validez. Los marcos de evaluación de la IA educativa y de IA consciente de la psicometría son el antídoto: exigen calibración, conciencia de la incertidumbre y evidencia de validez antes de confiar en las medidas automatizadas.

En resumen, la medición educativa puede dejar pasar lo que no muestrea (proceso, durabilidad, acceso, afecto) y puede hacer mal lo que muestrea deficientemente (autopercepción, características superficiales, constructos entre poblaciones). Leer los hallazgos sobre IA en la educación exige por tanto preguntar no solo qué se midió, sino cómo, y qué pudo haber dejado de capturar el instrumento.

  • Una codificación auditable separa el error de definición del error del modelo. EduBehaviors descompone un constructo en comportamientos observables anotados por separado más una regla de agregación explícita, de modo que quien revisa puede ver qué evidencia produjo una etiqueta y volver a derivar las etiquetas tras un cambio de regla sin nuevas llamadas al modelo; alcanzó un macro-F1 de 0,673 en Teacher TalkMoves, competitivo con el prompting directo de LLM (Bernado et al., 2026).

Conexiones

La medición educativa es el fundamento de la teoría de respuesta al ítem, la validez de la evaluación, el seguimiento del conocimiento y el modelado del estudiantado. Conecta con la analítica del aprendizaje (medición de datos de aprendizaje), el PLN educativo (medir el lenguaje) y la IA consciente de la psicometría (IA alineada con la teoría de la medición). Sus preocupaciones de validez y fiabilidad sustentan la evaluación de la IA educativa y los límites de la medición del campo. Por los constructos que mide, se cruza con la alfabetización en IA, el modelo de aceptación tecnológica, la autoeficacia, la motivación y la implicación del estudiantado.

  • Modelado causal de las intervenciones de apoyo (2026): un protocolo de modelado causal estructural lleva la evaluación educativa más allá de la actualización de creencias asociativa de la teoría de respuesta al ítem hacia el razonamiento interventivo y contrafactual (por ejemplo, el efecto de las pistas), con ecuaciones estructurales elicitadas de expertos mediante información puramente lógica, ilustrado con tareas de habilidades algorítmicas de la escuela obligatoria (Causal Modelling of Support Interventions for Student Competency Assessment).

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.