Conceptos
Teoría de respuesta al ítem
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
La teoría de respuesta al ítem (TRT) — una familia de modelos psicométricos que estiman la habilidad latente a partir de las respuestas a los ítems modelando la relación entre la habilidad de quien aprende y la probabilidad de responder correctamente a cada ítem. Los modelos de TRT modelan la dificultad y la discriminación de los ítems, lo que permite precisión de medición y pruebas adaptativas. En la era de la IA, la TRT se encuentra con los LLM en la predicción de la dificultad de los ítems con LLM y la calibración psicométrica con LLM: la IA predice y calibra la dificultad de los ítems, lo que puede mejorar la precisión de la medición y alimentar el aprendizaje adaptativo.
Preguntas para reflexionar
- La teoría de respuesta al ítem trata la habilidad y la dificultad del ítem como algo estimado conjuntamente a partir de los patrones de respuesta, en lugar de tratar la puntuación bruta de un test como la medida. ¿En qué podrían diferir realmente en habilidad dos estudiantes con el mismo número de aciertos?
- La TRT permite comparar a quienes aprenden en una escala común y estimar la precisión por persona. ¿Por qué podría importar más conocer la dificultad y la discriminación de un ítem que saber solo si un estudiante acertó?
- Un estudio usó estadísticos de ajuste de persona de la TRT para distinguir respuestas humanas de respuestas generadas por IA en pruebas de opción múltiple, marcando las respuestas de IA como «aberrantes». ¿Cómo podría la misma maquinaria de medición que evalúa el aprendizaje servir también para vigilar la integridad académica?
- El personal investigador usa la TRT para validar que las preguntas de examen generadas por IA igualan a las escritas por especialistas en dificultad y discriminación. Si una IA escribe un ítem que «parece» bueno, ¿por qué sigue siendo necesaria la calibración empírica frente a parámetros de TRT ajustados?
- A medida que la IA predice y calibra la dificultad de los ítems, ¿qué podría salir mal si la estimación de dificultad de un modelo no se valida contra datos reales de respuesta del estudiantado?
- La TRT se conecta con las pruebas adaptativas y el trazado de conocimiento — usar tus respuestas para elegir qué preguntar después. ¿Cómo permite estimar tu habilidad a partir de cada respuesta que un test sea más corto y más preciso, y no solo más largo?
Introducción
La TRT trata la habilidad (θ) y los parámetros de los ítems (dificultad, discriminación y, a veces, adivinación) como algo estimado conjuntamente a partir de los patrones de respuesta, en lugar de tratar la puntuación bruta como la medida. Esto permite comparar a quienes aprenden en una escala común, seleccionar ítems de forma adaptativa y estimar la precisión por persona en lugar de globalmente.
Cómo aparece la TRT en la investigación
-
Dificultad predicha por IA: la predicción de la dificultad de los ítems con LLM usa modelos de lenguaje para estimar la dificultad de los ítems, lo que debe validarse contra parámetros de TRT ajustados empíricamente.
-
Calibración psicométrica: la calibración psicométrica con LLM alinea la evaluación basada en modelos con la medición basada en la TRT, de modo que las respuestas generadas por IA preserven las propiedades de medición.
-
Trazado de conocimiento y modelado del estudiantado: la TRT está estrechamente relacionada con el trazado de conocimiento y el modelado del estudiantado — modelos que siguen el conocimiento de quien aprende a lo largo del tiempo — y comparte el objetivo de estimar estados no observables de quien aprende a partir de respuestas observables.
-
Validación de campo jerárquica bayesiana: Evaluar la calidad de exámenes generados por IA usa un modelo de TRT 2PL jerárquico bayesiano (con ítems ancla de pretest para situar a 1.686 estudiantes en una escala θ común) para mostrar que las preguntas generadas por IA igualan a los ítems de exámenes estandarizados escritos por especialistas en dificultad y discriminación: una demostración a gran escala de la TRT como columna vertebral de validación de la generación automática de preguntas.
-
Separar las respuestas humanas de las de IA generativa con estadísticos de ajuste de persona: Strugatski y Alexandron (2026) aplican estadísticos de ajuste de persona (PFS) dentro de la TRT para distinguir las respuestas humanas de las de IA generativa en evaluaciones de opción múltiple. Los PFS marcan las respuestas de IA generativa como respondientes «aberrantes» en dos contextos auténticos (un examen de química y un examen nacional), muestran que distintos chatbots producen patrones de respuesta diferentes (un grupo heterogéneo de «inteligencias») y revelan que las versiones más nuevas de IA generativa se vuelven más parecidas a las humanas, lo que posiciona la TRT como un marco robusto para el cribado de integridad en pruebas de alto impacto.
-
Estimación de dificultad con LLM frente a parámetros de TRT de Rasch: Razavi y Powers (2026) evalúan si GPT-4o puede estimar la dificultad de ítems de evaluación de matemáticas y lectura de K-5 (N = 5170) calibrados bajo el modelo de TRT de Rasch. Un enfoque de estimación directa en cero disparos correlacionó de moderada a fuertemente con las dificultades reales de Rasch (r = 0,83 en matemáticas, r = 0,81 en lectura), pero fue desigual entre cursos y a menudo no mejor que un regresor ficticio de media de curso para los cursos K y 1, probablemente por la restricción de rango en las dificultades de los ítems de los cursos inferiores. Una estrategia basada en características — características cognitivas y lingüísticas extraídas por LLM introducidas en modelos de árboles — superó la estimación directa (correlaciones de hasta r = 0,87), con el nivel de curso y el número de palabras como mejores predictores. El estudio subraya que las estimaciones de dificultad de los LLM deben validarse contra parámetros de TRT ajustados empíricamente, y que la extracción estructurada de características puede afinar la predicción allí donde el juicio holístico en cero disparos se queda corto.
-
Defectos de redacción de ítems como cribado previo al despliegue de los parámetros de TRT: Schmucker y Moore (2026) comprueban si las rúbricas de defectos de redacción de ítems (IWF) — una evaluación textual, general al dominio y que no requiere datos del estudiantado — predicen la dificultad y la discriminación de la TRT estimadas empíricamente. En 7.126 preguntas de opción múltiple de STEM (ciencias físicas, matemáticas, ciencias de la vida y de la Tierra), usaron codificación automatizada asistida por LLM para mostrar que las rúbricas IWF tienen validez predictiva respecto a los parámetros empíricos de la TRT, lo que ofrece un cribado escalable previo al despliegue que complementa o sustituye parcialmente las pruebas piloto intensivas en recursos.
-
Filtrado de riesgo basado en TRT para la calificación selectiva con IA: Cvengros y Kortemeyer ajustan un modelo de TRT logístico de dos parámetros a datos de química manuscrita calificados por IA y definen el «riesgo» de aceptar un juicio de la IA como la desviación absoluta entre la puntuación normalizada de la IA y la probabilidad de crédito esperada por la TRT (Riesgo = |s−p|); aceptar solo los ítems dentro de una tolerancia elegida respecto a esta expectativa bayesiana marca las puntuaciones de IA «sorprendentes» para revisión humana, lo que convierte la TRT de una herramienta pura de agregación de puntuaciones en un mecanismo operativo de aceptación o aplazamiento para la evaluación automatizada, uno que logró una alineación con la calificación humana similar a la de umbrales de crédito parcial más simples, pero con menor carga humana, aunque su lógica es menos transparente para audiencias no técnicas.
-
Calibración de divide y vencerás para bancos en evolución continua: Jewsbury et al. (2026) tratan la recalibración de la TRT como un problema de escalado y no de ajuste. Cuando la generación de ítems con IA y la predicción de parámetros basada en características hacen que un banco sea más grande, más disperso y se actualice de forma continua, reajustar todo el historial de respuestas en cada actualización se vuelve cada vez más costoso; su calibración por consenso calibra en cambio cada periodo una sola vez y combina un periodo nuevo con las posteriores anteriores ya calculadas. Dos rasgos la separan del trabajo previo de divide y vencerás en TRT: los periodos no comparten una métrica latente, así que cada uno se vincula a una métrica de referencia mediante un criterio robusto de Haebara resuelto por separado para cada extracción posterior (lo que arrastra el error de enlace a las posteriores enlazadas), y cada periodo es su propio ajuste jerárquico que aporta una prior estimada, de modo que al producto ingenuo de posteriores hay que dividirle esa prior y reinstaurar una prior de consenso — lo que se reduce a la regla de la máquina de comité bayesiana cuando las priors son fijas. Frente a una referencia agrupada en cuatro periodos trimestrales del Duolingo English Test, las medias posteriores coincidieron en r = 0,998 (dificultad) y 0,991 (log-discriminación) con desviaciones estándar posteriores de r = 0,970 y 0,920, lo que deja una leve subdispersión (razón de desviaciones estándar 0,91–0,98) que fue mayor en el tercil de menor exposición por periodo. Es calibración de TRT rediseñada para las condiciones de aplicación que crean los bancos de ítems generados por IA.
-
Con qué poca frecuencia la TRT ancla la validación de instrumentos: una evaluación de instrumentos de alfabetización en IA del profesorado cuantifica la ausencia de TRT más que su uso. Zainal, Mohd Matore y Maat (2026) calificaron 33 instrumentos con una matriz de decisión adaptada de COSMIN y Terwee et al. (2007); la validez estructural fue sólida, con 24 (72,7%) en grado A mediante AFC, PLS-SEM o modelado de TRT, y sin embargo ninguno usó la TRT o Rasch como evidencia principal, y solo cinco instrumentos (15,2%) informaron de invariancia de medición o de evidencia de funcionamiento diferencial del ítem. Los autores abogan por la TRT y las tareas de desempeño junto con la autoevaluación para separar la capacidad validada de la confianza declarada.
Conexiones
La TRT es un fundamento de la medición educativa y de la validez de la evaluación, sustenta el aprendizaje adaptativo (selección adaptativa de ítems) y el modelado del estudiantado, y se conecta con la IA psicométricamente consciente (evaluación con IA alineada con la teoría de la medición) y con el trazado de conocimiento. Aparece en la calibración de dificultad con LLM para la evaluación de programación.
Conceptos conectados
- Medición educativa
- Validez de la evaluación
- Seguimiento del conocimiento
- Modelado del estudiantado e instrucción adaptativa
- IA psicométricamente consciente
- Aprendizaje adaptativo
- Evaluación automatizada
- Tutoría inteligente
Artículos conectados
- The Impact of Item-Writing Flaws on Difficulty and Discrimination in Item Response Theory — Impacto de los defectos de redacción de ítems en la dificultad y la discriminación de la TRT (Schmucker y Moore 2026)
- Causal Modelling of Support Interventions for Student Competency Assessment — Modelado causal de intervenciones de apoyo para la evaluación de competencias del estudiantado
- Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis — ¿Miden los instrumentos de evaluación lo mismo para las personas y para los LLM? (Strugatski et al. 2026)
- Assessing the Quality of AI-Generated Exams: A Large-Scale Field Study — Validación de campo de TRT a gran escala de exámenes generados por IA
- GLAT: The Generative AI Literacy Assessment Test — GLAT usa validación con TRT/2PL (Jin et al. 2025)
- Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction — Predicción de la dificultad de los ítems con LLM
- Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach — Alinear la evaluación con LLM con la calibración psicométrica
- From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations — Calibración de dificultad con LLM en exámenes de programación
- Multimodal Item Parameter Estimation using Simulated Response Probabilities — Estimación multimodal de parámetros de ítems
- Interpretable Knowledge Tracing — Trazado de conocimiento interpretable
- Integrating AI Into Computational Thinking: Development and Validation of an Assessment Tool for Higher Education Students — Test de pensamiento computacional en el entrenamiento con IA (CTAT)
- Applying IRT to distinguish between human and generative AI responses to multiple-choice assessments — Usar la TRT para separar respuestas humanas y de IA generativa en opción múltiple
- CogEvolution: A Human-like Generative Educational Agent to Simulate Student's Cognitive Evolution — CogEvolution: agente generativo que simula la evolución cognitiva del estudiantado
- Estimating Item Difficulty Using Large Language Models and Tree-Based Machine Learning Algorithms — Estimar la dificultad de los ítems con LLM y aprendizaje automático basado en árboles
- Assisting the grading of a handwritten general chemistry exam with artificial intelligence
- Beyond ID Embeddings: Process-Grounded Language Modeling for Cognitive Diagnosis — Más allá de las incrustaciones de identificador: modelado del lenguaje anclado en el proceso para el diagnóstico cognitivo
- Bayesian Consensus Calibration of Continuously Evolving IRT Item Banks — Calibración por consenso bayesiana de un banco de ítems de TRT en evolución continua (Jewsbury et al. 2026)
- Assessing teachers' AI literacy: a systematic review of measurement tools — Auditoría de campo que muestra que la TRT/Rasch rara vez se usa como evidencia principal de validación en los instrumentos de alfabetización en IA del profesorado
- StudentBench: AI and human tutoring yield equivalent GRE learning gains — StudentBench: la tutoría con IA y la humana producen ganancias de aprendizaje equivalentes en el GRE
- Student Use of LLMs and the Limits of AI-Generated Question Difficulty in Data Science Courses — Uso de los LLM por parte del estudiantado y los límites de la dificultad de las preguntas generadas por IA en cursos de ciencia de datos