Conceptos
Medidas de autoinforme
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
Las medidas de autoinforme — instrumentos en los que la persona estudiada es también la fuente de los datos: cuestionarios y encuestas, entrevistas, diarios, competencia autoevaluada, uso autoestimado, aprendizaje percibido y satisfacción. Son el caballo de batalla de la investigación sobre IA en la educación —en esta base de conocimiento 139 páginas de artículo llevan la etiqueta de método de encuesta, más que cualquier diseño excepto el experimento y el punto de referencia— y son la única forma práctica de llegar a las actitudes, las creencias, las intenciones y la autoeficacia. Su límite es categórico y no estadístico: un autoinforme no puede medir la conducta ni el aprendizaje, solo lo que alguien dice sobre su conducta o su aprendizaje, y ambas cosas se separan en esta base de investigación con la frecuencia suficiente para ser un hallazgo por derecho propio.
Preguntas para reflexionar
- Si un estudio dice que el estudiantado «informó de una alta implicación», ¿qué se midió exactamente y qué necesitaría ver para concluir que de verdad se implicó?
- En un estudio, las medidas de autoinforme y objetivas de la alfabetización en IA del profesorado correlacionaron solo entre r = 0,07 y r = 0,24 en cuatro dimensiones. ¿Dónde divergiría más probablemente su propia autoevaluación de una prueba de la misma habilidad, y por qué?
- La satisfacción es fácil de medir y fácil de mejorar: un sistema ajustado para complacer a quien lo usa puntuará bien en ella. ¿Por qué podría eso convertir la satisfacción en una mala medida de resultado para el aprendizaje, y qué mediría en su lugar?
- «Casi todo el estudiantado usa IA para sus trabajos de curso» proviene de preguntar al estudiantado. ¿Qué podría equivocarse al preguntar en lugar de registrar, en cualquiera de las dos direcciones?
- Una encuesta obtiene 112 respuestas con una tasa de respuesta del 31%, o 90 respuestas de 572 invitaciones. Antes de aceptar sus porcentajes, ¿qué quiere saber sobre quién no respondió?
- Cuando un estudio correlaciona dos variables de autoinforme medidas en un mismo momento, ¿cuántas explicaciones distintas puede generar para la correlación, y qué diseño las descartaría?
- Si estuviera asesorando a alguien sobre una evaluación pequeña, ¿qué afirmaciones le dejaría respaldar con una encuesta y en cuáles insistiría en que hacen falta registros, rendimiento o evidencia observacional?
Introducción
El autoinforme abarca mucho más que el cuestionario. Incluye encuestas transversales con formatos de respuesta tipo Likert y otros, entrevistas y grupos focales realizados por investigadores cualitativos, diarios y muestreo de experiencias, habilidad o confianza autoevaluadas, estimaciones recordadas de la frecuencia de uso de una herramienta, y aprendizaje percibido o satisfacción tratados como resultados. Lo que los une es la posición epistémica de quien responde: informa sobre sí mismo en lugar de ser observado.
Esto no es una debilidad de la que haya que disculparse. Muchos constructos de interés —la motivación, la ansiedad, la confianza, la utilidad percibida, las intenciones de implicación— son estados internos que ningún archivo de registro recoge, y preguntar es la única forma defendible de llegar a ellos. El problema surge cuando un autoinforme se usa para respaldar una afirmación que no puede sostener, lo que en el fondo es una cuestión de validez: si el instrumento mide el constructo que nombra, y si la afirmación que se hace es sobre el tipo de cosa que el autoinforme puede ver. Esa preocupación corresponde a la medición educativa y a la validez de la evaluación; esta página trata de qué ocurre cuando la investigación sobre IA en educación se apoya específicamente en el autoinforme, y de dónde muestra la base de evidencia que se rompe.
Cómo se relaciona esta página con sus vecinas. Los métodos de investigación en educación con IA catalogan diseños y sus fortalezas y limitaciones, incluidas las encuestas y los estudios de ecuaciones estructurales. La investigación cuantitativa cubre la familia de métodos numéricos. La medición educativa cubre el desarrollo de instrumentos, la teoría de respuesta al ítem y la validación psicométrica. Esta página es la porción más estrecha a la que apuntan esas páginas: el instrumento de medición y la fuente de datos en sí, qué puede y qué no puede establecer el autoinforme, la brecha recurrente entre lo que la gente informa y lo que hace, y cómo leer críticamente un hallazgo de autoinforme.
Qué puede y qué no puede establecer el autoinforme
El autoinforme se adapta bien a las actitudes, las creencias, las intenciones, las percepciones de una herramienta, los estados afectivos y la confianza o la dificultad autojuzgadas. Se adapta mal a la conducta y no puede medir el aprendizaje en absoluto: la creencia de una persona de que ha aprendido algo es en sí misma una percepción, y la base de conocimiento trata el aprendizaje percibido como una cantidad distinta de las ganancias de aprendizaje.
La consecuencia es un conjunto de afirmaciones que se parecen en un apartado de resultados pero difieren en fuerza:
- «Al estudiantado le resultó útil el tutor»: una percepción, medida adecuadamente preguntando.
- «El estudiantado usó el tutor con regularidad»: una conducta, solo aproximada preguntando.
- «El estudiantado aprendió más con el tutor»: un resultado, que no puede establecerse preguntando en absoluto.
- «El profesorado se siente seguro usando IA»: una creencia sobre sí mismo, no evidencia de competencia.
De esto se derivan dos implicaciones para quien lee o diseña esta investigación. Primero, si un instrumento de autoinforme mide siquiera el constructo que nombra es una cuestión empírica, que se responde mediante la validación y no mediante la plausibilidad de los ítems. Segundo, la dirección de la tentación en la IA en la educación es constante: las herramientas se evalúan por cómo se sienten sus usuarios respecto a ellas, y el sentimiento es precisamente la parte que el autoinforme captura de forma más barata. La autoevaluación es un miembro de esa familia más amplia y no un sinónimo: mientras que las medidas de autoinforme llegan a las actitudes, la confianza y la satisfacción, la autoevaluación dirige la estimación de quien aprende específicamente hacia su propia habilidad, su confianza o su aprendizaje.
Un instrumento validado puede hacer ese límite preciso en lugar de vago. El Cuestionario de Autoevaluación de la Alfabetización en IA (AIL-SAQ) de Thianwan y Srikoon (2025) es una escala de 15 ítems confirmada con una estructura estable de tres factores en dos muestras (n = 335 exploratoria, n = 579 confirmatoria) y un alfa de Cronbach global de 0,934. Sus autores son explícitos en que registra la comprensión percibida, las actitudes y la conciencia y no la habilidad demostrada, y en que la precisión de la autoevaluación depende de una capacidad metacognitiva que en la infancia aún está madurando, de modo que la autoestimación de un niño es una señal más débil que la de un adulto.
La brecha entre percepción y conducta
El hallazgo más sólido sobre el autoinforme en esta base de conocimiento no es que el autoinforme esté sesgado en general, sino que la conducta informada y la observada divergen de formas concretas y documentadas.
Un estudio que construyó medidas paralelas de autoinforme y objetivas de la alfabetización en IA del profesorado encontró una concordancia débil entre los factores de autoinforme y los objetivos (r = 0,07 a r = 0,24) en una muestra de 288 docentes, con un análisis factorial confirmatorio que respaldaba la validez de constructo de ambas medidas a la vez que mostraba una correlación baja entre los factores de autoinforme y los objetivos. Los dos instrumentos eran creíbles; simplemente medían cosas distintas. En la muestra completa de 288 docentes, las correlaciones entre los factores objetivos y los autoinformados fueron de r = 0,07 a r = 0,24, y el análisis de perfiles latentes identificó 43 docentes que se puntuaban alto mientras obtenían puntuaciones más bajas en la medida objetiva, frente a 59 que mostraban el patrón inverso.
GLAT llega a la misma conclusión desde la dirección contraria: su prueba de 20 ítems basada en el rendimiento predijo el desempeño en tareas de aprendizaje apoyadas por IA generativa en un estudio intra-sujeto con 83 estudiantes, mientras que la alfabetización en ChatGPT autoinformada no lo hizo. El planteamiento de los autores es contundente: los instrumentos de este ámbito dependen de forma abrumadora de encuestas autoinformadas, «que capturan la competencia percibida y no la real y son propensas al sesgo y a la sobreestimación».
Las estimaciones conductuales muestran la misma división. Un estudio a gran escala de programación competitiva informó de una desconexión entre la confianza autoinformada y la conducta real de práctica, siendo la primera un mal indicador de la segunda. Un estudio de modelado del estudiantado reconoce con franqueza que la frecuencia de uso se autoinformó en una escala de Nunca a Diario en lugar de observarse, y que, al ser los predictores y los resultados ambos autoinformados, estilos de respuesta como la aquiescencia o el sesgo de extremidad podrían producir las asociaciones.
A veces preguntar y observar se ponen frente a frente. Una revisión de alcance de 46 categorizaciones de 33 estudios encontró que la literatura se divide casi por igual entre datos de autoinforme y datos de registros de interacción, y concluyó que las categorías «a menudo reflejan tanto el enfoque de medición como la interacción misma», con los estudios de autoinforme capturando percepciones e intenciones mientras que los estudios basados en registros capturan conducta conversacional observable, y ambos rara vez integrados. El trabajo con datos de proceso sobre la alfabetización en IA generativa hace la versión constructiva del argumento: si un estudiante hace prompts de forma iterativa, refina la salida y gestiona las alucinaciones es observable en los registros de interacción y no en un cuestionario.
Una revisión estructurada y un metaanálisis exploratorio de 2026 sobre las medidas del uso competente de la IA generativa pone una cifra agrupada a esa brecha desde la dirección contraria: agrupar tres correlaciones subjetivo–objetivo de una misma muestra informadas directamente (N informado combinado = 2.765) dio r = 0,055 (IC del 95% con Hartung–Knapp [−0,047; 0,156]), y añadir las correlaciones entre factores de un cuarto estudio solo llegó a r = 0,079. Los tres efectos primarios procedían de un único programa de investigación, la correlación y el valor p informados del contribuyente mayor no pudieron reconciliarse, y la revisión concluye que el autoinforme no puede sustituir a las puntuaciones objetivas de rendimiento, a la vez que señala que los instrumentos de rendimiento son en sí mismos estrechos, pues cubren conocimiento fundacional y no las conductas de supervisión y dependencia que importan en el trabajo (Verí (2026)).
La propia literatura sobre instrumentos puede leerse como evidencia de la magnitud de la brecha. Zainal, Mohd Matore y Maat (2026) evaluaron 33 instrumentos de alfabetización en IA del profesorado y encontraron que 31 (93,9%) eran escalas de autoinforme de confianza percibida, solo dos (6,1%) medían el conocimiento de forma objetiva y ninguno usaba tareas basadas en el rendimiento entre 2019 y 2025. Su conclusión es la que esta página alcanza una y otra vez desde otras direcciones: las puntuaciones de autoinforme indican confianza y no capacidad, así que no pueden sustituir a la competencia cuando se comparan grupos o programas.
Las medidas de resultado heredan la misma brecha. Pramod y Patil (2026) modelan la ruta desde la IA agéntica pasando por la motivación y la presencia social hasta lo que denominan rendimiento de aprendizaje, con un coeficiente de 0,671 —la relación más fuerte del estudio—, y su propio apartado de limitaciones afirma que esta variable dependiente refleja las percepciones del estudiantado y no los resultados de examen, el rendimiento en las tareas ni la analítica del aprendizaje. Ese es el patrón que hay que leer con cuidado en los modelos de rutas en general: un coeficiente grande sobre un resultado percibido cuantifica con qué consistencia cree el estudiantado que algo ayudó, y no dice nada todavía sobre si ayudó.
La satisfacción y el aprendizaje percibido como resultados
La satisfacción es el resultado autoinformado más frecuente en este corpus, presente en 63 páginas de artículo. También es el más débil como indicador del aprendizaje, y la base de conocimiento contiene argumentos explícitos en ese sentido.
- El trabajo sobre retroalimentación de IA secuenciada enuncia el principio de diseño directamente: la satisfacción del usuario y la implicación conductual no son indicadores fiables de las ganancias de aprendizaje, así que el aprendizaje debe medirse directamente.
- Sobre el direccionamiento pedagógico señala que los modelos de lenguaje actuales están ajustados por instrucciones para ser asistentes serviciales que maximizan la satisfacción del usuario, mientras que el objetivo de un tutor es maximizar el aprendizaje; los dos objetivos pueden entrar en conflicto, lo que convierte la satisfacción en un objetivo potencialmente engañoso y no solo en uno débil.
- Un estudio sobre andamiaje sostiene que la utilidad percibida, la facilidad de uso y la satisfacción inmediata no deberían tratarse como indicadores suficientes de la eficacia del andamiaje.
- Sobre el modelado del estudiantado alineado con la personalidad observa que optimizar la satisfacción del usuario no es lo mismo que optimizar los resultados de aprendizaje, y que ambas cosas pueden separarse.
El patrón que conviene llevarse: la satisfacción responde a las cosas equivocadas cuando el objetivo es el aprendizaje. Un sistema que responde rápido, está de acuerdo con facilidad y reduce el esfuerzo será muy bien valorado, y esas mismas propiedades son las que la base de conocimiento asocia con una menor lucha productiva y un rendimiento inflado en el trabajo asistido por IA. La satisfacción informada y el aprendizaje medido no son enemigos; simplemente no son sustitutos, y tratar la primera como evidencia del segundo es el deslizamiento más común que documenta esta página.
Qué hace creíble a un instrumento de autoinforme
Cuatro propiedades separan una encuesta que puede respaldar una afirmación de otra que no puede.
- Validez de constructo. Hay que demostrar que los ítems miden el constructo nombrado, idealmente con análisis factorial. El estudio de medidas paralelas anterior validó ambos instrumentos y aun así encontró que divergían: la validez de un instrumento no dice nada sobre si captura la conducta.
- Fiabilidad y estructura. Los instrumentos validados factorialmente se repiten en este corpus, desde medidas de alfabetización en IA del profesorado basadas en la teoría de la autodeterminación hasta escalas de aceptación modeladas con TAM y SEM en estudios de herramientas de IA para el aprendizaje de idiomas.
- Invarianza, cuando se comparan grupos. Una escala que se comporta de forma distinta entre poblaciones no puede respaldar una comparación. El trabajo con SEM multigrupo informa de pruebas de invarianza de medición (configural, métrica, escalar) junto a sus efectos indirectos, y una comparación entre Suiza y China encontró que solo el valor intrínseco alcanzaba la invarianza métrica y no la escalar, una limitación declarada y no ocultada, y que restringe lo que pueden significar sus diferencias entre países.
- Una alternativa de rendimiento cuando el constructo es la competencia. Los 20 ítems de elección múltiple de GLAT existen precisamente porque el autoinforme no puede sostener una afirmación de competencia.
Muestreo, respuesta y no respuesta
Como las encuestas son baratas de administrar, los problemas de muestreo suelen ser el punto donde falla la afirmación de generalizabilidad. Este corpus los informa de forma explícita e instructiva:
- Una encuesta británica sobre el uso de IA generativa por el estudiantado informa de una muestra de conveniencia en 7 instituciones, tasas de respuesta institucionales muy variables y un sesgo de no respuesta que puede inclinarse hacia el estudiantado con opiniones fuertes, y señala que aproximadamente el 32% de quienes respondieron describieron conductas que podrían considerarse contrarias a la política, en un formato en el que la deseabilidad social y la presión contextual hacen que la infradeclaración sea la dirección probable del error.
- Un estudio sobre retroalimentación de calificación asistida por IA se basa en 112 respuestas, una tasa de respuesta del 31%.
- Un estudio con profesorado se basa en 90 docentes de educación STEM de 572 premiados invitados, un 16%.
- Una encuesta de sociología obtuvo 504 respuestas de 844 invitados, y los autores señalan que las tasas de respuesta variaron según la pregunta.
- Un estudio Delphi completó su primera ronda con 17 respuestas, una limitación que declara con claridad.
La autoselección agrava esto. Un estudio de inoculación reclutó a 782 participantes y retuvo 100 casos válidos de una muestra de conveniencia de usuarios de ChatGPT autoinformados; un estudio de física hizo que el estudiantado se autoseleccionara para una tarea de crédito extra, lo que plausiblemente sesga las opiniones hacia lo complaciente y excluye a quienes dudan.
Dos errores más específicos del autoinforme se repiten. Los límites de la introspección y el sesgo de deseabilidad social se señalan como intrínsecos al autoinforme en el trabajo sobre evaluación de la implicación y en estudios cuyos datos cualitativos dependen del autoinforme. La varianza por método común surge cuando los predictores y los resultados proceden de las mismas personas respondientes y en el mismo momento: un estudio de mediación moderada sobre el uso de IA y el pensamiento crítico operacionalizó el uso, la carga cognitiva y el aprendizaje autorregulado todos mediante instrumentos de autoinforme estandarizados en un único momento temporal, y plantea el sesgo de método común como consecuencia; un estudio PLS-SEM sobre motivación e implicación se apoya igualmente del todo en el autoinforme y no puede establecer el orden temporal entre sus mediadores.
Remedio: añadir evidencia que no sea de autoinforme
Las respuestas constructivas de la base de conocimiento son consistentes, y ninguna de ellas exige abandonar las encuestas.
- Combine el autoinforme con datos de traza o de registro. Un estudio de 194 estudiantes y ocho semanas sobre tecnología de aprendizaje adaptativo combinó el autoinforme con datos de traza bajo un modelo lineal jerárquico, lo que le permitió seguir las fases del aprendizaje autorregulado tal como se desarrollaban y no como se recordaban.
- Observe la práctica directamente cuando la afirmación es sobre la práctica. Una tarea de evaluación grabada en pantalla más entrevistas estimuladas por vídeo salvó la brecha entre el uso de IA autoinformado y la práctica observada, capturando una conciencia metacognitiva que la encuesta no podía captar.
- Puntúe la conducta con una rúbrica en lugar de preguntar por ella. El trabajo sobre retención trata el esfuerzo de práctica como un indicador conductual derivado de los registros de interacción, explícitamente no como una medida del estado motivacional interno.
- Triangule. Los diseños de métodos mixtos y la investigación con métodos mixtos en general cambian tamaño de muestra por la capacidad de contrastar una fuente de datos con otra; una revisión sistemática de la educación vocacional es instructiva por el desequilibrio, pues señala que, entre los estudios cuantitativos que examinó, 2 se basaban exclusivamente en el autoinforme mientras que 5 usaban solo medidas objetivas.
- Mida el resultado que le importa. Si la afirmación es sobre el aprendizaje, hay que medir las ganancias de aprendizaje, no inferirlas de la satisfacción.
Cómo leer una afirmación basada en autoinforme
- Pregunte de qué tipo de afirmación se trata. Las percepciones son admisibles; la conducta se aproxima; el aprendizaje y la competencia no son alcanzables por esta vía.
- Compruebe quién respondió y quién no. La tasa de respuesta, el marco muestral y la autoselección deciden qué describen los porcentajes: un estudio del estudiantado de una institución describe ese contexto, no al estudiantado en general.
- Compruebe el instrumento. ¿Se validó para este constructo y esta población, y, si se comparan grupos, se probó la invarianza?
- Esté atento a los diseños de fuente única. Si los predictores y los resultados proceden del mismo cuestionario y en un mismo momento, las asociaciones son compatibles tanto con la varianza por método común como con la teoría propuesta.
- Trate la satisfacción como una señal de diseño, no como un resultado de aprendizaje. Una alta satisfacción con un aprendizaje no comprobado es la configuración estándar en la evaluación de herramientas de IA, y este corpus muestra que ambas cosas divergen.
- Prefiera los estudios que muestran su trabajo: tasas de respuesta declaradas, limitaciones declaradas y al menos una fuente de evidencia que no proceda de preguntar.
Conceptos conectados
- Interpretar y aplicar la investigación en AIED
- Medición educativa
- Autoevaluación
- Métodos de investigación en AIED
- Investigación cuantitativa
- Investigación cualitativa
- Investigación con métodos mixtos
- Validez de la evaluación
- Teoría de respuesta al ítem
- Alfabetización en IA
- Calibración de la confianza
- Mejoras en el aprendizaje
- Implicación del estudiantado
- Autoeficacia
- Analítica del aprendizaje
Artículos conectados
-
Agentic AI in educational environments and its association with social and motivational pathways to learning performance — La implicación predice un rendimiento percibido y no medido en un modelo de rutas de IA agéntica (Pramod y Patil 2026)
-
How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures — Medidas paralelas de autoinforme y objetivas de la alfabetización en IA del profesorado
-
GLAT: The Generative AI Literacy Assessment Test — GLAT: una alternativa basada en el rendimiento al autoinforme
-
"It is a temptation to get it to do the work…" Student Experiences of Navigating the Generative AI Landscape in UK Higher Education: A Cross-Institutional Survey with International Comparison — Encuesta sobre el uso de IA generativa por el estudiantado en instituciones británicas
-
Toward Convergence in Student-LLM Interactions: A Rapid Scoping Review and Taxonomy for Learning-Oriented Use — Taxonomías condicionadas por si los datos procedían de autoinformes o de registros
-
Tracing GenAI Literacy: Student-AI Interaction Patterns in Academic Writing — Datos de proceso que caracterizan la alfabetización en IA generativa
-
Engagement Intensity as a Learner-Modeling Signal for Adaptive AI Ethics Instruction — El uso autoinformado como señal de modelado del estudiantado
-
Predicting Student Attrition in Competitive Programming: A Large-Scale Study Integrating Survey Insights and Global Behavioral Logs — Confianza autoinformada frente a conducta de práctica
-
From AI Use to Critical Thinking Among Medical Students: A Moderated Mediation Perspective on Cognitive Load and Self-Regulated Learning — Sesgo de método común en un modelo de mediación de fuente única
-
Examining the Impact of Generative AI on Student Motivation and Engagement: The Mediating Role of Autonomy-Support and Autonomous Motivation in Education — PLS-SEM basado solo en autoinforme sobre motivación e implicación
-
Trust-utility gap in introductory physics education: Students' adoption, domain-specific skepticism, and preferences for AI integration — Encuesta a 81 estudiantes de grado de física sobre el uso y la confianza en la IA
-
Summarize, elaborate, try again: exploring the effect of feedback literacy on AI-enhanced essay writing — La grabación de pantalla y el recuerdo estimulado como remedio al autoinforme
-
Fostering self-regulated learning through adaptive learning technology: A differentiated perspective on the role of feedback — Autoinforme más datos de traza sobre el aprendizaje autorregulado
-
Do Gains from Generative AI-Enabled Adaptive Pretesting Persist? Evidence from a Retention Study — Indicadores conductuales de esfuerzo derivados de los registros
-
Artificial intelligence in vocational education and training: A systematic review of educational purposes, theoretical conceptualizations, and empirical effectiveness — Revisión que informa del desequilibrio entre autoinforme y medidas objetivas
-
Student use of and views on GenAI for writing — Encuesta más entrevistas en un departamento de sociología
-
Beyond AI Literacy: A Structured Review and Exploratory Meta-Analysis of Measures for Competent Generative-AI Use — Más allá de la alfabetización en IA: una revisión estructurada y un metaanálisis exploratorio de las medidas del uso competente de la IA generativa
-
PAUSE: A Privacy-Preserving Self-Reflection Tool for AI-Associated Cognitive Offloading — PAUSE: una herramienta de autorreflexión que preserva la privacidad frente a la delegación cognitiva asociada a la IA
-
The AIR Scale: Development and Validation of a Measure of Motivations for Using AI During Reading — La escala AIR: una medida de autoinforme validada de las motivaciones para usar IA en la lectura
-
Development of an AI literacy self-assessment questionnaire in upper primary school students — Un instrumento de autoevaluación de 15 ítems para estudiantes de primaria superior, explícito sobre lo que puede establecer la competencia percibida
-
Assessing teachers' AI literacy: a systematic review of measurement tools — Revisión que encuentra que 31 de 33 instrumentos de alfabetización en IA del profesorado son de autoinforme y ninguno se basa en el rendimiento
-
Student Use of LLMs and the Limits of AI-Generated Question Difficulty in Data Science Courses — El uso de LLM por el estudiantado y los límites de la dificultad de las preguntas generadas por IA en cursos de ciencia de datos