En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

Las medidas de autoinforme — instrumentos en los que la persona estudiada es también la fuente de los datos: cuestionarios y encuestas, entrevistas, diarios, competencia autoevaluada, uso autoestimado, aprendizaje percibido y satisfacción. Son el caballo de batalla de la investigación sobre IA en la educación —en esta base de conocimiento 139 páginas de artículo llevan la etiqueta de método de encuesta, más que cualquier diseño excepto el experimento y el punto de referencia— y son la única forma práctica de llegar a las actitudes, las creencias, las intenciones y la autoeficacia. Su límite es categórico y no estadístico: un autoinforme no puede medir la conducta ni el aprendizaje, solo lo que alguien dice sobre su conducta o su aprendizaje, y ambas cosas se separan en esta base de investigación con la frecuencia suficiente para ser un hallazgo por derecho propio.

Preguntas para reflexionar

  • Si un estudio dice que el estudiantado «informó de una alta implicación», ¿qué se midió exactamente y qué necesitaría ver para concluir que de verdad se implicó?
  • En un estudio, las medidas de autoinforme y objetivas de la alfabetización en IA del profesorado correlacionaron solo entre r = 0,07 y r = 0,24 en cuatro dimensiones. ¿Dónde divergiría más probablemente su propia autoevaluación de una prueba de la misma habilidad, y por qué?
  • La satisfacción es fácil de medir y fácil de mejorar: un sistema ajustado para complacer a quien lo usa puntuará bien en ella. ¿Por qué podría eso convertir la satisfacción en una mala medida de resultado para el aprendizaje, y qué mediría en su lugar?
  • «Casi todo el estudiantado usa IA para sus trabajos de curso» proviene de preguntar al estudiantado. ¿Qué podría equivocarse al preguntar en lugar de registrar, en cualquiera de las dos direcciones?
  • Una encuesta obtiene 112 respuestas con una tasa de respuesta del 31%, o 90 respuestas de 572 invitaciones. Antes de aceptar sus porcentajes, ¿qué quiere saber sobre quién no respondió?
  • Cuando un estudio correlaciona dos variables de autoinforme medidas en un mismo momento, ¿cuántas explicaciones distintas puede generar para la correlación, y qué diseño las descartaría?
  • Si estuviera asesorando a alguien sobre una evaluación pequeña, ¿qué afirmaciones le dejaría respaldar con una encuesta y en cuáles insistiría en que hacen falta registros, rendimiento o evidencia observacional?

Introducción

El autoinforme abarca mucho más que el cuestionario. Incluye encuestas transversales con formatos de respuesta tipo Likert y otros, entrevistas y grupos focales realizados por investigadores cualitativos, diarios y muestreo de experiencias, habilidad o confianza autoevaluadas, estimaciones recordadas de la frecuencia de uso de una herramienta, y aprendizaje percibido o satisfacción tratados como resultados. Lo que los une es la posición epistémica de quien responde: informa sobre sí mismo en lugar de ser observado.

Esto no es una debilidad de la que haya que disculparse. Muchos constructos de interés —la motivación, la ansiedad, la confianza, la utilidad percibida, las intenciones de implicación— son estados internos que ningún archivo de registro recoge, y preguntar es la única forma defendible de llegar a ellos. El problema surge cuando un autoinforme se usa para respaldar una afirmación que no puede sostener, lo que en el fondo es una cuestión de validez: si el instrumento mide el constructo que nombra, y si la afirmación que se hace es sobre el tipo de cosa que el autoinforme puede ver. Esa preocupación corresponde a la medición educativa y a la validez de la evaluación; esta página trata de qué ocurre cuando la investigación sobre IA en educación se apoya específicamente en el autoinforme, y de dónde muestra la base de evidencia que se rompe.

Cómo se relaciona esta página con sus vecinas. Los métodos de investigación en educación con IA catalogan diseños y sus fortalezas y limitaciones, incluidas las encuestas y los estudios de ecuaciones estructurales. La investigación cuantitativa cubre la familia de métodos numéricos. La medición educativa cubre el desarrollo de instrumentos, la teoría de respuesta al ítem y la validación psicométrica. Esta página es la porción más estrecha a la que apuntan esas páginas: el instrumento de medición y la fuente de datos en sí, qué puede y qué no puede establecer el autoinforme, la brecha recurrente entre lo que la gente informa y lo que hace, y cómo leer críticamente un hallazgo de autoinforme.

Qué puede y qué no puede establecer el autoinforme

El autoinforme se adapta bien a las actitudes, las creencias, las intenciones, las percepciones de una herramienta, los estados afectivos y la confianza o la dificultad autojuzgadas. Se adapta mal a la conducta y no puede medir el aprendizaje en absoluto: la creencia de una persona de que ha aprendido algo es en sí misma una percepción, y la base de conocimiento trata el aprendizaje percibido como una cantidad distinta de las ganancias de aprendizaje.

La consecuencia es un conjunto de afirmaciones que se parecen en un apartado de resultados pero difieren en fuerza:

  • «Al estudiantado le resultó útil el tutor»: una percepción, medida adecuadamente preguntando.
  • «El estudiantado usó el tutor con regularidad»: una conducta, solo aproximada preguntando.
  • «El estudiantado aprendió más con el tutor»: un resultado, que no puede establecerse preguntando en absoluto.
  • «El profesorado se siente seguro usando IA»: una creencia sobre sí mismo, no evidencia de competencia.

De esto se derivan dos implicaciones para quien lee o diseña esta investigación. Primero, si un instrumento de autoinforme mide siquiera el constructo que nombra es una cuestión empírica, que se responde mediante la validación y no mediante la plausibilidad de los ítems. Segundo, la dirección de la tentación en la IA en la educación es constante: las herramientas se evalúan por cómo se sienten sus usuarios respecto a ellas, y el sentimiento es precisamente la parte que el autoinforme captura de forma más barata. La autoevaluación es un miembro de esa familia más amplia y no un sinónimo: mientras que las medidas de autoinforme llegan a las actitudes, la confianza y la satisfacción, la autoevaluación dirige la estimación de quien aprende específicamente hacia su propia habilidad, su confianza o su aprendizaje.

Un instrumento validado puede hacer ese límite preciso en lugar de vago. El Cuestionario de Autoevaluación de la Alfabetización en IA (AIL-SAQ) de Thianwan y Srikoon (2025) es una escala de 15 ítems confirmada con una estructura estable de tres factores en dos muestras (n = 335 exploratoria, n = 579 confirmatoria) y un alfa de Cronbach global de 0,934. Sus autores son explícitos en que registra la comprensión percibida, las actitudes y la conciencia y no la habilidad demostrada, y en que la precisión de la autoevaluación depende de una capacidad metacognitiva que en la infancia aún está madurando, de modo que la autoestimación de un niño es una señal más débil que la de un adulto.

La brecha entre percepción y conducta

El hallazgo más sólido sobre el autoinforme en esta base de conocimiento no es que el autoinforme esté sesgado en general, sino que la conducta informada y la observada divergen de formas concretas y documentadas.

Un estudio que construyó medidas paralelas de autoinforme y objetivas de la alfabetización en IA del profesorado encontró una concordancia débil entre los factores de autoinforme y los objetivos (r = 0,07 a r = 0,24) en una muestra de 288 docentes, con un análisis factorial confirmatorio que respaldaba la validez de constructo de ambas medidas a la vez que mostraba una correlación baja entre los factores de autoinforme y los objetivos. Los dos instrumentos eran creíbles; simplemente medían cosas distintas. En la muestra completa de 288 docentes, las correlaciones entre los factores objetivos y los autoinformados fueron de r = 0,07 a r = 0,24, y el análisis de perfiles latentes identificó 43 docentes que se puntuaban alto mientras obtenían puntuaciones más bajas en la medida objetiva, frente a 59 que mostraban el patrón inverso.

GLAT llega a la misma conclusión desde la dirección contraria: su prueba de 20 ítems basada en el rendimiento predijo el desempeño en tareas de aprendizaje apoyadas por IA generativa en un estudio intra-sujeto con 83 estudiantes, mientras que la alfabetización en ChatGPT autoinformada no lo hizo. El planteamiento de los autores es contundente: los instrumentos de este ámbito dependen de forma abrumadora de encuestas autoinformadas, «que capturan la competencia percibida y no la real y son propensas al sesgo y a la sobreestimación».

Las estimaciones conductuales muestran la misma división. Un estudio a gran escala de programación competitiva informó de una desconexión entre la confianza autoinformada y la conducta real de práctica, siendo la primera un mal indicador de la segunda. Un estudio de modelado del estudiantado reconoce con franqueza que la frecuencia de uso se autoinformó en una escala de Nunca a Diario en lugar de observarse, y que, al ser los predictores y los resultados ambos autoinformados, estilos de respuesta como la aquiescencia o el sesgo de extremidad podrían producir las asociaciones.

A veces preguntar y observar se ponen frente a frente. Una revisión de alcance de 46 categorizaciones de 33 estudios encontró que la literatura se divide casi por igual entre datos de autoinforme y datos de registros de interacción, y concluyó que las categorías «a menudo reflejan tanto el enfoque de medición como la interacción misma», con los estudios de autoinforme capturando percepciones e intenciones mientras que los estudios basados en registros capturan conducta conversacional observable, y ambos rara vez integrados. El trabajo con datos de proceso sobre la alfabetización en IA generativa hace la versión constructiva del argumento: si un estudiante hace prompts de forma iterativa, refina la salida y gestiona las alucinaciones es observable en los registros de interacción y no en un cuestionario.

Una revisión estructurada y un metaanálisis exploratorio de 2026 sobre las medidas del uso competente de la IA generativa pone una cifra agrupada a esa brecha desde la dirección contraria: agrupar tres correlaciones subjetivo–objetivo de una misma muestra informadas directamente (N informado combinado = 2.765) dio r = 0,055 (IC del 95% con Hartung–Knapp [−0,047; 0,156]), y añadir las correlaciones entre factores de un cuarto estudio solo llegó a r = 0,079. Los tres efectos primarios procedían de un único programa de investigación, la correlación y el valor p informados del contribuyente mayor no pudieron reconciliarse, y la revisión concluye que el autoinforme no puede sustituir a las puntuaciones objetivas de rendimiento, a la vez que señala que los instrumentos de rendimiento son en sí mismos estrechos, pues cubren conocimiento fundacional y no las conductas de supervisión y dependencia que importan en el trabajo (Verí (2026)).

La propia literatura sobre instrumentos puede leerse como evidencia de la magnitud de la brecha. Zainal, Mohd Matore y Maat (2026) evaluaron 33 instrumentos de alfabetización en IA del profesorado y encontraron que 31 (93,9%) eran escalas de autoinforme de confianza percibida, solo dos (6,1%) medían el conocimiento de forma objetiva y ninguno usaba tareas basadas en el rendimiento entre 2019 y 2025. Su conclusión es la que esta página alcanza una y otra vez desde otras direcciones: las puntuaciones de autoinforme indican confianza y no capacidad, así que no pueden sustituir a la competencia cuando se comparan grupos o programas.

Las medidas de resultado heredan la misma brecha. Pramod y Patil (2026) modelan la ruta desde la IA agéntica pasando por la motivación y la presencia social hasta lo que denominan rendimiento de aprendizaje, con un coeficiente de 0,671 —la relación más fuerte del estudio—, y su propio apartado de limitaciones afirma que esta variable dependiente refleja las percepciones del estudiantado y no los resultados de examen, el rendimiento en las tareas ni la analítica del aprendizaje. Ese es el patrón que hay que leer con cuidado en los modelos de rutas en general: un coeficiente grande sobre un resultado percibido cuantifica con qué consistencia cree el estudiantado que algo ayudó, y no dice nada todavía sobre si ayudó.

La satisfacción y el aprendizaje percibido como resultados

La satisfacción es el resultado autoinformado más frecuente en este corpus, presente en 63 páginas de artículo. También es el más débil como indicador del aprendizaje, y la base de conocimiento contiene argumentos explícitos en ese sentido.

  • El trabajo sobre retroalimentación de IA secuenciada enuncia el principio de diseño directamente: la satisfacción del usuario y la implicación conductual no son indicadores fiables de las ganancias de aprendizaje, así que el aprendizaje debe medirse directamente.
  • Sobre el direccionamiento pedagógico señala que los modelos de lenguaje actuales están ajustados por instrucciones para ser asistentes serviciales que maximizan la satisfacción del usuario, mientras que el objetivo de un tutor es maximizar el aprendizaje; los dos objetivos pueden entrar en conflicto, lo que convierte la satisfacción en un objetivo potencialmente engañoso y no solo en uno débil.
  • Un estudio sobre andamiaje sostiene que la utilidad percibida, la facilidad de uso y la satisfacción inmediata no deberían tratarse como indicadores suficientes de la eficacia del andamiaje.
  • Sobre el modelado del estudiantado alineado con la personalidad observa que optimizar la satisfacción del usuario no es lo mismo que optimizar los resultados de aprendizaje, y que ambas cosas pueden separarse.

El patrón que conviene llevarse: la satisfacción responde a las cosas equivocadas cuando el objetivo es el aprendizaje. Un sistema que responde rápido, está de acuerdo con facilidad y reduce el esfuerzo será muy bien valorado, y esas mismas propiedades son las que la base de conocimiento asocia con una menor lucha productiva y un rendimiento inflado en el trabajo asistido por IA. La satisfacción informada y el aprendizaje medido no son enemigos; simplemente no son sustitutos, y tratar la primera como evidencia del segundo es el deslizamiento más común que documenta esta página.

Qué hace creíble a un instrumento de autoinforme

Cuatro propiedades separan una encuesta que puede respaldar una afirmación de otra que no puede.

  • Validez de constructo. Hay que demostrar que los ítems miden el constructo nombrado, idealmente con análisis factorial. El estudio de medidas paralelas anterior validó ambos instrumentos y aun así encontró que divergían: la validez de un instrumento no dice nada sobre si captura la conducta.
  • Fiabilidad y estructura. Los instrumentos validados factorialmente se repiten en este corpus, desde medidas de alfabetización en IA del profesorado basadas en la teoría de la autodeterminación hasta escalas de aceptación modeladas con TAM y SEM en estudios de herramientas de IA para el aprendizaje de idiomas.
  • Invarianza, cuando se comparan grupos. Una escala que se comporta de forma distinta entre poblaciones no puede respaldar una comparación. El trabajo con SEM multigrupo informa de pruebas de invarianza de medición (configural, métrica, escalar) junto a sus efectos indirectos, y una comparación entre Suiza y China encontró que solo el valor intrínseco alcanzaba la invarianza métrica y no la escalar, una limitación declarada y no ocultada, y que restringe lo que pueden significar sus diferencias entre países.
  • Una alternativa de rendimiento cuando el constructo es la competencia. Los 20 ítems de elección múltiple de GLAT existen precisamente porque el autoinforme no puede sostener una afirmación de competencia.

Muestreo, respuesta y no respuesta

Como las encuestas son baratas de administrar, los problemas de muestreo suelen ser el punto donde falla la afirmación de generalizabilidad. Este corpus los informa de forma explícita e instructiva:

La autoselección agrava esto. Un estudio de inoculación reclutó a 782 participantes y retuvo 100 casos válidos de una muestra de conveniencia de usuarios de ChatGPT autoinformados; un estudio de física hizo que el estudiantado se autoseleccionara para una tarea de crédito extra, lo que plausiblemente sesga las opiniones hacia lo complaciente y excluye a quienes dudan.

Dos errores más específicos del autoinforme se repiten. Los límites de la introspección y el sesgo de deseabilidad social se señalan como intrínsecos al autoinforme en el trabajo sobre evaluación de la implicación y en estudios cuyos datos cualitativos dependen del autoinforme. La varianza por método común surge cuando los predictores y los resultados proceden de las mismas personas respondientes y en el mismo momento: un estudio de mediación moderada sobre el uso de IA y el pensamiento crítico operacionalizó el uso, la carga cognitiva y el aprendizaje autorregulado todos mediante instrumentos de autoinforme estandarizados en un único momento temporal, y plantea el sesgo de método común como consecuencia; un estudio PLS-SEM sobre motivación e implicación se apoya igualmente del todo en el autoinforme y no puede establecer el orden temporal entre sus mediadores.

Remedio: añadir evidencia que no sea de autoinforme

Las respuestas constructivas de la base de conocimiento son consistentes, y ninguna de ellas exige abandonar las encuestas.

Cómo leer una afirmación basada en autoinforme

  • Pregunte de qué tipo de afirmación se trata. Las percepciones son admisibles; la conducta se aproxima; el aprendizaje y la competencia no son alcanzables por esta vía.
  • Compruebe quién respondió y quién no. La tasa de respuesta, el marco muestral y la autoselección deciden qué describen los porcentajes: un estudio del estudiantado de una institución describe ese contexto, no al estudiantado en general.
  • Compruebe el instrumento. ¿Se validó para este constructo y esta población, y, si se comparan grupos, se probó la invarianza?
  • Esté atento a los diseños de fuente única. Si los predictores y los resultados proceden del mismo cuestionario y en un mismo momento, las asociaciones son compatibles tanto con la varianza por método común como con la teoría propuesta.
  • Trate la satisfacción como una señal de diseño, no como un resultado de aprendizaje. Una alta satisfacción con un aprendizaje no comprobado es la configuración estándar en la evaluación de herramientas de IA, y este corpus muestra que ambas cosas divergen.
  • Prefiera los estudios que muestran su trabajo: tasas de respuesta declaradas, limitaciones declaradas y al menos una fuente de evidencia que no proceda de preguntar.

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.