En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

Las mejoras en el aprendizaje son mejoras medibles en el conocimiento, las habilidades o las competencias del estudiantado que resultan de intervenciones educativas, incluida la instrucción asistida por IA. En la investigación sobre la IA en la educación, las mejoras en el aprendizaje sirven como medida de resultado principal para evaluar si las herramientas de IA mejoran de verdad el aprendizaje, y no solo la implicación o la satisfacción.

Preguntas para reflexionar

  • ¿Ha sentido alguna vez que aprendió mucho con una actividad, para luego suspender un examen que medía algo distinto? La página distingue el rendimiento inmediato con apoyo de IA del aprendizaje duradero: ¿cómo podrían divergir esos dos en su propia experiencia?
  • Un hallazgo central es que la IA generativa puede inflar las puntuaciones en los deberes asistidos por IA y a la vez bajar las puntuaciones en medidas supervisadas y sin apuntes. Si usted evaluara si una herramienta de IA ayuda de verdad al estudiantado a aprender, ¿en qué resultado confiaría y por qué?
  • La investigación muestra que la dependencia no guiada de la IA predice peores mejoras en el aprendizaje, mientras que el uso estructurado predice mejores: la misma herramienta, resultados opuestos. ¿Qué distingue el uso «estructurado» del uso «no guiado» en un aula real?
  • Los botones de pista correlacionan con un menor aprendizaje: más pistas, menos aprendizaje. ¿Ha sentido alguna vez la tentación de recurrir a una pista o a una respuesta en el momento en que se atascaba? ¿Qué sugiere eso sobre cuánto esfuerzo es realmente necesario para aprender?
  • Un metaanálisis amplio agrupó muchos estudios y encontró que la tecnología educativa habilitada por IA elevó el aprendizaje en una cantidad modesta, sin ventaja alguna de la IA generativa sobre las herramientas adaptativas anteriores. ¿Cómo debería cambiar esa estimación prudente y agrupada su lectura de las afirmaciones entusiastas sobre la eficacia de un solo producto de IA?

Introducción

Las mejoras en el aprendizaje son la prueba definitiva de cualquier tecnología educativa. En la investigación de la base de conocimiento aparecen como variables dependientes en ensayos controlados aleatorizados, como comparaciones pretest-postest en estudios cuasiexperimentales y como análisis correlacionales que vinculan el uso de herramientas de IA con los resultados académicos.

Terminología. El sentido de resultado del logro (rendimiento del estudiantado, rendimiento académico, logro de aprendizaje, rendimiento previo, brechas de logro) se trata aquí como sinónimo de mejoras en el aprendizaje, y esas expresiones enlazan a esta página. El sentido percibido («una sensación de logro») es una experiencia motivacional y no un resultado medido; véanse motivación y autoeficacia. La teoría de las metas de logro («metas de logro», orientaciones de meta) es asimismo un constructo motivacional y enlaza con motivación.

Hallazgos clave de la base de conocimiento:

  • El preexamen adaptativo examina si el preexamen habilitado por IA generativa produce mejoras en el aprendizaje duraderas que persisten más allá de la prueba inmediata.
  • Los metaanálisis de la IA generativa en la programación encuentran mejoras positivas en el aprendizaje con un uso estructurado de la IA, pero efectos negativos con la dependencia no guiada, una distinción clave entre productividad y aprendizaje duradero.
  • La investigación sobre los botones de pista muestra asociaciones negativas entre el abuso de las pistas y las mejoras en el aprendizaje: más pistas correlacionan con menos aprendizaje.
  • La orientación instruccional demuestra que las mejoras en el aprendizaje dependen de cómo se usa la IA, y no solo de si está disponible.
  • El metaanálisis del Banco Mundial agrupa 191 tamaños de efecto de 14 ECA para estimar que la tecnología educativa adaptativa y habilitada por IA eleva el aprendizaje en ~0,125 DE de media, por encima de la mediana de los ECA educativos, mientras no encuentra ventaja alguna de la IA generativa sobre las herramientas adaptativas anteriores.
  • Las mejoras son interacciones entre contenido y tratamiento, no constantes. Rachatasumrit et al. (2025) muestran que la proporción óptima de ejemplos y problemas depende del contenido de conocimiento: la práctica de recuperación pura produce mejoras mayores para hechos literales, mientras que la práctica integrada con ejemplos (alternar ejemplos resueltos y problemas) produce mejoras mayores para habilidades generalizables, evidencia directa de que «más práctica» no siempre es mejor y de que las mejoras dependen de ajustar el calendario de entrenamiento al componente de conocimiento que se aprende.

El problema de la medición en la era de la IA

Un tema central en la investigación de la base de conocimiento sobre las mejoras en el aprendizaje es que la IA generativa puede inflar el rendimiento aparente sin producir mejoras en el aprendizaje, y que la elección de la medida de resultado determina si eso es visible. La investigación y los datos de campo a gran escala muestran una divergencia marcada: el uso de IA mejora las puntuaciones en los deberes asistidos por IA y a la vez baja las puntuaciones en medidas supervisadas, sin apuntes y sin asistencia. La investigación sobre rendimiento frente a aprendizaje y las revisiones rápidas distinguen por tanto el rendimiento inmediato con apoyo de IA del aprendizaje duradero, y tratan las medidas sumativas sin asistencia (véase evaluación sumativa) como la señal fiable de mejoras genuinas en el aprendizaje.

Qué muestra la investigación sobre eficacia

A lo largo de los ECA, los metaanálisis y los estudios de campo de la base de conocimiento, emerge una imagen coherente de la eficacia del aprendizaje (qué intervenciones de IA producen de hecho mejoras en el aprendizaje y de qué magnitud):

  • La evidencia metaanalítica es en general positiva pero condicional. Un metaanálisis exhaustivo de 53 estudios (Dong 2026) encuentra que la IA generativa supera en general a los enfoques tradicionales en rendimiento académico, pensamiento de orden superior y escritura, con la retroalimentación con IA especialmente eficaz, aunque la IA generativa asistida por juegos no muestra ningún beneficio añadido significativo y las mejoras varían según el país y el resultado. El metaanálisis de la IA generativa y la programación encuentra grandes mejoras de productividad pero ninguna mejora significativa en el aprendizaje (g ≈ 0), lo que separa la eficiencia de la tarea del aprendizaje duradero. Un metaanálisis sobre el aprendizaje de idiomas encuentra mejoras positivas pero modestas en el aprendizaje con robots corporeizados mejorados con IA. Para la alfabetización en IA en concreto, un metaanálisis de tres niveles de 59 estudios estima un efecto global grande (g = 0,837), pero el amplio intervalo de predicción y el hallazgo de que las intervenciones centradas en el conocimiento superaron a las dirigidas a habilidades, actitudes o ética advierten de que el resultado medido da forma a la mejora aparente, lo que se hace eco del argumento más amplio de que las mejoras relacionadas con la IA dependen de qué se evalúa y de cómo.
  • Los tutores de IA bien diseñados producen mejoras reales. Un ECA por conglomerados de dos años (Khanmigo) encontró que la tutoría con IA elevó el rendimiento en matemáticas ~1,3 rangos percentiles nacionales por trimestre (de 0,06 a 0,08 DE por curso escolar, ~0,14 DE por un año completo), unas mejoras parecidas a las de la práctica sin IA, lo que demuestra que la implicación, y no la capacidad del modelo, es la restricción determinante. NUMI mostró que el apoyo de IA mejoró la corrección en el siguiente intento tras los errores, con más tiempo por pregunta, una «ralentización productiva» que construye un dominio duradero. La tutoría virtual encontró que la restricción determinante es la adopción y la participación sostenida, y no la calidad del tutor.
  • La IA puede igualar la ayuda humana. La ayuda generada por ChatGPT produce mejoras en el aprendizaje equivalentes a las de la ayuda redactada por un tutor humano en habilidades de matemáticas, evidencia de que la IA generativa puede ser tan eficaz como el andamiaje humano cuando se usa de forma adecuada.
  • La IA sin salvaguardas puede dañar el aprendizaje. El ECA sobre barreras de seguridad (PNAS 2025) encontró que un tutor al estilo de ChatGPT sin salvaguardas elevó la práctica asistida un +48% pero redujo las puntuaciones de los exámenes sin asistencia un −17%, mientras que un tutor con salvaguardas (pista y no respuesta) eliminó el daño. Esta es la demostración más nítida de que la eficacia del aprendizaje depende del diseño: la misma clase de herramienta puede ser una mejora fuerte o un daño neto según cómo se configure.
  • La eficacia percibida y la eficacia real divergen. El rendimiento autoinformado se desalinea con el rendimiento medido, y la línea base cognitiva ausente muestra que el estudiantado nativo digital sobreestima su aprendizaje, de modo que las afirmaciones de eficacia basadas en el autoinforme no son fiables sin medidas objetivas de resultado. Las medidas de autoinforme recogen los casos en que los resultados informados y los medidos se separan.

Conclusión: el peso de la evidencia respalda mejoras en el aprendizaje modestas, condicionales y dependientes del diseño con la IA: reales cuando la IA está estructurada para orientar en lugar de responder, cuenta con salvaguardas y se combina con medidas de resultado sin asistencia, y ausentes o negativas cuando sustituye el esfuerzo de quien aprende. Por eso las mejoras en el aprendizaje como resultado deben medirse con instrumentos válidos y resistentes a la IA, y por eso la evaluación de la IA educativa empareja las afirmaciones de eficacia con el escrutinio metodológico.

  • La tutoría con IA puede igualar a la tutoría humana experta en las mejoras de las pruebas estandarizadas. En una evaluación con 2.383 participantes, la tutoría con IA agrupada fue estadísticamente equivalente a la tutoría humana experta en las mejoras de aprendizaje del GRE (p = .015), con ambas por encima de un control sin tutoría; los autores proponen el coste por punto porcentual de mejora como unidad para comparar tutores (Northcutt et al., 2026).

Un mapa de campo de los efectos de la IA en el aprendizaje y el rendimiento

El corpus de la base de conocimiento (metaanálisis, ECA, cuasiexperimentos y estudios de campo) respalda una imagen matizada y a veces contradictoria. Los hallazgos se agrupan en efectos positivos, negativos y condicionales.

Efectos positivos (la IA puede producir mejoras genuinas en el aprendizaje):

Efectos negativos (la IA puede reducir el aprendizaje o no mejorarlo):

Efectos condicionales y mixtos (el contexto determina la dirección):

Las estimaciones metaanalíticas de mejora del aprendizaje están infladas: léalas con cautela

Los números de mejora del aprendizaje que dominan el resumen de eficacia de esta página (sobre todo los tamaños de efecto agrupados de los metaanálisis) deben leerse con una advertencia firme: una oleada de metainvestigación muestra que las estimaciones de síntesis positivas del campo están infladas por el sesgo de publicación, la incoherencia de constructo y los atajos metodológicos.

  • Un metaanálisis de metaanálisis a nivel de estudio de 1.840 tamaños de efecto de 67 metaanálisis encuentra que el efecto medio de la IA ajustado por sesgo de publicación es aproximadamente un tercio de la magnitud reportada (SMD ≈ 0,196 frente a una mediana de 0,67), con un intervalo de predicción que abarca desde un daño grande hasta un beneficio grande y sin ningún moderador que produzca mejoras consistentes. Incluso un único estudio extremo aporta casi nada de información dada la heterogeneidad, lo que significa que más estudios del tipo actual no resolverán la cuestión; solo lo harán los ensayos de alta calidad, prerregistrados y orientados a la replicación.
  • Un metaanálisis de segundo orden de la propia capa de síntesis. Emslander et al. (2026) invierten la unidad de análisis habitual: tratan 45 metaanálisis como sus datos y corrigen el solapamiento de estudios (818 estudios primarios únicos, ponderados por su unicidad en lugar de descartados), y agrupan 129 tamaños de efecto metaanalíticos en g = .57 [.50, .65], con grupos de resultados que van de .35 para el rendimiento en STEM a .68 para los resultados académicos generales. Dos resultados atañen a los números anteriores. El tipo de IA no moderó el efecto (p = .63), de modo que los sistemas de tutoría inteligente, los chatbots y ChatGPT son estadísticamente indistinguibles en esta capa, así que las mejoras agrupadas del campo no están siendo impulsadas por la IA generativa como tal, y el único moderador claro fue el nivel educativo (terciario .61 frente a .30 en muestras más jóvenes), lo que en parte es un artefacto del diseño de los estudios, dado que el 74% del corpus evaluó a estudiantes de educación superior y la evidencia de K-12 es comparativamente escasa. Su evaluación de la calidad es la más aguda del corpus: los 45 metaanálisis promediaron 9,3 de 17 en una escala adaptada de AMSTAR, ninguno fue prerregistrado y solo 23 de 45 tenían un 80% de potencia para detectar el efecto que ellos mismos reportaban. Sus dos pruebas de sesgo de publicación también discrepan (un gráfico de embudo simétrico, τ de Kendall = −.01, p = .868, frente a PET-PEESE, B = 0,9, p = .009, que indica inflación), así que el propio efecto medio del SOMA llega con una nube de sesgo sin resolver por encima.
  • Una auditoría forense de 14 metaanálisis de AIED de alto impacto encuentra que ninguno proporcionó una base válida para su afirmación de mejora agrupada del aprendizaje: ninguno tenía un constructo de resultado coherente, todos tenían una heterogeneidad extrema sin resolver (I² osciló entre el 77,2% y el 94,4% en los 13 metaanálisis que la reportaron, y 12 de esos 13 superaron el 80%), doce trataron los tamaños de efecto dependientes como independientes y ninguno evaluó válidamente el sesgo de publicación. Una mayoría de los estudios primarios verificados al azar no coincidía con la afirmación metaanalítica. Los errores llegaron a la política: dos de los metaanálisis auditados trataron el tamaño de la muestra del estudio como tamaño de clase y, sobre la base de un estudio primario mal calculado, concluyeron que de 21 a 40 estudiantes es el tamaño de intervención ideal y recomendaron que las intervenciones de IA generativa se diseñaran para ese número.
  • Una síntesis de STEM de 2026 que corrige dos de los defectos auditados y aun así ilustra un tercero. Doğan y sus colegas (2026) agruparon 35 estudios STEM experimentales y cuasiexperimentales con un tamaño de efecto por estudio para evitar el problema de los tamaños de efecto dependientes, y ejecutaron una batería completa de sesgo de publicación (gráfico de embudo, pruebas de Begg y de Egger, trim-and-fill, N a prueba de fallos de Rosenthal = 2.404) en lugar de afirmar la simetría, los dos atajos que la auditoría anterior encontró en todos los metaanálisis que examinó. Sobreviven dos cautelas. Primera, los autores no aplicaron ninguna evaluación formal de la calidad y trataron los criterios de inclusión como el umbral de rigor, de modo que entraron en el conjunto estudios de diseños muy distintos sin ponderar por calidad. Segunda, la heterogeneidad destacada depende enteramente de qué modelo se lea: los mismos 35 estudios se reportan como I² = 82,98% bajo el modelo de efectos fijos y I² = 15,75% bajo el modelo de efectos aleatorios, así que quien lea los números sin la etiqueta del modelo puede concluir que el corpus es homogéneo cuando no lo es. Su estimación agrupada (g = 0,670, IC del 95% [0,491, 0,848]) es por tanto del tipo de cifra que describe la sección anterior: mejor construida que la mayoría, y aun así una cota superior.
  • Una crítica de medios y métodos muestra que muchas «mejoras en el aprendizaje» no se midieron válidamente: los resultados eran a menudo habilidades autoinformadas o rendimiento medido durante la asistencia de la IA, en lugar de aprendizaje duradero y sin asistencia.

Conclusión para los números de mejora anteriores: trate los grandes tamaños de efecto agrupados de la IA como cotas superiores, no como estimaciones puntuales. Prefiera la evidencia de mejora del aprendizaje de ECA bien diseñados y de estudios de campo con medidas de resultado estandarizadas y sin asistencia (el ECA sobre barreras de seguridad, los experimentos de Khanmigo y NUMI, y el metaanálisis de tecnología educativa del Banco Mundial citados antes), y lea las mejoras metaanalíticas como provisionales y probablemente exageradas hasta que mejore la calidad de la síntesis. El problema además sobrevive a la corrección: de los artículos publicados después de que se retractara uno de los metaanálisis auditados, el 60% seguía citándolo como respaldo autorizado de grandes mejoras de aprendizaje con ChatGPT y ninguno reconocía la retractación, así que una estimación retirada sigue propagándose. Por eso la página de Límites de la investigación en AIED documenta ahora en detalle la crisis de la evidencia metaanalítica.

Medir lo que importa

Las mejoras en el aprendizaje conectan con la validez de la evaluación: si las evaluaciones no captan una comprensión más profunda, las medidas de mejora del aprendizaje engañan. También se cruzan con la dependencia excesiva y la descarga cognitiva, donde las aparentes mejoras de rendimiento pueden enmascarar pérdidas de aprendizaje, y con los ECA (los ensayos aleatorizados como diseño de referencia para detectar mejoras causales en el aprendizaje), y con el metaanálisis (agrupar tamaños de efecto entre estudios para establecer la evidencia de eficacia del campo).

  • Mejoras pretest/postest significativas a partir de una pedagogía de la IA basada en errores: el curso de diseño de bases de datos de Hosseini (2026) (n=13) mostró mejoras grandes y significativas en ítems pretest/postest idénticos (media 4,25→6,83/7, d de Cohen = 1,49, p < .001), con mejoras no correlacionadas con la confianza previa en la IA o en las bases de datos: el diseño de crítica y refinamiento integrado con IA benefició al estudiantado con independencia de sus percepciones iniciales.

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.