En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

Los métodos de investigación en AIED: el conjunto de diseños empíricos, estrategias de recogida de datos y técnicas analíticas que usa quien investiga para estudiar la IA en la educación: si las herramientas de IA apoyan (o dañan) el aprendizaje y cómo lo hacen, y en qué condiciones. El corpus de la base de conocimiento abarca métodos experimentales, de encuesta, cualitativos, basados en el diseño, de evaluación computacional con puntos de referencia y de revisión. Cada uno tiene fortalezas y limitaciones propias, y elegir entre ellos implica compensaciones entre la validez interna (la confianza en las afirmaciones causales), la validez externa (la generalizabilidad), la validez ecológica (la autenticidad del mundo real) y la viabilidad de estudiar herramientas de IA que cambian muy rápido.

Preguntas para reflexionar

  • La tensión central de la página: los diseños más sólidos para la inferencia causal (los experimentos aleatorizados) son los más difíciles de llevar a cabo en aulas reales, mientras que los entornos más auténticos ofrecen un control causal más débil. Si tuviera que decidir si un tutor de IA ayuda a aprender, ¿con cuál de esos dos fallos preferiría convivir, y por qué?
  • Antes de leer, ¿sabría nombrar la diferencia entre validez interna, externa y ecológica? La página sostiene que todo diseño las compensa entre sí. ¿Cómo podría un estudio rigurosamente causal seguir diciéndole casi nada útil sobre un aula real?
  • Un punto de referencia muestra que una IA obtiene una precisión alta, pero la página insiste en que una precisión alta en un punto de referencia no implica eficacia educativa. ¿Por qué un sistema que «pasa la prueba» podría seguir sin ayudar al estudiantado a aprender, y qué tipo de evidencia falta?
  • La investigación basada en el diseño itera sobre una intervención real, pero no puede atribuir las ganancias a un mecanismo concreto, mientras que un ensayo controlado aleatorizado aísla las causas pero se ejecuta en condiciones artificiales. Dado el ritmo rápido del cambio en la IA, ¿cuánto tiempo cree que un ensayo controlado aleatorizado riguroso sigue siendo relevante antes de que la herramienta que evaluó quede obsoleta?
  • El consenso de expertos por método Delphi establece acuerdo entre expertos, no un efecto empírico. ¿Cuándo es legítimo construir un marco de competencias a partir de lo que creen los expertos, y cuándo a partir de datos sobre lo que funciona, y cómo distinguiría la diferencia en la práctica?
  • La página aboga por la triangulación: combinar la evaluación con puntos de referencia, los experimentos, la medición y el trabajo cualitativo para juzgar tanto si una herramienta funciona como de qué manera. Antes de leer, en una afirmación como «esta IA mejora el aprendizaje», ¿en qué punto haría falta cada método para que usted se convenciera?

Introducción

La tensión central de la investigación en AIED es que los diseños más sólidos para la inferencia causal (los experimentos aleatorizados) suelen ser los más difíciles de llevar a cabo con herramientas de IA auténticas en aulas reales, mientras que los entornos más auténticos (despliegues sobre el terreno, estudios de caso, análisis de datos de registro) ofrecen un control causal más débil. Ningún método resuelve esto por sí solo; el campo avanza triangulando entre métodos y siendo explícito sobre qué tipo de afirmación puede sostener cada diseño. Todo método arrastra además limitaciones transversales (la generalizabilidad, la validez de la medición, el ritmo rápido del cambio en la IA, la reproducibilidad y un uso débil de la teoría) que quien lee debe sopesar; véase Limitations in AIEd Research.

El tema de esta página es el método y no los hallazgos. Las ciencias del aprendizaje son el campo sustantivo al que sirven estos métodos: donde esta página cubre cómo debería diseñarse, medirse y comunicarse un estudio, aquella cubre lo que el campo ha establecido sobre cómo aprende la gente y cómo deberían diseñarse los entornos de aprendizaje, y trata los métodos basados en el diseño y los mixtos como los enfoques característicos de las ciencias del aprendizaje y no como dos opciones entre muchas.

Rigor en la comunicación de resultados y el modelo TEP-AIED

La calidad de la comunicación de resultados de los estudios sobre IA en la educación es en sí misma una preocupación de investigación. El modelo TEP-AIED (Hwang, Xie, Wah y Gasevic, 2026) ofrece un marco estructurado para presentar con rigor la investigación sobre IA en la educación, organizando los componentes esenciales de un informe de estudio (el encuadre del problema teórico, tecnológico y educativo, el diseño, los datos, el análisis y los resultados) para que quien lee y quien revisa puedan evaluar si las afirmaciones están respaldadas y si el trabajo es reproducible. Responde a las debilidades crónicas del campo en la comunicación de resultados (descripciones vagas de las herramientas, versiones de modelo sin declarar, detalles de evaluación omitidos) que documenta la página de límites. Los marcos de comunicación como TEP-AIED se sitúan junto a las listas de verificación consolidadas (por ejemplo, las orientaciones al estilo CONSORT para los ensayos y las orientaciones al estilo PRISMA para las revisiones) como parte del giro más amplio del campo hacia la transparencia metodológica y la reproducibilidad.

RAISE (Allison, 2026) aborda el mismo problema desde la dirección opuesta: como una lista de verificación y no como una estructura narrativa. Establece 30 ítems repartidos en diez dominios temáticos (justificación educativa y fundamentación teórica, especificación del sistema de IA, papel de la IA e interacción, accesibilidad y adecuación cultural, entorno y participantes, intervención humana, diseño del estudio y evaluación, ética y fiabilidad, transparencia y reproducibilidad, y limitaciones e implicaciones), con una versión editable y una Matriz de ética y riesgo complementaria que cubre la agencia de quien aprende, la equidad de acceso, la gobernanza de los datos y la transparencia algorítmica. Los dos marcos se dirigen directamente el uno al otro: TEP-AIED caracteriza a RAISE como exhaustivo, pero critica su amplitud, sosteniendo que «su amplitud y granularidad pueden volverlo complejo y menos accesible para aplicaciones empíricas rutinarias», mientras que el propio encuadre de RAISE es que no impone ningún método ni modelo y solo exige que las decisiones se hagan visibles. Leídos juntos, marcan la compensación propia de esta literatura (la lista de verificación de auditoría más completa frente a la narrativa más ligera de tres dimensiones) y convergen en los mismos puntos no negociables: nombrar y versionar el sistema de IA, declarar las indicaciones y el diseño de la interacción, definir las condiciones de tratamiento y de comparación, informar de la revisión ética y de la mitigación de riesgos, y decir si los resultados miden el rendimiento, la retención o la transferencia. Para que un estudio pueda juzgarse en esos términos, el instrumento de comunicación debe adoptarse en la fase de diseño y no ensamblarse en la fase de manuscrito, que es el punto en el que insisten ambos marcos. El análisis histórico a escala de corpus es en sí mismo una decisión metodológica con obligaciones de transparencia: Rismanchian y Doroudi sitúan cada artículo en su marco AI×Ed a partir del juicio de los autores sobre los resúmenes y los textos completos, reconocen explícitamente que no es una categorización sistemática ni escalable basada en datos, y publican su conjunto de datos completo como material suplementario para su replicación.

Diseños experimentales y cuasi experimentales

Un estudio de eficacia evalúa si una intervención produce el efecto de aprendizaje que pretende, normalmente mediante diseños experimentales o cuasi experimentales que comparan los resultados con y sin la intervención. Los experimentos asignan aleatoriamente a quien aprende a distintas condiciones (por ejemplo, tutor de IA frente a tutor humano, o con andamiaje de IA frente a sin asistencia) para estimar efectos causales en resultados como las ganancias de aprendizaje, la implicación o la motivación. Los ensayos controlados aleatorizados son el estándar de referencia para la validez interna. Un estudio de campo aleatorizado sobre el apoyo humano junto a la tutoría con IA y un ensayo controlado aleatorizado sobre la IA generativa en la enseñanza usan la asignación para aislar efectos causales. Los diseños cuasi experimentales (pre/post, entre sujetos o grupos emparejados sin aleatorización) son más viables en aulas intactas, pero más débiles para las afirmaciones causales.

Estudios de encuesta y de modelado de ecuaciones estructurales

Las encuestas transversales miden actitudes, percepciones, motivación, autoeficacia y aceptación tecnológica autoinformadas, a menudo modeladas con regresión o con modelado de ecuaciones estructurales (SEM/PLS-SEM) para poner a prueba relaciones hipotetizadas y mediadores. Estas dominan el corpus de la base de conocimiento, en particular para las preguntas sobre aceptación, motivación y mecanismos psicológicos.

  • Fortalezas: muestras grandes; una cobertura amplia y de bajo coste; permiten poner a prueba modelos mediacionales complejos de mecanismos psicológicos; viables para estudiar actitudes difíciles de observar.
  • Limitaciones: los datos transversales no pueden establecer causalidad; sesgo de método común y de autoinforme; el muestreo por conveniencia limita la generalizabilidad; los mediadores se infieren de la covarianza y no de una manipulación.

El instrumento mismo merece un examen aparte. Lo que un cuestionario, una entrevista o un diario pueden y no pueden establecer, y la brecha documentada entre lo que la gente informa y lo que hace, se recoge en Self-Report Measures.

Métodos cualitativos

Las entrevistas, los grupos de discusión y el análisis temático producen relatos ricos y contextuales de cómo el estudiantado y el profesorado viven las herramientas de IA, los significados que les atribuyen y las tensiones y los daños que las medidas estandarizadas pasan por alto. La investigación sobre la seguridad de los tutores de IA y cómo la IA cambia los flujos de trabajo docentes se apoyan en gran medida en evidencia cualitativa. Véase la página de concepto específica de Qualitative Research para el tratamiento completo de los enfoques cualitativos (el análisis temático, la teoría fundamentada, la fenomenología y la fenomenografía, el análisis del discurso, las observaciones y la etnografía, los estudios de caso y las entrevistas y grupos de discusión), cada uno con ejemplos de la base de conocimiento.

Diseños de métodos mixtos

Los estudios de métodos mixtos combinan ramas cuantitativas y cualitativas, a menudo de forma secuencial (por ejemplo, QUAL→QUAN→qual), de modo que los datos cualitativos expliquen o contextualicen los hallazgos cuantitativos. Un estudio de métodos mixtos sobre la IA generativa y el aprendizaje sostenible combina encuestas de tres oleadas con entrevistas a docentes; el estudio de la paradoja de la competencia usa grupos de discusión con docentes, una encuesta al estudiantado y entrevistas de seguimiento.

Investigación basada en el diseño (DBR)

La DBR diseña, implementa y refina iterativamente una intervención educativa en contextos auténticos, alternando entre la teoría, el diseño y la práctica real. Destaca en la base de conocimiento por el desarrollo de entornos de aprendizaje con IA y de modelos pedagógicos. Véase la página de concepto específica de Design-Based Research para el ciclo completo de la DBR, sus ejemplos y sus fortalezas y limitaciones. Un ejemplo canónico de la AIED es el estudio del modelo de aprendizaje colaborativo asistido por IA (Putra et al.), que ejecutó un ciclo de DBR de cuatro fases (análisis de necesidades, diseño del modelo, implementación en el aula durante ocho semanas y refinamiento del modelo), iterando sobre un ciclo de aprendizaje de cuatro etapas (identificación del problema → indagación colaborativa asistida por IA → resolución de problemas colaborativa → reflexión y presentación). Otros ejemplos desarrollan la formación del profesorado en alfabetización en IA (Development and evaluation of artificial intelligence literacy training for teacher education students) y el andamiaje de IA generativa para el pensamiento crítico (Scaffolding critical thinking with generative AI: Design principles for integrating large language models in higher).

La DBR cambia el control causal de los experimentos por autenticidad ecológica y refinamiento iterativo: es la herramienta adecuada para preguntas del tipo «¿cómo diseñamos este entorno de aprendizaje con IA para que funcione en la práctica?», y su evidencia es más sólida como prueba de concepto y orientación de diseño que como eficacia causal. Leer las ganancias de aprendizaje de la DBR exige la misma precaución que otros diseños: sin una medida de resultado controlada y sin asistencia, las ganancias pueden reflejar el mismo factor de confusión del rendimiento inflado por la IA que se documenta en ganancias de aprendizaje.

Revisiones sistemáticas y metaanálisis

Las revisiones sintetizan el corpus de evidencia en lugar de ejecutar un experimento nuevo. Las revisiones sistemáticas y de alcance aplican un protocolo transparente para buscar, cribar, valorar y sintetizar un conjunto de estudios; los metaanálisis agrupan además los tamaños del efecto de varios estudios para producir una estimación resumen ponderada y poner a prueba moderadores. Una revisión exhaustiva de los ITS y una revisión sistemática de la IA generativa en la educación superior ejemplifican el enfoque.

Véase la página de concepto específica de Meta-Analysis and Systematic Review para un tratamiento más completo de la revisión sistemática y el metaanálisis en la IA en la educación, incluida su relación con los diseños primarios, la comunicación conforme a PRISMA y sus fortalezas y limitaciones.

Evaluación computacional y con puntos de referencia

La evaluación computacional evalúa los sistemas de IA directamente (frente a puntos de referencia, etiquetas de referencia o juicios humanos) en lugar de estudiar a personas que aprenden. Esto incluye los puntos de referencia y los enfoques de Grandes modelos de lenguaje (LLM) como juez. Es el método más cercano a la evaluación de la IA educativa (véase la distinción más abajo).

Otros diseños: estudios longitudinales, de caso y de simulación

Más allá de las grandes familias, la base de conocimiento usa diseños longitudinales que siguen a quien aprende a lo largo del tiempo (un estudio longitudinal de un LMS), estudios de caso y en condiciones reales sobre un uso auténtico (un análisis a gran escala de interacciones reales del estudiantado) y estudios de simulación en los que los LLM hacen las veces de estudiantes o de pacientes (los LLM como estudiantes simulados, simulación). Estos cambian amplitud o control por realismo y por acceso a fenómenos que de otro modo son difíciles de observar.

Métodos de consenso de expertos: la técnica Delphi

El método Delphi es una técnica estructurada para establecer un consenso de expertos sobre una cuestión cuya respuesta todavía no se conoce empíricamente; se usa sobre todo en la base de conocimiento para desarrollar marcos, listas de competencias y definiciones con los que puedan estar de acuerdo quienes ejercen la práctica y quienes investigan. En un estudio Delphi, un panel de expertos responde a rondas sucesivas de cuestionarios; tras cada ronda se devuelve un resumen anonimizado de las respuestas del grupo, y los expertos revisan sus respuestas hasta que el grupo converge en un acuerdo (definido normalmente por un umbral preestablecido, por ejemplo el 75%). Es una forma de construir validez de constructo y consenso profesional mediante una consulta iterativa y anonimizada, y no mediante una única encuesta o votación.

  • Fortalezas: produce consenso a partir de un panel diverso de expertos sin las presiones de un grupo presencial (el anonimato reduce los efectos de dominancia); muy adecuados para definir constructos, competencias y marcos cuando no existe una medida validada; las rondas iterativas permiten a los expertos refinar y converger; viables cuando los experimentos completos o las muestras grandes no son prácticos.
  • Limitaciones: el consenso refleja el juicio de los expertos y no evidencia empírica: establece acuerdo, no efecto; los resultados dependen de la composición del panel y del umbral de consenso (subjetivo); pueden ser lentos a lo largo de varias rondas; el juicio de un solo panel puede no generalizarse.
  • Ejemplos: el estudio del marco SAIL (tres rondas, 17 expertos, refinando niveles de competencia en alfabetización en IA), el estudio del marco HCAP (tres rondas, 30 docentes, definiendo 25 competencias docentes en IA), el heptágono de la alfabetización en IA (que usó aportaciones y consenso de expertos junto a una revisión guiada por PRISMA), y.

El Delphi se combina a menudo con otros métodos: por ejemplo, el consenso de expertos puede usarse para validar un marco (como en SAIL y HCAP) que después se pone a prueba o se implementa mediante investigación basada en el diseño o estudios de encuesta. Convive con los enfoques cualitativos y de juicio experto y contribuye a la validez de los instrumentos basados en marcos.

Investigación frente a evaluación: conexiones y distinciones

La investigación y la evaluación están muy relacionadas, pero son distintas. La investigación plantea preguntas generalizables sobre cómo afecta la IA al aprendizaje («¿mejora el andamiaje los resultados de aprendizaje?») y aspira a construir teoría y evidencia que se transfiera más allá del estudio concreto. La evaluación (véase AI Ed Evaluation) valora si una herramienta o un sistema de IA concreto funciona (si es preciso, fiable, pedagógicamente sólido y adecuado a su propósito) frente a puntos de referencia, rúbricas o criterios definidos por los actores implicados. La investigación hace hincapié en la validez interna y la generalización; la evaluación, en la calidad del sistema y la toma de decisiones local.

Los límites se difuminan: los estudios con puntos de referencia son evaluación que puede alimentar la investigación, y los instrumentos de evaluación (rúbricas, conjuntos de referencia, marcos de validez) dependen de las cuestiones de Educational Measurement y Validez de la evaluación que la investigación aclara. A la inversa, los hallazgos de la investigación sobre qué apoya el aprendizaje deberían orientar cómo se evalúan las herramientas de IA. La base de conocimiento las trata como complementarias: la evaluación computacional y con puntos de referencia (Benchmark, AI Ed Evaluation) nos dice si un sistema de IA es técnicamente sólido, mientras que la investigación de eficacia y de encuesta (RCT) nos dice si ayuda a la gente a aprender.

Cómo elegir entre métodos

La elección del método sigue a la pregunta de investigación. Las preguntas sobre efectos causales favorecen los experimentos (RCT); las preguntas sobre mecanismos y percepciones, las encuestas y el trabajo cualitativo; las preguntas sobre la calidad de un sistema, la evaluación computacional (Benchmark, AI Ed Evaluation); las preguntas de síntesis, las revisiones y los metaanálisis; las preguntas de diseño, la DBR; y las preguntas sobre qué debería contener un constructo, una competencia o un marco según el acuerdo entre expertos favorecen métodos de consenso de expertos como la técnica Delphi. Dada la heterogeneidad del campo y la velocidad del cambio en la IA, el corpus de la base de conocimiento refleja un giro deliberado hacia la triangulación: combinar la evaluación computacional con evidencia de eficacia, cualitativa y de consenso de expertos para juzgar tanto si una herramienta funciona como si ayuda a aprender.

Igual de importante es leer cualquier estudio con conciencia de los límites transversales que afectan a la investigación en AIED en su conjunto: las restricciones metodológicas, el ritmo rápido del cambio en la IA frente a una publicación lenta, las carencias de reproducibilidad y de prácticas FAIR, la dependencia de herramientas propietarias y un uso débil o acrítico de la teoría. Véase Limitations in AIEd Research.

Contraste entre las principales tradiciones de investigación

Las tres grandes tradiciones de investigación (la cuantitativa, la cualitativa y la experimental) difieren en lo fundamental en lo que pueden afirmar, lo que sacrifican y cuándo es apropiada cada una. Comprender estos contrastes es esencial tanto para diseñar como para leer investigación sobre IA en la educación.

Qué establece cada tradición

Dimensión Cuantitativa / encuesta Cualitativa Experimental
Pregunta central ¿Cuánto? ¿Cómo se relaciona? ¿Qué significa? ¿Cómo se vive? ¿X causa Y?
Datos primarios Números, escalas, autoinforme Palabras, observaciones, artefactos Medidas de resultado entre condiciones asignadas
Objetivo de la inferencia Patrones, correlaciones, mediación Significado, mecanismos, categorías Efectos causales
Validez interna Débil (correlacional) Débil (sin control) Fuerte (asignación aleatoria)
Validez externa Fuerte (muestras grandes) Limitada (pequeña, atada al contexto) Moderada (condiciones controladas)
Validez ecológica Moderada Alta Más baja (condiciones artificiales)
  • La investigación cuantitativa mide y modela relaciones entre variables: encuestas, SEM/PLS-SEM, medición, seguimiento longitudinal. Aporta amplitud, precisión y generalizabilidad, pero no puede establecer causalidad a partir de datos transversales y hereda las limitaciones de la medición (incluido el sesgo de autoinforme).
  • La investigación cualitativa interpreta el significado y la experiencia: entrevistas, grupos de discusión, análisis temático, teoría fundamentada, fenomenografía, análisis del discurso, observación y etnografía, estudios de caso. Aporta profundidad, mecanismo y construcción de teoría (véase Theory Development in AI in Education) pero una generalizabilidad limitada y un apoyo causal débil.
  • Los diseños experimentales y cuasi experimentales (véase RCT) estiman efectos causales mediante asignación aleatoria o comparación emparejada: el estándar de referencia para la validez interna, a costa del coste, la velocidad y la validez ecológica.

Los vínculos con la medición y los métodos mixtos

El trabajo cuantitativo depende de la medición educativa: instrumentos fiables y válidos para los constructos que se estudian. El trabajo cualitativo revela los mecanismos y los significados que esos instrumentos pueden pasar por alto. El trabajo experimental estima si una intervención causa los resultados que miden los instrumentos. Las tres son capas complementarias: los instrumentos cuantifican constructos, los experimentos establecen causalidad y el trabajo cualitativo explica el cómo y el porqué que hay detrás de las cifras.

Los diseños de métodos mixtos combinan deliberadamente ramas cuantitativas y cualitativas para que sus fortalezas compensen las debilidades de la otra: amplitud cuantitativa más profundidad cualitativa, con la triangulación aumentando la confianza.

Investigación sobre usabilidad y IHC

Una rama metodológica distinta, la investigación sobre usabilidad e IHC, evalúa cómo interactúan las personas usuarias con un sistema de IA: su usabilidad, su utilidad, su facilidad de aprendizaje y su experiencia de uso, mediante protocolos de pensamiento en voz alta, estudios estructurados con usuarios, entrevistas y observación. Es la más cercana a la evaluación de la IA educativa y responde a una pregunta previa: incluso una herramienta pedagógicamente sólida fracasa si es inutilizable. La investigación sobre usabilidad comparte métodos de recogida de datos con la investigación cualitativa, pero aspira a evaluar un artefacto y no a interpretar un significado.

Beneficios y limitaciones entre tradiciones

  • Cuantitativa / encuesta: beneficios: muestras grandes, cobertura amplia, pone a prueba mediadores complejos, eficiente. Limitaciones: nada de causalidad, sesgo de autoinforme, muestreo por conveniencia, los instrumentos pueden medir el constructo equivocado.
  • Cualitativa: beneficios: comprensión profunda, saca a la luz fenómenos y daños inesperados, esencial para construir teoría, sitúa en el centro voces poco representadas. Limitaciones: generalizabilidad limitada, dependencia de quien investiga, muestras pequeñas, apoyo causal débil, difícil de sintetizar.
  • Experimental: beneficios: la inferencia causal más sólida, una medición limpia de los resultados, estimación del tamaño del efecto. Limitaciones: costosa y lenta, condiciones artificiales, el cambio rápido de la IA deja obsoletos los resultados, muestras pequeñas con potencia insuficiente, restricciones éticas.
  • Métodos mixtos: beneficios: triangulación, amplitud más profundidad, explica resultados inesperados. Limitaciones: complejos, intensivos en recursos, la integración puede ser superficial, heredan las debilidades de cada rama.
  • Usabilidad / IHC: beneficios: identifica barreras de adopción, orientación de diseño accionable, rápida y barata. Limitaciones: no establece efectos sobre el aprendizaje, muestras pequeñas, la satisfacción autoinformada puede engañar.

En la práctica, la investigación sobre IA en la educación rara vez encaja limpiamente en una sola tradición. La evidencia más sólida triangula: una evaluación computacional o de usabilidad establece que un sistema funciona, un experimento establece que causa aprendizaje, los instrumentos cuantitativos miden los constructos y el trabajo cualitativo revela los mecanismos y los significados, respondiendo en conjunto tanto si una herramienta ayuda a aprender como cómo y por qué.

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.