Preguntas frecuentes
¿Usar IA ayuda de verdad a que mi estudiantado aprenda?
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
Sí, puede hacerlo, pero un trabajo mejor producido con IA no es necesariamente evidencia de un mejor aprendizaje. La investigación documenta beneficios de aprendizaje genuinos, efectos insignificantes y daños al aprendizaje. La pregunta importante no es simplemente si el estudiantado usa IA, sino qué les ayuda a hacer la IA, qué pensamiento sigue siendo responsabilidad suya y qué son capaces de hacer después.
La base de conocimiento llama a la distinción entre un trabajo asistido por IA exitoso y una capacidad adquirida la brecha entre desempeño y aprendizaje. Un estudiante podría entregar un ensayo más sólido o resolver más problemas de práctica con IA y, aun así, no volverse mejor (y a veces volverse peor) a la hora de hacer un trabajo comparable por su cuenta. A la inversa, una retroalimentación, unos ejemplos y una tutoría de IA bien diseñados pueden mejorar el desempeño posterior sin IA. Véase Ganancias de aprendizaje y Carga cognitiva y delegación cognitiva.
¿Qué muestra en realidad la investigación?
Algunas intervenciones apoyadas por IA mejoran el aprendizaje
Un punto de partida amplio es ¿Puede la tecnología educativa cerrar las brechas de aprendizaje? Evidencia global de intervenciones digitales. Esta síntesis del Banco Mundial de 14 estudios aleatorizados en diez economías estimó un efecto de aprendizaje promedio positivo de 0,125 desviaciones estándar para la tecnología educativa adaptativa y habilitada por IA. Sin embargo, combinó sistemas adaptativos anteriores con herramientas de IA generativa. No encontró ninguna ventaja estadísticamente establecida para las herramientas generativas más nuevas, aunque reconoció una incertidumbre considerable en esa comparación. El resultado respalda el potencial de estas intervenciones, no la afirmación de que cualquier chatbot mejorará el aprendizaje.
Una evidencia más específica muestra por qué importa el diseño instruccional. En Diseño de retroalimentación con IA generativa centrado en las personas en la educación superior, un estudio aleatorizado multisitio con 1.176 estudiantes universitarios de primer año comparó la retroalimentación entre pares, la retroalimentación directa de la IA, la autoevaluación seguida de retroalimentación de la IA, y una secuencia híbrida que combinaba autoevaluación, retroalimentación entre pares y crítica de la IA.
Los diseños reflexivos e híbridos produjeron una transferencia diferida sin IA más sólida que la retroalimentación directa de la IA. El estudiantado rindió después mejor en una nueva tarea de argumentación científica, y no solo en la tarea que estaba revisando. Sin embargo, esas condiciones también exigían una actividad evaluativa adicional y potencialmente más tiempo. El estudio respalda el diseño completo de la retroalimentación, más que demostrar que un componente o la propia IA causaran la ventaja.
La IA puede mejorar el desempeño en la práctica y a la vez perjudicar el aprendizaje
La advertencia más clara procede de La IA generativa sin barreras de protección puede perjudicar el aprendizaje: evidencia de las matemáticas de secundaria.
En este experimento de campo aleatorizado con casi 1.000 estudiantes, una interfaz de IA de propósito general aumentó las puntuaciones de práctica asistida en un 48% en relación con el grupo de control, pero el estudiantado obtuvo después un 17% menos en los exámenes sin asistencia. Un tutor configurado con orientaciones y pistas diseñadas por el profesorado evitó en gran medida esa penalización. De manera crucial, no produjo una mejora estadísticamente significativa en el desempeño de los exámenes sin asistencia respecto al grupo de control. Evitar el daño no es lo mismo que demostrar un aprendizaje adicional. Estos porcentajes describen esta intervención y este contexto concretos, no efectos universales del uso de IA.
La implicación es práctica: juzgar una herramienta de IA por las tareas hechas, las respuestas de práctica correctas o la satisfacción del estudiantado puede dar una imagen engañosa de su valor educativo. La satisfacción y la percepción de aprendizaje son medidas autoinformadas, y la base de conocimiento documenta cuánto pueden alejarse del aprendizaje medido.
Un estudio de campo más amplio y más largo apunta en la misma dirección a escala. La penalización de aprendizaje de la IA generativa siguió a 26.811 estudiantes de secundaria chinos (grados 7-12) durante 30 meses con una adopción de la IA escalonada. Las puntuaciones de las tareas subieron un 18% y el tiempo de finalización cayó un 30% (de 64 a 45 minutos), mientras que las puntuaciones de los exámenes mensuales con libro cerrado cayeron un 20% en seis meses y las de los exámenes de acceso de alta relevancia cayeron un 18-24% respecto a la línea base, pero solo después de unos dos años. Las pérdidas se concentraron en el 81% aproximado de usuarios de IA cuyo comportamiento indicaba externalización de las tareas; los usuarios que mantuvieron un tiempo de tareas comparable al de los no usuarios aprendieron de forma más o menos igual de eficiente. La divergencia entre el desempeño en las tareas y en los exámenes es la brecha entre desempeño y aprendizaje escrita a lo largo de toda una cohorte nacional, y el retraso de dos años significa que las evaluaciones cortas subestiman sistemáticamente el costo.
El acceso y las salvaguardas no bastan
Un experimento escolar aleatorizado de dos años, A un clic: tutoría con IA con Khanmigo, encontró modestas ganancias de rendimiento en matemáticas en 18 escuelas de secundaria. Sin embargo, el estudiantado rara vez participó en conversaciones de tutoría sustantivas. Los autores señalaron que las ganancias se parecían a las asociadas con la práctica estructurada sin IA. Como la intervención combinaba práctica individualizada y tutoría con IA, no aislaba de forma limpia la contribución adicional del componente de IA. Que haya un tutor capaz disponible es distinto de que el estudiantado lo use de forma productiva.
El experimento más reciente Hacer productiva la tutoría con IA ofrece una lección relacionada. Entre más de 6.000 estudiantes de secundaria que usaban NUMI, el apoyo de IA mejoró la recuperación después de los errores, pero ralentizó el avance entre preguntas. Una regla de dominio de tres aciertos consecutivos aumentó el éxito definido por la plataforma sin mejorar por sí sola el aprendizaje una semana después. La señal de aprendizaje diferido más fuerte apareció cuando la IA se integró en el flujo de trabajo de dominio, pero las ganancias fueron marginalmente significativas desde el punto de vista estadístico y se concentraron en material practicado concreto. Este documento de trabajo ofrece evidencia indiciaria para un enfoque cuidadosamente estructurado, no una receta ampliamente probada.
Cómo usa el estudiantado la herramienta, y no solo el acceso a ella, determina el resultado
La misma tecnología produce aprendizajes distintos según cómo se estructure la interacción. En un estudio cualitativo de 38 estudiantes universitarios en evaluaciones de ensayo sin supervisión, la implicación abarcó un espectro que iba de la delegación cognitiva a la reasignación cognitiva, es decir, desplazar el esfuerzo de la recuperación de bajo nivel a la evaluación crítica. La mayoría del estudiantado (n = 31) tenía la intención de usar la IA generativa como asistente de aprendizaje, pero el 76,32% se apoyaba en un diálogo de un solo turno de pedir, obtener la respuesta y parar, y el 78,94% usaba la herramienta antes o después de redactar en lugar de durante la tarea, lo que producía una paradoja de eficiencia: comodidad obtenida a costa del trabajo cognitivo que construye los esquemas ("la velocidad con la que lo olvidas también es muy alta"). Solo 8 estudiantes trabajaron como socios cognitivos mediante un diálogo sostenido e iterativo.
La lección pedagógica es que los permisos o las prohibiciones generales dejan al estudiantado adivinando. Lo que cambió el comportamiento fue una orientación específica para cada tarea sobre qué trabajo cognitivo debía conservar el estudiantado y qué asistencia de IA era apropiada, la dirección de diseño desarrollada en Reducir las trampas con IA.
Menos esfuerzo no significa automáticamente menos aprendizaje
También sería un error concluir que la IA solo ayuda cuando hace que el estudiantado trabaje más o cuando nunca muestra un ejemplo completo.
En los experimentos preregistrados recogidos en Entrenador, no muleta, los adultos que practicaron la revisión de cartas de presentación con IA produjeron después una escritura sin IA mejor que quienes practicaron solos, a pesar de emplear menos esfuerzo. Los beneficios se mantuvieron en un seguimiento al día siguiente. Otro experimento encontró que ver un ejemplo revisado por IA producía beneficios comparables a practicar con la herramienta. Eran tareas de escritura breves y acotadas, no evidencia de una mejora duradera en todo tipo de escritura, pero muestran que los ejemplos pueden apoyar el aprendizaje en lugar de reemplazarlo necesariamente.
El objetivo, por lo tanto, no es la dificultad máxima. Es preservar o mejorar la actividad de aprendizaje que desarrolla la capacidad prevista.
El patrón se repite en la educación en informática
Una revisión sistemática de 72 estudios en educación en informática encuentra la misma estructura en su resultado más robusto. La IA generativa eleva de forma fiable la finalización a corto plazo y reduce el tiempo en la tarea (36 estudios), y ni un solo estudio del corpus documenta un efecto negativo en el desempeño inmediato, pero esas ganancias "no se transfieren al desempeño independiente" (21 estudios). Los estudiantes asistidos por Codex completaron el doble de tareas durante el aprendizaje, pero no rindieron mejor que los controles en las pruebas posteriores sin IA. El conocimiento previo modera todo: el estudiantado bien preparado convierte la asistencia en habilidad duradera, mientras que el estudiantado con menos preparación corre el riesgo de usarla como una muleta que le quita la práctica que necesita. El requisito de diseño central de la revisión es la verificación (leer, probar, modificar, explicar y criticar el resultado de la IA) convertida en un componente calificado y observable del trabajo, y no en una aspiración dejada a la discreción.
Un principio de diseño útil: andamiar, no sustituir
Las síntesis de andamiaje y Aprendizaje activo de la base de conocimiento subrayan el apoyo que ayuda a quien aprende a comprender, practicar, evaluar y, con el tiempo, desempeñarse con menos asistencia.
"Andamiar, no sustituir" es un principio útil, pero hay que aplicarlo al objetivo de aprendizaje, no mecánicamente a cada función de IA. Un ejemplo completo resuelto puede ser algo de lo que el estudiantado aprenda; una secuencia de pistas también puede convertirse en algo que van clicando sin pensar. La distinción importante es qué hace quien aprende con la asistencia. Véase Carga cognitiva y delegación cognitiva y Búsqueda de ayuda.
Para una actividad destinada a desarrollar capacidad independiente, una rutina inicial razonable es:
- Establezca el pensamiento de quien aprende. Pida un intento inicial, una predicción, un borrador, una explicación o una interpretación de un ejemplo apropiado.
- Ofrezca una asistencia específica. Use la IA para una pista, una explicación, un ejemplo contrastante o una retroalimentación centrada en la dificultad.
- Exija una respuesta a la asistencia. Haga que el estudiante explique, revise, verifique o justifique aceptar o rechazar la sugerencia.
- Compruebe una nueva aplicación con menos apoyo. Pida al estudiante que resuelva un problema comparable o aplique la idea en un contexto diferente.
Este es un punto de partida instruccional, no una secuencia validada universalmente. La cantidad y el momento del apoyo deberían reflejar el conocimiento previo del estudiantado y la tarea. Véase Reducir el mal uso de la IA y Conocimiento previo.
Haga explícito el pensamiento que se conserva
En matemáticas, un docente podría pedir al estudiantado que entregue su solución intentada antes de solicitar ayuda y luego usar una indicación como: "Identifica el primer paso que debería reconsiderar, dame una pista útil y pídeme que lo intente de nuevo". La comprobación posterior debería exigir una nueva solución y una explicación, y no la reproducción de la respuesta de la IA. Esto aplica las orientaciones de andamiaje y Búsqueda de ayuda.
En escritura, un docente podría hacer que el estudiantado evalúe su borrador con una rúbrica antes de recibir la crítica de la IA y luego explicar qué sugerencias aceptó, modificó o rechazó. Si la construcción de argumentos es el objetivo, la prosa generada por IA no debería sustituir la evidencia de que el estudiante puede construir un argumento. Si evaluar revisiones alternativas es el objetivo, comparar ejemplos completos puede ser apropiado. Véase Educación en escritura y Alfabetización en retroalimentación.
Estas son aplicaciones de diseño de la evidencia. Aun así deberían evaluarse en el curso en lugar de darse por supuestas porque suenen pedagógicamente sensatas.
¿Cómo puedo saber si la IA está ayudando en mi curso?
La página Evaluación de la IA en educación recomienda separar la calidad del resultado de la IA, la experiencia del estudiantado al usarla y el aprendizaje real del estudiantado. Una evaluación práctica necesita más que una encuesta de satisfacción o una comparación de las calificaciones de las tareas.
Especifique primero la capacidad. Decida qué debería entender o ser capaz de hacer el estudiantado después de la actividad. "Producir un informe pulido" es distinto de "seleccionar evidencia apropiada", "explicar una relación causal" o "detectar una conclusión sin respaldo". La evaluación debería revelar la capacidad que se pretende desarrollar. Véase Medición educativa.
Mida antes, después y más tarde. Use una breve tarea de línea base, una comprobación inmediata del aprendizaje y una aplicación diferida. Incluya tanto una tarea comparable como, cuando proceda, una que cambie el contexto o exija una aplicación diferente. Cuando el objetivo es la competencia independiente, retire la asistencia de IA que podría desempeñar esa competencia en lugar del estudiante. Una comprobación exitosa inmediatamente después de la práctica es útil, pero no establece la retención durante meses ni la transferencia entre dominios. Véase Ganancias de aprendizaje y Transferencia del aprendizaje.
Use una comparación significativa. Cuando sea factible, compare la actividad apoyada por IA con una alternativa sin IA bien diseñada que use contenido, tiempo de instrucción y oportunidades de práctica similares. Una simple mejora antes y después no puede establecer que la IA causó la ganancia; el estudiantado podría mejorar por el resto de la enseñanza. Para afirmaciones causales más sólidas, consulte Métodos de investigación de eficacia al diseñar la comparación.
Observe cómo usa el estudiantado la ayuda. Busque explicaciones, intentos de corregir errores, revisiones justificadas y verificación, y no solo inicios de sesión, recuentos de mensajes o preguntas completadas. Estas observaciones pueden ayudar a explicar un resultado, pero no deberían reemplazar una medida de aprendizaje. Véase Búsqueda de ayuda y Interacción estudiante-IA.
Compruebe qué mide realmente un panel de control. En una evaluación de ocho agentes de enseñanza con IA en educación médica, la clasificación de los agentes según la propia puntuación de la plataforma divergía de una rúbrica de calidad docente validada por expertos (el agente clasificado en tercer lugar por la plataforma quedó último en calidad según la rúbrica) porque la puntuación de la plataforma seguía el desempeño del estudiantado durante la interacción, y no el comportamiento docente del agente. Una métrica incorporada es una hipótesis que hay que validar, no evidencia de aprendizaje. Véase Evaluar intervenciones de IA: métodos para conocer las medidas y los diseños de comparación que hacen creíble esa comprobación.
Una salvedad importante es que no todo resultado de aprendizaje legítimo debe demostrarse sin IA. Un curso puede enseñar deliberadamente un trabajo eficaz apoyado por IA. En ese caso, evalúe la capacidad del estudiantado para seleccionar, verificar, revisar y defender su uso de la IA, junto con las bases independientes que exija la disciplina. Una prueba de capacidad humana para los resultados de aprendizaje en la era de la IA propone esta distinción entre capacidad independiente, desempeño aumentado por IA y responsabilidad de verificación. Es un marco conceptual de evaluación, no una solución validada para todos los cursos.
Compruebe quién se beneficia y qué cuesta el beneficio
Una mejora promedio puede ocultar a estudiantes que reciben poco beneficio o que se topan con nuevas barreras. La síntesis Brecha digital distingue el acceso a una herramienta de las habilidades necesarias para usarla y de los resultados que se obtienen en última instancia.
Para una evaluación en el aula, examine los resultados según puntos de partida pertinentes como el conocimiento previo, las necesidades lingüísticas y los requisitos de accesibilidad. Ofrezca orientación en lugar de suponer que el estudiantado ya sabe cómo obtener y evaluar una retroalimentación útil. Al evaluar el aprendizaje independiente, retire la asistencia que aporta el pensamiento objetivo, y no los ajustes necesarios para acceder a la tarea. Véase Alfabetización en IA, Equidad en la educación con IA y Accesibilidad.
También inspeccione la retroalimentación que recibe realmente el estudiantado. Una respuesta fluida puede diagnosticar mal su dificultad, reforzar un error u ofrecer una respuesta cuando se necesitaba otro tipo de apoyo. Use materiales alineados con el curso, conserve una vía de ayuda humana y evite recoger más información del estudiante de la que exige la actividad. Estas preocupaciones conectan directamente con Calidad de la retroalimentación de IA, Seguridad pedagógica y Privacidad.
Conclusión
La IA puede ayudar al estudiantado a aprender, pero ni el acceso, ni un resultado pulido, ni la etiqueta de "tutor" establecen que lo haga. La evidencia es más sólida cuando se evalúa un diseño instruccional especificado frente a una alternativa significativa usando medidas de las capacidades que se supone que el estudiantado debe desarrollar. La retención a largo plazo, la transferencia amplia y la generalización entre estudiantes y contextos siguen siendo incertidumbres importantes. Véase Limitaciones en la investigación sobre AIEd.
La pregunta más útil para un docente es:
Después de esta actividad apoyada por IA, ¿qué puede entender, explicar, juzgar o hacer mi estudiantado que no podía hacer antes, y qué evidencia muestra esa mejora?