En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

El aprendizaje automático — la base técnica de la IA en la educación: algoritmos que infieren patrones, predicciones y políticas a partir de datos educativos en lugar de reglas codificadas a mano. Abarca el aprendizaje supervisado (clasificar al estudiantado en riesgo, predecir calificaciones), el aprendizaje no supervisado (descubrir agrupaciones de estudiantes), el aprendizaje por refuerzo (inducir políticas de tutoría y andamiaje) y el aprendizaje profundo (modelos neuronales para secuencias, cursos y conducta visual). La IA generativa es el subconjunto más reciente y visible, pero se apoya en una pila mucho más antigua de maquinaria predictiva y adaptativa.

Preguntas para reflexionar

  • Es probable que se haya topado con sistemas de recomendación o puntuaciones de riesgo que «aprendieron» de los datos. ¿Qué le parece que un modelo decida algo sobre usted (como una marca de riesgo o una ruta recomendada) basándose solo en patrones de datos históricos?
  • La página traza una línea nítida entre predecir un riesgo e intervenir de verdad: una puntuación de riesgo le dice que un estudiante podría suspender, pero no qué hacer al respecto. ¿Dónde ha visto una predicción presentada como si ya fuera una solución?
  • El aprendizaje automático puede «hackear» su propia recompensa: un tutor de IA que optimiza la implicación puede mantener entretenido al estudiantado mientras le enseña poco. Si un sistema parece mediblemente exitoso pero es pedagógicamente dañino, ¿qué medidas deberíamos vigilar además del número que optimiza?
  • Los modelos predictivos entrenados con calificaciones históricas pueden codificar sesgos sistémicos, y la supervisión automatizada de exámenes eleva el riesgo de falsos positivos que señalan erróneamente conductas normales. Cuando los datos arrastran los sesgos del pasado, ¿cuánto deberíamos confiar en una IA que los usa para tomar decisiones educativas de alto impacto?
  • Algunos sistemas de IA superan a los métodos interpretables por las personas, pero siguen siendo opacos: se ve que funcionan, pero no por qué. En educación, ¿cuándo es la interpretabilidad algo «deseable» y cuándo es innegociable?
  • La IA generativa suele tratarse como algo completamente nuevo, pero la página la enmarca como el subconjunto más reciente del aprendizaje automático. ¿Cómo cambia el ver ChatGPT como parte de la misma maquinaria predictiva y adaptativa los riesgos y límites que cabría esperar que herede?

Introducción

El aprendizaje automático es lo que convierte los rastros educativos en inteligencia accionable. Impulsa los modelos de estudiante que hay detrás de los sistemas adaptativos, los paneles de analítica del aprendizaje que señalan a quienes están en riesgo, los tutores inteligentes que eligen el siguiente problema o andamiaje, y los sistemas automatizados de supervisión que vigilan los exámenes remotos. En los artículos aquí sintetizados, el patrón es constante: recoger datos sobre quienes aprenden, aprender de ellos un modelo predictivo o de decisión y actuar según ese modelo, ya sea la acción una alerta temprana, una recomendación de curso, un andamiaje adaptativo o la vigilancia de un examen.

Qué hace el aprendizaje automático en la educación

Modelado predictivo para el éxito del estudiantado. Los clasificadores supervisados —regresión logística, bosques aleatorios, SVM, K vecinos más cercanos— identifican al estudiantado en riesgo antes de que abandone, usando rendimiento académico, datos demográficos y registros de matrícula. Arquitecturas más avanzadas van más lejos: el transformer TRACE predice conjuntamente los cursos que cursará el estudiantado y las calificaciones que obtendrá el semestre siguiente, modelando la concurrencia de asignaturas cursadas a la vez en lugar de tratar el historial como una secuencia plana. Los híbridos de optimizador y secuencia, como el marco DMO-GRU de el aprendizaje en línea interactivo, combinan la selección automática de características y el ajuste de hiperparámetros con redes recurrentes para alcanzar una alta precisión y un error bajo en la predicción de la implicación y el rendimiento. Una ambición compartida es la «educación de precisión»: estratificación continua del riesgo y gemelos digitales del estudiantado que anticipan el fracaso y alinean las trayectorias con los resultados, lo que desplaza a las instituciones de la remediación reactiva al apoyo preventivo. Los modelos de caja de cristal pueden defenderse aquí: Zhang, Jeffries y Koprinska (2025) muestran que los árboles de decisión intrínsecamente interpretables —podados hasta solo 3–5 nodos hoja mediante selección de características— predicen el progreso del estudiantado a nivel de módulo en cursos masivos en línea de programación con tanta precisión como los bosques aleatorios y las SVM de caja negra (85–91% de precisión), evidencia de que la interpretabilidad no tiene por qué sacrificarse en favor del poder predictivo en aplicaciones de alerta temprana. Los modelos basados en árboles también resultan eficaces para estimar la dificultad de los ítems: Razavi y Powers (2026) introdujeron características cognitivas y lingüísticas extraídas con LLM en bosques aleatorios y máquinas de potenciación de gradiente para predecir la dificultad de ítems de matemáticas y lectura de K-5 (N = 5.170), alcanzando correlaciones de hasta r = 0,87 con RMSE/MAE inferiores a las estimaciones directas de LLM, los regresores ficticios, las líneas base de TF-IDF y los modelos solo con metadatos. Los modelos basados en árboles también ofrecieron una importancia de características interpretable —el nivel educativo y el recuento de palabras fueron los mejores predictores—, lo que muestra cómo las características estructuradas y los aprendices interpretables pueden superar a un único juicio holístico. La fusión multimodal amplía este conjunto de herramientas predictivas: Bird (2026) combina un transformer ELECTRA ajustado con una red neuronal profunda buscada sobre características de lingüística computacional para clasificar literatura inglesa por Key Stage del Reino Unido con un F1 de 0,996, muy por encima del mejor transformer unimodal (BERT, 0,75) y de la mejor red de características lingüísticas (0,392), un caso concreto en el que combinar familias de modelos supera a cualquier enfoque único. Sukoon (Bashir y Afzal, 2026) es un caso aplicado y compacto de clasificación supervisada en el apoyo al bienestar cercano a la educación: un bosque aleatorio (100 estimadores) sobre 20 características de las dimensiones psicológica, fisiológica, ambiental, académica y social de una encuesta de estrés estudiantil con 1.100 respuestas, entrenado con una partición estratificada 70/15/15 y un escalador ajustado solo con los datos de entrenamiento para evitar fugas, y comparado con una SVM en las mismas particiones (89,09% frente a 88,48% de precisión). Dos detalles merecen atención: los autores interpretan la matriz de confusión por la dirección del error —el principal error del modelo fue clasificar el estrés bajo como moderado, lo que en un despliegue de bienestar deriva al estudiante hacia más apoyo y no hacia menos— y usan las importancias de características nativas como hallazgo sustantivo (presión arterial 15,6%, relación docente-estudiante 10,0%), a la vez que admiten que una única partición estratificada, sin intervalos de k-fold, y un conjunto de datos no representativo limitan la confianza de esos pesos.

Instrucción y tutoría adaptativas. El aprendizaje automático cierra el bucle entre el modelado y la enseñanza. En los sistemas de tutoría inteligente, tanto una heurística de seguimiento bayesiano del conocimiento como una política profunda de aprendizaje por refuerzo seleccionaban de forma adaptativa tipos de ejemplos resueltos para suscitar distintos niveles de implicación cognitiva, mejorando significativamente el rendimiento en la prueba posterior frente al control no adaptativo, mientras que las dos políticas divergían según el conocimiento previo de quien aprende, lo que plantea preguntas de interpretabilidad. El aprendizaje por refuerzo también sustenta la agenda de seguridad pedagógica: como un tutor de RL optimiza una recompensa sustituta, puede «hackear» esa recompensa (elevar la implicación mientras enseña poco), y se necesitan restricciones arquitectónicas sobre el cumplimiento de prerrequisitos y la demanda cognitiva mínima para mantenerlo seguro. Programas adaptativos más ligeros, como el sistema basado en reglas de STEM en ciencias de sexto grado, muestran que el aprendizaje automático puede usarse con moderación —para la monitorización más que para el control directo de la trayectoria— sin dejar de apoyar el aprendizaje profundo.

En el terreno del seguimiento del conocimiento, Pradeesh et al. (2026) muestran que un modelo recurrente puede ajustarse a la propia estructura de un currículo: su modelo OKT trata los resultados de aprendizaje de la educación basada en resultados como conceptos de conocimiento, combina asignaciones de afinidad OBE validadas por expertos (relaciones entre resultados de asignatura y de programa) con una red neuronal con memoria aumentada para el impacto entre resultados, y empareja una columna vertebral GRU con embeddings BERT adaptados al dominio, alcanzando un AUC de 89,81% y superando a DKT, DKVMN, EKT y SimpleKT con datos reales de un programa de ingeniería.

Diagnóstico a partir de respuestas numéricas tabulares. Yin et al. (2026) muestran árboles potenciados por gradiente resolviendo el lado del diagnóstico de la tutoría en un dominio largamente cerrado a la IA: para preguntas de fórmula calculada de economía de la ingeniería, donde las soluciones manuscritas del estudiantado carecen de datos digitales estructurados, entrenan una columna vertebral multi-etiqueta de XGBoost específica por pregunta para asignar las respuestas numéricas intermedias y finales entregadas a las etiquetas de error de la rúbrica del profesorado (precisión media 0,81, exhaustividad 0,79, exactitud 0,65). El aumento de datos por enmascaramiento aleatorio —enmascarar características de entrada como «NaN» con probabilidades variables— preserva mejor las dependencias lógicas de las soluciones tabulares que métodos de interpolación como SMOTE y mejora significativamente el diagnóstico, y incluir las respuestas intermedias ayuda sobre todo. Es evidencia de que los modelos basados en árboles más un aumento consciente de la estructura pueden arrancar retroalimentación tutorial allí donde los métodos generativos carecen de datos de entrenamiento.

Una visión de campo del subconjunto de aprendizaje por refuerzo la ofrece la revisión sistemática de Riedmann, Schaper y Lugrin (2025) sobre 89 estudios de RL en educación: confirma que el RL es una línea principal del aprendizaje automático para inducir políticas adaptativas de tutoría y andamiaje, pero encuentra que los métodos clásicos (Q-learning) son más consistentemente eficaces que el RL profundo (61% frente a 36% de superioridad significativa) y señala que más de la mitad de los estudios no realiza ninguna prueba estadística, una cautela metodológica que resuena con las preocupaciones de validación que se exponen más abajo.

De la predicción a la acción y la rendición de cuentas. Una limitación persistente es la brecha entre una puntuación de riesgo y una intervención viable. El marco SC2R combina un modelo predictivo calibrado con la generación de recursos contrafactuales mediante programación entera y validación semántica, y produce planes de intervención que respetan restricciones de tiempo, presupuesto y disponibilidad en lugar de ser solo válidos para el modelo. Este paso «más allá de la predicción» hacia recomendaciones que respetan restricciones y son verificables por máquina es la respuesta del campo a la objeción de que la IA predictiva en la educación puede recomendar acciones que las instituciones no pueden o no deberían tomar.

El aprendizaje automático en la supervisión de exámenes

Una aplicación distinta es la supervisión automatizada de exámenes. Los sistemas de aprendizaje profundo —CNN y RNN/LSTM que analizan movimientos oculares, postura de la cabeza y expresiones faciales— detectan las trampas con más fiabilidad que la monitorización tradicional, pero la revisión sistemática de una década encuentra limitaciones persistentes de los conjuntos de datos, evaluaciones con un solo modelo, brechas de reproducibilidad y riesgos de falsos positivos que pueden señalar erróneamente conductas normales. La revisión complementaria sobre deshonestidad académica documenta los métodos de trampa que estos sistemas deben contrarrestar (suplantación de identidad, uso del navegador, copiar y pegar) y las cargas prácticas —coste, conectividad, ansiedad de quien se examina— que acotan su equidad. En conjunto, ambas advierten de que la supervisión con aprendizaje automático debe combinarse con un diseño que preserve la privacidad y atienda al contexto, y con alternativas accesibles.

Límites y preocupaciones éticas

La literatura sintetizada es franca sobre los límites del aprendizaje automático. Las ganancias suelen proceder de datos de referencia o de una sola institución y pueden no generalizarse sin reentrenamiento; SC2R y TRACE lo reconocen. Los modelos predictivos entrenados con calificaciones históricas pueden codificar sesgos sistémicos, y las puntuaciones de riesgo aplicadas a datos sensibles del estudiantado plantean preocupaciones de privacidad y equidad que exigen gobernanza y supervisión humana. La interpretabilidad es una tensión recurrente: las políticas de RL pueden superar a las heurísticas interpretables y seguir siendo opacas. Y el hackeo de la recompensa muestra que un sistema de aprendizaje automático puede ser mediblemente exitoso y pedagógicamente dañino, que es por lo que importan las restricciones arquitectónicas de seguridad y la infraestructura de auditoría.

La práctica de validación es otra fuente de exceso de confianza. Schuetze, Yan y Carvalho (2025) muestran que los modelos de seguimiento del conocimiento (BKT, BKT con olvido, AFM) parecen capturar tendencias de aprendizaje cuando se ajustan retrospectivamente a todas las sesiones disponibles, pero bajo una validación cruzada basada en el tiempo (walk-forward) —entrenar con sesiones anteriores para predecir las posteriores, reflejando el despliegue real— sobreestiman el rendimiento futuro, pasan por alto el efecto de espaciamiento y ordenan mal las condiciones de práctica; los modelos sin olvido incluso igualaron a los aumentados con olvido, lo que indica que el olvido se absorbía en otros parámetros en lugar de aprenderse. Cuando las distribuciones de entrenamiento y despliegue están separadas en el tiempo —lo habitual en datos longitudinales de estudiantado—, un buen ajuste en muestra o retrospectivo no garantiza la validez predictiva.

La IA generativa como subconjunto

La IA generativa —los grandes modelos de lenguaje y los sistemas LLM relacionados— se entiende mejor como un subconjunto del aprendizaje automático: los mismos fundamentos neuronales y de entrenamiento, pero aplicados a generar contenido (explicaciones, retroalimentación, diálogo) en lugar de clasificar o predecir. Hereda las preocupaciones de validez, sesgo y seguridad del campo y añade otras nuevas, como la alucinación. A los efectos de esta base de conocimiento, el aprendizaje automático es el paraguas técnico más amplio; la IA generativa es su rama contemporánea más visible.

Formación docente y alfabetización en aprendizaje automático

El aprendizaje automático también aparece en la educación como materia. En la formación inicial del profesorado, las intervenciones prácticas de programación y robótica con el Micro:bit y los proyectos supervisados de clasificación de imágenes mejoraron significativamente el conocimiento del profesorado en formación sobre conceptos computacionales y aprendizaje automático introductorio, así como sus actitudes hacia su enseñanza. A medida que la alfabetización en IA entra en los currículos, dotar al profesorado de un dominio operativo del aprendizaje automático se convierte en una condición previa para enseñarlo al estudiantado.

Conceptos conectados

Artículos conectados

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.