En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

Sistemas de recomendación y rutas de aprendizaje — la parte de la tecnología adaptativa y de aprendizaje personalizado que decide qué debería encontrar a continuación quien aprende y en qué orden: qué recurso, ítem de práctica o curso clasificar para esa persona, y qué secuencia de conceptos recorrer. Sus dos familias de métodos son la conductual —el filtrado colaborativo sobre registros de interacción— y la semántica —la secuenciación sobre un grafo de conocimiento de conceptos, recursos y relaciones de prerrequisito—, cada vez más fundidas en modelos híbridos. Como la salida es una lista ordenada y no un diálogo, los problemas distintivos son la selectividad y la legitimidad: el arranque en frío y el sesgo de popularidad con datos dispersos, la asimetría direccional de los prerrequisitos, y si un docente o quien aprende puede entender, auditar y confiar en la lista que se le muestra.

Preguntas para reflexionar

  • Un sistema de recomendación aprende de lo que el estudiantado hizo clic, vio y completó. Si el sistema solo ve conducta, ¿el aprendizaje de quién está modelando en realidad, y qué se pierde en el caso de un estudiante callado, con dificultades o que ya domina el material?
  • En un estudio, el profesorado encontró más comprensibles y dignas de confianza las explicaciones en el lenguaje del currículo que los gráficos de importancia de variables. ¿Qué tendría que decir una explicación de una recomendación para que usted actuara en consecuencia?
  • Las relaciones de prerrequisito van en una sola dirección: conocer B no implica conocer A. ¿Por qué un modelo que puntúa los pares de conceptos de forma independiente podría equivocarse en esto, y qué le iría mal después a quien aprende si lo hiciera?
  • Los estudios de optimización de rutas informan de rutas más cortas y mejores puntuaciones en el postest, con la reducción de la carga cognitiva como principal mediador. ¿Es una ruta más corta siempre la mejor ruta, o la eficiencia puede eliminar práctica que quien aprende necesitaba?
  • Una auditoría de un sistema de recomendación educativo encontró que los materiales populares seguían dominando las listas tras intervenciones de equidad y diversidad. Si la popularidad sigue ganando, ¿qué le haría rediseñar el objetivo en lugar de ajustar el reordenador?
  • Los datos de diseño del aprendizaje de 554 cursos mostraron que la Adquisición (transmisión de conocimiento) era a la vez el tipo de actividad más común y el punto de entrada más común. Si la IA recomienda «qué viene después» a partir de esos datos, ¿los hábitos de diseño de quién reproduce?

Introducción

Los sistemas de recomendación educativos existen porque la oferta de material de aprendizaje ha superado la capacidad de cualquier persona para navegarla. Solo la programación introductoria cuenta con muchos miles de actividades de práctica, y organizarlas en paquetes didácticamente significativos requiere normalmente una curación experta que consume mucho tiempo. Un sistema de recomendación toma el historial de quien aprende, las propiedades del material o ambos, y produce una lista corta ordenada o una ruta ordenada por el contenido.

Mientras que el aprendizaje adaptativo describe el mecanismo de ajustar el contenido, el ritmo y la dificultad a un modelo de quien aprende, y la tutoría inteligente describe la plataforma que lo hace en diálogo, la investigación sobre recomendación se concentra en la decisión de selección y secuencia en sí: la función de ordenación, la estructura sobre la que ordena y la evidencia que utiliza. Esa capa de decisión trae sus propios modos de fallo, que se abordan en las secciones siguientes.

Cómo funcionan los sistemas de recomendación educativos

Los sistemas conductuales heredan la lógica del filtrado colaborativo: se supone que quienes tienen historiales similares quieren recursos similares, así que el sistema predice a partir de la coocurrencia y no del contenido. Esto es potente donde los datos son densos y frágil donde no lo son. Evangelista y Bukhari (2026) enuncian el problema sin rodeos —los sistemas centrados en la exactitud dan un apoyo menos fiable al estudiantado con historiales de participación limitados, mientras los recursos populares dominan las listas— y lo responden con un marco híbrido HKG-GRU que incrusta un grafo de conocimiento heterogéneo de materiales de curso y modela las secuencias de quien aprende con una GRU, y después entrena para la robustez entre grupos de estudiantes (GroupDRO) y reordena para la diversidad de exposición (Maximal Marginal Relevance). Sobre registros de Moodle de 152 estudiantes, 59 recursos y unos 150.000 registros de interacción alcanzó HR@10 = 0,68 y MRR = 0,41, pero persistió un sesgo de popularidad sustancial a nivel de catálogo: evidencia de que la mitigación del sesgo es parcial.

Los sistemas semánticos sustituyen la coocurrencia por la estructura. Liu, Sun y Song (2026) construyen un grafo de conocimiento de recursos didácticos, conceptos lingüísticos, destrezas, grupos de estudiantes y atributos pedagógicos, y descomponen cada recurso en cuatro dimensiones didácticas: contexto de enseñanza, nivel cognitivo, característica tecnológica y adaptabilidad cultural. La recomendación expande k saltos por el grafo desde los requisitos declarados por quien aprende, refina los candidatos con un filtro colaborativo basado en características y los ordena con un coeficiente de fusión que sube con los índices de capacidad, progreso e interés de quien aprende, de modo que quienes están menos avanzados reciben más orientación estructurada del grafo mientras que quienes tienen más capacidad se apoyan en su patrón conductual. En el subconjunto de inglés del conjunto de datos MARS (4.800 usuarios, 14.200 recursos, 132.000 interacciones, dispersión 0,9981) alcanzó NDCG 0,625 y HR 0,751, en torno a un 7–8% de mejora sobre la mejor referencia neuronal, y superó a referencias conscientes del grafo como RippleNet y KGAT en cobertura y exactitud entre dominios. La ablación muestra que las señales son complementarias (solo FC: NDCG 0,584; solo GC: 0,604), y los autores señalan que son métricas de ordenación, no evidencia de eficacia del aprendizaje.

Una tercera vía evita casi por completo los datos de interacción por persona. Hoq y sus colegas (2026) extraen componentes de conocimiento basados en patrones de cada muestra de código y recomiendan actividades de práctica relacionadas por la similitud de sus conjuntos de componentes de conocimiento. Sobre un corpus de materiales introductorios de Python organizado por expertos, el enfoque se alineó con los propios paquetes conceptuales del profesorado y superó a las referencias de componentes de conocimiento y de embeddings en métricas de ordenación: evidencia de que la alineación didáctica puede venir de la semántica del material cuando los historiales de quien aprende son escasos.

Una cuarta vía trata la recomendación como una decisión secuencial y no como una ordenación. ExRec (Ozyurt, Almaci, Feuerriegel y Sachan, 2025) construye un trazador de conocimiento con base semántica —un LLM anota cada pregunta con pasos de solución y conceptos de conocimiento, el aprendizaje contrastivo alinea los embeddings de pregunta, paso y concepto, y una pérdida de calibración permite al trazador predecir directamente un estado de conocimiento a nivel de concepto— y después usa ese trazador como entorno de aprendizaje por refuerzo en el que una política selecciona el siguiente ejercicio. Dos decisiones de diseño importan específicamente para el problema de recomendación: el estado del estudiante es una codificación recurrente compacta y no el historial completo de ejercicios, de modo que las secuencias largas siguen siendo manejables en el búfer de repetición, y la recompensa es el cambio en el conocimiento conceptual predicho, calculado sin ejecutar inferencia sobre todas las preguntas del concepto objetivo. Una estimación de valor basada en modelo inicializa el crítico a partir del trazador, lo que mejoró a los agentes continuos basados en valor en cuatro tareas de XES3G5M (2.048 estudiantes de prueba) y los llevó más allá de los métodos de acción discreta en la más difícil: recomendar para el concepto más débil del estudiante, donde el objetivo cambia en cada paso. Las cifras son una mejora porcentual del conocimiento máximo en un entorno simulado, una afirmación más débil que el aprendizaje medido, y el propio apéndice de los autores señala que la mayoría de los conjuntos de datos de trazado registran solo una etiqueta binaria de corrección, así que la recomendación a nivel de idea errónea que esbozan aún no es contrastable con los datos existentes.

Prerrequisitos y secuenciación de rutas

Ordenar el siguiente ítem es más fácil que ordenar un currículo, porque las dependencias de aprendizaje son direccionales. Cheng y sus colegas (2026) sostienen que tratar el descubrimiento de prerrequisitos como una predicción de enlaces ordinaria fracasa ante tres propiedades de la relación: es irreversible, su evidencia suele ser de varios saltos (ci → ck → cj) y no una transición de un solo paso de quien aprende, y su relevancia es específica del par, de modo que la representación de un concepto debería cambiar según con qué se empareje. Su modelo ProPRL añade una Restricción de Irreversibilidad —un regularizador de antisimetría que penaliza la alta confianza en ambas direcciones de un par— junto con una puerta condicionada por el par que pondera la evidencia consciente de recursos de un hipergrafo concepto-recurso frente a la evidencia consciente de conducta de un grafo de conducta de aprendizaje. Quedó primero en las nueve combinaciones de conjunto de datos y métrica en los conjuntos MOOC, LectureBank y University Course, mejorando la referencia más fuerte entre un 1,96% y un 6,11%, y la restricción elevó la proporción de relaciones correctamente ordenadas del 88,0% al 90,0%.

Una vez modeladas las dependencias, una ruta se convierte en un problema de optimización. Feng y Huang (2026) combinan el diagnóstico cognitivo bayesiano, la teoría de espacios de conocimiento y la teoría de la carga cognitiva: un modelo DINA bayesiano convergió sobre datos de EdNet con un 91,3% de dispersión, y un algoritmo de ruta de remediación más corta produjo rutas personalizadas de 3,82 pasos de media, un 22,4% más eficientes que las rutas aleatorias y un 23,6% más eficientes que las rutas fijas de cobertura completa. En un experimento aleatorizado de aprendizaje de probabilidad con 120 estudiantes, quienes siguieron rutas personalizadas terminaron en 57,6 minutos frente a 73,8 minutos del grupo de control y superaron al control en el postest tras controlar el pretest. El estudio también prueba por qué: las rutas personalizadas redujeron la carga cognitiva en las seis dimensiones adaptadas del NASA-TLX, y la carga cognitiva fue el principal mediador del efecto sobre el rendimiento en el postest (efecto indirecto 0,28 en el modelo de mediación múltiple). Un modelo oculto de Markov identificó el Pensamiento Analítico como el atributo cuello de botella, con la probabilidad de transición hacia delante más baja (0,31) y el parámetro de adivinación más alto (g = 0,28).

PersonaPath lleva más lejos la cuestión de la secuenciación al disputar la unidad de la decisión. Liu et al. (2026) contraponen la recomendación centrada en el ejercicio —inferir el siguiente ítem a partir de los registros de interacción— con la planificación centrada en el conocimiento, en la que un planificador lee una persona de quien aprende explícita, un estado de dominio y una unidad objetivo declarada, y selecciona el siguiente libro de texto, unidad y concepto de una jerarquía curricular (347 libros de texto, 1.751 unidades, 4.092 conceptos en 77 materias, con 411 aristas de prerrequisito verificadas con una precisión del 99,5% con κ de Cohen = 0,93). El caso distintivo es el que los registros no pueden ver: dos estudiantes con registros de corrección idénticos pero objetivos distintos necesitan rutas distintas, y solo la meta hace eso visible. Su evaluación en bucle cerrado de diez LLM (1B–30B+) separa las dimensiones que una métrica agregada confunde: DeepSeek-V3.1 alcanza el 90,9% en validez de prerrequisitos y alucinaciones pero solo el 44,3% en adaptabilidad, para una tasa final de aprobado del 29,5% en Educación Básica y del 14,6% en Educación Superior, y ningún modelo supera el 44,7% de adaptabilidad en ningún caso. Dos ablaciones afinan el diagnóstico: eliminar el campo de dominio de la persona cuesta hasta 26,1 puntos de adaptabilidad mientras apenas mueve la validez, y la generación de rutas de un solo paso eleva la validez hasta 30,8 puntos mientras recorta la adaptabilidad en 28,8: la secuenciación conforme al currículo es un objetivo mucho más fácil que la secuenciación condicionada por quien aprende, lo que es una advertencia contra informar de la calidad de una ruta sin una restricción de alineación con quien aprende (PersonaPath: Towards Knowledge-Centric Personalized Learning Path Planning).

La estructura de prerrequisitos también funciona como lente diagnóstica sobre el currículo y no sobre quien aprende. Medhat y sus colegas (2026) clasifican las preguntas del estudiantado a un asistente docente de IA contra un grafo de prerrequisitos extraído con GPT-4, alcanzando un 80,0% de exactitud en 43 etiquetas sobre 1.340 eventos de pregunta de 164 estudiantes de posgrado, y encontraron que el volumen de preguntas por tema correlacionaba con la dificultad autoinformada del estudiantado (ρ de Spearman = 0,491, p = 0,008). El registro de interacción se convierte en un mapa de dónde está fallando el ordenamiento del currículo a quienes aprenden, sin ninguna carga de evaluación añadida.

Explicar y auditar las recomendaciones

La calidad de la ordenación no resuelve si alguien debería seguir esa ordenación. Feldman-Maggor, Cukurova, Kent y Alexandron (2025) adaptan el modelo de confianza en la automatización de Hoff y Bashir a las recomendaciones de IA y lo prueban con 41 docentes de química en activo usando la herramienta de recomendación GrouPer. La explicabilidad elevó la confianza de forma indirecta, al elevar la comprensibilidad, y la forma de la explicación importó más que su presencia: pasar al profesorado de explicaciones basadas en la importancia de variables («guiadas por los datos») a explicaciones semánticas en el lenguaje del currículo («guiadas por el dominio») aumentó significativamente la comprensibilidad (W = 80,5, p = 0,005), la confianza aprendida (W = 52, p = 0,002) y la aceptación (W = 22,5, p = 0,003), y los siete docentes del think-aloud señalaron las explicaciones guiadas por el dominio como más influyentes. Aparecieron dos impulsores más de la aceptación, ambos situacionales más que epistémicos: la alineación pedagógica (informada por 8 de 11) y la reducción de la carga de trabajo (6 de 11). Varios docentes también dijeron que la explicación por sí sola era insuficiente: querían experiencia en el aula con la herramienta antes de fiarse de ella, una afirmación contundente de que la confianza en un sistema de recomendación se construye con el uso y no se entrega en una leyenda.

La auditoría de equidad plantea otra pregunta: ¿las recomendaciones de quién son peores? El estudio Graph-GRU es un ejemplo práctico útil porque nombra lo que su auditoría no podía ver. La equidad se operacionalizó mediante cohortes basadas en la participación porque el conjunto de datos público de Moodle carecía de logros, conocimiento previo, perfiles de aprendizaje y atributos demográficos, así que el resultado es una auditoría de la conducta entre niveles de implicación y no una evaluación completa de la equidad educativa; quien aprende con poca actividad puede estar con dificultades, desconectado o ya familiarizado con el material. La explicabilidad adopta ahí la forma de análisis basados en rutas y contrafactuales, con una estabilidad contrafactual mediana de CR@10 = 1,0 para muchos estudiantes pero un sesgo de popularidad persistente a nivel de catálogo reflejado en métricas de exposición de Gini altas. La lección es que la mitigación del sesgo debe medirse en el nivel de la exposición y de los grupos de estudiantes, y no inferirse de la exactitud ni de la presencia de un módulo de explicación, y que la supervisión de humanos en el bucle solo tiene sentido si la persona ve la evidencia a nivel de grupo.

Rutas de aprendizaje en la práctica

Las rutas no solo se calculan; se diseñan. Divjak, Svetec y Horvat (2026) dirigieron la analítica del aprendizaje hacia el propio proceso de diseño, analizando la secuencia de 29.064 actividades de enseñanza y aprendizaje en 554 cursos planificados en una herramienta gratuita de Planificación de Diseño Equilibrado. Las cadenas de Markov y la minería de patrones sacaron a la luz una gramática de diseño: las actividades de tipo Adquisición fueron el tipo de aprendizaje más común (por encima del 20%) y el punto de entrada más común, seguidas de Práctica, Discusión y evaluación (cada una entre el 15% y el 20%), y la transición más fuerte fue Evaluación → Discusión (0,332), por delante de Práctica → Práctica (0,317). La regla Adquisición → Evaluación → Práctica → Práctica se mantuvo con una confianza de 0,74 (lift 1,45), y el tipo de aprendizaje siguió el nivel cognitivo del resultado previsto: la Adquisición cayó de cerca del 50% de las actividades en el nivel 1 de Bloom a cerca del 20% en el nivel 6. Los autores advierten de que el parecido con diseños invertidos, de indagación o por proyectos no es evidencia de intención, pero un sistema de recomendación entrenado con esos datos de diseño aprende estos hábitos, incluido un sesgo hacia actividades de apertura orientadas a la transmisión.

En el otro extremo de la escolarización formal, la estructura de las rutas se convierte en una cuestión de gobernanza. Szekely, Gal-Ezer y Harel (2026) sostienen que el acceso al conocimiento mediado por IA justifica repensar los currículos fijos de la educación superior y proponen los «grafos de aprendizaje» (learnity graphs): representaciones estructuradas del aprendizaje como unidades interconectadas de conocimiento, destrezas, experiencia y artefactos, que abarcan el aprendizaje académico, profesional y personal. La propuesta mantiene el papel de la universidad en el conocimiento fundamental a la vez que desplaza el énfasis hacia la creatividad y la integración interdisciplinar, y convierte a quien aprende en mantenedor de su propio grafo, que es donde conecta con el aprendizaje autodirigido y el aprendizaje autorregulado. Que la navegación autodirigida lleve a algún lugar constructivo no está garantizado: Shen y Arunrugstichai (2026) modelan dos vías desde el clima de aprendizaje de secundaria hasta el uso universitario de IA generativa en una encuesta transcultural (N = 508), distinguiendo el uso autónomo constructivo de la dependencia compulsiva.

Un límite que vale la pena enunciar: lo que hacen actualmente los sistemas de recomendación se parece más a una consulta que a una colaboración. Mutlu Cukurova (2026) reconstruye lo que históricamente se ha exigido para que una interacción califique como colaborativa —una relación negociada y parcialmente simétrica, metas compartidas y negociables, una división del trabajo baja y cambiante, y modelado mutuo y regulación socialmente compartida— y concluye que la mayor parte de la interacción humano-IA actual se describe mejor como consulta, gobernanza, delegación o instrucción. Su taxonomía de cinco niveles (transaccional, situacional, operativo, práctico, sinérgico) es una calibración útil: sugerir el siguiente recurso es un arreglo operativo, y llamarlo socio de aprendizaje colaborativo infla la afirmación.

Cómo se relaciona esta página con la investigación sobre personalización, adaptación y tutoría

Las tres páginas de conceptos adyacentes cubren terreno contiguo y deberían leerse junto con esta. El aprendizaje personalizado cubre el objetivo —adaptar toda la experiencia, incluidos las metas, las preferencias y el ritmo, de lo cual la selección de ruta es un componente. El aprendizaje adaptativo cubre el mecanismo —el bucle medir-modelar-adaptar que cambia el contenido, el ritmo y la dificultad en tiempo real. La tutoría inteligente cubre la plataforma, el sistema canónico que combina diagnóstico con interacción didáctica. Esta página cubre la capa de decisión que esas páginas presuponen: la propia tecnología de ordenación y secuenciación. Es el hogar de las arquitecturas de recomendación de filtrado colaborativo y de grafos de conocimiento, del descubrimiento de relaciones de prerrequisito y del ordenamiento curricular, de la explicabilidad y la equidad de las salidas ordenadas, y de los modos de fallo propios de la recomendación —arranque en frío, sesgo de popularidad, estrechamiento excesivo, ordenación opaca y calidad de recomendación desigual entre grupos de estudiantes. Un estudio que informe de NDCG o de cobertura sobre registros de interacción pertenece aquí; uno que informe de ganancias de aprendizaje a partir de un diálogo de tutoría pertenece a la página de tutoría o de aprendizaje adaptativo.

Riesgos y preguntas abiertas

La base de evidencia tiene una forma consistente: métricas de ordenación offline sólidas y evidencia débil sobre el aprendizaje. Los dos estudios de recomendación anteriores se evalúan sobre registros de interacción históricos y lo dicen, y los autores de FC–GC piden explícitamente evaluaciones docentes, estudios con estudiantes y experimentos basados en resultados. El sesgo de popularidad sobrevivió a un objetivo de entrenamiento consciente de la equidad en un sistema, así que el campo todavía no puede señalar una corrección de reordenación o regularización que cambie de forma fiable la exposición, y las auditorías de equidad siguen limitadas por lo que contienen los registros del LMS. El arranque en frío se aborda arquitectónicamente, mediante la estructura semántica, pero no se contrasta con usuarios genuinamente nuevos en un despliegue real. La eficiencia de las rutas está mejor evidenciada, aunque las cifras de eficiencia siguen apoyándose en un estudio y una familia de algoritmos, y una ruta más corta no es automáticamente mejor si elimina el esfuerzo productivo que quien aprende necesita. El trabajo formal de optimización de rutas afina la idea en ambas direcciones: garantizar un problema duro dice poco sobre un corpus concreto, ya que un escalador de colinas alcanzó lo más alto de la rúbrica de intercalado en todos los perfiles reales pese a las pruebas de NP-completitud, y una ruta calificada con 3,54 en una rúbrica derivada de la teoría sigue siendo una ruta que nadie ha probado con estudiantes, así que la calidad de la rúbrica es un proxy orientado al diseñador para la evidencia de resultados y no un sustituto de ella. El vocabulario también es inestable: Ikram y sus colegas (2026), en una revisión PRISMA de 31 artículos indexados en Scopus (2013–2025), informan de efectos cognitivos de medianos a grandes (g = 0,50–0,70) para los sistemas adaptativos habilitados por IA, fuertemente moderados por la calidad de la implementación y el diseño del estudio.

Conceptos conectados

Artículos conectados

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.