En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

La IA en la educación — sistemas de IA que planifican, ejecutan y adaptan flujos de trabajo de varios pasos de forma autónoma para alcanzar objetivos de aprendizaje, y que van más allá de las preguntas y respuestas de un solo turno para actuar como colaboradores persistentes y orientados a objetivos: tutores de IA que ofrecen andamiaje a lo largo de interacciones prolongadas, sistemas multiagente que orquestan diseños instruccionales y agentes que corregulan el aprendizaje. Este cambio de paradigma, de una herramienta que responde a un prompt a un colaborador activo, conlleva tanto promesas como riesgos: la IA agéntica puede personalizar y profundizar el aprendizaje, pero también amenaza la Agencia de quien aprende, el esfuerzo cognitivo y el control. Los artículos de la base de conocimiento sobre la revisión de alcance, el marco invariable respecto a la herramienta y las buenas prácticas pedagógicas examinan esta tensión.

Preguntas para reflexionar

  • La IA agéntica no solo responde preguntas: planifica, ejecuta y adapta flujos de trabajo de varios pasos hacia un objetivo, y actúa como un colaborador persistente. ¿En qué se diferencia aprender con un agente proactivo de aprender con una herramienta a la que hay que darle un prompt?
  • El campo traza una línea entre la IA «conversacional» y la «agéntica» (un sistema solo califica si cumple varios criterios, como planificación, memoria, autonomía y acción orientada a objetivos). ¿Dónde está esa línea en la práctica, y llamar «agéntico» a cualquier chatbot oculta más de lo que revela?
  • Cuanto más automatiza un agente, menos trabajo cognitivo hace quien aprende. ¿Dónde está la línea entre una IA que da andamiaje a su aprendizaje y una que aprende por usted?
  • Una revisión de alcance encontró que solo el 29% de los estudios sobre IA agéntica fundamentaban sus sistemas en la teoría educativa. Si la mayoría de los sistemas no se basan en la teoría, ¿qué debería hacerle ser escéptico al evaluar un agente tutor «inteligente»?
  • Los sistemas multiagente orquestan agentes especializados con roles distintos. Cuando varios agentes trabajan juntos en un aula, ¿quién rinde cuentas y dónde debería intervenir una persona?
  • La tensión central del campo es la personalización frente a la agencia de quien aprende y el esfuerzo cognitivo. Si un tutor se vuelve tan bueno adaptándose que usted nunca tiene que esforzarse, ¿qué aprendizaje está obteniendo en realidad?
  • ¿Dónde debería situarse una tarea dada en el espectro de copiloto a piloto automático, y mover una tarea de «el agente propone, quien aprende dispone» a «el agente se encarga de ella» sirve alguna vez al aprendizaje, y no solo a la eficiencia?
  • Los agentes híbridos fundamentados en teoría de diseño consolidada superaron al prompting puro. ¿Por qué un sistema fundamentado teóricamente podría vencer a la ingeniería de prompts sin más, y qué dice eso sobre cómo se mide la «inteligencia» de un agente?

Introducción

La IA agéntica se refiere a los sistemas de inteligencia artificial que pueden planificar, ejecutar y adaptar flujos de trabajo de varios pasos de forma autónoma para alcanzar objetivos de aprendizaje, y que van más allá de responder preguntas de un solo turno para actuar como colaboradores persistentes y orientados a objetivos en contextos educativos. En educación, la IA agéntica se manifiesta como tutores de IA que ofrecen andamiaje a lo largo de interacciones prolongadas, sistemas multiagente que orquestan diseños instruccionales complejos y agentes autónomos que adaptan sus estrategias pedagógicas según las necesidades de quien aprende. Este paradigma emergente desplaza la IA de ser una herramienta que responde a prompts a ser un colaborador que guía, adapta y corregula activamente los procesos de aprendizaje.

Definir y clasificar la IA agéntica

Kostopoulos et al. (2025) aportan una definición operativa de la que el campo carece por lo demás. Proponen una lista de verificación de seis criterios: un sistema cuenta como agéntico si cumple al menos cuatro: autonomía (acción independiente de una intervención humana continua), razonamiento y planificación, memoria y conciencia del contexto, acción orientada a objetivos hacia resultados de aprendizaje, adaptabilidad, y colaboración e iniciativa dinámicas. El umbral de ≥4 excluye deliberadamente a los chatbots reactivos (un bot de preguntas frecuentes estático, sin planificación ni persistencia, no califica) y a la vez admite arquitecturas diversas. También organizan el espacio en tres ejes: rol pedagógico (tutor, entrenador o mentor del aprendizaje, compañero, asistente del profesorado, planificador de currículo), nivel de autonomía (reactivo → adaptativo → proactivo → colaborativo) y corporización (basada en texto, con avatar o gráfica, corporeizada o robótica). Esta taxonomía —en particular el espectro de autonomía y la exclusión de las herramientas reactivas en la lista de verificación— da a la investigación y al diseño un vocabulario compartido para clasificar sistemas agénticos y distinguir la IA genuinamente agéntica de la meramente conversacional.

Un discriminador trabajado hace concreta la línea. Un chatbot estático de preguntas frecuentes que solo puede responder a un conjunto fijo de preguntas cumple cero criterios (ni planificación, ni persistencia, ni iniciativa) y claramente no es agéntico. Un tutor conversacional que recuerda la sesión actual pero nunca actúa salvo que se le pida, no mantiene ningún modelo del estudiantado entre sesiones y no puede fijar subobjetivos puede cumplir solo uno o dos (memoria, algo de razonamiento): conversacional, no agéntico. En cambio, un tutor que planifica lecciones de varios turnos, guarda el progreso de quien aprende en un perfil persistente, lanza proactivamente una pista cuando el estudiante se atasca y replanifica el siguiente paso a partir de ese perfil satisface la planificación, la memoria, la autonomía y la interacción orientada a objetivos: al menos cuatro criterios, así que califica como agéntico. El valor de aplicar esta prueba no es el pedantismo: etiquetar como «agéntica» toda interfaz de chat con LLM difumina precisamente la cuestión de diseño —qué inicia el sistema frente a qué debe iniciar quien aprende— que determina si da andamiaje al aprendizaje o lo suplanta.

La agencia acotada como postura de diseño educativo. El marco AGAI-HE de Ilieva et al. (2026) acepta la lista de capacidades que describen definiciones como la lista de verificación de seis criterios y después la restringe deliberadamente: los objetivos, los roles, las fuentes de datos, las herramientas, los puntos de control, las condiciones de parada y las decisiones finales los definen o los aprueban los educadores, y cada función agéntica debe remitirse a un requisito de aprendizaje, a un propósito de evaluación o a un control de gobernanza. El marco también traza una línea entre la orquestación agéntica y el prompting avanzado: un flujo de trabajo agéntico conserva el estado de la tarea, asigna funciones, comprueba condiciones de finalización, vuelve a etapas anteriores cuando la evidencia es insuficiente y registra las decisiones relevantes. Cabe destacar que su estudio exploratorio de percepción con 130 estudiantes de educación superior no encontró diferencias significativas entre el aprendizaje apoyado por agentes y el apoyado por chatbots, lo que los autores leen como evidencia de que la capacidad agéntica no produce por sí sola una ventaja pedagógica percibida (supervisión humana).

El campo: expansión rápida y forma actual

La revisión de alcance de la base de conocimiento —la síntesis más completa del campo hasta la fecha, que mapea 474 estudios (2020–2026)— documenta un campo que ha crecido de forma explosiva desde 2025, pero cuya literatura sigue dominada por ponencias de congresos concentradas en la Educación superior, las disciplinas STEM y escenarios de tutoría basados en texto. La revisión analiza las características de publicación, los diseños de estudio, los roles de los agentes, los modelos y las arquitecturas de IA, seis dimensiones de capacidad agéntica y el grado de integración de la teoría educativa, y ofrece una hoja de ruta de las fronteras y las brechas del campo. Cabe destacar que solo el 29% de los estudios revisados (138 de 474) fundamentaban explícitamente sus sistemas en la teoría educativa, lo que deja al descubierto una división disciplinar entre el trabajo de orientación técnica y el de orientación pedagógica.

Un mapa del campo basado en roles

Donde la revisión de alcance de 474 estudios y la encuesta conceptual de Kostopoulos et al. mapean la amplitud y la capacidad de la investigación, Baradziej (2026) organiza la IA agéntica por el rol que desempeña: un encuadre institucional para decidir dónde desplegar y gobernar estos sistemas. En 48 estudios de educación superior emergen seis roles, por orden de peso probatorio: aprendizaje personalizado y tutoría adaptativa (18/48), Evaluación automatizada y retroalimentación (12), asistencia y aumento de la enseñanza (11), apoyo administrativo y al estudiantado (8), diseño curricular y alineación con el mercado laboral (5), y apoyo a la investigación y operaciones académicas (4). La lente de los roles pone en primer plano una decisión de diseño que reaparece en cada despliegue: cuánto control momento a momento conserva la persona (una relación de «copiloto») frente a cuánto asume el agente (una relación de «piloto automático»), el eje de autonomía que determina si un agente da andamiaje al aprendizaje o lo suplanta.

Diseño y evaluación de sistemas agénticos

La investigación de la base de conocimiento abarca el diseño y la evaluación:

  • Los agentes híbridos fundamentados en la teoría superan al prompting puro: ISD-Agent-Bench, un banco de pruebas de 25.795 escenarios de diseño instruccional, encuentra que el enfoque de mejor rendimiento integra marcos clásicos de ISD (ADDIE, Dick & Carey, prototipado rápido) con razonamiento moderno al estilo ReAct: híbrido (teoría + técnica) > teoría pura > solo técnica. Fundamentar los agentes Grandes modelos de lenguaje (LLM) en teoría consolidada del diseño educativo proporciona una ventaja estructural que el prompting sin más no puede replicar.
  • Marcos de evaluación para herramientas agénticas: el marco invariable respecto a la herramienta propone la enseñanza y evaluación de los métodos computacionales de una manera que no dependa de ninguna herramienta de IA específica, y hace hincapié en los fundamentos del Pensamiento computacional, la Evaluación auténtica mediante defensa oral, y la verificación; todo ello relevante para las preocupaciones sobre la dependencia excesiva.
  • Un escalador de notificación y gobernanza: el marco de Autonomía–Supervisión–Evidencia (AOE). Dey (2026) sostiene que el término IA agéntica se aplica de forma tan inconsistente que la evidencia y la supervisión no pueden compararse entre estudios: los sistemas que planifican, recuerdan, usan herramientas o coordinan varios agentes se mezclan con interfaces estáticas de IA generativa y con agentes pedagógicos convencionales. Su revisión integradora crítica de quince revisiones revisadas por pares encuentra que la evidencia es más sólida para los resultados a nivel de artefacto (precisión de la retroalimentación, reducción de alucinaciones) y más débil para el aprendizaje duradero, la equidad, la carga de trabajo o los resultados institucionales, con despliegues auténticos que suelen ser cortos, de un solo sitio y débilmente ligados a la supervisión. La solución es una terna concreta de notificación —nivel de autonomía A0–A4 (generación reactiva → orquestación acotada → autonomía delegada de tareas → autonomía de flujo de trabajo → autonomía consecuente sobre la calificación, la admisión y la progresión), nivel de supervisión O0–O4 (no especificada → auditoría retrospectiva → aprobación previa al uso → control con puntos de verificación → supervisión continua y acotada) y etapa de madurez de la evidencia M0–M5 (concepto → prototipo o banco de pruebas → evaluación con participantes → despliegue auténtico → extendido o multisitio → replicado o a escala institucional)— más una regla de proporcionalidad: la autonomía admisible no debería ir por delante ni de la madurez de la evidencia ni de la solidez de la supervisión (por ejemplo, un sistema consecuente A4 exige evidencia M4–M5, validación legal y O4 con autoridad humana final. Notificar A2–O3–M3 convierte las afirmaciones vagas de «despliegue agéntico» en especificaciones comparables y comprobables y da a las instituciones una gramática escalonada de adopción, registro y reversión: el complemento probatorio del espectro de copiloto a piloto automático anterior.
  • Pruebas de robustez adversarial: las pruebas de estrés multiagente coordinan agentes interrogador, objetivo y juez para revelar modos de fallo invisibles a las pruebas de una sola estrategia, y reducen las puntuaciones de robustez en 0,17–0,20 puntos, algo crítico para la consistencia de la persona y el despliegue seguro con quien aprende.
  • Aplicaciones de dominio: los sistemas agénticos aparecen en diversos dominios, como los agentes de aprendizaje adaptativo, los agentes pedagógicos con LLM, el andamiaje guiado con LLM, los agentes de aprendizaje gamificado en ciberseguridad y los agentes de simulación clínica.
  • Agentes web como evaluadores de la experiencia de aprendizaje: un único agente web autónomo «descriptor» que navega una lección en línea como lo haría un estudiante —Wang, Mitchell y Piech (2025)— produce una descripción lo bastante rica como para predecir el abandono del estudiantado y dar al diseñador retroalimentación accionable antes de que intervenga estudiantado real, y supera a una cohorte simulada completa y a todas las líneas de base en un curso global de CS1. Esto sitúa la evaluación agéntica (un agente como crítico sustituto de una experiencia de aprendizaje) como un uso distinto y de bajo coste de la IA agéntica, junto a los agentes que enseñan o diseñan.

Sistemas multiagente

Una corriente creciente y distinta de la IA agéntica implica sistemas multiagente que orquestan varios agentes especializados con roles distintos. La base de conocimiento documenta varias arquitecturas: CODE-GEN: A Human-in-the-Loop RAG-Based Agentic AI System for Multiple-Choice Question Generation empareja un agente generador con un agente validador para la generación de preguntas con human in the loop; las pruebas adversariales coordinan agentes interrogador, objetivo y juez; las aulas multiagente (por ejemplo, MAIC, con arquetipos de docente, ayudante y compañero de clase) crean dinámicas variadas de aprendizaje entre pares; y el aprendizaje social multiagente explora cómo los agentes que interactúan dan forma al aprendizaje. El diseño multiagente plantea preguntas características sobre la supervisión humana (¿qué agente rinde cuentas y dónde interviene una persona?), los costes de coordinación y cómo la diferenciación de roles apoya o complica el Andamiaje.

Dos sistemas de 2026 afinan qué aporta la especialización de roles y dónde deja de compensar. MeduAI-SP (Yang et al., 2026) reparte la instrucción en entrevista clínica entre cuatro agentes LLM —un agente paciente, un agente tutor socrático, un evaluador por turno y un evaluador final—, cada uno con una función instruccional distinta. La arquitectura oculta las respuestas por diseño: al tutor se le prohibió revelar el diagnóstico o las respuestas del caso, y las puntuaciones OSCE del evaluador final permanecieron ocultas durante el encuentro en vivo. La especialización de roles, y no la capacidad bruta del modelo, es lo que el ensayo atribuye a la mejora del comportamiento en la consulta (71,8% frente a 55,6% en el examen final), lo que ofrece una plantilla concreta para un diseño multiagente alineado con la pedagogía. Un segundo estudio señala los límites de ese patrón: en un sistema de discusión ética con 45 estudiantes y 15 grupos (Seo et al., 2026), tres personas LLM que encarnaban la ética del cuidado, deontológica y pragmática no produjeron diferencias significativas entre sí, y todas fueron valoradas por debajo de sus pares humanos en contribución, diversidad e influencia (todas p < .001 con Kruskal-Wallis). Los autores atribuyen la diferencia a la conformidad sycophantic —los agentes aceptaban casi cualquier contribución a menos que fuera completamente errónea— y a la falta de razonamiento visible, y sostienen que un diseño de agentes centrado en la tarea debe combinar la transparencia del proceso con salvaguardas (encuadre de par falible, una fase dedicada de cuestionamiento) para evitar la dependencia excesiva.

Un paso más allá de orquestar unos pocos agentes especializados es el ecosistema multiagente plenamente agéntico que proponen Sudarshan et al. (2026): una plataforma de alcance institucional que coordina agentes de aprendizaje, de enseñanza y administrativos mediante bucles de retroalimentación transversales e inteligencia distribuida. Su movimiento distintivo es tratar la inclusión como una preocupación arquitectónica de primer orden: coordinar agentes de Accesibilidad, de apoyo cognitivo y de Bienestar para que el estudiantado con necesidades educativas especiales reciba apoyo en las dimensiones cognitiva, sensorial y emocional en tiempo real, en lugar de ser atendido por una herramienta de asistencia aislada. El artículo sitúa esto dentro de un bucle de coevolución humano-IA (los comportamientos y las decisiones humanas dan forma a la adaptación de la IA, que a su vez mejora la capacidad humana) que mantiene a las personas en el circuito.

  • Agentes LLM específicos de cada participante para la resolución colaborativa de problemas. Fang (2026) ajusta agentes LLM individuales con los datos de diálogo de participantes reales para representar a cada participante en simulaciones de resolución colaborativa de problemas, con selección probabilística de hablante y de código temático y una memoria de ventana deslizante más resumida. Validados con el Análisis de Redes Epistémicas, los diálogos simulados son estadísticamente indistinguibles de los reales (distancia ENA 0,17, p de permutación = 0,65): una demostración de que la IA agéntica reproduce discurso colaborativo auténtico.
  • Tutoría multiagente socialmente inteligente. Los prototipos de tutoría multiagente socialmente inteligente, como ASTRA, estudian cómo coordina quien aprende con la IA en díadas, usando agentes diferenciados de tutor y de facilitador para propiciar la coordinación y una participación equilibrada. La evaluación basada en trazas del marco permite un análisis reproducible de la interacción, el equilibrio de participación y la verificación en programación introductoria.

La tensión central: automatización frente a aprendizaje

El trabajo sobre buenas prácticas pedagógicas articula la tensión que define el campo: a medida que la IA educativa pasa de chatbots pasivos a agentes proactivos que inician y persiguen objetivos, la personalización mejora pero la Agencia de quien aprende de quien aprende y su esfuerzo cognitivo corren riesgo. Cuanto más automatiza un agente, menos trabajo cognitivo hace quien aprende. La respuesta de diseño —fricción intencionada, Andamiaje dinámico, supervisión IA con intervención humana (HITL) y una utilización de la IA meditada— actúa como salvaguarda fundamentada. Esto conecta con las Dificultades deseables, el Aprendizaje sociocultural y el riesgo de dependencia excesiva, y con el tema más amplio de preservar la Agencia de quien aprende en el aprendizaje mediado por IA. Una comprobación empírica proviene de un informe práctico sobre el desarrollo guiado por especificaciones en un curso de ABP de software (Tanaka et al. 2026): el estudiantado que usó agentes de IA en todas las fases del desarrollo generó más código, pero mostró caídas en la comprensión del código que solo se recuperaron tras entrevistas individuales con el profesorado; evidencia de campo concreta de la tensión entre automatización y aprendizaje y del seguimiento con IA con intervención humana (HITL) como mitigación.

La literatura de encuesta convierte estos principios en Salvaguardas de diseño medibles en lugar de intenciones vagas. En cuanto al andamiaje, Kostopoulos et al. (2025) recomiendan protocolos de retirada progresiva —reducir gradualmente la frecuencia de las pistas tras cada intento exitoso— y apuntar a una Búsqueda de ayuda (pistas iniciadas por la IA ÷ acciones totales del estudiantado) inferior a 0,3, para que el agente no sea quien impulse la mayor parte de la interacción. Lo combinan con puntos de control reflexivos (por ejemplo, pedir a quien aprende que explique su razonamiento antes de que el agente ofrezca la siguiente indicación) y curvas de retirada adaptativas cuya probabilidad de intervención baja a medida que sube la competencia. En cuanto a la transparencia, los agentes deberían exponer una justificación del tipo «¿Por qué esta sugerencia?» y mantener registros de trazabilidad de decisiones con marca temporal (justificación del agente, fuentes de datos, decisiones) disponibles para la auditoría instruccional. En cuanto a la equidad, aconsejan pruebas de impacto dispar entre al menos tres grupos demográficos (por ejemplo, género, idioma, geografía) antes del despliegue y la participación de profesorado diverso en el diseño. Estas métricas dan al profesorado o al diseñador una palanca de auditoría: en lugar de preguntar «¿es el agente demasiado servicial?», medir si las pistas se están retirando, si es quien aprende quien inicia y si el razonamiento del agente es inspeccionable.

Un vocabulario complementario para la cuestión de la autonomía proviene de la analogía aeronáutica que aparece en la síntesis de Baradziej (2026): hasta qué punto un despliegue se sitúa en el espectro de copiloto a piloto automático, desde un agente que asiste a una persona que conserva el control momento a momento hasta uno que asume toda la tarea y deja a la persona solo supervisando. El mismo sistema subyacente puede configurarse hacia cualquiera de los dos extremos, y la elección es pedagógica antes que técnica. Las configuraciones tipo copiloto (el agente propone, quien aprende dispone, la persona conserva la última palabra) tienden a preservar la Agencia de quien aprende y a sostener los procesos esforzados que construyen el aprendizaje; las configuraciones tipo piloto automático maximizan la finalización de tareas y la eficiencia, pero desplazan la carga cognitiva fuera de quien aprende. Elegir una posición en este espectro —por tarea, y no una vez de forma global— es una manera concreta de operacionalizar el principio de «fricción intencionada» del campo.

Implicaciones positivas de los agentes de IA para la educación

Bien diseñada, la IA agéntica ofrece beneficios sustanciales:

  • Personalización más profunda y adaptativa. Los agentes persistentes pueden sostener una conversación de aprendizaje durante muchos turnos, seguir lo que sabe quien aprende, adaptar la dificultad y secuenciar Andamiaje de varios pasos, y van más allá de las respuestas únicas de los chatbots anteriores. Esto apoya el aprendizaje adaptativo y personalizado a escala. En la síntesis de Baradziej (2026), la evidencia más sólida para este rol reporta ganancias académicas del 15–25% y aumentos de implicación de hasta un +40%, con un potencial particular para el estudiantado históricamente mal atendido por una instrucción uniforme (estudiantes de primera generación, diferencias de aprendizaje, estudiantes de segunda lengua).
  • Aligerar el trabajo instruccional rutinario. Los agentes pueden planificar lecciones, generar y validar preguntas, redactar retroalimentación y orquestar subagentes especializados (por ejemplo, generador y validador para la creación de preguntas), lo que libera al profesorado para una interacción de mayor valor. Esta es la promesa de los flujos de trabajo multiagente para el profesorado. Los agentes de evaluación en particular reportan un 90–95% de acuerdo con evaluadores humanos y reducciones del 50–70% en el tiempo de calificación, aunque esa misma evidencia señala el sesgo y el coste metacognitivo de una retroalimentación instantánea y sin reflexión.
  • Interacción rica y variada. Las aulas multiagente y los pares simulados crean dinámicas de interacción diversas (discurso entre iguales, desacuerdo constructivo, juego de roles) que los sistemas de un solo agente no pueden, y apoyan el Aprendizaje colaborativo, el sondeo socrático y la Simulación.
  • Fricción productiva. Los agentes diseñados para desafiar en lugar de asentir pueden empujar a quien aprende hacia una reconsideración más profunda. La investigación sobre agentes de diseño adversariales muestra que los agentes de conflicto constructivo propiciaron significativamente más iteraciones de diseño, una exploración más amplia y diseños finales mejor valorados (N=48): una forma de dificultad deseable.
  • Práctica y simulación escalables. Las simulaciones basadas en agentes (estudiantes simulados, escenarios clínicos) permiten a quien aprende practicar en entornos de bajo riesgo antes de la aplicación en el mundo real, como en la simulación clínica y los estudiantes simulados.
  • Andamiaje consciente de la evidencia. Los agentes bien fundamentados pueden aplicar la teoría del aprendizaje y la pedagogía conocida en sus interacciones, y los bancos de pruebas muestran que los agentes fundamentados en la teoría superan al prompting sin más.

Una clase más acotada de agentes, construidos por el profesorado, recibe un argumento propio en la propuesta del tercer espacio de El Khoury y Ma: GPT personalizados, Gems y agentes de Copilot Studio diseñados por el profesorado para un propósito pedagógico específico y explícitamente no autónomos. Su valor declarado es el de un espacio de ensayo de bajo riesgo —un simulador de examen oral, una simulación de comunicación clínica, un avatar de pronunciación de inglés como segunda lengua— donde el estudiantado practica antes de ser evaluado mientras el rol evaluador del profesorado se mantiene intacto, con el agente fuera de las jerarquías sociales que el estudiantado navega con sus pares y con el profesorado. Merece la pena señalar dos límites: los autores excluyen por diseño la calificación basada en agentes del alcance de su propuesta, y sostienen que la evaluación debe seguir siendo relacional: el rol docente no puede ser sustituido por una máquina, aunque sí puede ampliarse y hacerse más sostenible mediante un diseño cuidadoso.

Implicaciones negativas y riesgos de los agentes de IA para la educación

La misma autonomía que hace posibles estos beneficios también crea riesgos significativos:

  • Erosión de la agencia de quien aprende y del esfuerzo cognitivo. Cuanto más automatiza un agente, menos trabajo cognitivo hace quien aprende. Los agentes proactivos que inician, planifican y completan tareas pueden dejar a quien aprende como consumidor pasivo, y vaciar los procesos esforzados —redactar, recordar, revisar— que construyen un aprendizaje duradero. Esta es la preocupación central de dependencia excesiva y de Agencia de quien aprende. El efecto es medible: en la síntesis de Baradziej (2026), el estudiantado pasivo en entornos de tutoría agéntica rindió un 8,7% por debajo del estudiantado de Aprendizaje activo, evidencia de que el daño sigue al diseño del despliegue (dejar que el agente haga el trabajo cognitivo) más que a la tecnología en sí.
  • Automatización excesiva del proceso de aprendizaje. Si un agente optimiza la finalización de tareas en lugar del aprendizaje, puede producir «respuestas» que se saltan la comprensión: precisamente el riesgo que advierte el marco invariable respecto a la herramienta, donde el artefacto ya no certifica a quien aprende.
  • Menor implicación metacognitiva y autorregulada. Cuando los agentes se encargan de la planificación y el seguimiento, quien aprende puede no desarrollar la Metacognición y la autorregulación que la educación pretende construir. Los agentes deben diseñarse para suscitar estos procesos, no para reemplazarlos.
  • Confianza mal situada y brechas de verificación. Los agentes autónomos pueden producir resultados plausibles pero no validados; quien aprende y el profesorado pueden confiar en ellos en exceso. La necesidad de una verificación robusta y de Alfabetización en IA crece a medida que los agentes asumen más autonomía.
  • Opacidad, coordinación y rendición de cuentas. Los sistemas multiagente complican la supervisión humana: ¿qué agente rinde cuentas de un error y dónde interviene una persona? Los fallos de coordinación, la deriva de la persona y los comportamientos emergentes pueden socavar la fiabilidad y la Seguridad pedagógica.
  • Sesgo y equidad. Los agentes entrenados con datos que codifican sesgos pueden reproducirlos a escala, y un acceso desigual a sistemas agénticos capaces puede ampliar la desigualdad educativa. El sesgo opera en varios niveles —datos de entrenamiento, arquitectura, criterios de evaluación y poblaciones de prueba—, así que necesita mitigación institucional (auditorías de sesgo, conjuntos de datos diversos, documentación transparente, participación de las partes interesadas), y no comprobaciones puntuales. Una forma más sutil y culturalmente específica es la hegemonía epistémica: como la mayoría de los sistemas agénticos se entrenan con datos producidos en inglés y en Occidente, incorporan supuestos particulares sobre el conocimiento, la argumentación y el registro académico. La evidencia de la síntesis documenta herramientas de educación lingüística que marginan tradiciones retóricas no occidentales y penalizan rasgos lingüísticos de culturas académicas no anglófonas, y los análisis del Sur global muestran pedagogías agénticas que reproducen la desigualdad cuando ignoran la diversidad epistemológica y las limitaciones de infraestructura.
  • Integridad de la evaluación y deterioro de habilidades. Cuando los agentes pueden generar trabajo a demanda, evaluar el aprendizaje genuino se vuelve más difícil, y la dependencia excesiva puede erosionar habilidades fundamentales: el problema de la «deuda de comprensión» y de la certificación que el campo señala.
  • Estudiantes fantasma y la brecha de verificación. Bozkurt, Crompton y Fell Kurban (2026) describen al «estudiante fantasma»: un sustituto digital creado acoplando LLM (la «mente») con navegadores de IA agéntica (el «cuerpo») que pueden navegar por los sistemas de gestión del aprendizaje, interactuar con el contenido y completar evaluaciones con una imitación propia de una persona, lo que hace opcional la presencia real de quien aprende. Esto crea una brecha de verificación que las herramientas tradicionales de vigilancia y detección son estructuralmente incapaces de cerrar, y acumula deuda cognitiva en quien aprende y queda al margen. A medida que la IA pasa de generativa a agéntica, esta amenaza para la integridad y la verificación crece: un riesgo específico de lo agéntico, más allá de los de la IA generativa de un solo turno.

Los agentes de IA y la integridad académica

La IA agéntica plantea amenazas a la integridad propias que van más allá de los casos de IA generativa de un solo turno con los que el campo ya batalla. Como los agentes actúan de forma autónoma durante horizontes largos —y como los «estudiantes fantasma» (una «mente» LLM acoplada a un «cuerpo» de navegador agéntico) pueden navegar por los sistemas de gestión del aprendizaje, interactuar con el contenido y completar evaluaciones con una imitación propia de una persona—, hacen opcional la presencia genuina de quien aprende y crean una brecha de verificación que la vigilancia y la detección no pueden cerrar. De ahí se siguen varias implicaciones para la integridad:

  • El artefacto ya no certifica a quien aprende. Cuando un agente puede generar, planificar y ejecutar una entrega completa, la calidad del producto refleja la capacidad del agente, no la de quien aprende. Este es el problema de certificación invariable respecto a la herramienta en su extremo: la evaluación tradicional de «entregue el trabajo» pierde su valor probatorio.
  • La verificación, y no la detección, es la única respuesta viable. La vigilancia basada en la detección es estructuralmente incapaz de seguir el ritmo de los agentes autónomos. La cuestión de la integridad pasa de «¿podemos atrapar a los agentes de IA?» a «¿podemos verificar qué es capaz de hacer realmente quien aprende?», lo que favorece la verificación basada en procesos, interactiva y con IA con intervención humana (HITL).
  • La realización agéntica de trabajos evaluados ya está demostrada, y es un fallo de validez, no solo de integridad. Hadjisolomou y El-Haddad (2026) documentaron agentes (Claude for Chrome, Perplexity Comet, Claude Opus) que iniciaban sesión en un curso de grado real en un LMS y completaban trabajo evaluado auténtico con una sola instrucción: un cuestionario de 10 preguntas obtuvo 10/10 en menos de 5 minutos, y en una publicación de foro de discusión el agente fabricó una historia personal creíble tras minar las publicaciones de sus compañeros. Aplicando el marco de validez basado en argumentos de Kane, sitúan un «supuesto de producción humana» en la base de la inferencia de puntuación: la realización por un agente elimina su respaldo, así que toda puntuación asíncrona sin vigilancia —incluidas las obtenidas con honestidad— pierde apoyo interpretativo, porque la autoría no es verificable. Enmarcar el problema como una cuestión de validez y no de integridad importa porque una institución puede sancionar una mala conducta y aun así carecer de fundamento para las puntuaciones que reporta, y porque los mismos artefactos alimentan las cadenas de evidencia de revisión de programas y acreditación. Su remedio, alineado con el «verificación antes que detección» de esta página, es rediseñar la evaluación en favor de una presencia humana verificada (presencia sobre producto, integración sobre aislamiento, autenticidad sobre genericidad, práctica de bajo riesgo y presencia de alto riesgo) con un menú de opciones de momento verificado que preserva la equidad.
  • La rendición de cuentas se difumina. En los sistemas multiagente, cuando un agente autónomo produce un resultado problemático, no está claro quién rinde cuentas: quien aprende, el sistema o la institución. Esto difumina la atribución que suponen los procesos de integridad académica.
  • La deuda cognitiva se acumula en silencio. Los estudiantes fantasma permiten a quien aprende saltarse los procesos esforzados que construyen la comprensión, y acumulan una deuda cognitiva que solo aflora cuando se exige un desempeño independiente. La integridad está, pues, ligada al aprendizaje genuino, y no solo al cumplimiento de las normas.
  • Amplía las brechas de equidad. Quien aprende con acceso a sistemas agénticos más capaces obtiene una ventaja desproporcionada, y el apoyo automatizado puede erosionar la ayuda a quienes más la necesitan: una dimensión de Equidad de la integridad.

Esto conecta el debate sobre la IA agéntica con la cobertura de la Integridad académica en la base de conocimiento, que enmarca la respuesta como un rediseño de la evaluación y Alfabetización en IA, y no solo como detección.

Fricción productiva e interacción social

No todo comportamiento agéntico tiene que ser asistencia fluida. La investigación sobre agentes de diseño adversariales muestra que los agentes que ponen en acto el conflicto constructivo propiciaron significativamente más iteraciones de diseño, una exploración más amplia de alternativas y diseños finales mejor valorados entre diseñadores de interacción novatos (N=48): una dinámica de fricción productiva, donde el agente de conflicto resultaba frustrante pero a la postre útil. Esto conecta con el cuestionamiento socrático y el Pensamiento de diseño, e ilustra cómo la IA agéntica puede apoyar una reconsideración profunda en lugar de una aceptación pasiva.

Un estudio sobre cómo la IA agéntica alcanza resultados de aprendizaje por vías psicológicas y no tecnológicas aporta el ángulo de medición que faltaba. Pramod y Patil (2026) encuestaron a 398 estudiantes de empresariales en la India y modelaron la autonomía, la competencia y la relación junto con la interactividad, el intercambio de información y la presencia social percibida; la autonomía fue el motor motivacional más fuerte (β = 0,504) y la interactividad el social más fuerte (0,468), con la motivación y la presencia social alimentando la implicación con una fuerza casi idéntica (0,533 y 0,493) antes de que la implicación predijera el rendimiento de aprendizaje percibido (0,671). La lección de diseño es que la vía social no es automática: un constructo de entorno colaborativo movió la presencia social percibida menos que la simple capacidad de respuesta y el intercambio de información, así que tratar a un agente como una interfaz de chat en lugar de como un participante deja sin usar la mayor parte de esa vía.

Implicaciones para el profesorado y el diseño instruccional

Para docentes, personal académico y diseñadores instruccionales, la IA agéntica cambia tanto lo que es posible como lo que debe protegerse:

  • Reasignar el esfuerzo hacia trabajo de mayor valor. Los agentes pueden encargarse de la planificación de lecciones, la generación y validación de preguntas, el triaje de la retroalimentación y la recuperación de recursos. El profesorado debería tratarlos como andamiajes automatizables que liberan tiempo para lo que los agentes no pueden hacer: la enseñanza relacional, el juicio contextual y el diseño de experiencias de aprendizaje. Los flujos de trabajo multiagente orientados al profesorado son un modelo prometedor.
  • Mantener el trabajo cognitivo de quien aprende en el centro. La cuestión central de diseño no es «¿qué puede hacer el agente?», sino «¿qué debe hacer quien aprende?». Los diseñadores instruccionales deberían configurar los sistemas agénticos para que den andamiaje en lugar de reemplazar la planificación, el seguimiento y el esfuerzo de quien aprende, usando Andamiaje dinámico y fricción intencionada para proteger la Agencia de quien aprende y evitar la dependencia excesiva.
  • Diseñar para la verificación y el proceso, no solo para el producto. Cuando los agentes pueden generar trabajo a demanda, el artefacto ya no certifica el aprendizaje. El profesorado debería emparejar las herramientas agénticas con una evaluación basada en procesos (defensa oral, tareas invariables respecto a la herramienta, comprobaciones de verificación) para que se mida la comprensión, y no solo la producción.
  • Curar y fundamentar los agentes en la pedagogía. La evidencia de los bancos de pruebas muestra que los agentes fundamentados en la teoría superan al prompting sin más. Los diseñadores deberían fundamentar el comportamiento del agente en marcos instruccionales consolidados (por ejemplo, liberación gradual, cuestionamiento socrático, teoría del aprendizaje) en lugar de recurrir por defecto a encadenar herramientas genéricas.
  • Retener la supervisión y el juicio humanos. Los sistemas multiagente y autónomos hacen esencial un diseño con IA con intervención humana (HITL): decidir dónde interviene una persona, quién rinde cuentas y cómo se detectan los fallos. Las pruebas adversariales ayudan a sacar a la luz los modos de fallo antes del despliegue.
  • Construir la Alfabetización en IA del profesorado. Docentes y diseñadores necesitan modelos mentales precisos de la IA agéntica para configurar, supervisar y criticar estos sistemas, y para modelar un uso responsable ante quien aprende. Esto enlaza con la Competencia en IA del profesorado y el desarrollo profesional del profesorado.
  • Vigilar la equidad. Las herramientas agénticas corren el riesgo de ampliar brechas si el acceso es desigual o si la automatización erosiona el apoyo a quien más lo necesita; hay que diseñar con la Equidad en mente.
  • Levantar el andamiaje institucional antes de escalar. La cuestión del despliegue no es solo de nivel de diseño, sino de nivel institucional. La síntesis de Baradziej (2026) condensa la evidencia de gobernanza en tres pilares: desarrollar la Alfabetización en IA entre el estudiantado y el personal; construir infraestructura ética (políticas de protección de datos, marcos de rendición de cuentas algorítmica y de integridad académica) antes del despliegue a gran escala; y ofrecer formación docente basada en competencias que vaya más allá de la familiarización con herramientas y llegue a marcos pedagógicos que preserven la agencia humana. Dado que solo alrededor del 6,5% del profesorado de algunos contextos nacionales declara usar la IA directamente, la brecha de formación es una restricción vinculante para una adopción responsable.

Técnicas para garantizar la integridad académica con IA agéntica

Como los agentes autónomos hacen inútil la detección, el profesorado debería centrarse en técnicas que verifiquen el aprendizaje y hagan visible el trabajo honesto, en lugar de en la vigilancia:

  • Preferir la verificación a la detección. Sustituir o complementar el «entregue el trabajo» con interacciones que exijan a quien aprende demostrar una comprensión que no puede externalizar: defensas orales, tareas invariables respecto a la herramienta, Resolución de problemas en vivo y evaluación basada en procesos. El objetivo es establecer qué puede hacer quien aprende de forma independiente, no atrapar a un agente.
  • Usar evaluación interactiva y por etapas. Exigir entregas por etapas (borradores, revisiones, reflexiones) y comprobaciones conversacionales de seguimiento que sondeen si el estudiantado entiende el trabajo que ha entregado: los enfoques de «viva con IA» y de administración cognitiva. Los estudiantes fantasma no pueden sostener un interrogatorio en vivo que no realizaron.
  • Fijar expectativas claras y orientadas a un propósito. Fundamentar las expectativas de integridad en el propósito del curso —qué uso de la IA se permite, cuándo y por qué— en lugar de en reglas abstractas. Una política clara y alineada con la pedagogía reduce la ambigüedad que el estudiantado explota y los juicios erróneos que documenta la investigación sobre integridad.
  • Hacer visible y declarado el uso de la IA. Las declaraciones de uso de IA estructuradas y específicas para cada tarea (que asignan el uso a etapas cognitivas) fuerzan la reflexión y normalizan la divulgación honesta, y desplazan la cultura del ocultamiento a la transparencia.
  • Construir la alfabetización en IA como educación para la integridad. Enseñar al estudiantado a usar los agentes de forma responsable y a juzgar sus resultados con criterio, enmarcando la integridad como aprendizaje genuino y no como cumplimiento de normas. Esto incluye la Alfabetización en IA, entender qué pueden y qué no pueden hacer los agentes, y el coste de aprendizaje de saltarse el esfuerzo.
  • Mantener a las personas en el circuito. Conservar la supervisión humana de las decisiones de evaluación, verificar de forma interactiva las entregas de alto riesgo y diseñar las herramientas agénticas de modo que el profesorado pueda intervenir siempre.
  • Cerrar la brecha de verificación con interacción. En contextos totalmente en línea o asíncronos, usar componentes vigilados o interactivos que exijan presencia en vivo, y abordar así directamente la amenaza del estudiante fantasma en lugar de suponer que la detección lo atrapará.

Una conclusión equilibrada

La IA agéntica no es ni una panacea ni un daño inevitable: su valor depende del diseño. Usada para dar andamiaje a la agencia de quien aprende, fundamentada en la pedagogía y con las personas en el circuito, los agentes pueden personalizar y profundizar el aprendizaje; usada para maximizar la automatización y la finalización de tareas, puede erosionar justamente el esfuerzo que produce el aprendizaje. El principio de diseño recurrente es la intencionalidad: decidir explícitamente qué hace el agente y qué deja deliberadamente a quien aprende.

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Recursos relacionados

  • DeepTutor
    The open-source release of the DeepTutor agentic tutoring framework: one workspace for tutoring, question generation, mastery practice, research and visualization, with inspectable learner memory.

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.