Conceptos
IA multimodal
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
IA multimodal: sistemas de IA que procesan, entienden o generan contenido en varias modalidades —texto, imágenes, audio, vídeo y datos estructurados—, y las cuestiones educativas que estos sistemas plantean. En la IA en la educación, la IA multimodal aparece en tres papeles distintos: como el contenido de aprendizaje que el estudiantado crea y con el que interactúa (aprendizaje multimodal), como la frontera de capacidad de los sistemas de tutoría que deben interpretar diagramas y gráficos (tutoría multimodal) y como la señal de evaluación utilizada para valorar la comprensión (medición multimodal).
Preguntas para reflexionar
- Piense en un gráfico, un diagrama de fuerzas o un esquema que alguna vez le costara explicar con palabras. ¿Qué sugiere esa experiencia sobre los límites de un tutor de IA solo de texto que intenta ayudar con problemas ricos en imágenes?
- Un tutor de física responde a los problemas basados en texto en torno al 96% de las veces, pero baja a cerca del 74% en problemas que incrustan significado en diagramas. Antes de leer, ¿qué cree que causa esta «interferencia multimodal», y se le ocurre una solución que no implique reentrenar el modelo?
- Es probable que haya generado texto e imágenes con herramientas de IA. ¿Ha comprobado que el «prompting para imágenes» difiere del prompting para texto? ¿Qué habilidades podría necesitar el estudiantado para traducir una idea abstracta a un prompt visual preciso?
- La IA multimodal puede calificar ensayos, generar retroalimentación con narración de audio e incluso reconstruir las estadísticas de los ítems de un examen a partir de ítems de imagen y texto. ¿Qué señala (o qué arriesga) el paso de la evaluación solo de texto a la multimodal en términos de equidad y validez?
- ¿Cómo podría el hecho de que el apoyo de IA sea menos fiable precisamente en los problemas cargados de diagramas que construyen una comprensión profunda de STEM crear una brecha de equidad entre quienes aprenden? ¿A quién afecta más?
- Los sistemas multimodales pueden traducir texto a audio o a elementos visuales para apoyar un aprendizaje inclusivo, pero también permiten una detección de aula muy granular. ¿Dónde está la línea entre un acceso multimodal útil y la vigilancia?
Introducción
La multimodalidad en la IA se refiere a la capacidad de trabajar con distintas formas de representación y no solo con texto. Los sistemas modernos de IA generativa y de LLM aceptan y producen cada vez más imágenes, audio y vídeo además de texto, lo que abre nuevas posibilidades y nuevos riesgos para la educación. Fundamentada en la teoría semiótica social, según la cual el significado se construye a través de los modos —y no solo con palabras—, la IA multimodal cambia cómo se diseña y se evalúa la enseñanza, el aprendizaje y la evaluación.(Multimodal Learning with Generative AI)
Tres caras de la IA multimodal en la educación
1. Aprendizaje multimodal y creación de contenidos
La IA multimodal permite a quienes aprenden producir contenido en texto, imagen, audio y vídeo, y interactuar con él. Una guía para educadores sobre el aprendizaje multimodal con IA generativa sitúa estas herramientas como un socio «ciber-social»: complementan —pero no pueden sustituir— la construcción humana de significado.(Multimodal Learning with Generative AI)
- La alfabetización en IA en contextos multimodales es por capas: conciencia básica de las plataformas multimodales, co-creación intermedia y evaluación crítica de las salidas, y diseño avanzado de actividades y evaluaciones multimodales.(Multimodal Learning with Generative AI)
- El prompting multimodal es en sí mismo una práctica epistémica exigente. El estudiantado que hace prompts tanto para imágenes como para texto descubre que «la alfabetización en prompts es distinta entre hacer prompts para texto y para imágenes»: traducir un significado abstracto a prompts multimodales legibles por máquina exige un vocabulario visual preciso y deja a la vista las limitaciones y los sesgos del sistema.(Students' multimodal prompting practices as epistemic work in AI literacy development)
- La evaluación multimodal pasa de los ensayos a artefactos que combinan texto, imagen, audio y vídeo, con el personal docente usando la IA para andamiar la creación y la retroalimentación en lugar de sustituir la producción del propio estudiante.(Multimodal Learning with Generative AI)
- La composición multimodal del estudiantado como andamiaje del pensamiento crítico conlleva una contrapartida. Lu et al. (2027) muestran que hacer que estudiantes de primaria superior convirtieran narraciones escritas en imágenes y vídeos cortos generados por IA sostuvo ganancias mantenidas en interpretación, análisis, evaluación y explicación, pero no en inferencia. Como los elementos visuales hacían explícito el significado del relato, el estudiantado informó de que necesitaba menos inferir el significado implícito a partir del texto solo; fue la colaboración entre pares, y no la herramienta multimodal, lo que restauró las ocasiones para inferir. El valor de la IA multimodal como socio en la construcción de significado es, por tanto, específico de cada dimensión y depende de un diseño instruccional que reintroduzca deliberadamente el trabajo inferencial y autorregulatorio que la externalización puede cortocircuitar.
- La composición multimodal del estudiantado como alfabetización crítica en IA. Burriss et al. (2026) analizan los anuncios de servicio público en vídeo de 90 segundos a 3 minutos de 22 estudiantes de undécimo grado sobre cuestiones de ética de la IA elegidas por ellos mismos —vigilancia mediante portátiles regulados por la escuela y «pases» electrónicos, consentimiento informado y acusación algorítmica punitiva— como alfabetización crítica en IA puesta en acto mediante la composición con imagen en movimiento, sonido, texto y los propios cuerpos del estudiantado. En las siete películas el daño se representaba como algo que emerge del entrelazamiento humano-máquina y no de la herramienta por sí sola (un «acosador de IA» antropomorfizado fue interpretado por una persona actoral en tres de las siete), y 15 de las 18 respuestas de fin de unidad dijeron que componer había cambiado su comprensión de la ética de la IA. Los autores sostienen que los productos multimodales tanto demuestran como comunican la competencia crítica: artefactos productivos, reflexiones y discurso cívico pueden servir como evidencia de evaluación que las escalas de alfabetización solo de texto estructuralmente no captan.
2. Tutoría multimodal y la frontera de capacidad
Cuando los tutores basados en LLM deben resolver problemas que incrustan significado en gráficos, diagramas de fuerzas, esquemas o tablas, su precisión se degrada bruscamente: el efecto de interferencia multimodal.(Multimodal Dialogue in STEM Education)
- En problemas de física de OpenStax, la precisión solo de texto de en torno al 96% baja a cerca del 74% en problemas ricos en imágenes, de forma consistente entre familias de modelos.(Multimodal Dialogue in STEM Education)
- Los errores de procesamiento visual —fallos al extraer información de gráficos o diagramas— dominan la taxonomía de errores y son el modo de fallo más corregible.
- Una intervención sencilla de diálogo estructurado (pedir al modelo que describa lo que ve, corregir solo las malas lecturas observables sin desvelar la física y volver a preguntar) devuelve la precisión a cerca del 95% sin ningún reentrenamiento.(Multimodal Dialogue in STEM Education)
- Esto es una preocupación de equidad: el estudiantado que trabaja con problemas ricos en imágenes —precisamente los problemas que construyen una comprensión conceptual profunda en STEM— recibe actualmente un apoyo de IA menos fiable que quien trabaja con ejercicios solo de texto.
- La frontera es un perfil, no un nivel, y las imágenes artísticas quedan fuera de la región que los modelos manejan bien. MUSE (Zhu et al., 2026) evalúa 30 VLM abiertos y propietarios en 12 tareas sobre 1.174 obras de arte por encargo, y la dispersión de capacidades entre dimensiones es mayor de lo que sugiere cualquier puntuación agregada: la clasificación de escenas está casi madura (23 de 30 modelos por encima de 75,0, mediana 81,0), mientras que la detección de emociones se queda en 39,5 y las tareas abiertas que exigen que los modelos articulen su evidencia puntúan 50,90 (identificación de pistas visuales) y 49,18 (inferencia de la causa de la emoción) en similitud semántica. El razonamiento composicional y dependiente del punto de vista es el que falla más: donde la verdad de referencia no especifica ninguna relación lateral o vertical definida, el 90,0% y el 73,3% de los modelos afirman una de todos modos, solo el 43,3% sitúa correctamente a la chica en profundidad, y ningún modelo resuelve las tres dimensiones de un mismo ítem. Los fallos además se encadenan: un personaje mal anclado se justifica después con una razón fluida construida a partir de la semántica visual cercana (mariposas, pájaros), que es el resultado más peligroso en tutoría porque la explicación se lee como competente. Para el aprendizaje de idiomas basado en imágenes, esto aboga por una validación a nivel de dimensión sobre las imágenes que un curso usa realmente, en lugar de importar una puntuación multimodal general, y por extender el punto de control de anclaje descrito más abajo —describir lo que se ve, y dónde, antes de razonar a partir de ello— al contenido artístico situado (MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education).
La implicación práctica de diseño es un punto de control de anclaje visual en la tutoría multimodal: un paso deliberado en el que el sistema describe lo que ve antes de intentar una solución, dando al estudiante o a una persona supervisora la oportunidad de corregir errores perceptivos.(Multimodal Dialogue in STEM Education)
3. Evaluación y medición multimodales
La IA multimodal amplía tanto el contenido de la evaluación como la señal utilizada para puntuarla.
- Los sistemas de retroalimentación multimodal integran texto estructurado, referencias a diapositivas y narración de audio en streaming. En un estudio, la retroalimentación multimodal con IA igualó a la retroalimentación de los educadores en cuanto a aprendizaje, y superó significativamente a esta en las percepciones del estudiantado.(LLM-based Multimodal Feedback Produces Equivalent Learning and Better Student Perceptions than Educator Feedback)
- La estimación multimodal de la respuesta al ítem usa LLM multimodales ajustados para reconstruir las curvas características del ítem (TRI / 3PL) directamente a partir de las probabilidades predichas por opción en ítems de imagen y texto, lo que conecta la IA multimodal con la medición educativa y la teoría de respuesta al ítem.(Multimodal Item Parameter Estimation using Simulated Response Probabilities)
- La evaluación de modelos visión-lenguaje educativos y la alfabetización de los LLM multimodales amplían el conjunto de herramientas de evaluación del campo al razonamiento multimodal y la visualización.(The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors)(Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy)
- La calificación multimodal de química manuscrita deja al descubierto una frontera de capacidad dependiente del formato: Cvengros y Kortemeyer calificaron página a página un examen final manuscrito de química general de 296 estudiantes contra imágenes de rúbricas con un LLM multimodal de razonamiento, puntuando de forma fiable las respuestas textuales y las ecuaciones de reacción química (F1 normalizado más alto) pero los dibujos y gráficos peor que el azar —las cuadrículas de fondo distraen visualmente a la visión de la IA y los diagramas científicos y las estructuras químicas siguen siendo difíciles de interpretar—, lo que refuerza que la visión de la IA multimodal no es robusta ante el trabajo cargado de representaciones y que es mejor desplegarla con deferencia humana en los ítems gráficos (Assisting the grading of a handwritten general chemistry exam with artificial intelligence).
IA multimodal para el aprendizaje de idiomas y el aprendizaje accesible
Los sistemas multimodales también amplían el acceso y la personalización. Las herramientas de aprendizaje con audio y vídeo guiadas por IA adaptan la velocidad de reproducción, producen resúmenes de vídeo multimodales y apoyan la práctica de la pronunciación.(AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques) Los grafos de conocimiento multimodales razonan sobre imágenes y texto para tareas educativas,(Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning) y las representaciones multimodales mejoran el aprendizaje inclusivo al traducir la información entre modos (por ejemplo, texto a audio o a visual). Entre las aplicaciones de dominio están la calificación y el diagnóstico de matemáticas manuscritas,(Benchmarking Large Language Models for Diagnosing Students' Cognitive Skills from Handwritten Math Work) la tutoría afectiva con señales multimodales,(An Interpretable Closed-Loop Intelligent Tutoring System for Multimodal Affective Feedback in Asynchronous Presentation Training)(MathBuddy: Affective Math Tutoring) el aprendizaje de texto a imagen en campos especializados(NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts) y la detección multimodal de incidentes en el aula respetuosa con la privacidad.(Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition) Bird (2026) demuestra una forma interna al texto de multimodalidad: fusionar un transformador ELECTRA ajustado con un análisis de rasgos de lingüística computacional para clasificar literatura inglesa por etapa clave del Reino Unido, donde el modelo fusionado (F1 0,996) superó con creces a todos los modelos de referencia unimodales, evidencia de que combinar formas de representación, incluso dentro del texto, puede superar a los enfoques de un solo modelo.
Retos e implicaciones de diseño
- Cerrar la brecha multimodal. Los sistemas de tutoría multimodal deberían incluir anclaje visual y andamiajes de diálogo estructurado en lugar de dar por supuesto que las capacidades de visión son robustas.(Multimodal Dialogue in STEM Education)
- Tratar el prompting multimodal como una habilidad enseñable. Los currículos de alfabetización en IA deben abordar el prompting específico de cada modalidad, la coherencia entre modos y la evaluación crítica de las salidas multimodales.(Students' multimodal prompting practices as epistemic work in AI literacy development)
- Preservar la construcción humana de significado. La IA multimodal debe aumentar, y no sustituir, la propia construcción y evaluación del significado por parte de quien aprende en los distintos modos.(Multimodal Learning with Generative AI)
- Extender la evaluación a la validez multimodal. La validez de la evaluación, el sesgo y la fiabilidad deben examinarse cuando la IA puntúa o genera artefactos multimodales.(Multimodal Item Parameter Estimation using Simulated Response Probabilities)(Evaluación de la IA en educación)
- Vigilar la equidad y la privacidad. El apoyo poco fiable en problemas ricos en imágenes y las exigencias de datos de la detección multimodal conllevan implicaciones tanto de equidad como de privacidad.(Multimodal Dialogue in STEM Education)(Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition)
Conceptos conectados
- IA generativa
- Grandes modelos de lenguaje (LLM)
- Grafo de conocimiento
- Tutoría inteligente
- Alfabetización en IA
- Ingeniería de prompts
- Retroalimentación
- Evaluación
- Medición educativa
- Teoría de respuesta al ítem
- Modelado del estudiantado e instrucción adaptativa
- Método socrático
- Andamiaje
- Evaluación de la IA en educación
- Punto de referencia
- Educación superior
- Equidad
- Privacidad
- Educación STEM
- Aprendizaje inclusivo
- Tecnologías — Paraguas: tecnologías y técnicas de IA (modelos, entrenamiento de LLM, robótica, RAG, agéntica)
- Realidad virtual y aumentada — el gesto, la voz y la entrada espacial como canales de aprendizaje
- Tecnologías del habla y de la voz
- Educación en artes, diseño y medios
Artículos conectados
- "Young Scholar[s] on the Beat": Multimodal Composition as a Form of Critical AI Literacy Pedagogy — Composición de anuncios de servicio público en vídeo sobre ética de la IA como pedagogía de alfabetización crítica en IA (Burriss et al. 2026)
- Fairness-Aware Multimodal Transformer Modeling for Real-Time Student Attention Estimation — Modelado con transformadores multimodales conscientes de la equidad para la estimación de la atención del estudiantado en tiempo real
- OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora
- Students' Perceptions of Multiliteracies Development Using AI-Assisted Portfolio Assessment
- The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors — Rendimiento de los VLM con trabajo matemático manuscrito del estudiantado (DrawEduMath, Lucy et al. 2026)
- Multimodal Learning with Generative AI — Guía para educadores sobre el aprendizaje multimodal con IA generativa (modelo MMLD-AI)
- Multimodal Dialogue in STEM Education — El efecto de interferencia multimodal y la recuperación mediante diálogo estructurado en STEM
- LLM-based Multimodal Feedback Produces Equivalent Learning and Better Student Perceptions than Educator Feedback — La retroalimentación multimodal con IA iguala a los educadores en aprendizaje y los supera en percepciones
- Students' multimodal prompting practices as epistemic work in AI literacy development — El prompting multimodal del estudiantado como trabajo epistémico en la alfabetización en IA
- Multimodal Item Parameter Estimation using Simulated Response Probabilities — Estimación de parámetros de ítems TRI con LLM multimodales
- AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques — Apoyo al aprendizaje con audio y vídeo guiado por IA
- Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning — Grafos de conocimiento multimodales para el razonamiento educativo
- Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy — Alfabetización de los LLM multimodales para la visualización científica
- An Interpretable Closed-Loop Intelligent Tutoring System for Multimodal Affective Feedback in Asynchronous Presentation Training — Señales multimodales en la tutoría inteligente afectiva
- MathBuddy: Affective Math Tutoring — Tutoría matemática afectiva multimodal
- Benchmarking Large Language Models for Diagnosing Students' Cognitive Skills from Handwritten Math Work — Diagnóstico cognitivo con LLM de matemáticas manuscritas
- NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts — Aprendizaje de texto a imagen en la enseñanza de ingeniería nuclear
- Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition — Detección multimodal de incidentes en el aula respetuosa con la privacidad
- Integrating Generative AI into Cybersecurity Education: A Study of OCR and Multimodal LLM-Assisted Instruction — Instrucción multimodal con OCR en la enseñanza de ciberseguridad
- Benchmarking Multimodal Large Language Models for Educational Slide Auditing — CFES-P24: evaluación de LLM multimodales para la auditoría de diapositivas
- DiagramIR: An Automatic Pipeline for Educational Math Diagram Evaluation — DiagramIR: evaluación de diagramas matemáticos visuales a partir de código generado por LLM
- Large Scale AI Grading of Handwritten Physics Assessments: Score Agreement and Olympiad Team Selection Outcomes — Calificación con IA de evaluaciones de física manuscritas (Olimpiada)
- Using Gemini and LuaLaTeX to transcribe physics videos into PDF/UA-2 and ISO 32005 math-accessible PDFs — Transcripción de vídeo de física accesible matemáticamente con Gemini + LuaLaTeX
- What differentiates educational literature? A multimodal fusion approach of transformers and computational linguistics — Fusión multimodal para clasificar literatura educativa
- More externalization, but less inference? Exploring changes in young learners' critical thinking during conversational — Composición multimodal con IA y pensamiento crítico en la escritura de primaria (Lu et al. 2027)
- Assisting the grading of a handwritten general chemistry exam with artificial intelligence
- Beyond Generation and Accuracy: Diagnosing and Enhancing Visual Chain-of-Thought for Geometry Problem Solving — Más allá de la generación y la precisión: diagnosticar y mejorar la cadena de pensamiento visual para resolver problemas de geometría
- MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education — MUSE: 12 tareas sobre 1.174 obras de arte muestran la capacidad de los VLM como un perfil específico por dimensión, más débil en interpretación afectiva y razonamiento espacial dependiente del punto de vista (Zhu et al. 2026)
- AI-Assisted Assessment of Experimental Physics Laboratory Reports: Potential, Limitations, and Support for Teaching Practice — Evaluación asistida por IA de informes de laboratorio de física experimental: potencial, limitaciones y apoyo a la práctica docente
Recursos relacionados
- DrawSplatA free browser platform of small teaching tools: whiteboard, spreadsheets, slides, documents, lists, concept maps, quizzes, charts, images and video.