En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

Educación científica — el estudio y la práctica de cómo aprende ciencias el estudiantado y de cómo enseñarlas, un campo que la IA generativa (LLM, simulaciones, laboratorios virtuales y calificación con IA) está reconfigurando en física, química y biología. Los artículos sobre educación científica de esta base de conocimiento muestran un campo que negocia una tensión central: la IA apoya de forma demostrable la indagación, la corrección de ideas erróneas y la evaluación a escala, y a la vez su valor depende del diseño instruccional y conlleva riesgos reales de dependencia excesiva, alucinación y aprendizaje deshumanizado y orientado al beneficio.

Preguntas para reflexionar

  • La página se abre con una tensión: la IA apoya de forma demostrable la indagación y la corrección de ideas erróneas a escala, y a la vez su valor depende por completo del diseño instruccional. Antes de leer, ¿cuándo le ha parecido potente pero pedagógicamente hueca una herramienta que haya usado para enseñar ciencias, y qué marcó la diferencia?
  • Una indagación de física facilitada por IA «inventó» valores de masa que nadie había medido cuando el estudiantado la presionó. ¿Qué revela ese incidente sobre tratar las salidas de la IA como algo con autoridad en ciencia, y cómo debería entrenarse al estudiantado para tratar una respuesta que suena segura?
  • La investigación sugiere que la IA puede aportar hoy más valor como generador de contenido escalable que como tutor interactivo: en un estudio, textos de cambio conceptual bien elaborados (de especialistas o hechos por IA) superaron a un diálogo con IA dirigido por prompts. ¿Le sorprende, y qué sugiere eso sobre dónde reside ahora mismo el verdadero rendimiento pedagógico de la IA en ciencia?
  • La IA calificó 10.364 evaluaciones manuscritas de física con un alto acuerdo con los evaluadores humanos, y aun así los modelos multimodales siguen mostrando lagunas en razonamiento complejo y generación de diagramas. ¿Qué tiene el trabajo científico «auténtico y cargado de representaciones» que podría resistirse a la evaluación automatizada?
  • El estudiantado de física muestra una brecha llamativa entre confianza y utilidad —mucho uso, poca confianza— y se divide entre usuarios pragmáticos y no usuarios escépticos. Si el propio estudiantado son escépticos calibrados por el dominio, ¿qué implica eso para las políticas uniformes sobre la IA en las aulas de ciencias?
  • Una voz crítica advierte de una «colonización por IA» de la educación científica: extracción sin consentimiento, monocultivo algorítmico, reforma deshumanizadora. Antes de leer, ¿dónde cree que se están vendiendo en exceso los beneficios de la IA en la educación científica, y cómo sería una alternativa humanocéntrica y orientada a la justicia?

Introducción

La educación científica es donde la promesa de la IA y sus límites chocan de forma más visible, porque las disciplinas exigen un razonamiento multimodal riguroso —pensamiento visual-espacial en física, destrezas de laboratorio en química y sistemas a escala de organismo en biología— junto con contenido bien estructurado y verificable, que los LLM manejan bien. Los trece artículos aquí sintetizados abarcan las tres disciplinas y todos los niveles, desde las aulas de secundaria de K-12 hasta cursos universitarios de educación superior y programas de formación inicial del profesorado. En conjunto, emerge un cuadro coherente: la IA funciona mejor no como generadora de respuestas, sino como socia integrada —coinvestigadora, generadora de contenido, asistente de laboratorio virtual— cuya contribución la deciden el diseño instruccional y la estructura pedagógica que la rodea.

Laboratorios virtuales y simulaciones

La IA está rebajando drásticamente la barrera para crear instrumentación científica personalizada y encarnada. Levy et al. muestran que un prompt en lenguaje natural de cuatro elementos puede generar una simulación de física en realidad aumentada controlada con las manos (un gesto de pellizcar y separar ajusta la longitud de onda de una lámpara virtual), con un 86% del estudiantado piloto informando de una mayor implicación. De forma similar, Suñer et al. generaron por completo mediante prompts un laboratorio de movimiento circular basado en navegador, validado frente al análisis de vídeo con un error inferior al 1%. Estos trabajos replantean la IA generativa como una herramienta de programación que permite al profesorado diseñar software en torno a la intención pedagógica en lugar de adaptar actividades a aplicaciones fijas, avanzando en el aprendizaje encarnado y basado en la simulación. En educación química, Abdikayumova y Madybekova integraron simulaciones de PhET y tutoría con ChatGPT dentro de un ciclo de indagación 7E basado en contextos para estudiantes de décimo grado, logrando un rendimiento y una implicación significativamente mayores que cualquiera de los dos componentes por separado, evidencia de que la contextualización, la indagación estructurada y la IA adaptativa actúan de forma sinérgica. El análisis conductual de cómo trabaja el estudiantado dentro de esos entornos de modelado refuerza esta lección de diseño: al rastrear a 315 personas que aprendían en línea construyendo modelos ecológicos en VERA, An, Hammock y Goel (2025) encontraron que quienes se implican en una exploración de ciclo completo guiada por hipótesis construyen los modelos más complejos y diversos, mientras que quienes aprenden con un sesgo hacia la observación en gran medida copian modelos existentes, lo que sugiere que las herramientas de modelado científico deberían promover activamente una conducta exploratoria de ciclo completo en lugar de dejar a quien aprende en un modo pasivo dominado por la observación.

Tutores de IA y aprendizaje basado en la indagación

El aprendizaje basado en la indagación es un tema central. La revisión sistemática de 24 estudios de Jiang et al. sitúa a ChatGPT como «coinvestigador impulsado por IA» usado principalmente en las fases de conceptualización, investigación y discusión de la indagación STEAM, mejorando el rendimiento, el pensamiento crítico y la implicación, y a la vez con riesgos de dependencia excesiva, alucinación y conclusiones superficiales cuando se trata la salida como algo con autoridad. Aydın encontró que ocho semanas de indagación guiada asistida por IA produjeron grandes avances en la comprensión conceptual de la fotosíntesis y la respiración en futuros docentes, mientras que la alfabetización en IA y el pensamiento computacional no mostraron cambios significativos, lo que sugiere que el aprendizaje disciplinar puede mejorar incluso cuando las competencias más amplias necesitan una instrucción más larga o más explícita. Tufino y Damiani muestran que la IA puede andamiar el núcleo epistémico de la indagación ISLE sin salir del canal verbal, pero encontraron una facilitación frágil: bajo la presión del estudiantado, la IA «inventó» valores de masa que nadie había medido, lo que subraya el riesgo de alucinación y la necesidad de verificar en lugar de dar por supuesta la fidelidad de la IA. Kuhn et al. proponen el marco AIRIS (Activar–Indagar–Reflexionar) para mantener la predicción, la interpretación y la evaluación como tareas humanas no delegables, y reclaman experimentos de «condición de retirada» que comprueben si el aprendizaje sobrevive a la eliminación de la IA, una respuesta directa al «problema de la rana hervida» de la erosión de la práctica epistémica. El juicio experto sobre planificaciones de clase generadas por IA extiende esta lección de diseño a la ciencia alineada con el currículo: Karaismailoglu, Surmeli y Yildirim (2026) hicieron que once especialistas turcos en educación científica puntuaran ChatGPT-4 y una herramienta centrada en la educación (Teacher's Buddy) sobre planificaciones de sexto grado para una unidad de «Vida sostenible y biodiversidad» alineada con el modelo de aprendizaje basado en el diseño ingenieril (EDBL). Ambas plataformas puntuaron más alto en «Presentar la solución» y más bajo, en cambio, en Habilidades de Ingeniería (x̄ = 37,45 para la de uso general; x̄ = 41,45 para la centrada en la educación), una debilidad compartida a la hora de simular las etapas iterativas y orientadas al proceso (prototipado, análisis de fallos, revisión, retestado reflexivo) que definen el aprendizaje basado en el diseño, y solo 3 de los 11 especialistas juzgaron cualquiera de las planificaciones directamente como «Aplicable», con 7 calificándolas como «Aplicable con correcciones».

Ideas erróneas y cambio conceptual

En el ámbito del cambio conceptual, la evidencia es matizada y en parte contraintuitiva. Akdoğan encontró, en un diseño de Solomon de cuatro grupos con 413 estudiantes, que tanto los textos de cambio conceptual escritos por especialistas como los generados por IA eran igualmente y significativamente más eficaces para reducir las ideas erróneas sobre calor y temperatura que el diálogo interactivo con IA, que no ofreció ninguna ventaja sobre el grupo de control, lo que sitúa el valor pedagógico actual de la IA como generadora de contenido escalable y no como tutora interactiva, con las ganancias concentradas en el estudiantado de alto rendimiento (una preocupación de equidad). Esto lo refuerzan Borse et al., que muestran que la especificidad del prompt determina la calidad de las soluciones de física y que la crítica guiada por MAPS prepara mejor al estudiantado para evaluar la salida de la IA que la resolución de problemas por su cuenta, tratando la falibilidad de la IA como un recurso de aprendizaje para el pensamiento crítico.

Calificación y evaluación con IA

La calificación con IA avanza rápidamente en trabajos de alta exigencia. Pathak et al. calificaron 10.364 páginas escaneadas de evaluaciones manuscritas de física (incluidas una olimpiada nacional y un campamento de selección de equipos), logrando correlaciones de puntuación altas (0,91–0,97) y recuperando el mismo equipo de cinco estudiantes que la calificación humana, y sostienen que la IA funciona como segunda evaluadora válida y herramienta de auditoría bajo control del examinador cuando se le dan rúbricas detalladas y específicas de física. La corrección automática de respuestas cortas tiene un linaje transformador más largo y más fundacional: la revisión de alcance de Morley et al. sobre 21 estudios (2017–principios de 2024) encontró que los modelos de la familia BERT dominaron la corrección automática de preguntas científicas de respuesta corta hasta 2021, antes de que los enfoques basados en GPT se adoptaran mediante prompts a partir de ~2022; que los modelos aumentados con datos del dominio (libros de texto, rúbricas, preentrenamiento adicional) superaron de forma consistente las líneas base; y que las amenazas no resueltas a la fiabilidad, la explicabilidad y la equidad abogan por que estos correctores automáticos apoyen a los examinadores humanos en lugar de sustituirlos. Sin embargo, el punto de referencia OmniPhys de Chen et al. revela que los LLM multimodales siguen mostrando lagunas significativas en razonamiento complejo y en generación de diagramas, lo que advierte contra confiar en exceso en la evaluación automatizada de física en las tareas auténticas y cargadas de representaciones que definen la competencia disciplinar profunda. Una contraparte en química afina la dependencia del formato: Cvengros y Kortemeyer calificaron un examen final manuscrito de química general de 296 estudiantes con un LLM multimodal, y encontraron un alto acuerdo con el personal ayudante en las respuestas textuales y de reacciones químicas, pero un rendimiento peor que el azar en el dibujo y la representación gráfica (las cuadrículas de fondo distraen a la visión de la IA), evidencia de que la calificación fiable con IA en ciencia es selectiva según el formato de respuesta y exige una deferencia basada en la confianza hacia examinadores humanos en los ítems gráficos, en lugar de un enfoque uniforme de «calificarlo todo».

Percepciones del profesorado y la mirada crítica

La preparación del profesorado es decisiva. Amponsah et al. encontraron que los futuros docentes de ciencias ghaneses mantienen actitudes positivas e intenciones firmes hacia la IA, pero solo un uso real moderado en el aula, una brecha entre intención y uso que señala la competencia docente en IA y el apoyo institucional como las palancas reales. Becker et al. y Fouad y Bentley documentan que el estudiantado de física son escépticos calibrados por el dominio y no adoptadores acríticos: una brecha de 50 puntos entre confianza y utilidad (91% lo usa, 41% confía) y dos perfiles de usuario distintos (usuarios pragmáticos frente a no usuarios escépticos) que cuestionan las políticas uniformes. Como contrapeso al tecnoptimismo, Avraamidou advierte de una «colonización por IA» de la educación científica —extracción sin consentimiento, monocultivo algorítmico y reforma deshumanizadora y centrada en el beneficio— y reclama una IA feminista y humanocéntrica que priorice la justicia sobre el beneficio, mientras que la revisión sistemática de 18 estudios de Erümit y Özdemir Sarıalioğlu subraya los riesgos éticos (sesgo, alucinación, plagio, erosión del pensamiento independiente) y la necesidad de formación docente y de un uso consciente. La lección colectiva de los trece artículos es que la IA en la educación científica aporta ganancias cuando se integra en un diseño sólido de indagación, andamiaje y evaluación, y socava el aprendizaje cuando desplaza el trabajo epistémico que el estudiantado debe hacer por sí mismo.

Conceptos conectados

Artículos conectados

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.