Conceptos
Simular estudiantes
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
Simular estudiantes —usar agentes basados en LLM para modelar la conducta, la cognición y las dinámicas sociales de quien aprende con fines de investigación, diseño y formación educativa. El estudiantado simulado permite a quienes investigan evaluar enfoques pedagógicos, modelar perfiles diversos de aprendientes, probar la IA educativa antes de su despliegue y formar al profesorado, tareas que resultan difíciles, lentas o éticamente limitadas de hacer de forma sistemática con estudiantes reales.
Preguntas para reflexionar
- Si tuviera que construir un «estudiante» de IA para practicar su docencia, ¿qué lo haría convincente para usted, y por qué un sistema que siempre da la respuesta correcta podría ser en realidad un mal sustituto de una persona que aprende?
- La página llama «paradoja de la competencia» al desajuste entre las respuestas perfectas de una IA capaz y las imperfectas de un estudiante real. ¿Dónde ha visto esta tensión en su propia experiencia con la IA, y qué cree que hace falta para que un aprendiente simulado sea genuinamente realista?
- ¿Qué razones éticas y prácticas podrían llevarle a preferir probar un sistema de tutoría o un diseño curricular con estudiantes simulados en lugar de reales, y qué riesgos de validez sospecha que introduce ese intercambio?
- Un estudiante simulado puede ser «epistémicamente fiel» sin parecer superficialmente humano. Antes de seguir leyendo, ¿qué distinción imagina entre una superficie creíble y un modelo veraz de lo que una persona que aprende sabe de verdad?
- ¿Cómo decidiría si un hallazgo producido con estudiantes simulados merece la suficiente confianza como para cambiar su forma de enseñar a personas reales?
Introducción
El estudiantado simulado es una herramienta metodológica: agentes que sustituyen a personas que aprenden para poder evaluar e iterar sistemas de tutoría, currículos y estrategias didácticas sin reclutar cohortes de estudiantes humanos. Los modelos de lenguaje grandes han hecho este paradigma mucho más escalable y lingüísticamente realista que los aprendientes simulados basados en reglas que los precedieron, a la vez que han introducido nuevos retos de validez.
Las aproximaciones mediadas por IA afinan la pregunta que interesa a esta página: a quién representa la simulación y qué se supone que debe notar el profesorado. En la formación del profesorado de matemáticas, los trabajos escritos de estudiantado simulado basados en texto y los compañeros chatbot usados en el ensayo amplían las aproximaciones a la práctica que ya organizan la formación profesional. Un estudio con chatbots produjo cuatro perfiles de interrogación distintos, pero las autoevaluaciones del profesorado en formación no coincidían con la calidad de interacción que registraban las personas observadoras, lo que convierte la retroalimentación automatizada posterior al ensayo —que aumentó las preguntas de sondeo y exploración— en una guía útil pero insuficiente. El simulador, la persona candidata y la retroalimentación deben leerse en conjunto. Lo que una simulación permite notar al profesorado también lo fija su diseño: en la intervención de tres semanas sobre el signo igual de Galiç et al. (2026) con 17 futuros docentes de matemáticas, las personas candidatas se movían entre atender, interpretar y modelar en lugar de seguir una secuencia fija, pero la configuración textual y uno a uno hizo que el modelado se redujera a preguntar y dar prompts, y un diseño que partía de las ideas erróneas desviaba la atención hacia la detección de errores en lugar de hacia las fortalezas del estudiantado. El simulador elige la porción de la enseñanza que la persona candidata puede ensayar.
Por qué simular estudiantes
- Evaluar la pedagogía: probar enfoques didácticos en muchos perfiles de aprendientes de forma controlada y repetible.
- Modelar aprendientes diversos: capturar la variación en niveles cognitivos, estilos de aprendizaje, conocimientos previos e ideas erróneas que es difícil reunir en una cohorte real.
- Probar la IA educativa: validar sistemas de tutoría y de evaluación antes de desplegarlos en vivo, y generar datos de entrenamiento.
- Formación del profesorado: permitir que el profesorado practique la tutoría y la gestión del aula con aprendientes simulados, a menudo imperfectos.
El reto central: la imperfección realista
La dificultad definitoria de la simulación de estudiantes es que los LLM se entrenan para ser «asistentes serviciales» que producen respuestas correctas y pulidas. Sin embargo, los estudiantes reales son imperfectos: cometen errores característicos, sostienen ideas erróneas y aprenden gradualmente. Un estudiante simulado que responde de forma perfecta (o demasiado aleatoria) no es un modelo válido de quien aprende. La investigación lo enmarca como la paradoja de la competencia: los LLM ampliamente capaces a los que se pide emular a aprendientes con conocimientos parciales producen patrones de error y dinámicas de aprendizaje poco realistas. Nguyen y Cao (2026) dan una dirección a esa deriva. Frente a las ideas del estudiantado integradas en 49 lecciones de ciencias alineadas con NGSS, seis modelos mantuvieron la mayoría de las ideas dentro del ámbito de conocimiento esperado y aproximadamente dos tercios en el nivel de lectura objetivo o por debajo, pero se pasaron de la raya justo donde quien aprende era más joven: las ideas de primaria y secundaria superaban con más frecuencia el ámbito de conocimiento y el nivel de lectura del curso objetivo, mientras que el corpus en su conjunto se inclinaba hacia un razonamiento más amplio, un vocabulario más técnico y menos marcadores de incertidumbre («quizá», «parece») que las ideas de las lecciones. La elección de modelo tampoco es unidimensional: un sistema que se ajusta estrechamente a las ideas de la lección puede aun así situarlas por encima del curso, de modo que la corrección suele ser didáctica, ya que un nuevo prompt explícito con el nivel de curso devolvió a la mayoría de los modelos al rango. Abordarlo exige restringir la simulación para que refleje un estado epistémico genuino —lo que sabe quien aprende, cómo se estructuran los errores y cómo evoluciona ese estado— en lugar de la competencia plena del modelo. Entre las técnicas están los prototipos cognitivos anclados en modelos de grafo de conocimiento o de seguimiento del conocimiento, las especificaciones explícitas de estado epistémico y los modelos de transición de estados del aprendizaje en lugar del simple juego de roles condicionado por un personaje.
Fidelidad por encima del realismo superficial
La validez es la preocupación central: un estudiante simulado solo es útil si su conducta es epistémicamente fiel, es decir, si refleja el estado de conocimiento del aprendiente previsto, y no si es meramente verosímil desde el punto de vista lingüístico. La investigación advierte contra la adulación, en la que un «estudiante simulado» simplemente da la razón al tutor en lugar de exhibir las ideas erróneas que debía encarnar. Esto conecta con la calibración de la confianza y con el problema más amplio de evaluar si un agente modela de verdad un constructo en lugar de reproducir una conducta superficial.
Conexión con la base de conocimiento
La simulación de estudiantes se sitúa en la intersección de la simulación, el modelado del estudiantado y el seguimiento del conocimiento. Es un uso diferenciado de la IA generativa en educación (modelar a quienes aprenden en lugar de tutelarlos) y una aplicación de los sistemas multiagente de IA agéntica. Apoya la tutoría inteligente, el aprendizaje adaptativo, el aprendizaje personalizado y el desarrollo del rol docente, y se solapa con la simulación de pacientes para la formación profesional (por ejemplo, en contextos de educación especial y de educación médica). En el plano de los paradigmas, Zhang, Jiang y Tang (2026) lo llevan más allá de la evaluación: su artículo de posición sostiene que la ciencia educativa sufre un desajuste estructural entre su teoría y su aparato de datos y métodos, y propone una ciencia educativa basada en agentes, en la que los agentes modelan a quienes aprenden, al profesorado, a las familias y a los pares mientras el aparato de simulación —y no el agente individual— sirve de instrumento de investigación, generando trayectorias de desarrollo prolongadas en el tiempo y diseños contrafactuales que son lentos, costosos o éticamente inviables de ejecutar en aulas, con los datos empíricos reformulados como calibración, validación y condiciones de contorno. El artículo no informa de ninguna validación empírica de todo esto: los agentes de desarrollo del estudiantado solo se especifican conceptualmente, y la propia revisión de los autores admite que los LLM siguen sin captar la variabilidad interindividual y que validar la simulación social generativa sigue siendo el reto no resuelto del campo, de modo que la afirmación de que la simulación cambiaría el funcionamiento de la evidencia y la replicación es una propuesta y no un resultado demostrado.
Simular estudiantes frente a modelar al estudiantado
La distinción clave está entre representar a una persona que aprende real y generar una persona que aprende sintética. El modelado del estudiantado es la práctica de construir una representación computacional de un estudiante real —lo que sabe, siente y necesita— para que los sistemas adaptativos puedan personalizar la enseñanza para ese aprendiente. La simulación de estudiantes, en cambio, crea aprendientes ficticios a demanda, no para atender a un individuo real, sino para sustituir a una cohorte de modo que la pedagogía y los sistemas de IA puedan probarse fuera de línea.
Ambos enfoques son complementarios y no competidores. Un estudiante simulado de alta fidelidad normalmente contiene un modelo de estudiante (un estado epistémico, un conjunto de ideas erróneas, un perfil de implicación) y se apoya en los mismos constructos que formalizan el modelado del estudiantado y el seguimiento del conocimiento. El reto de validez compartido es el mismo en ambos casos: la representación debe reflejar fielmente el estado real de quien aprende y no la conducta por defecto del sistema. Pero el propósito difiere: el modelado del estudiantado diagnostica a una persona real para actuar sobre ella; la simulación fabrica aprendientes para probar o formar. Por eso la investigación sobre estudiantado simulado se usa cada vez más para auditar la IA (véase más abajo), mientras que la investigación sobre modelado del estudiantado sigue orientada al aprendizaje adaptativo y al aprendizaje personalizado en vivo.
Fidelidad en dos ejes: coincidencia conductual y capacidad de respuesta a la orientación
StudentSim (Yang et al., 2026) formaliza el problema de validez como dos requisitos que deben cumplirse a la vez: la fidelidad conductual (F), es decir, qué tan bien coincide un simulador con las respuestas de un estudiante concreto, y la capacidad de respuesta a la orientación (R), es decir, con qué fiabilidad se actualiza hacia donde lleva la orientación del tutor. Su punto de referencia, StudentSimEval, convierte corpus públicos de aprendientes (ajedrez, escritura en inglés como segunda lengua, matemáticas) en un protocolo estandarizado por estudiante sobre el que se ajusta y puntúa cualquier simulador con registros reservados. Una canalización en dos etapas, agrupada y luego especializada (un fondo compartido de patrones conductuales más un adaptador por estudiante), produce una familia de simuladores fuertes en ambos ejes, que supera al seguimiento de estado específico de dominio (débil en R) y al juego de roles con LLM solo por prompt (débil en F). Esto da al campo un vocabulario concreto y bidimensional para juzgar si un aprendiente simulado es genuinamente útil y no solo verosímil y, como prueba de concepto, un StudentSim congelado usado como recompensa en un bucle de aprendizaje por refuerzo para tutoría de ajedrez produjo tutores que los expertos valoraron como más exactos, mejor orientados y más personalizados que los entrenados con una recompensa de simulador LLM de frontera o sin ningún aprendizaje por refuerzo.
Describir, no simular: cuándo un solo agente supera a una cohorte simulada
Una pregunta recurrente es si simular una distribución de aprendientes es la mejor manera de predecir cómo les irá a los estudiantes reales. Wang, Mitchell y Piech (2025) aportan un contrarresultado llamativo: para evaluar una experiencia de aprendizaje en línea antes de que el estudiantado se implique —predecir el abandono y la finalización y dar retroalimentación de diseño—, un único agente web «descriptor» que recorre la lección de forma autónoma y produce una descripción rica de la experiencia del estudiantado superó a simular directamente una población de estudiantes. Sus estudiantes simulados (agentes condicionados por un personaje y muestreados para coincidir con una tasa de finalización prevista) mostraron mucha menos variedad conductual que las personas que aprenden de verdad: en 100 agentes y cinco lecciones de prueba reprodujeron solo alrededor del 4% de los caminos que tomaron los estudiantes reales, y ofrecieron poca información sobre la dificultad de la lección, además de ser sustancialmente más costosos desde el punto de vista computacional. La canalización única de describir y luego predecir (descripciones generadas por el agente y alimentadas a un LLM para predecir resultados) logró la mejor predicción de la distribución de abandono en un curso masivo y global de CS1 (JSD media 0,060, por delante de todas las bases de referencia). Es un resultado de frontera productivo para el campo: simular una distribución de estudiantes puede ser innecesario —e incluso contraproducente— cuando el objetivo es predecir resultados o criticar un diseño, porque una descripción fiel de la experiencia contiene más señal que una porción estrecha de trayectorias simuladas. También sugiere que el papel de la simulación puede quedar acotado a preguntas (por ejemplo, auditar el trato que da una IA a perfiles diversos o formar al profesorado) en las que cubrir la variación real de quienes aprenden importa más que predecir resultados agregados.
Modelos de estudiante con datos auténticos y práctica interactiva
Dos hilos de 2026 afinan el valor práctico de la simulación. En primer lugar, los modelos de estudiante con datos auténticos: TeachLM entrena un modelo de estudiante con 100.000 horas de interacciones reales de tutoría individual entre tutor y estudiante (con anonimización rigurosa), produciendo aprendientes sintéticos que permiten una evaluación multiturno rápida, escalable y reproducible de la conducta del tutor; esto aborda la baja autenticidad y diversidad de los simuladores de estudiantado construidos solo con prompts. En segundo lugar, los simulacros didácticos interactivos: EducaSim usa agentes generativos (con personajes, memorias ancladas en el curso y un oráculo de habla con LLM como juez) para simular una sección de grupo pequeño destinada a docentes en formación, añadiendo interacción por voz y código ejecutable, además de retroalimentación estructurada posterior a la sesión y autorreflexión, y demuestra una práctica docente experiencial de bajo coste y buena adopción a la escala de cursos en línea masivos. Ambos apuntan a que la simulación sirve no solo para evaluar, sino también para la preparación práctica del profesorado.
Un tercer hilo de 2026 se refiere a cómo se construye un simulador y no a para qué se usa, y converge en una conclusión: el prompting fija un techo que el entrenamiento elimina. SWIM (Do, Kontak y Sachan, 2026) reformula la simulación de la escritura del estudiantado como generación de ensayos condicionada por el nivel de competencia y compara el prompting anclado en rúbricas, el ajuste fino supervisado con pares reales de puntuación y ensayo, y GRPO con una recompensa de alineación de competencia derivada de la puntuación automatizada de ensayos, puntuando cada ensayo generado frente a su perfil objetivo de rasgos con el kappa cuadrático ponderado. El prompting dio un control limitado incluso a modelos propietarios potentes (mejor QWK medio de rasgo 0,577 para Claude Sonnet, 0,422 para GPT-5.4, y casi cero al promptear un modelo abierto de 7B), alineó mucho mejor los rasgos orientados al contenido que la forma (0,695 frente a 0,458) y produjo una población idealizada de alta competencia, con una puntuación global normalizada media de 0,74 frente a 0,58 en estudiantes reales y una longitud mediana de 304 palabras frente a 167. El ajuste fino supervisado llevó un modelo de 7B a 0,474 ± 0,023 y GRPO a 0,618 ± 0,005, las ganancias se mantuvieron con dos evaluadores independientes contra los que la política nunca se entrenó, y los modelos entrenados recuperaron las distribuciones humanas de puntuación y longitud sin ninguna supervisión de longitud; la forma auténtica de baja competencia siguió siendo lo más difícil, ya que los modelos entrenados recuperaron la sintaxis pero escribieron demasiado pocos errores ortográficos y gramaticales, mientras que el prompting simulaba la debilidad sobre todo mediante corrupción superficial. La misma lección llega desde la dirección opuesta en Liu et al. (2026), que ajustaron por instrucciones tres modelos pequeños para que sostuvieran ideas erróneas de álgebra: la composición de los datos decidió el resultado, porque una sola idea errónea se generalizaba en exceso y degradaba la resolución correcta hasta que se mezclaron ejemplos correctos, varias ideas erróneas se entrenaron conjuntamente sin coste, y ninguna idea errónea se adquirió con supervisión basada solo en la respuesta final, sea cual sea el tamaño de los datos, lo que deja los rastros de solución paso a paso como requisito vinculante.
Auditar la IA con estudiantes simulados
Más allá de evaluar la pedagogía, el estudiantado simulado sirve como banco de pruebas para auditar los propios sistemas de IA, una forma controlada de sondear cómo se comporta una IA con perfiles diversos de aprendientes antes de que toque a estudiantes reales. López-Pernas et al. (2026) lo ilustran: generaron 4.500 viñetas sintéticas de estudiantes con tres LLM para auditar si los modelos de lenguaje grandes actuales pueden actuar como recomendadores prescriptivos de analítica del aprendizaje, y encontraron una sensibilidad limitada a la necesidad del estudiantado y una marcada inconsistencia entre modelos. Usar cohortes simuladas para someter a prueba las recomendaciones de una IA (y no solo para entrenar o evaluar tutores) es un papel creciente de este paradigma, muy ligado a la evaluación de la IA en educación y a la equidad en la educación con IA cuando la auditoría pretende sacar a la luz un trato desigual entre tipos de aprendientes.
Un segundo registro de auditoría es metacognitivo y afectivo. MEDS (Esposito et al., 2026) es un conjunto de datos de 28.000 registros —2.000 personajes sintéticos para cada uno de 14 modelos, cada uno ejecutado tanto como personaje humano como en modo asistente de referencia— que registra la exactitud en 18 problemas de matemáticas de secundaria junto con la confianza autoinformada y las puntuaciones de autoeficacia y ansiedad matemática que reportarían los aprendientes a los que representa. Su señal de auditoría es la brecha de calibración: la familia Qwen y Ministral 3B afirmaban una confianza superior a 0,90 mientras su exactitud se estancaba cerca de 0,55, mientras que Grok 4.1 Fast, DeepSeek Chat y varias variantes de Mistral Small mostraban poca confianza y Ministral 14B y Anita 24B se mantenían razonablemente alineados. Las mismas ejecuciones exponen un fallo de fidelidad más silencioso: los personajes en modo humano produjeron distribuciones de puntuación amplias y plausibles, pero los asistentes de referencia devolvieron respuestas casi idénticas, seguras y de baja ansiedad, un autorretrato por defecto y no el de un aprendiente simulado. Esto amplía la auditoría de recomendadores anterior al sondear qué afirma un modelo sobre su propia competencia y su afecto, y agudiza la advertencia de validez de esta página desde una dirección inesperada: como los personajes de MEDS se ponderan por construcción y no se muestrean de una población real, sus autores presentan el conjunto de datos como un recurso observacional para auditar la conducta de la IA generativa condicionada por prompts y explícitamente no como un sustituto de datos reales del estudiantado.
Simular dinámicas colaborativas y sociales
La simulación también va más allá de los aprendientes individuales para reproducir las dinámicas sociales del aprendizaje colaborativo. Los agentes LLM específicos de cada participante: Fang (2026) ajustó agentes LLaMA 3.2-3B con los datos de diálogo de participantes individuales para representar a cada participante en simulaciones de resolución colaborativa de problemas, combinando memoria de ventana deslizante con embeddings de memoria resumida para preservar tanto los turnos de palabra locales como la continuidad temática, y seleccionando de forma probabilística los turnos de habla y los códigos temáticos a partir de distribuciones empíricas. Con el análisis de redes epistémicas (ENA), los diálogos simulados resultaron estadísticamente indistinguibles de los reales (distancia ENA 0,17, muy dentro del umbral nulo del percentil 95; p de permutación = 0,65), lo que valida que los agentes LLM pueden reproducir tanto las dinámicas de turnos de palabra como las trayectorias de códigos temáticos de la resolución colaborativa de problemas real.
El trabajo de 2026 sobre habilidades duraderas invierte la dirección habitual de la simulación. En lugar de simular al estudiante para auditar un sistema, el sistema simula a los compañeros de equipo para evaluar al estudiante: un LLM ejecutivo genera todos los turnos de cada compañero de IA en una tarea grupal de 30 minutos, mantiene la rúbrica de puntuación y orienta la conversación para fabricar ocasiones en las que aparezca la habilidad objetivo (Globerson et al., 2026). En 373 conversaciones de 188 participantes, la orientación ajustada a la habilidad elevó la evidencia puntuable al 92,4% para la gestión de proyectos y al 85% para la resolución de conflictos, significativamente por encima de los agentes independientes sin restricciones, mientras que el evaluador de IA se calibró contra dos evaluadores humanos cuyo propio kappa interevaluador era de solo 0,45–0,64, un recordatorio útil de que el techo de un simulador lo fija el acuerdo al que pueden llegar las personas sobre el constructo.
Conceptos conectados
- Quienes aprenden — Aprendientes: el paraguas de los conceptos del lado de quien aprende
- Simulación
- Modelado del estudiantado e instrucción adaptativa
- Seguimiento del conocimiento
- Diagnóstico cognitivo
- IA agéntica
- Agente pedagógico
- Tutoría inteligente
- Aprendizaje adaptativo
- Aprendizaje personalizado
- IA generativa
- Grandes modelos de lenguaje (LLM)
- Analítica del aprendizaje
- La docencia
Artículos conectados
- Can LLMs Effectively Simulate Human Learners? Teachers' Insights from Tutoring LLM Students — ¿Pueden los LLM simular a aprendientes humanos? La perspectiva del profesorado
- Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators — ¿Simular estudiantes o resolver problemas con adulación?
- Who Am I? History-Aware Profiles for Student Simulation in Tutoring Dialogues — Perfiles con conciencia del historial para la simulación de estudiantes
- LLM-Based Educational Simulation: Evaluating Temporal Student Persona Stability Across ADHD Profiles — Simulación educativa basada en LLM y estabilidad de los personajes de estudiantado
- Simulating Students' Java Programming Errors with Large Language Models — Simular los errores de programación en Java del estudiantado
- The Empirically Grounded Adaptive Virtual Patient for Psychotherapy Training: Disclosure That Responds to Therapist — Pacientes virtuales adaptativos para la formación en psicoterapia
- MedEasy: Designing AI Standardized Patients for Clinical Consultation Training — MedEasy: pacientes estandarizados con IA
- Embracing Imperfection: Simulating Students with Diverse Cognitive Levels Using LLM-based Agents — Abrazar la imperfección: simular niveles cognitivos diversos
- Simulating Students with Large Language Models: A Review of Architecture, Mechanisms, and Role Modelling in Education with Generative AI — Simular estudiantes con LLM: una revisión
- Towards Valid Student Simulation with Large Language Models — Hacia una simulación válida de estudiantes
- AgentSchool: An LLM-Powered Multi-Agent Simulation for Education — AgentSchool: simulación multiagente para la educación
- INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
- TeachLM: Post-Training LLMs for Education Using Authentic Learning Data — TeachLM: modelo de estudiante auténtico ajustado para diálogos sintéticos
- EducaSim: Interactive Simulacra for CS1 Instructional Practice — EducaSim: agentes generativos que simulan una sección de CS1 para la práctica docente
- Responsible Integration of AI into Pedagogies of Practice in Mathematics Teacher Education — Integración responsable de la IA en las pedagogías de la práctica en la formación del profesorado de matemáticas
- CogEvolution: A Human-like Generative Educational Agent to Simulate Student's Cognitive Evolution — CogEvolution: agente generativo que simula la evolución cognitiva del estudiantado
- Can AI deliver appropriate support for diverse student profiles? A large-scale evaluation — ¿Puede la IA ofrecer un apoyo adecuado a perfiles diversos de estudiantado? Una evaluación a gran escala
- Modelling Individual Participants as LLM Agents in Collaborative Problem Solving Simulations — Agentes LLM ajustados y específicos de cada participante que reproducen diálogos de resolución colaborativa de problemas (Fang 2026)
- StudentSim: Training LLM-based Student Simulators — StudentSim: entrenar simuladores de estudiantado basados en LLM
- AI Web Agents Can Effectively Guide Lesson Design and Predict Student Outcomes — Agentes web de IA: un único agente descriptor supera a simular una distribución de estudiantes para predecir el abandono y criticar el diseño
- Simulating Learners' Task-Selection Strategies and System Constraints in Mastery Learning — Simular las estrategias de selección de tareas de quien aprende y las restricciones del sistema en el aprendizaje hasta el dominio (Noh, Chowdhary, Ooge, Aleven y Borchers 2026)
- Towards Scalable Measurement of Durable Skills — Hacia una medición escalable de las habilidades duraderas
- Toward Agent-based Educational Science: Rethinking Educational Research in the Age of AI — Hacia una ciencia educativa basada en agentes: el aparato de simulación como instrumento de investigación (Zhang, Jiang y Tang 2026)
- Math Education Digital Shadows for facilitating learning with LLMs: Math performance, anxiety and confidence in simulated students and AIs — MEDS: una auditoría de 28.000 registros del rendimiento matemático, la confianza y la ansiedad en estudiantes simulados y asistentes de IA
- SWIM: Student Writing Simulation via Proficiency-Conditioned Generation — prompting frente a ajuste fino supervisado frente a entrenamiento con recompensa para un simulador de escritura del estudiantado
- Misconception Acquisition Dynamics in Large Language Models — qué tiene que haber en los datos de entrenamiento para que un simulador sostenga una idea errónea
- Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation for Multiple-Choice Questions — análisis a nivel de rastro de cómo los modelos simulan el razonamiento incorrecto del estudiantado
- CoLearn: An Agentic Tutor that Learns its Learner in a Human-AI Co-Learning Loop — CoLearn: un tutor agéntico que aprende de su aprendiente en un bucle de coaprendizaje humano-IA
- Instructional Governance by Design: A Framework for AI in Computing Education — Gobernanza instruccional por diseño: un marco para la IA en la enseñanza de la informática
- Exploring the Capacity of Large Language Models to Simulate Students' Scientific Thinking: Insights for Responsive Teaching — seis modelos frente a 8.820 ideas científicas integradas en lecciones: dónde el razonamiento simulado se pasa del ámbito, el vocabulario y la certeza de los aprendientes jóvenes
- Preservice mathematics teachers’ noticing in AI-based simulations: transitions among attending, interpreting, and shaping — tres semanas de atención, interpretación y modelado de docentes en formación en una simulación de chatbot sobre el signo igual, y cómo el diseño orienta lo que notan