En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

La generación automática de preguntas (AQG) — el uso de IA, en especial la PLN y los grandes modelos de lenguaje (LLM), para generar ítems de evaluación educativa (preguntas de opción múltiple, de respuesta corta, de rellenar huecos, de programación y de desempeño) de forma automática a partir de material fuente u objetivos de aprendizaje. La AQG permite evaluar a escala —producir cuestionarios formativos, ejercicios adaptativos e ítems de práctica—, pero la calidad varía enormemente según el tipo de ítem y exige validación para evitar preguntas alucinadas o mal calibradas. Es un componente central de la evaluación automatizada y un habilitador clave del aprendizaje adaptativo y el aprendizaje personalizado.

Preguntas para reflexionar

  • La generación automática de preguntas produce ítems de evaluación a partir de material fuente y a escala, pero esta página advierte de que la calidad varía enormemente según el tipo de ítem. Antes de leer, ¿qué tipo de ítem diría usted que la IA genera de forma más fiable: opción múltiple, respuesta corta o código, y por qué?
  • El reto central es el control de calidad: los LLM pueden generar preguntas factualmente incorrectas. Una cadena de procesamiento redujo la alucinación en 62% añadiendo un bucle de generar, validar y refinar. ¿Por qué cree que pedirle a la IA que valide sus propias preguntas las mejoraría de forma significativa, en lugar de limitarse a aprobar su propia salida?
  • La investigación muestra que las preguntas generadas pueden inclinarse hacia el pensamiento de orden inferior (recuerdo) salvo que se diseñen explícitamente para resultados de orden superior. Si usted usara IA para crear ítems de práctica, ¿cómo sabría si estaban entrenando una comprensión genuina o solo la memorización?
  • La calibración de la dificultad importa: las estimaciones de dificultad de la IA correlacionan fuertemente con el desempeño del estudiantado, pero la página advierte contra su mal uso en contextos de alta exigencia. ¿Cuándo una pregunta que la IA juzga «de dificultad adecuada» seguiría siendo la pregunta equivocada para un estudiante concreto?
  • La generación con conciencia de accesibilidad construye preguntas ajustadas para quienes aprenden y son personas sordas o con hipoacusia, refinadas en colaboración con la comunidad destinataria. ¿Qué sugiere este ejemplo sobre por qué la generación de preguntas no puede tratarse como un problema puramente técnico ni solo de contenido?

Introducción

La generación automática de preguntas importa porque crear ítems de evaluación a mano es caro, y la IA puede producirlos con rapidez y a escala. Sin embargo, la investigación de la base de conocimiento muestra que los ítems generados deben validarse en cuanto a corrección, pertinencia y dificultad, y que los distintos tipos de ítem (opción múltiple, respuesta corta, código) varían en la fiabilidad con que pueden generarse. La AQG se sitúa, por tanto, en la intersección de la IA generativa, la PLN educativa y la medición educativa.

Enfoques para la generación de preguntas

La investigación de la base de conocimiento ilustra varios enfoques:

  • Cadenas de generar y validar: Generate-Then-Validate presenta un bucle de generación → validación → refinamiento que reduce la alucinación del LLM en 62% frente a la generación directa, alcanza 89% de precisión en conjuntos de datos de STEM y una mejora de 23% en pertinencia. El paso de validación filtra los ítems inválidos o de baja calidad, y los ítems fallidos activan una regeneración con consignas correctivas.
  • Generación basada en el seguimiento del conocimiento: KT4EQG genera preguntas de ejercicio personalizadas guiadas por el seguimiento del conocimiento, ajustando los ítems al estado de conocimiento de cada estudiante en lugar de generar preguntas genéricas.
  • Distractores ligados a concepciones erróneas como etiquetas diagnósticas: CoLearn (He et al., 2026) asocia cada distractor a una única concepción errónea extraída y marca exactamente una opción correcta, de modo que el ítem se genera con sus objetivos diagnósticos incorporados y después puede calificarse de forma determinista sin ninguna llamada al Grandes modelos de lenguaje (LLM): unos 7,6 segundos y aproximadamente $0,005 por ronda en el despliegue real de los autores, frente a unos 32 segundos y $0,015 por una ronda de respuesta corta calificada con un LLM. El vínculo es tan bueno como las etiquetas de concepciones erróneas que hay detrás, ya que las concepciones erróneas extraídas coincidían con las concepciones erróneas objetivo con F1 ≈ 0,56, y sus opciones de ítem atendían a una habilidad realmente débil 0,72 de las veces.
  • Generación con conciencia de la profundidad cognitiva: Evaluating the cognitive depth of LLM-generated questions examina si los ítems generados apelan al pensamiento de orden superior (creación, evaluación) o solo a la memorización, en conexión con la taxonomía de Bloom y la medición educativa.
  • Problemas de caso con errores incorporados para la evaluación repetida: Takahashi et al. (2026) generaron nuevos problemas de razonamiento diagnóstico jerárquico (HDR) —casos breves que llevan errores deliberadamente incorporados y que el estudiantado debe encontrar y explicar— y encontraron que los ítems redactados por GPT-4o igualaban a los redactados por personas en consistencia interna (α de Cronbach = 0,78 en ambos) y en dificultad, sin que las pruebas exactas de Fisher encontraran diferencias significativas en la distribución de puntuaciones entre 100 participantes. El formato combina una exigencia de pensamiento de orden superior con una respuesta acotada, de modo que las respuestas convergen y la calificación se vuelve reproducible. La motivación generativa es la reutilización de ítems: reutilizar un caso invita a reutilizar el recuerdo y las respuestas, mientras que casos generados estructuralmente equivalentes pero contextualmente distintos suprimen el sesgo de ítem en la remedición.
  • Cadenas pedagógicas: Slide-deck Q&A generation usa una cadena de varias etapas para generar preguntas pedagógicamente sólidas a partir de materiales de curso.
  • Generación con conciencia de la accesibilidad: Chen et al. diseñan un sistema de generación de preguntas impulsado por LLM para quienes aprenden y son personas sordas o con hipoacusia, introduciendo estrategias de preguntas visuales y emocionales que apuntan a los momentos de dificultad visual o emocional de un vídeo, y refinando iterativamente las preguntas con la comunidad destinataria para garantizar la accesibilidad lingüística.
  • Sistemas basados en RAG y con intervención humana: CODE-GEN combina la generación aumentada por recuperación con la revisión con intervención humana para generar evaluaciones de opción múltiple.
  • Puntos de referencia y evaluación: NSMQ Riddles proporciona un punto de referencia de acertijos científicos y matemáticos para evaluar sistemas de generación de preguntas y de razonamiento.

Validación y calidad

El reto central de la AQG es el control de calidad:

  • Evalúe el proceso de resolución, no el enunciado: ProIQA sostiene que la revisión de la calidad de un ítem debe seguir lo que hace una persona experta —simular la solución— y construye un árbol de razonamiento generado por LLM para cada ítem, verificado en cuanto a corrección matemática en 90,38–97,80%, y después codifica su estructura de dependencias con una red neuronal de grafos junto a una vista solo del enunciado. Informa de ganancias medias sobre el segundo mejor método de 7,5% en evaluación de conceptos, 6,3% en estimación de dificultad y 19,5% en evaluación de competencias, y su análisis de errores nombra un modo de fallo que conviene vigilar: un árbol de razonamiento lógicamente correcto pero estructuralmente superficial deja un ítem difícil con apariencia de fácil.

  • Riesgo de alucinación: los LLM pueden generar preguntas factualmente incorrectas. Generate-Then-Validate muestra que una fase de validación dedicada reduce esto de forma marcada, y el riesgo de alucinación es una preocupación reconocida en todo el ámbito.

  • Calibración de la dificultad: las preguntas generadas deben calibrarse a una dificultad adecuada. La investigación sobre calibración de la dificultad muestra que las estimaciones de dificultad de la IA correlacionan fuertemente con el desempeño del estudiantado (p. ej., rho ≈ −0,87), lo que permite seleccionar mejores ítems, a la vez que advierte contra el mal uso en contextos de alta exigencia. Razavi y Powers (2026) extienden esto a ítems de matemáticas y lectura de K-5 (N = 5170) calibrados con el modelo de teoría de respuesta al ítem de Rasch: las valoraciones de dificultad de GPT-4o sin ejemplos previos correlacionaron de moderada a fuertemente con las dificultades reales (r = 0,83 en matemáticas, r = 0,81 en lectura) pero variaron según el curso, mientras que un enfoque basado en características —características cognitivas y lingüísticas extraídas por LLM e introducidas en modelos de árboles— alcanzó correlaciones de hasta r = 0,87. La extracción estructurada de características del estudio (p. ej., complejidad sintáctica, carga cognitiva, dificultad de los distractores) y su flujo de trabajo práctico de siete pasos ofrecen una plantilla para calibrar ítems generados, mientras que su hallazgo de restricción del rango en los primeros cursos y sus advertencias de generalizabilidad aconsejan cautela ante usos de alta exigencia.

  • Validación psicométrica de campo a gran escala: Assessing AI-Generated Exams valida una cadena de AQG de refinamiento iterativo (generar→juzgar→revisar, al estilo Self-Refine) en 91 clases universitarias reales (~1.686 estudiantes). El análisis bayesiano jerárquico IRT de 2PL muestra que las preguntas generadas por IA rinden a la par que los ítems de exámenes estandarizados escritos por expertos: algo más fáciles (β̄ = −0,45 frente a 0,35) pero ligeramente más discriminativas (ᾱ = 1,3 frente a 1,2), con una información máxima del test más alta (fiabilidad 0,79 frente a 0,72), lo que demuestra que la AQG puede producir evaluaciones adaptadas al curso y psicométricamente sólidas a escala.

  • Dependencia de la tarea: la fiabilidad de la generación varía según el tipo de ítem. La calificación de respuesta corta y la evaluación analítica de la escritura muestran que los ítems de respuesta abierta y de escritura son más difíciles de generar y calificar de forma fiable que los ítems estructurados.

  • Calidad cognitiva: la evaluación de la profundidad cognitiva muestra que los ítems generados pueden inclinarse hacia el pensamiento de orden inferior salvo que se diseñen explícitamente para resultados de orden superior.

Papel en el aprendizaje adaptativo y personalizado

La AQG es un habilitador clave del aprendizaje adaptativo y personalizado: produce los grandes bancos de ítems de los que se nutren los tutores adaptativos y, combinada con el seguimiento del conocimiento o el modelado del estudiantado, puede generar ítems ajustados al estado de conocimiento de cada estudiante (KT4EQG). La personalización basada en intereses muestra que la AQG también puede adaptar las preguntas a los intereses del estudiantado, y no solo a la dificultad.

Implicaciones para la IA en la educación

  • Genere y después valide: empareje siempre la generación con una etapa de validación y refinamiento para controlar la alucinación y asegurar la pertinencia.
  • Empareje el tipo de ítem con la fiabilidad: use la AQG para los tipos de ítem estructurados (opción múltiple, rellenar huecos, código), donde es más fiable, y aplique una validación cuidadosa a los ítems de respuesta abierta y de escritura.
  • Diseñe para la profundidad cognitiva: las consignas y las cadenas deben apuntar al pensamiento de orden superior, y no solo al recuerdo, para apoyar un aprendizaje genuino.
  • Calibre la dificultad: use las estimaciones de dificultad de la IA para seleccionar ítems con un reto adecuado, con una validación sólida antes de usos de alta exigencia.
  • Personalice mediante modelos del estudiantado: combine la AQG con el seguimiento del conocimiento y los modelos de interés para generar ítems adaptativos e individualizados.

Conceptos conectados

Artículos conectados

Recursos relacionados

  • TeacherServer
    A large free library of single-purpose teaching generators — lesson plans, worksheets, IEP goals, rubrics, case studies, math problems — for K-12 teachers and college faculty.

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.