Conceptos
Evaluación automatizada de ensayos
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
La evaluación automatizada de ensayos (AES) — el uso de la IA para evaluar y puntuar ensayos escritos, abarcando enfoques estadísticos tradicionales, modelos de lenguaje ajustados y estrategias de prompts basadas en LLM cada vez más accesibles. La investigación sobre AES en esta base de conocimiento cubre la precisión de la puntuación, la equidad y los sesgos, la validez psicométrica y la accesibilidad práctica para el profesorado.
Preguntas para reflexionar
- La evaluación automatizada de ensayos ha pasado de los modelos estadísticos tradicionales a los prompts basados en LLM. Una tensión clave en esta página se da entre precisión y accesibilidad: los modelos ajustados puntúan bien pero son poco prácticos para la mayoría del profesorado. ¿Cuál priorizaría usted en su propio contexto, y por qué?
- Un hallazgo importante es que incluir simplemente ensayos ejemplares en el prompt acerca el acuerdo entre LLM y personas al nivel de fiabilidad entre personas, y que un modelo más barato puede igualar a uno más caro. ¿Qué sugiere eso sobre cuánto de la calidad de la AES depende del modelo y cuánto de cómo se le dan los prompts?
- La página advierte de que la puntuación con IA puede subestimar sistemáticamente al estudiantado de orígenes lingüísticamente diversos. Antes de leer, si viera que una IA da una puntuación más baja al ensayo de una persona no nativa, ¿habría supuesto que era un «problema de sesgo» o simplemente «la nota»? ¿Qué cambiaría su forma de responder?
- Un enfoque autorreferencial evalúa a quienes escriben en L2 comparando su escritura con su propio trabajo previo y no con las normas de hablantes nativos. ¿Cómo cambia el significado de una puntuación la elección de la línea base de comparación, y a qué estudiantes podría tratar con más justicia?
- La AES se cruza con la evaluación formativa cuando se usa para dar retroalimentación en lugar de calificar. ¿Cuándo sería genuinamente útil para quien está desarrollando su escritura la retroalimentación de una máquina sobre un ensayo, y cuándo podría aplanar el tipo de retroalimentación cualitativa que daría una persona editora?
Introducción
La evaluación automatizada de ensayos tiene una larga historia en la tecnología educativa, desde los primeros modelos estadísticos hasta los enfoques modernos basados en LLM que pueden evaluar ensayos de forma holística sin grandes conjuntos de datos previamente puntuados. La tensión clave en la investigación sobre AES es la que existe entre precisión y accesibilidad: aunque los modelos ajustados logran resultados sólidos, consumen muchos recursos y son poco prácticos para la mayoría del profesorado.
- Zhang et al. RACES usa la alineación por recompensa para hacer que la puntuación de ensayos con LLM sea a la vez precisa y consistente, atendiendo a una preocupación central de validez de la AES.
Temas clave de investigación
La AES basada en prompts se ha consolidado como el enfoque más accesible. El estudio de prompts con anclas de Choi et al. muestra que incluir ensayos ejemplares en los prompts acerca el acuerdo entre LLM y personas al nivel de fiabilidad entre personas, con GPT-4o mini logrando resultados comparables a GPT-4o a menor coste. Esto conecta con la investigación más amplia sobre ingeniería de prompts y hace que la AES sea viable para su uso por parte de quien enseña.
La puntuación psicométrica y por rasgos va más allá de las puntuaciones holísticas. PsyScore ofrece un marco psicométricamente informado para la puntuación adaptativa por rasgos con retroalimentación fundamentada en la ZDP. ICLE++ modela rasgos de grano fino para la puntuación holística de ensayos, avanzando en la precisión de la evaluación automatizada.
- La puntuación de rasgos a nivel de dimensión está acotada por los datos que hay detrás de cada dimensión. Firdausi et al. (2026) entrenaron un clasificador por cada dimensión del marco de pensamiento crítico FRISCO de Ennis sobre 106 ensayos de física de undécimo grado indonesios (83 para entrenamiento y 23 para prueba, con tres docentes evaluadores que coincidían entre kappa 0,78–0,84 en todas las dimensiones). El acuerdo se concentró en la expresión y no en el razonamiento: la kappa cuadrática ponderada alcanzó 0,763 en Claridad y 0,728 en Situación, pero solo 0,374 en Foco, 0,332 en Razón y 0,227 en Inferencia. La señal ordinal fue fabricada y no observada —ensayos sintéticos de nivel 1 (generación por plantilla, degradación al 20–40% de la longitud original, eliminación de palabras clave) más paráfrasis por LLM elevaron el Foco en +0,346 kappa partiendo de una línea base de 0,028—, y una configuración alcanzó 0,652 de precisión con kappa cercana a cero o negativa, de modo que la precisión no es un criterio de selección utilizable en la AES ordinal.
Sesgo y equidad son una preocupación crítica. Feser y Tschisgale encontraron que la puntuación con IA subestima sistemáticamente al estudiantado de orígenes lingüísticamente diversos, lo que subraya la necesidad de considerar la mitigación de sesgos y la equidad en el despliegue de la AES.
La evaluación en L2 y autorreferencial explora contextos de escritura no nativa. la evaluación de L2 basada en perfiles usa un enfoque autorreferencial que compara la escritura del estudiantado con su propio trabajo previo y no con las normas de hablantes nativos.
La interpretabilidad y el peso de las características abren la caja negra de cómo puntúan realmente los LLM. Wang et al. (2026) compararon tres LLM (Qwen, GPT, Gemini) con evaluadores humanos sobre ensayos en inglés no nativo a través de dieciséis características textuales, y encontraron una alineación general sólida pero una ponderación distinta: los LLM daban más peso a la corrección gramatical, la sofisticación léxica y la complejidad sintáctica, mientras que los evaluadores humanos priorizaban la completitud del contenido y la presentación visual. De forma crítica, los LLM cambiaban su ponderación según el nivel de competencia —dando más peso a los errores lingüísticos del estudiantado de bajo nivel y recompensando cada vez más la sofisticación lingüística del estudiantado de nivel alto—, mientras que los evaluadores humanos mantenían un marco más estable. Liu, Ye y Yan (2026) amplían esto con un marco de evaluación de cinco modelos (GPT-4.1, Llama 4 Maverick, Gemini 2.5 Flash, Claude Sonnet 4, DeepSeek R1) sobre 60 ensayos largos, usando descubrimiento causal para revelar heurísticas evaluativas distintas: la mayoría de los modelos priorizaba la precisión léxica y la fluidez, mientras que otros enfatizaban la complejidad sintáctica o la integración entre dominios, y algunos mostraban inconsistencia, compresión de las puntuaciones o subestimación sistemática. En conjunto, estos estudios establecen que la validez de la AES depende no solo del acuerdo global, sino de cómo ponderan los modelos las características y de si esa ponderación es estable entre subgrupos de estudiantes, lo que informa directamente las auditorías de validez de la evaluación y de mitigación de sesgos.
Fronteras por tipo de ítem y los límites de la calificación de ensayos. En un examen universitario de formato mixto, Falahat, Das, Bhaumik y Thambi (2026) encontraron que la concordancia de ChatGPT-5 con el profesorado era de sustancial a casi perfecta en los ítems objetivos (CCC 0,935–1,000) pero caía bruscamente en las respuestas abiertas —cercana a cero o negativa en las de respuesta corta y de solo 0,341–0,854 en las preguntas de ensayo—, y que una rúbrica estructurada no mejoraba de forma consistente el acuerdo en los ensayos. Esto acota la validez de la AES: la fluidez del modelo ayuda en ítems bien especificados, pero no se traslada a la puntuación holística de ensayos, donde la interpretación contextual de respuestas con crédito parcial sigue favoreciendo el juicio humano.
Fronteras por tipo de problema en el acuerdo diagnóstico. Yao y Fan (2026) usaron DeepSeek-R1 para etiquetar problemas de escritura concretos antes de la revisión y compararon sus etiquetas con el diagnóstico docente a lo largo de tres ciclos (F1 medio = 0,768, DE = 0,037). El acuerdo fue mayor en los problemas con indicios locales, como la elección de vocabulario (F1 = 0,824), y menor allí donde el problema depende de una relación entre afirmación y evidencia (uso de fuentes y evidencia, 0,579), de modo que el acuerdo en un papel diagnóstico depende del tipo de problema, no solo del modelo o del prompt. Una distribución de rúbrica sesgada puede hacer que las métricas agregadas de puntuación engañen. La evaluación automatizada de una dimensión de rúbrica puede ser una tarea de clasificación con una distribución de etiquetas muy desequilibrada en lugar de una puntuación continua: al etiquetar el nivel de reflexión 0-3 en 1.954 ensayos de estudiantes húngaros, el 68% de los ensayos se situaba en el nivel 3 y el 1,8% en el nivel 0, y la mejor configuración superficial (SMOTEBoost con embeddings de Qwen3) alcanzó una puntuación global de 0,7176 promediada entre precisión, F1 y ROC-AUC, frente a 0,6872 del mejor transformador ajustado; sin embargo, una configuración de RidgeClassifier obtuvo 0,7131 de ROC-AUC con solo 0,5162 de precisión, y el equilibrado de clases redujo todas las métricas (la precisión cayó de 0,6672 sin él a 0,6408 con él), así que los autores leen la elección de modelo como una cuestión de qué métrica importa, y los transformadores se ganan su lugar por la sensibilidad a las clases minoritarias y no por el acuerdo agregado (Csibi et al., 2026).
Evidencia de un despliegue de alta exigencia. La evidencia de campo de un despliegue real de alta exigencia (el Acredita EB de Uruguay, 2024–2025; Curi et al.) muestra que GPT-5 dirigido con prompts alcanza un 60–80% de acuerdo con evaluadores humanos formados en una rúbrica analítica española de 15 ítems, unos cinco puntos porcentuales por debajo del acuerdo interevaluador humano en la mayoría de los ítems y nunca más de 15 puntos por debajo, con una consistencia entre ejecuciones superior al 90% en casi todos los ítems. El vocabulario, la sintaxis y la ortografía fueron las dimensiones más débiles, y el ítem de ortografía tuvo que entregarse a un corrector gramatical determinista (LanguageTool, 68% de precisión, 100% de consistencia) porque la ortografía a nivel de token es donde el modelo es menos estable. Los prompts construidos para una edición del examen se trasladaron a la siguiente con solo ediciones específicas del tema, y la IA fue sistemáticamente más estricta que las personas, infracalificando en lugar de sobrecalificar. Para el diseño de la AES, la lección es que la puntuación basada en prompts puede acercarse al acuerdo humano incluso en un examen nacional, mientras que su debilidad restante se sitúa en el nivel de las convenciones lingüísticas básicas y no en la calidad holística de la escritura.
El punto de referencia humano, y lo que puede y no puede autorizar. El estudio OpRaise es la prueba más sólida de esta base de conocimiento sobre si la corrección con LLM está lista para el uso rutinario, y su respuesta depende del punto de referencia y no del modelo. Comparó tres sistemas de frontera (Claude Opus 4.6, GPT-5.4, Gemini 3 Flash), cada uno bajo 27 configuraciones de prompt que cruzaban especificidad de rúbrica, calibración y estrategia de puntuación, con las notas moderadas de 761 ensayos auténticos de Psicología de 125 estudiantes de tres universidades del Reino Unido. Se adoptaron las notas humanas como verdad de referencia porque el juicio académico es el estándar socialmente aceptado, y los autores señalan que los evaluadores humanos solo coinciden moderadamente entre sí, lo que acota cuán fuerte podría exigirse razonablemente que fuera el acuerdo entre IA y personas. Frente a ese punto de referencia, el acuerdo sobre la banda de titulación británica osciló entre el 35 y el 65 por ciento según la institución (63 por ciento en Cambridge, 53 por ciento en Nottingham, 35 por ciento en Manchester Metropolitan) y no se trasladó entre ellas, de modo que la recomendación central del informe es una validación local con los propios materiales de evaluación de cada institución. Dos hallazgos se generalizan más allá de este corpus. Primero, la fiabilidad y el acuerdo se separan: todos los modelos volvieron a puntuar de forma casi idéntica (ICC 1,00; 1,00; 0,97) y los modelos coincidían entre sí más que con las personas (ICC de tres modelos 0,91), y aun así los tres coincidieron en la banda de titulación en solo el 56 por ciento de las entregas: la autocoherencia no es validez. Segundo, las notas de la IA se comprimían hacia la mitad de la escala (una puntuación de compresión de 0,47–0,82, con el cruce en el que la IA y las personas coinciden en promedio situado entre los 50 altos y los 60 bajos), lo que hace que la IA sea menos precisa precisamente en las fronteras de nota que separan los «First» de los «Upper Second» y los aprobados de los suspensos. La amplitud de vocabulario, los conectores, la complejidad de las oraciones y la longitud del texto predecían las notas de la IA con efectos pequeños pero significativos, mientras que su relación con las notas humanas era en general desdeñable, una demostración directa de la preocupación por el sesgo lingüístico que ninguna de las estrategias de prompt probadas eliminó.
La AES como señal de entrenamiento y no como jueza. Los modelos de puntuación se estudian normalmente como evaluadores, pero SWIM usa uno como función de recompensa: Do, Kontak y Sachan (2026) congelan un verificador AES multirrasgo y lo puntúan frente a ensayos de estudiantes generados, convirtiendo el perfil de rasgos predicho en una recompensa densa por ensayo (la distancia media normalizada por rasgo respecto al perfil objetivo) para GRPO, deliberadamente no la propia métrica de kappa cuadrática ponderada, porque la QWK se define sobre un lote de pares objetivo-predicción y no es una señal por muestra, mientras que las recompensas de coincidencia exacta son demasiado dispersas en el entorno multirrasgo. Las ganancias se verificaron de nuevo frente a un evaluador DeBERTa y a un verificador solo de evaluación con el que la política nunca se entrenó (0,598 frente a 0,479 para SFT, y 0,647 frente a 0,501), que es la comprobación que separa un control genuino de la competencia de una adaptación al modelo de recompensa. Para la investigación sobre AES, esto supone una segunda exigencia de validez: un evaluador usado como objetivo de entrenamiento se está optimizando en su contra, de modo que su propia ponderación de rasgos y sus sesgos lingüísticos se propagan a todo lo que aprende el generador —las mismas asimetrías de ponderación de características (corrección gramatical, sofisticación léxica y complejidad sintáctica ponderadas con más fuerza por los modelos que por los evaluadores humanos) documentadas en otro lugar de esta página, ahora moldeando el entrenamiento y no solo las notas—. La puntuación y la retroalimentación quieren métodos distintos, así que un sistema debería separarlas. Labib et al. (2026) construyeron un sistema de ensayos argumentativos TOEFL como tres módulos —puntuación, retroalimentación superficial sobre gramática y mecánica, y retroalimentación profunda sobre organización, coherencia y argumentación— en lugar de un único modelo que hiciera los tres trabajos, y encontraron que lo que gana en un módulo pierde en otro: el ajuste supervisado de GPT-4o sobre 120 ensayos de un conjunto propietario de 480 puntuados con punto de referencia, probados sobre los 360 restantes, alcanzó una kappa cuadrática ponderada de 0,84 y un RMSE de 0,44 en la escala de 0-5, por delante de la línea base de Wang y Gayed (2024) (QWK 0,78; RMSE 0,57), y sin embargo ese mismo ajuste produjo resultados inutilizables en los módulos de retroalimentación, donde fue el prompt directo a Claude 3.7 lo que generó comentarios aprobados por el profesorado.
Conexiones con conceptos relacionados
La AES se sitúa en la intersección de la evaluación automatizada, la escritura y la IA generativa. Conecta con la evaluación formativa cuando se usa para dar retroalimentación en lugar de calificar, con el bucle de retroalimentación cuando se integra en procesos de escritura iterativos, y con la alfabetización en IA cuando el profesorado entiende y calibra las herramientas de AES. Los conceptos de validez de la evaluación y de medición educativa son esenciales para garantizar que las puntuaciones de la AES sean significativas y justas.
- Acuerdo, error y lo que aporta un evaluador híbrido. En un pequeño corpus abierto de escritura de marketing, el LLM superó tanto a reglas deterministas como a un híbrido de igual ponderación en acuerdo absoluto con evaluadores humanos (ICC(2,1) 0,435 frente a 0,266 y 0,091), con el híbrido significativamente peor que el LLM solo, mientras que la dispersión de las puntuaciones y una única respuesta casi vacía mostraron hasta qué punto esas estimaciones dependen de la composición del corpus (Agreement and error in automated scoring of student marketing posts).
Conceptos conectados
- Mitigación de sesgos
- Equidad
- Evaluación automatizada
- Aprendizaje de lenguas
- Medición educativa
- K-12
- Ingeniería de prompts
- Escritura
- Alfabetización en IA
- Validez de la evaluación
Artículos conectados
- Automatic Reflection Level Classification in Hungarian Student Essays — Clasificación automática del nivel de reflexión en ensayos de estudiantes húngaros
- WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays — WrAFT: un sistema modularizado de evaluación automatizada de la escritura para ensayos argumentativos
- Educational Innovation through Automated Essay Scoring: A Multidimensional Framework for Evaluating Critical Thinking in High School Physics Essays — Innovación educativa mediante la evaluación automatizada de ensayos: un marco multidimensional para evaluar el pensamiento crítico en ensayos de física de secundaria
- AI in University Assessment: Evaluating the Opportunities and Risks of Automated Marking — Informe OpRaise: corrección con IA de 761 ensayos universitarios en tres universidades del Reino Unido
- A Human-in-the-Loop Framework for AI-Assisted Scoring in Large-Scale Writing Assessment — Un marco con intervención humana en el circuito para la puntuación asistida por IA en la evaluación de la escritura a gran escala
- RACES: reward-aligned consistent essay scoring with large language models — RACES: puntuación de ensayos consistente y alineada con recompensas mediante LLM
- AI-based scoring systematically underestimates conceptual understanding of linguistically weak students' explanations in physics
- Anchor Is the Key: Toward Accessible Automated Essay Scoring with Large Language Models Through Prompting
- ICLE++: Modeling Fine-Grained Traits for Holistic Essay Scoring
- LLMs Do Not Grade Essays Like Humans — Los LLM no califican los ensayos como las personas (Mathew et al. 2026)
- PsyScore: A Psychometrically-Aware Framework for Trait-Adaptive Essay Scoring and ZPD-Scaffolded Feedback
- Towards Self-Referential Analytic Assessment: A Profile-Based Approach to L2 Writing Evaluation with LLMs
- AiAWE: An Open-Source LLM Automated Writing Evaluation System Using LoRA-Adapted Instruction-Tuned Models
- From automated scoring to learning diagnosis: a mechanism study of AI-supported formative assessment in English writing — De la puntuación automatizada al diagnóstico del aprendizaje: un estudio de mecanismos de la evaluación formativa asistida por IA en la escritura en inglés
- Opening the Blackbox of LLM-Based Automated Essay Scoring: Insights into Feature Weighting Patterns and Score Validity — Patrones de ponderación de características en la puntuación de ensayos basada en LLM (Wang et al. 2026)
- A Framework for Evaluation of Large Language Models in Essay Assessment: Reliability, Alignment, and Causal Reasoning — Marco para evaluar los LLM en la evaluación de ensayos (Liu, Ye y Yan 2026)
- Bridging technology and education: The use of ChatGPT in grading pharmacy student exams
- Know When to Trust: Making AI Scoring More Reliable for Educational Assessment — Saber cuándo confiar: la autoconfianza, la puntuación probabilística ponderada y el ensamblado mejoran el acuerdo en la puntuación con LLM
- SWIM: Student Writing Simulation via Proficiency-Conditioned Generation — un verificador AES congelado usado como recompensa de entrenamiento densa para un generador de escritura
- Can large language models reproduce higher education grade bands? Cross-model study of calibration and grading bias in authentic student writing — ¿Pueden los grandes modelos de lenguaje reproducir las bandas de titulación de la educación superior? Estudio entre modelos de la calibración y el sesgo de calificación en escritura auténtica de estudiantes