En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

La evaluación automatizada — el uso de la IA para evaluar el trabajo del estudiantado, desde los cuestionarios formativos hasta los exámenes de alto impacto. La evaluación automatizada abarca múltiples modalidades —opción múltiple, respuesta corta, ensayo, código y evaluación basada en el desempeño— y va de la calificación automatizada directa a sistemas conscientes de la confianza que informan de una incertidumbre calibrada junto a sus puntuaciones.

Preguntas para reflexionar

  • La evaluación automatizada va de la puntuación de opción múltiple a los ensayos, el código y la evaluación basada en el desempeño. ¿Cuál cree que es la mayor diferencia entre la fiabilidad con que la IA puede calificar un cuestionario de opción múltiple y un ensayo de forma libre, y por qué?
  • Una idea de diseño central aquí es la «conciencia de la confianza»: calificadores de IA que informan de cuán seguros están y señalan los casos de baja confianza para revisión humana en lugar de emitir una única puntuación sin matices. ¿Cómo cambiaría una nota que dijera «estoy seguro al 70% de esto» el modo en que usaría o confiaría en una puntuación automatizada?
  • La investigación muestra que la calificación automatizada puede perjudicar sistemáticamente a los hablantes no nativos: la IA califica el lenguaje y no la comprensión. ¿Por qué podría un calificador automatizado ser especialmente propenso a este tipo de injusticia, incluso cuando alcanza una alta concordancia global con calificadores humanos?
  • Un estudio encontró que el modo de hacer la validación puede inflar el rendimiento reportado: un método ingenuo de validación cruzada reportaba resultados casi perfectos que caían drásticamente bajo una validación más rigurosa e independiente de los ensayos. ¿Qué sugiere esta lección aleccionadora sobre cómo debería leer cualquier afirmación de que un sistema de evaluación con IA «funciona»?
  • La página sostiene que una confianza calibrada habilita flujos de trabajo con humanos en el bucle, apoya la calibración de la confianza y refuerza la validez de la medición. Si un sistema automatizado derivara sus casos más inciertos a un revisor humano, ¿qué querría saber sobre cómo se eligen esos casos antes de confiar en ese reparto?
  • La calificación automatizada se describe como una de las aplicaciones más maduras de la IA en la educación, pero calificar sin retroalimentación útil tiene un valor educativo limitado. ¿Cómo podría un enfoque centrado únicamente en producir puntuaciones —y no en retroalimentación aprovechable— cambiar lo que el estudiantado realmente obtiene de una evaluación calificada por IA?

Introducción

Modalidades de evaluación

Calificación automatizada

La calificación automatizada es una de las aplicaciones de IA en la educación más maduras y más ampliamente desplegadas: sistemas de IA que evalúan el trabajo del estudiantado, desde la puntuación de opción múltiple hasta la evaluación de ensayos y la revisión de código. Sus modalidades de calificación incluyen:

  • El estudiantado separa la utilidad de la retroalimentación de la autoridad evaluadora: AlGhamdi (2026) documenta un caso en el que una puntuación de IA contaba para la nota y el estudiantado lo sabía: 13 estudiantes de informática cuyo trabajo manuscrito escaneado fue evaluado por ChatGPT con una rúbrica que cubría claridad, organización, corrección de las oraciones y concisión. Todos los participantes consideraron útil la retroalimentación, pero todos separaron esa utilidad de la autoridad, y varios rechazaron el carácter unidireccional y no dialógico de la calificación automatizada: «ChatGPT no es como las personas. Les hablas y explicas excusas... Me gusta que un profesor normal [me] corrija el trabajo.» El estudio sitúa la evaluación automatizada como aceptable para la revisión superficial, pero no como evaluadora final, con una confianza condicional mediada por la supervisión del docente.

  • Calificación de respuestas cortas: la evaluación automática de respuestas cortas consciente de la confianza evalúa respuestas de texto libre, y la calibración de la confianza es crítica: los sistemas deben saber cuándo la calificación es fiable. Una revisión de alcance sobre la autocorrección de respuestas cortas en ciencias (2017–principios de 2024) documenta la historia del campo: Morley et al. encontraron que los modelos de la familia BERT (base, RoBERTa, DistilBERT, SciBERT) dominaban —se usaron en 20 de 21 estudios, con un máximo en 2021— antes de que los enfoques basados en GPT se adoptaran mediante ingeniería de prompt en lugar de ajuste fino a partir de 2022 aproximadamente. Los modelos aumentados con datos de dominio (libros de texto, rúbricas, preentrenamiento adicional) superaron de forma consistente a los que no lo estaban, pero pocos podían justificar las puntuaciones en términos comprensibles para las personas y el sesgo entre grupos demográficos y lingüísticos se examinaba rara vez, lo que llevó a los autores a sostener que los autocorrectores deberían apoyar y no sustituir a los examinadores humanos. Una revisión sistemática guiada por PRISMA de 42 estudios empíricos de calificación y retroalimentación (2023–2025) generaliza esta cautela a todo el campo: los LLM igualan a los calificadores humanos en tareas cerradas y preguntas de respuesta corta, pero no pueden sustituir por completo el juicio humano en trabajos complejos, abiertos o subjetivos que exigen un análisis profundo o creatividad, y la mayor eficacia de calificación se alcanza en sistemas híbridos que combinan la calificación con IA con la supervisión y verificación del docente (Can ChatGPT Replace the Teacher in Assessment? A Review of Research on the Use of Large Language Models in Grading and Providing Feedback).

  • Puntuación de ensayos: sistemas como Evaluación automatizada de ensayos o la puntuación automatizada de ensayos basada en anclas usan estrategias de prompting para acercarse a la fiabilidad humana. AIAWE extiende la evaluación automatizada a una evaluación más amplia de la escritura.

  • Revisión de código: la calificación de Linux Bash y la revisión de código en CS1 demuestran la evaluación automatizada en la educación en informática.

  • Una persona del prompt puede hundir a un calificador, y el ajuste fino puede repararlo: Habibullah et al. (2026) calificaron un examen práctico de visión por computador (570 estudiantes con doble calificación) bajo 171 configuraciones y un segundo examen de aprendizaje automático (1.038 estudiantes) bajo 162 más. Un breve preámbulo de «calificador estricto» sacó a 14 de 17 modelos de pesos abiertos de la banda de calificación (MAE ≥ 8) y tres dejaron de calificar por completo; el daño se remontaba a dos oraciones que retenían puntuación y no al tono ni a la escala del modelo, y su dirección dependía del examen, mejorando a siete modelos en el segundo. Un ajuste fino ligero con LoRA sobre unos 3.900 ejemplos calificados agrupados llevó a cinco modelos abiertos pequeños a la paridad o mejor que un calificador humano, de modo que la vulnerabilidad es un artefacto del prompt y no un techo de capacidad.

  • Integración formativa: la automatización en ciencias de bachillerato y CoTAL muestran cómo la calificación automatizada alimenta los ciclos de evaluación formativa.

  • Sesgo y equidad: el sesgo lingüístico en la calificación de física documenta cómo la calificación automatizada puede perjudicar a los hablantes no nativos, en conexión con la mitigación del sesgo y la equidad en la IA educativa.

  • Evaluación comparativa de modelos de IA generativa para calificación abierta: Pecuchova, Benko y Drlik (2025) compararon once modelos de IA generativa y de incrustación de oraciones con dos calificadores humanos expertos sobre 1.885 respuestas abiertas a 24 preguntas de ingeniería de software. Solo GPTo1 alcanzó una concordancia casi perfecta (Kappa de Fleiss 0,82, con pocos falsos positivos y falsos negativos en todas las categorías de nota), con Claude3 y PaLM2 muy cerca; los modelos de IA generativa sensibles al contexto manejaron de forma robusta respuestas breves y formuladas de manera diversa, mientras que los modelos de incrustación basados en referencias (por ejemplo, los 345 falsos positivos de BERT) penalizaron sistemáticamente respuestas correctas pero formuladas de otro modo: evidencia de que la elección del modelo, y no solo el formato de calificación, configura la fiabilidad en la evaluación abierta de texto libre.

  • Los ejemplos del prompt deciden la concordancia de la puntuación: Takahashi et al. (2026) automatizaron el razonamiento diagnóstico jerárquico (HDR), una tarea de competencia aplicada en la que quienes aprenden localizan y explican errores deliberadamente insertados en un caso breve. Usando GPT-4o sin ajuste fino, el equipo generó nuevos problemas y puntuó las descripciones del estudiantado: los problemas generados y los escritos por personas tuvieron la misma consistencia interna (α de Cronbach = 0,78) y no mostraron diferencias significativas en la distribución de puntuaciones entre 100 participantes, y la correlación del formato con un control de comprensión lectora se mantuvo baja (α = 0,36 y 0,41). La precisión de la puntuación dependía del prompt y no del modelo: sin ejemplos resueltos, la precisión de Q2 caía a 0,42, mientras que añadir ejemplos correctos e incorrectos calificados por humanos elevó la concordancia al 98% o más en todas las preguntas (Q1 y Q2 al 100%), frente a un coste humano medido de 138 minutos de calificación experta para 117 respuestas más 30 minutos de consenso.

  • Codificación multiagente de las respuestas abiertas del profesorado, donde el marco y no el modelo sostiene la fiabilidad: Copur-Gencturk et al. (2026) extienden la evaluación automatizada más allá del trabajo del estudiantado a la codificación del conocimiento disciplinar (CK) y el conocimiento didáctico del contenido (PCK) del propio profesorado, preguntando si la IA puede reproducir la codificación humana entrenada de las respuestas escritas de 268 docentes estadounidenses de secundaria de matemáticas sobre razones y relaciones proporcionales. Un LLM multiagente creado a propósito, GradeOpt, asigna tres roles respaldados por GPT-4o —un Calificador que aplica el manual de codificación humano, un Reflector que diagnostica cada desacuerdo con el código humano y un Refinador que reincorpora los puntos de aclaración al manual a lo largo de hasta seis rondas— y coincidió estrechamente con codificadores humanos entrenados en CK (κ = 0,88 y 0,85), a la vez que alcanzaba una concordancia sustancial en los ítems de PCK, mucho más interpretativos, en conjunto (κ = 0,68; κ ponderada = 0,79). Dos líneas base de PLN y un modelo GPT-4o con un único prompt nunca superaron κ = 0,39 ni κ ponderada = 0,55 en PCK, así que los autores atribuyen la fiabilidad al refinamiento de las instrucciones contra el manual de codificación y no a la escala del modelo, y recomiendan la revisión experta allí donde se difuminan los niveles de codificación adyacentes, ya que los errores residuales de GradeOpt eran típicamente códigos adyacentes y no fallos groseros.

  • Calificación de exámenes de formato mixto (2026): Falahat, Das, Bhaumik y Thambi (2026) evaluaron ChatGPT-5 frente a la calificación del profesorado humano de un examen de farmacia de 21 ítems (16 estudiantes) que abarcaba opción múltiple, selección múltiple, rellenar huecos, listados, respuesta corta y ensayo. La concordancia fue de sustancial a casi perfecta en los tipos objetivos (CCC 0,935–1,000, favorecida por las respuestas correctas proporcionadas durante la calificación), pero se derrumbó en los ítems de listado (0,621–0,708), respuesta corta (≈ 0 a negativa) y ensayo (0,341–0,854); proporcionar una rúbrica estructurada no mejoró de forma consistente la concordancia del examen completo (71,1% sin ella frente a 68,2% con ella). El estudio afina un punto metodológico que reaparece en toda la evaluación automatizada —una precisión porcentual moderada coexiste con frecuencia con una baja concordancia—, de modo que la precisión por sí sola exagera la fiabilidad, y recomienda la calificación híbrida para ítems complejos, subjetivos o de alto impacto.

  • Calibración de bandas de nota entre familias de modelos sobre ensayos auténticos ya calificados (2026): Kerwat, Donaldson y Mahomed (2026) ejecutaron ocho configuraciones preespecificadas de cuatro familias de modelos (GPT-OSS 20B, GPT-OSS 120B, Qwen 32B y Llama 3.1 8B, cada una con dos temperaturas) sobre la misma cohorte fija de 114 ensayos de BAWE/Coventry con etiquetas institucionales de Merit y Distinction, con un único prompt compartido que permitía cuatro bandas. La concordancia exacta de banda fue del 18,4% al 54,4%: Llama 3.1 8B a temperatura 0,5 lideró (54,4% exacta, 98,2% dentro de una banda, MAE 0,474, sesgo casi nulo), mientras que GPT-OSS 120B fue el más débil (18,4%) y infravaloraba sistemáticamente, por un promedio de 1,316 bandas a temperatura 0,5, con la precisión en Distinction por detrás de la de Merit en todo momento. La cohorte fija no contenía referencias de Aprobado ni Suspenso, así que se trata de discriminación Merit–Distinction y no de fiabilidad en todo el rango de notas, y la temperatura no fue una cura: ayudó descriptivamente a una familia, dejó otra igual y empeoró significativamente a GPT-OSS 20B (de 39,5% a 29,8% exacta). Dos lecciones se trasladan más allá del estudio: la distancia de nota y el sesgo direccional revelan lo que las estadísticas de concordancia ocultan, y el tamaño del modelo no es un indicador de la validez de la evaluación.

  • Ingeniería de rúbricas para la puntuación abierta en educación médica: Olvet et al. (2026) se preguntaron si GPT-4 podía puntuar de forma fiable preguntas abiertas en exámenes médicos previos al prácticum. Tras tres iteraciones de refinamiento humano de la rúbrica en dos escuelas estadounidenses, la fiabilidad interevaluador con el profesorado alcanzó una concordancia de sustancial a casi perfecta en tres de las cuatro preguntas usando rúbricas analíticas y holísticas (kappa ponderada de hasta 0,94), mientras que el ítem con rúbrica holística se quedó en moderada (κw = 0,54). El análisis de patrones de error mostró que las discrepancias eran atribuibles a ambos evaluadores —GPT-4 puntuaba por encima cuando el estudiantado ofrecía varias respuestas o usaba vocabulario ausente de la rúbrica, mientras que el profesorado era a menudo un calificador «demasiado generoso»—, lo que llevó a los autores a recomendar mantener a los humanos en el bucle (por ejemplo, que el profesorado puntúe un subconjunto para confirmar la precisión). Como alrededor del 82% de las escuelas de medicina estadounidenses califica el trabajo previo al prácticum como apto/no apto, la concordancia exacta de la puntuación de la IA a menudo no es necesaria para el uso operativo.

  • Puntuación con humanos en el bucle para una evaluación nacional de escritura a gran escala (2026): Curi et al. (2026) escalan la puntuación con Grandes modelos de lenguaje (LLM) basada en prompts a un examen real de escritura en español de alto impacto (unas 5.000–6.000 respuestas al año), alcanzando una precisión por ítem del 60–80% y una consistencia de salida superior al 90% en una rúbrica analítica de 15 ítems, con un verificador determinista de PLN que sustituye al LLM en el ítem de ortografía (100% de consistencia). Su aportación distintiva es una validación orientada a la decisión y no a métricas centradas en el modelo: el sesgo sistemático de infravaloración de la IA, convertido mediante TRI y Bookmark en niveles de competencia, produce discrepancias de apto/no apto en el 15,3–16,5% de los casos, todas las cuales el flujo de trabajo con humanos en el bucle deriva a revisión experta, reduciendo al menos un 50% las respuestas que necesitan calificación humana completa y preservando la calidad de la decisión. Esto ancla la calificación híbrida en la evaluación operativa y no en conjuntos de datos de prueba de concepto.

  • La concordancia por dimensión muestra dónde un evaluador no puede detectar cambios: SOPHIE 2.0 (Hasan et al., 2026) validaron un juez LLM frente al consenso de todas las fuentes humanas de calificación —pacientes estandarizados y evaluadores externos— en una rúbrica de comunicación clínica de tres dimensiones, alcanzando una Pearson de 0,759 y una ICC(A,1) de 0,746 solo a partir de las transcripciones, dentro de la dispersión de los evaluadores humanos individuales y no fuera de ella. Su dimensión más débil fue «Ser explícito» (correlaciones de 0,414–0,598 entre los jueces candidatos), y también fue la única dimensión cuyas puntuaciones no se movieron de forma medible entre los dos encuentros (Δ = 0,014, p = 0,1204), de modo que la concordancia por dimensión puede indicar de antemano en qué dimensiones un evaluador automatizado es incapaz de mostrar mejoras.

Evaluación consciente de la confianza

Un objetivo de diseño central dentro de la evaluación automatizada es la conciencia de la confianza: sistemas de evaluación con IA que informan de una incertidumbre calibrada junto a sus puntuaciones, en lugar de emitir una única predicción sin matices. Un calificador consciente de la confianza no solo produce una nota o una clasificación, sino que además señala cuán seguro está, de modo que los casos de baja confianza pueden señalarse para revisión humana y los usuarios pueden calibrar su confianza en el sistema. Esto es central para una evaluación automatizada responsable y conecta estrechamente con la IA psicométricamente consciente y la calibración de la confianza.

Cómo se modela la confianza en la investigación de la base de conocimiento:

  • Señales de confianza fusionadas para la calificación de respuestas cortas: Confidence-Aware ASAG fusiona señales de confianza basadas en el modelo (verbalizadas, latentes y basadas en la consistencia) con la incertidumbre aleatoria derivada del conjunto de datos mediante regresión con bosques aleatorios.
  • Confianza en el trabajo multimodal del estudiantado: la evaluación consciente de la confianza de figuras científicas dibujadas por estudiantes extiende el modelado de la confianza a respuestas multimodales del estudiantado.
  • Calibración psicométrica de los LLM: la IA psicométricamente consciente impulsa el estándar de alinear la puntuación con Grandes modelos de lenguaje (LLM) con la teoría de la medición, con la calibración como requisito central junto a la alineación con la teoría de respuesta al ítem.
  • Calibración de dificultad y tiempo de respuesta: la calibración de la dificultad de exámenes de programación reubica a los LLM como fuentes auxiliares de evidencia cuyas estimaciones de dificultad se correlacionan con las tasas de aprobación del estudiantado.
  • Puntuación de ensayos adaptada a los rasgos: PsyScore muestra que un marco psicométricamente consciente puede adaptar la retroalimentación sobre ensayos a los rasgos de quien aprende.
  • Evaluación de trabajo visual del estudiantado: DiagramIR retrotraduce diagramas matemáticos generados por LLM (TikZ) a una representación intermedia con comprobaciones deterministas, superando al LLM como juez en la concordancia con evaluadores humanos y permitiendo que los modelos pequeños igualen a los grandes con un coste unas 10 veces menor: una vía escalable para evaluar la producción diagramática, no textual, del estudiantado.
  • Inferencia condicionada por la confianza en la evaluación docente automatizada: Li, Yang y Fang (2025) colocan la calibración por dropout de Monte Carlo directamente en la ruta de puntuación, de modo que una varianza de dropout por encima de un umbral aprendido desencadena una salida de rechazo y derivación en lugar de una puntuación, junto a una desvinculación de sesgo adversarial que mantiene la brecha de equidad en el 1,8% donde las líneas base se sitúan en el rango del 6,4–8,2% y un error de calibración esperado de 0,032 en TeacherEval-2023. Su ablación es el argumento de la calibración en miniatura: eliminar el módulo condicionado por la confianza baja la consistencia interevaluador al 78,6%, y los autores atribuyen a ese condicionamiento una reducción del 41% en la carga de revisión humana: el tratamiento de la incertidumbre como arquitectura y no como informe a posteriori.
  • Explicabilidad de la puntuación basada en rúbricas: Bueno et al. muestran que las atribuciones SHAP independientes del modelo son más fieles y transferibles que las justificaciones generadas por LLM para explicar las puntuaciones basadas en rúbricas (por ejemplo, la calidad de la retroalimentación en el aula), y proponen pruebas basadas en eliminación y entre modelos como forma fundamentada de evaluar las explicaciones de cualquier modelo de puntuación.

Por qué importa una confianza calibrada:

  • Habilita la delegación con humanos en el bucle: los casos de baja confianza se derivan a un revisor humano, lo que apoya flujos de trabajo con humanos en el bucle en lugar de una automatización ciega.
  • Apoya la calibración de la confianza: una confianza calibrada permite a los usuarios ajustar su confianza a la fiabilidad real del sistema, evitando tanto la confianza excesiva como la insuficiente.
  • Mejora la validez de la medición: la puntuación consciente de la confianza refuerza la medición educativa y la validez de la evaluación al hacer explícita la incertidumbre.
  • Equidad y defendibilidad: señalar los casos de baja confianza para su revisión reduce el riesgo de puntuaciones equivocadas con seguridad, especialmente en respuestas atípicas o subrepresentadas.
  • Generación de rúbricas y flujos de calificación supervisados por el docente: Mendonça et al. (2026) muestran que las rúbricas de evaluación generadas por LLM (HARMOGEN-R) pueden igualar a las rúbricas creadas por personas en contenido técnico dentro de un margen de equivalencia de ±5 puntos, y que la generación estructurada da mayor consistencia entre modelos. Cruz et al. (2026) evalúan un flujo de calificación integral con GPT-4o en el que las notas de la IA quedaron dentro de 0,5 puntos de las del docente en el 83% de 362 entregas (MAE 0,31), algo que conviene enmarcar como un complemento escalable al juicio del docente, no como su sustituto.

Calidad y equidad

La calidad de la evaluación automatizada depende de la validez de la evaluación y de la mitigación del sesgo. La investigación sobre el sesgo lingüístico muestra que la puntuación automatizada puede perjudicar sistemáticamente a ciertas poblaciones de estudiantes.

Escenarios de despliegue y lo que exige cada uno

Cuánta alineación debería exigir una institución depende de qué se le permite decidir al sistema. En un estudio de métodos mixtos sobre 761 ensayos universitarios auténticos de tres universidades británicas, tres modelos de frontera con 27 configuraciones de prompt cada uno alcanzaron solo un 35–65 por ciento de concordancia con los calificadores humanos en la banda de titulación, y la precisión no se transfirió entre instituciones, así que el informe trata los usos candidatos como escenarios distintos y no como una sola decisión. El aseguramiento de la calidad de la calificación humana, donde la IA califica en paralelo y las diferencias significativas desencadenan una revisión humana, es el más conservador. Un asistente de calificación, que ordena o categoriza las entregas por calidad o incertidumbre previstas, clasifica los casos complejos o amplía comentarios humanos breves en retroalimentación más completa, es un término medio genuino. La IA como calificador principal, con revisión humana de una muestra o de las distribuciones de notas, se consideró aceptable solo si mejora el rendimiento del sistema, y ningún grupo de partes interesadas respaldó la IA como único calificador.

De todo ello se siguen tres requisitos. Como la alineación es específica del modelo y de la institución, la validación debe ser local y continua: una precisión destacada obtenida en otro lugar no es evidencia de estar preparado. Como las notas se comprimían hacia el centro, la IA era menos precisa en los límites de nota y en las entregas más fuertes y más débiles, que es justo donde las decisiones de evaluación tienen más consecuencias. Y como el desacuerdo entre una nota de IA y una humana refleja juicios distintos y no un mero error, las discrepancias deberían desencadenar una interpretación humana en lugar de una anulación algorítmica, manteniendo en las personas la autoridad final sobre la nota. La adopción también conlleva obligaciones de gobernanza que las métricas técnicas no recogen: un derecho a la explicación conforme al artículo 22 del RGPD cuando las decisiones automatizadas afectan al estudiantado, deberes derivados de la Ley de Igualdad una vez que se demuestra que el nivel de logro y el uso del lenguaje influyen en las notas, procesos de apelación revisados para errores que no se detectan fácilmente, y un riesgo de irreversibilidad: una vez que cambian la plantilla y la inversión, una institución puede tener dificultades para seguir recogiendo la calificación humana que necesitaría para volver atrás.

Venetsanos (2026) aporta los criterios que esos requisitos presuponen, argumentando que lo que hace defendible la automatización es el estatus epistémico de la tarea y no lo que la tecnología puede realizar técnicamente. Su marco limita la IA a la verificación acotada de afirmaciones fácticas y procedimentales —deben cumplirse simultáneamente las cuatro condiciones de criterios documentados sin ambigüedad, comparación directa con conocimiento establecido, ausencia de evaluación de enfoques alternativos válidos y una única respuesta correcta o un conjunto aceptable preespecificado, y la ambigüedad se escala a una persona por defecto— y condiciona la implicación de la IA en ese nivel a cinco principios no negociables que deben cumplirse todos a la vez: la base de conocimiento debe estar curada por el evaluador y anclada en la recuperación de los materiales del módulo y no en el conocimiento paramétrico del modelo; los evaluadores humanos revisan cada salida de la IA antes de que llegue al estudiantado y conservan una anulación absoluta con responsabilidad no compartida; la retroalimentación debe llevar una procedencia y atribución claras; y la seguridad debe diseñarse contra el uso adversarial desde el principio, con saneamiento de entradas para instrucciones ocultas en texto blanco o de tamaño pequeño, codificaciones, imágenes o metadatos de documentos, ya que la elusión exitosa de un sistema automatizado se propaga por las cohortes de estudiantes. El mismo artículo explicita que sus principios no están probados en cuanto a viabilidad simultánea y que el tiempo de los evaluadores para la curación, la infraestructura de seguridad y la supervisión de alta frecuencia puede desplazar el esfuerzo del personal en lugar de reducirlo: una cautela que acompaña al requisito de validación local anterior.

Seguridad de la calificación mediada por IA

Una evaluación de equipo rojo de un flujo de trabajo de calificación cotidiano muestra la superficie de ataque que debe cubrir la planificación frente al uso adversarial. Humble (2026) insertó cinco inyecciones indirectas de prompt dentro de un ensayo sintético que Microsoft Copilot (GPT-5.2) había calificado como suspenso en seis de seis ejecuciones de referencia, iterando cada una en archivos docx, pdf y htm. Dos estrategias cambiaron la nota sin ninguna advertencia visible —un párrafo de manipulación de instrucciones y juego de rol en 9 de 9 iteraciones (100%) y el mismo párrafo oculto tras una capa de imagen en 17 de 18 (94%)—, mientras que un párrafo en texto blanco pequeño al final del documento falló en las nueve iteraciones, y las inyecciones en los metadatos del archivo nunca funcionaron, lo que el autor atribuye a que el acceso a los metadatos estaba desactivado en la versión probada. El problema de confianza sobrevivió a los exploits: tras una ejecución en pdf que detectó una instrucción insertada y declaró que solo calificaría según el trabajo oficial, volver a ejecutar el mismo archivo subió la nota seis veces más sin advertencia, y un chat bloqueado por un ataque detectado se desactivó en silencio en lugar de notificarse al usuario. El autor sostiene que las notas resultantes no aportan ninguna pretensión de validez en ninguna dirección, que a un adversario le basta una única combinación que funcione contra barreras en capas, y que el docente sigue siendo la única comprobación real de la salida mientras la manipulación está diseñada para no ser visible, lo que conecta directamente con la obligación de saneamiento de entradas y seguridad adversarial que Venetsanos plantea más arriba.

Conexiones

La evaluación automatizada se conecta con la validez de la evaluación (aseguramiento de la calidad), la evaluación formativa (contexto de uso), la mitigación del sesgo y la equidad en la IA educativa (equidad), el papel docente (cómo la automatización cambia el trabajo del profesorado) y la calidad de la retroalimentación con IA (calificar sin retroalimentación útil tiene un valor educativo limitado). La evaluación consciente de la confianza es un mecanismo específico dentro de la agenda más amplia de la IA psicométricamente consciente y una contribución a la confianza calibrada.

  • Calificación con IA a gran escala de física manuscrita (2026): un modelo multimodal (GPT-5.5) calificó 10.364 páginas escaneadas de un examen nacional de teoría de la Olimpiada de Física, un campamento de selección y un examen universitario de mecánica cuántica, alcanzando correlaciones de la puntuación total de 0,91–0,97 con las notas oficiales y recuperando el mismo equipo olímpico de los cinco primeros. Revisadas página a página, las instrucciones de localización de evidencia mejoraron la concordancia, evidencia de que la IA multimodal puede apoyar la calificación sumativa de alto impacto con una cuidadosa ingeniería de rúbricas y prompts (Large Scale AI Grading of Handwritten Physics Assessments: Score Agreement and Olympiad Team Selection Outcomes).

  • Automatización selectiva para química manuscrita (2026): Cvengros y Kortemeyer calificaron página a página un examen final de química general manuscrito de 296 estudiantes frente a imágenes de rúbricas con un LLM multimodal y de razonamiento, alcanzando una alta fiabilidad entre ejecuciones en las puntuaciones totales (ICC(A,1) = 0,967) y una fuerte concordancia de la puntuación total con la calificación de los ayudantes (R² = 0,91). Como la fiabilidad a nivel de ítem variaba mucho según el formato —las respuestas textuales y de reacciones químicas se calificaban de forma fiable, mientras que el dibujo y la representación gráfica puntuaban peor que el azar—, la concordancia bruta se consideró inadecuada para un uso de alto impacto. Operacionalizan la derivación a humanos mediante filtros de confianza (umbrales de crédito parcial, un umbral de riesgo basado en TRI y la exclusión por tipo de problema) que convierten las puntuaciones brutas de la IA en una política de aceptación o derivación, y muestran que los falsos positivos (la IA que acredita respuestas genuinamente incorrectas) tienden a pasar desapercibidos, ya que el estudiantado rara vez los impugna: una vía concreta y fundamentada psicométricamente hacia la automatización selectiva (Assisting the grading of a handwritten general chemistry exam with artificial intelligence).

  • Matemáticas manuscritas semiabiertas en un examen universitario (2026): Liu et al. calificaron con GPT-4 un examen de matemáticas de grado alemán a través de dos rutas de extracción (recuadros de respuesta precortados frente a páginas completas), dos rutas de reconocimiento óptico de caracteres y dos formatos de rúbrica, informando de un alfa de Krippendorff frente a las notas humanas de 0,22-0,44 con una precisión de 0,59-0,62 en los mejores flujos de trabajo y una precisión por problema que va de 0,27 a 0,91: no aceptable para un uso sumativo de alto impacto. Detallar las reglas de calificación multicriterio no mejoró la concordancia en general (sí ayudó en el problema con crédito parcial), la calificación libre sin rúbrica fue mucho peor (precisión 0,50-0,51), y un filtro probabilístico de confianza destinado a señalar notas para revisión humana no mejoró significativamente la precisión y señaló erróneamente como fiables entre el 7 y el 41 por ciento de las respuestas. La lección transferible del estudio es procedimental: escanear y transcribir toda la hoja del examen con marcadores en lugar de recortar los recuadros de respuesta, porque el estudiantado escribe por encima de los bordes de los recuadros; reescribir las reglas de calificación pensadas para ayudantes, ya que el modelo intentaba derivaciones no solicitadas a partir de una regla destinada a una persona; y tener en cuenta que las propias reglas de calificación humana se parafraseaban con un alfa de 0,88 entre cinco variantes, así que la robustez del prompt no es el cuello de botella.

  • Juicio comparativo con LLM para el cribado de la escritura (2026): Mercer y Reed usaron siete LLM como jueces comparativos por pares para puntuar la escritura informativa de 1.208 estudiantes de 3.º a 6.º grado en tres ocasiones de cribado. Las puntuaciones del juicio comparativo con LLM correlacionaron fuertemente con las puntuaciones de rúbricas analíticas (r = 0,67–0,73, más fuerte con Gemini-3.1 Pro) con un AUC de 0,82–0,86 para la competencia; los resultados fueron estables entre modelos, con poca ganancia de validez al usar modelos más costosos y capaces, mientras que promediar tres muestras de escritura mejoró la precisión: la amplitud del muestreo importó más que la elección del modelo. Los patrones de sesgo predictivo para quienes aprenden en varias lenguas coincidieron con la puntuación humana por rúbrica, lo que respalda el juicio comparativo con LLM como enfoque de cribado eficiente y de bajo coste (Validity of Large Language Model Comparative Judgment for Universal Writing Screening).

  • Alineación con la calificación del docente en función de la calidad (2026): al comparar a ChatGPT, a los compañeros y a un docente calificando los mismos proyectos grupales de grado, Usher y Faraon encontraron que la alineación de ChatGPT con el docente mejoraba a medida que aumentaba la calidad del proyecto: su mayor sobreestimación se daba en trabajos de baja calidad (≈ +14 puntos), y se reducía a ≈ +2,5 puntos en los proyectos de alta calidad. ChatGPT también calificó en promedio más alto que los compañeros y que el docente, una tendencia a inflar las notas que socava su fiabilidad como calificador sumativo autónomo, especialmente en las entregas más débiles.

  • Las estadísticas de concordancia con corpus pequeños pueden inducir a error en las decisiones de despliegue. Puntuar 60 publicaciones de marketing (15 estudiantes más 15 anclas de baja calidad escritas por investigadores) frente a dos evaluadores humanos independientes dio una concordancia absoluta ICC(2,1) de 0,435 para el LLM, 0,266 para un híbrido de reglas y LLM con el mismo peso y 0,091 para reglas deterministas, con un MAE de 6,28, 10,53 y 17,22 puntos respectivamente en una escala de 0-100; el híbrido fue significativamente peor que el LLM solo (diferencia de ICC emparejada −0,169, IC del 95% [−0,260, −0,106]). Añadir anclas elevó la ICC interevaluador de 0,338 a 0,902 y la concordancia del LLM de 0,435 a 0,846, y una publicación casi vacía recibió 75 frente a una media humana de 30,5, lo que muestra que una única respuesta degenerada puede dominar una evaluación pequeña. (Agreement and error in automated scoring of student marketing posts)

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.