Preguntas frecuentes
¿Cómo enseño a los estudiantes a verificar los resultados de la IA?
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
Ya les ha advertido. El chatbot no es un motor de búsqueda, comprueba las fuentes, úsalo con responsabilidad; y sin embargo las mismas citas inventadas y las mismas respuestas erróneas pero seguras de sí mismas siguen llegando en los trabajos entregados. Las advertencias fallan porque piden una disposición. Los estudiantes cuidadosos la tienen, los que van con prisa no, y no hay nada en esa frase sobre lo que un estudiante pueda actuar a las 11 de la noche con un resultado en pantalla que se lee perfectamente bien.
La investigación reunida aquí dice que ese encuadre es demasiado grueso para enseñarlo o calificarlo. Comprobar es un conjunto de acciones analíticamente separadas, y la etiqueta amplia "uso responsable" oculta la diferencia entre un estudiante que intentó comprobar y otro que resolvió si el resultado era correcto. La conclusión de fondo: la verificación se vuelve enseñable en el momento en que se deja de tratar como un rasgo y se empieza a tratar como una secuencia, es decir, un estándar fijado antes de la comprobación, una comprobación que produce un registro y una decisión que el estudiante debe defender con argumentos de dominio. Eso es un problema de diseño que puede resolver esta semana, y un problema de calificación que puede resolver con artefactos que la tarea ya genera.
Esta página aborda la mecánica de la verificación en sí. Sobre lo que los estudiantes deberían entender acerca de cómo funcionan estos sistemas, y cómo se define, se secuencia y se evalúa esa comprensión, véanse ¿Cómo debería incorporar la alfabetización en IA a mi curso? y ¿Qué evidencia existe sobre las intervenciones de alfabetización en IA en la educación superior?. Un estudiante puede saber mucho sobre los grandes modelos de lenguaje y no verificar nada.
Qué exige realmente la verificación a un estudiante
Wei y Shang (2026) separan siete objetivos que el "uso crítico de la IA" suele colapsar en uno: evaluación epistémica, inicio de la verificación, calidad del proceso, éxito de la verificación, decisiones de dependencia, desempeño inmediato en la tarea y aprendizaje independiente. La rúbrica de su programa dice "comprobó las fuentes", lo que se sitúa en el segundo paso y no dice nada sobre si la comprobación fue competente (calidad del proceso) ni sobre si cambió algo (éxito y, después, la decisión de dependencia). Iniciar no es tener éxito: un proceso sólido puede terminar sin conclusión, uno débil puede dar con la respuesta correcta, y un estudiante que hizo una búsqueda y quedó confundido puntúa igual que otro que resolvió la cuestión.
La segunda distinción es entre confianza y dependencia. La misma revisión define la calibración de la dependencia como un juicio sobre si una decisión de dependencia fue adecuada dada la calidad real del resultado de la IA: una clasificación contingente al resultado, y no una etapa de una línea temporal ni una puntuación en una escala de confianza. Un estudio auditado encontró que la información falsa de ChatGPT modificó la confianza declarada de los participantes, pero nunca registró si después aceptaron o rechazaron una recomendación concreta. Otro registró decisiones de aceptación y rechazo sobre la retroalimentación de ChatGPT en 78 estudiantes de traducción, pero sin una evaluación experta independiente una aceptación no puede calificarse de adecuada ni un rechazo de justificado. Sin una verdad de referencia sobre la calidad del resultado, la dependencia no puede clasificarse en absoluto, lo que indica lo que necesita toda tarea de verificación: una clave de respuestas defendible.
Por eso Jaidka y Cai (2026) tratan la descalibración como un problema de diseño y no como un déficit del estudiante. Su tipología cruza la capacidad de verificar con la motivación para verificar, y los perfiles requieren remedios distintos: el usuario de alta capacidad y baja motivación es propenso a una confianza excesiva complaciente, mientras que el usuario de baja capacidad y baja motivación es el más expuesto, de modo que dos estudiantes que fallan la misma comprobación pueden necesitar remedios opuestos.
Cómo enseñarlo
La síntesis de Wei y Shang se basó en 493 registros deduplicados de búsquedas en Web of Science Core y asignó 14 estudios empíricos prioritarios a las columnas de verificación, dependencia y resultado. Su producto constructivo es la secuencia en torno a la cual construir tareas. Primero, juzgar la calidad del resultado; después, registrar si se inició la verificación; después, codificar la calidad del proceso; después, puntuar si tuvo éxito; después, registrar la decisión de aceptar, revisar o rechazar; y, por último, evaluar esa decisión contra la calidad juzgada. Aquí corresponde también una advertencia: las intervenciones que reducen la aceptación inadecuada deben comprobarse además por el rechazo involuntario de ayuda correcta, así que deje espacio para que un estudiante acepte un buen resultado por una razón declarada.
Prediga antes del resultado, después compare. Gousopoulos (2026) construye un programa de medición para tareas de construcción en torno a predecir antes de ejecutar: el estudiante declara lo que debería ocurrir y, después, el comportamiento del artefacto se juzga contra esa predicción con argumentos de dominio, y no por si se ejecuta. Su auditoría de 24 estudios encontró la misma herramienta produciendo resultados opuestos bajo estructuras de tarea distintas: una configuración convencional de ChatGPT terminó significativamente por debajo en rendimiento, autoeficacia y flujo, mientras que una condición que añadía requisitos de verificación y módulos de reflexión sobre errores mostró un pensamiento de orden superior más fuerte. Como la predicción precede al resultado, el razonamiento queda registrado, y ese registro es lo que se califica.
Exija comprobaciones de fuentes contra el registro, con un objetivo concreto. Denny et al. (2026) rastrearon 113.588 referencias de 5.225 artículos de educación en informática publicados desde 2021 y verificaron manualmente 828 registros sospechosos, encontrando 30 con información bibliográfica verificablemente fabricada en 14 artículos, todos de 2025 y 2026. Trece estaban totalmente fabricados; los otros 17 combinaban un título real con autoría, sede o año fabricados o incorrectos. En el Technical Symposium de SIGCSE el recuento pasó de 3 en las actas de 2025 a 17 en las de 2026, o el 2,3% de los artículos de las actas de 2026. Los campos de autoría fallan más a menudo que cualquier otra parte de una referencia generada, así que "abra la fuente y lea la lista de autores" apunta al campo con más probabilidad de estar mal. No pida a los estudiantes que "se aseguren de que las fuentes son reales"; pídales que confirmen la autoría, la sede y el año contra el propio registro. El artículo pide que se verifique toda obra citada y que quien compruebe se mantenga con el ser humano en el circuito, la práctica que entrena un requisito de verificación de citas.
Enseñe la discriminación, no solo la cautela. Gousopoulos formaliza la verificación como un problema de detección de señales con dos parámetros independientes: la sensibilidad, la capacidad de discriminar un resultado correcto de uno defectuoso, y el criterio, donde el estudiante fija el umbral de rechazo. La dependencia excesiva se divide en consecuencia: las advertencias, las listas de comprobación y las indicaciones sobre alucinaciones desplazan el criterio, cambiando cuándo rechaza un estudiante, mientras que la instrucción en el dominio, las comparaciones resueltas y la práctica con errores sembrados elevan la sensibilidad, porque entonces el estudiante puede distinguir. El requisito previo se sigue de ahí: la instrucción en verificación solo es educativa donde la sensibilidad puede superar el cero, lo que exige suficiente conocimiento del dominio para distinguir un resultado correcto de uno incorrecto. En la misma auditoría, los novatos a quienes se pidió explicar código generado por un Large Language Models (LLMs) acertaron en torno a un tercio de las tareas, y por eso juzgar la retroalimentación o el código de la IA contra el propio razonamiento es una comprobación real solo donde ese razonamiento tiene sustancia. Si sus estudiantes todavía no pueden hacer el razonamiento de dominio sin ayuda, más advertencias no le compran nada; enseñe primero el contenido y asocie la comprobación a él.
Advierta de antemano, inmediatamente antes de la tarea. Vu, Cummings y Park (2026) mostraron un mensaje genérico de inoculación (advertencia previa) inmediatamente antes de dos tareas a 100 estudiantes estadounidenses, 40 nacionales y 60 internacionales de inglés como lengua extranjera. Los estudiantes inoculados fueron significativamente más propensos a verificar la tarea de resumen de una fuente académica (M = 0.34 frente a 0.18), mientras que las intenciones de verificación autoinformadas no cambiaron. Dos lecciones: una advertencia breve en el punto de uso cambia la conducta efectivamente realizada, y el efecto dependió de la tarea, ya que apareció en la tarea de resumen de fuentes pero no de forma uniforme en un cuestionario de matemáticas sobre exponenciación y multiplicación de números grandes.
Haga que corregir cueste algo. En un paradigma de corrección de errores que la revisión auditó, el esfuerzo durante la corrección importó para el aprendizaje; la simple sustitución de la respuesta difícilmente aportará el mismo beneficio. Pedir a un estudiante que reproduzca un paso, reescriba un pasaje o exponga la razón de dominio por la que un resultado es incorrecto convierte una comprobación en trabajo. Venetsanos (2026) fija el listón de lo que puede comprobarse mecánicamente: criterios documentados, comparación contra conocimiento establecido sin juicio interpretativo, y una única respuesta correcta o alternativas aceptables preespecificadas. Todo lo interpretativo queda por debajo de ese listón, así que separe la capa mecánica (fechas, fórmulas, citas, cálculos) de la capa de juicio, donde la lectura propia del estudiante es el instrumento de la comprobación.
Cómo evaluarlo sin vigilar a los estudiantes
Gousopoulos extrae la consecuencia directamente: si la IA puede producir el artefacto, el artefacto no puede ser la evaluación, de modo que la evaluación se desplaza a la especificación, el razonamiento de validación y la interpretación. Su constructo de autoría de modelo tiene cuatro facetas (especificación, modelo conceptual, verificación, interpretación) en cuatro niveles ordenados, de delegado a autoría, donde el nivel de autoría exige una especificación verificable anterior a la primera indicación, el rechazo del resultado con argumentos de dominio y una razón declarada, y una interpretación que vaya más allá del propio informe que el artefacto hace de sí mismo. Como la rúbrica se puntúa a partir de materiales que una tarea de construcción ya genera, el mismo instrumento sirve como evaluación formativa y como medida de investigación. Esa es la respuesta a la preocupación por el trabajo añadido: no está añadiendo una tarea, está puntuando un subproducto.
Tres decisiones evitan que esto se convierta en vigilancia. Primera, califique la comprobación contra la calidad juzgada, no contra el esfuerzo; de lo contrario creará un incentivo para representar una comprobación de teatro. Segunda, declare la procedencia, como exige Venetsanos: los estudiantes deben entender la procedencia, la naturaleza y las limitaciones de la retroalimentación que reciben (qué partes se verificaron mecánicamente, qué partes se juzgaron evaluativamente y que el juicio humano tiene primacía), porque los estudiantes no pueden sopesar una retroalimentación que no saben situar. Tercera, mantenga la aplicación al margen de las herramientas de detección. Bassett et al. (2026) sostienen que la detección de IA no debería usarse en educación en absoluto: sus estimaciones son probabilísticas y no pueden verificarse de forma independiente porque el origen real de un texto del mundo real es desconocido; sus puntuaciones no alcanzan el estándar de balance de probabilidades que exigen las investigaciones de integridad; y la dicotomía humano frente a IA carece de sentido para un trabajo creado con IA, y no por la IA. Su conclusión es que la detección "no salvaguarda la integridad académica, la socava", y que los regímenes de vigilancia fomentan la sospecha y erosionan la confianza de los estudiantes. Mantenga separados los dos sentidos de la detección: detectar texto generado por IA no tiene aquí ningún papel probatorio defendible, mientras que enseñar a los estudiantes a detectar errores en los resultados de la IA es el objetivo del ejercicio.
La separación es arquitectónica y merece contarse a los estudiantes: Li, Zhang y Botelho (2026) comprueban el resultado con un segundo modelo en lugar de incrustar la comprobación en el generador, y un estudiante que ve por qué puede ver por qué "la herramienta dijo que era correcto" no es un argumento de verificación.
Por qué los estudiantes se saltan la comprobación
Calibración. La tipología de Jaidka y Cai sitúa al estudiante de alta capacidad y baja motivación en riesgo de confianza excesiva complaciente, mientras que el de baja capacidad y baja motivación es el más expuesto. La literatura auditada muestra la misma división en miniatura: un diseño que ofrecía consejos correctos la mitad de las veces, donde el peso que los estudiantes le daban variaba con los conocimientos previos. Los fallos de calibración no se arreglan con exhortaciones: la propia señal de confianza del estudiante es lo que está descalibrado.
Fluidez. Un resultado que se lee bien se trata como correcto. Los novatos a quienes se pidió explicar código generado por un Large Language Models (LLMs) acertaron en torno a un tercio de las tareas, y un estudio de campo de conversaciones de cuestionario entre estudiantes y ChatGPT encontró que seguir una orientación correcta seguía produciendo una respuesta errónea. Cuando la sensibilidad es casi nula, saltarse la comprobación no le cuesta al estudiante nada que pueda percibir: el fallo es invisible hasta que se califica.
Prueba social e intención. Los estudiantes informan de que tienen intención de verificar, y el informe no vale nada: en el estudio de Vu, Cummings y Park, las intenciones de verificación autoinformadas no cambiaron mientras la conducta efectivamente realizada sí lo hizo (M = 0.34 frente a 0.18). No califique la intención. Las apelaciones basadas en normas tampoco son un recurso fiable: los empujones normativos basados en mensajes no mostraron ningún efecto significativo en un torneo directo que Jaidka y Cai recogen. La presión de tiempo es una razón documentada por la que los estudiantes se saltan las comprobaciones, y un programa que deja la verificación sin programar dice que es opcional.
Tres objeciones
"Pueden hacerlo solo por la nota." En parte es cierto, así que califique materiales que la IA no pueda producir en nombre del estudiante. Una especificación escrita antes de la primera indicación, una predicción registrada antes de ejecutar el artefacto, una lista de fuentes comprobada contra el registro, una razón de dominio declarada para el rechazo: cada una de ellas exige que el estudiante sostenga una posición que el generador no puede aportar. En el nivel de autoría, Gousopoulos exige el rechazo del resultado con argumentos de dominio y con una razón declarada; una razón fabricada es tan visible como una cita fabricada. El riesgo residual está acotado por el umbral de sensibilidad: donde un estudiante no tiene conocimiento del dominio contra el que comprobar, la verificación es teatro y ninguna rúbrica la rescata. Ese es un argumento para enseñar primero el dominio, no para abandonar la comprobación.
"No hay tiempo en el programa." La advertencia previa es un mensaje inmediatamente antes de la tarea; la tarea con errores sembrados son veinte ítems, ocho con un error de nivel de dominio, y le dice si los estudiantes pueden discriminar en absoluto; y la rúbrica se apoya en materiales que la tarea ya genera, de modo que cuesta tiempo de corrección sobre evidencia que de otro modo no tendría, en lugar de una tarea nueva. Lo que cuesta tiempo es la alternativa: entregas sin verificar, referencias fabricadas y las conversaciones sobre integridad que vienen después. La restricción sigue siendo real: la presión de tiempo es una razón documentada por la que los estudiantes se saltan las comprobaciones, así que una verificación que no esté programada dentro de la tarea no ocurrirá.
"La herramienta suele tener razón." Entonces la comprobación es barata y las excepciones son lo importante. El registro sobre referencias no es tranquilizador: 30 ítems verificablemente fabricados en 14 artículos, todos de 2025 y 2026, 17 de ellos emparejando un título real con autoría, sede o año fabricados o incorrectos, 13 totalmente fabricados, y un salto de 3 en las actas de SIGCSE de 2025 a 17 en las de 2026, o el 2,3% de los artículos de las actas de 2026. La exactitud en las partes que uno casualmente nota no dice nada sobre las partes que no nota: los campos de autoría fallan más a menudo que cualquier otra parte de una referencia generada. Y una respuesta aceptada puede ser errónea incluso cuando la orientación era correcta: el estudio de campo sobre conversaciones de cuestionario entre estudiantes y ChatGPT registró exactamente eso. La razón para enseñar verificación no es que la herramienta suele estar equivocada, sino que el estudiante no puede saber en cuál de los dos casos se encuentra, precisamente la habilidad que su curso existe para construir.
Lo que sigue sin saberse
- Si alguna intervención mejora el éxito de la verificación y la decisión de dependencia que le sigue, juzgada contra la calidad del resultado ya evaluada: ningún estudio entre los 14 casos prioritarios de Wei y Shang midió ambas cosas, y pocos siguieron el desempeño inmediato con retención diferida o transferencia.
- Si los componentes se relacionan en el orden que el mapa implica. Los siete objetivos son un ordenamiento analítico, no un modelo causal validado.
- Si las proposiciones de diseño funcionan. Las ocho proposiciones de Jaidka y Cai son predicciones no puestas a prueba, y los empujones normativos basados en mensajes no mostraron ningún efecto significativo en un torneo directo que ellos recogen.
- Si la comprobación integrada en la retroalimentación desarrolla hábitos de autoverificación o dependencia de la validación externa, algo que Venetsanos plantea y deja abierto.
- Si la instrucción en verificación funciona por debajo de un umbral de conocimiento del dominio. Gousopoulos predice que no, y señala que algunos dominios ofrecen un criterio externo (física, química, ecología, epidemiología), mientras que la historia, la literatura y la ética en gran medida no lo hacen.
Qué hacer esta semana
- Fije el estándar antes de la comprobación. Decida qué significa la corrección juzgada para la tarea, de modo que una comprobación tenga algo contra lo que resolverse.
- Pida primero la predicción. Haga que los estudiantes se comprometan por escrito con lo que debería ocurrir y después compare el resultado con argumentos de dominio, no por su fluidez.
- Exija verificación de citas con un objetivo concreto. Las listas de autoría son la parte menos fiable de una referencia generada; haga que los estudiantes abran el registro y confirmen autoría, sede y año.
- Diagnostique la sensibilidad y el criterio por separado. Un estudiante que acepta un resultado defectuoso porque no puede distinguirlo necesita práctica de dominio; uno que puede distinguirlo y lo acepta igualmente necesita que se le mueva el umbral.
- Califique la comprobación, no solo el artefacto. Puntúe especificaciones, registros de predicción, registros de validación, comprobaciones de fuentes y razones declaradas para el rechazo.
- Declare la procedencia. Diga a los estudiantes qué retroalimentación se verificó mecánicamente y qué se juzgó por una persona.
- Mantenga la aplicación al margen de los detectores y programe la verificación. La presión de tiempo es una razón documentada por la que los estudiantes se saltan las comprobaciones.
- Aplique la tarea con errores sembrados. Veinte ítems, ocho con un error de nivel de dominio, le dicen si los estudiantes pueden discriminar en absoluto.
- Diga la advertencia en el punto de uso. Advierta de antemano por tipo de tarea, no una vez por programa.
Para el trabajo que lo rodea, véanse cómo incorporar la alfabetización en IA en un curso y qué muestra la evidencia sobre la alfabetización en IA, las dos páginas que construyen la comprensión que esta pone en práctica.