Preguntas frecuentes
¿Deberíamos usar detectores de IA?
Traducción automática de la página en inglés, todavía sin revisar por una persona hablante nativa.
No como prueba en un caso de mala conducta, y no como primera línea de defensa de una institución. La puntuación de un detector no puede validarse contra la verdad de referencia, no puede ser interrogada y no cumple el estándar de balance de probabilidades que exigen las conclusiones sobre integridad académica. Peor aún: sus errores siguen patrones y no son aleatorios. El estudio controlado más sólido de la base de conocimiento encontró que los detectores señalan la edición honesta con IA y conforme a las directrices mucho más fácilmente que la prosa estudiantil sin modificar, mientras que la evasión deliberada pasa casi intacta; y el estudiantado con más probabilidad de ser señalado es el de escritores no nativos de inglés (Why AI Detection Fails for Academic Integrity, Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI), uno de los varios lugares donde la tasa de error de un sistema de IA no se distribuye de manera uniforme entre quienes aprenden, como documenta Efectos diferenciales entre grupos de estudiantes. Bassett et al. (2026) van más lejos y sostienen que la detección no debería usarse en educación en absoluto, porque la tecnología no sabe distinguir entre "trabajo creado con IA" y "trabajo creado por IA". Esta página es para quienes tienen que decidir: docentes, responsables de integridad académica y administradores. El manual del lado del diseño está en ¿Cómo puedo reducir las trampas con IA en mi curso?.
1. Las cifras de precisión no sostienen una conclusión
Tres líneas independientes de evidencia convergen en la misma conclusión.
La tasa de falsos positivos en trabajo legítimo es alta, y castiga la transparencia. Un estudio controlado de 642 resúmenes publicados en inglés, de cuatro dominios y dos periodos, encontró que con un umbral de 0.50 dos detectores comerciales señalaron la edición ligera con IA y conforme a las directrices en el 38% al 80% de los casos, señalaron los originales sin modificar de 2023 a 2025 en el 9% al 15% (muy por encima en las áreas no STEM, p<0.001) y, una vez que un texto había pasado por un servicio de humanización, detectaron menos del 4% de las reescrituras etiquetadas como IA, una tasa de falsos negativos superior al 96%. Los autores describen esto como un callejón sin salida para la integridad: el estudiantado que declara y edita ligeramente es justo el que la herramienta atrapa, mientras que quien evade deliberadamente no lo es. Su recomendación es explícita: las puntuaciones de los detectores nunca deberían servir como prueba aislada de mala conducta.(Why AI Detection Fails for Academic Integrity)
El mejor benchmark independiente no alcanza una precisión utilizable. En el Benchmark temprano más completo, ninguna de las catorce herramientas llegó al 80% de precisión, y la paráfrasis simple, la edición menor o los servicios de humanización reducen a la mitad incluso ese rendimiento. Con tasas base realistas, los falsos positivos superan a los verdaderos positivos.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
Y se pierde por completo el uso masivo de IA justo cuando importa. En un estudio de campo encubierto, los investigadores inyectaron entregas totalmente generadas por IA en un sistema examen en línea real de cinco módulos de Psicología: el 94% pasó sin ser detectado, y el trabajo de la IA superó por término medio al del estudiantado real. El fraude por encargo ya había demostrado el mismo problema estructural: no deja rastro fiable que encontrar.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
La precisión también varía por tarea de formas que una política no puede anticipar. Cuando los investigadores probaron si la IA generativa puede detectar de forma fiable su propia producción, la detección fue fiable para la programación y la escritura reflexiva extensa pero mala para las respuestas cortas, donde el modelo a menudo juzgaba su propio texto como más humano que el trabajo auténtico del estudiantado, y variaciones menores en la indicación reducían bruscamente la precisión.(Distinguishing Artificial from Authentic: Evaluating LLMs for Detecting LLM-Generated Content) Cualquier umbral que fijes valdrá para algunas tareas y fallará para otras.
La detección nunca ha sido claramente mejor que una persona cuidadosa, y el margen no es lo importante. Leaton Gray, Edsall y Parapadakis (2025) informan de una detección automática de texto de IA o parafraseado de alrededor del 80% frente al 78.4% de los revisores humanos, y citan evidencia de que el texto generado por IA ha pasado como escrito por humanos en hasta el 80% de los casos, un margen que leen como demasiado estrecho para fundamentar una conclusión de mala conducta, ya que la ventaja de la máquina se disuelve en la misma banda de error que aporta la persona. Su revisión también socava el supuesto de que la detección disuade a quien es capaz: el metaanálisis de Krou et al. encuentra que la autoeficacia correlaciona negativamente con hacer trampas mientras que la capacidad real no correlaciona de forma inversa con ello en absoluto, así que el estudiantado que podría hacer el trabajo puede hacer trampas cuando juzga que la evaluación es injusta. La detección no es, por tanto, ni un instrumento fiable ni un elemento disuasorio evidente.
2. Los errores siguen patrones y recaen en el estudiantado equivocado
Esta es la parte que debería decidir la cuestión para cualquiera que sea responsable de la equidad.
Los rasgos que los detectores tratan como señales de IA (densidad de tokens largos, frecuencia de vocabulario académico, estilo uniforme) son también rasgos de una escritura competente en segunda lengua, así que los detectores clasifican erróneamente a hablantes no nativos de inglés de forma sistemática y no aleatoria. El daño de la clasificación errónea recae, por tanto, en estudiantes que ya están en desventaja.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) El mismo sesgo aparece por disciplina: los resúmenes no STEM fueron señalados muy por encima de los de STEM en el estudio de resúmenes, lo que es una propiedad de las convenciones de escritura de esos campos, no de la conducta de sus autores.(Why AI Detection Fails for Academic Integrity) En efecto, un detector es una prueba de estilo, y el estilo que castiga correlaciona con el origen lingüístico, la disciplina y el registro, no con si un estudiante usó IA.
Eso es un problema de equidad antes que técnico, y también un problema de confianza. Como los detectores no son fiables y los procesos formales exigen una prueba de nivel detectivesco que en la práctica no está disponible, el profesorado acaba con lo que un relato profesional llama "sospecha sin recurso", mientras el estudiantado racionaliza su propio uso y los expedientes se estancan.(The Best Response to Student AI Use Is Not Detection, It Is Dialog)
3. Por qué una puntuación no puede sostener un caso de integridad
Si participas en una audiencia, esta es la sección que importa.
- No se cumple el estándar probatorio. Las conclusiones de mala conducta académica exigen pruebas que alcancen el balance de probabilidades. Las puntuaciones de los detectores, solas o combinadas con marcadores lingüísticos, comparaciones de estilo, juicios del Large Language Models (LLMs) o el silencio de un estudiante, no satisfacen ese estándar.(Heads We Win, Tails You Lose: AI Detectors in Education)
- El silencio y la palabra se están usando mal. El estudiantado conserva el derecho al silencio; negarse a responder no inclina la balanza en su contra. La pregunta legítima no es "¿usaste IA?" sino si el estudiante puede demostrar el aprendizaje que la evaluación afirma medir, algo que una respuesta oral puede responder.(Heads We Win, Tails You Lose: AI Detectors in Education)
- La probabilidad es inverificable. A diferencia de un filtro de spam o una prueba médica, la salida de un detector no puede comprobarse de forma independiente: en las entregas reales no hay verdad de referencia sobre cómo se produjo el texto, así que la validación se vuelve circular, y las métricas de falsos positivos y falsos negativos solo se aplican en pruebas controladas.(Heads We Win, Tails You Lose: AI Detectors in Education)
- Los datos de referencia están obsoletos por construcción. Los detectores se entrenan y se prueban con escritura humana anterior a la IA generativa (la propia validación de Turnitin usó 700,000 trabajos anteriores a 2019), lo que presupone que ese corpus refleja la prosa actual del estudiantado. Ese supuesto no está verificado, y cambia con cada lanzamiento de modelo.(Heads We Win, Tails You Lose: AI Detectors in Education)
- La herramienta no puede ser interrogada. Los detectores no publican umbrales ni datos de entrenamiento y no permiten la replicación independiente, así que un estudiante señalado no puede responder ni interrogar la acusación. No puedes defender una conclusión que no puedes explicar.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
- La dicotomía es la pregunta equivocada. El trabajo del estudiantado se crea con frecuencia con IA y no por IA, dentro de un continuo híbrido, y las políticas que dicen "en la evaluación" rara vez definen cuándo empieza una evaluación, lo que deja la aplicación al juicio subjetivo en lugar de a criterios fundamentados.(Heads We Win, Tails You Lose: AI Detectors in Education)
- Asumes un riesgo de datos. Los detectores almacenan el trabajo del estudiantado en servidores de terceros, a veces en el extranjero y bajo protecciones de privacidad más débiles, lo que crea exposición a brechas, retención y explotación comercial que asume tu institución.(Heads We Win, Tails You Lose: AI Detectors in Education)
- Más vigilancia puede volverse en contra. La disuasión pasa por la discriminación de un detector entre el uso oculto y el trabajo legítimo, no por su tasa bruta de aciertos. Cuando una sensibilidad extra produce más falsos positivos nuevos que verdaderos positivos nuevos, una vigilancia más fuerte hace relativamente más atractivo el ocultamiento: gastas credibilidad en estudiantes que no hicieron nada malo más rápido de lo que identificas a quienes sí lo hicieron.(Assessment Design Under Imperfect Information: Generative AI, Disclosure, and Student Response in Higher Education)
4. Qué hacer en su lugar
Pide verificación, no procedencia. La Grand Canyon University pasó de "¿usó IA este estudiante?" a "¿puede este estudiante demostrar que entiende lo que entregó?", usando conversaciones breves, primeros borradores y explicaciones grabadas, implementado en toda la institución en otoño de 2025. El argumento es práctico: el profesorado ya está cualificado para juzgar la comprensión, y el cambio le devuelve su autoridad en lugar de dejarlo esperando una prueba que nunca llegará.(The Best Response to Student AI Use Is Not Detection, It Is Dialog)
Haz que al menos una tarea de alto riesgo sea sin ayuda. Las evaluaciones orales asíncronas (indicaciones improvisadas con respuestas grabadas breves y de tiempo limitado, calificadas con rúbricas integradas) rindieron de forma comparable a los exámenes presenciales de opción múltiple en un estudio y significativamente mejor en otro, con estudiantes que informaron de una preparación más activa y una mayor relevancia profesional percibida. Para un administrador, la propiedad relevante es que esto es escalable sin vigilancia presencial.(Asynchronous Oral Assessments: Enhancing Integrity, Engagement, and Communication in the AI Era)
Rediseña las tareas para que los atajos con IA resulten menos atractivos. Un estudio de caso con estudiantes de grado de economía encontró que solo alrededor de un tercio declaró algún uso de IA, y la declaración era todavía más rara, y que no declararlo se leía como una cautela racional bajo una política ambigua y no como deshonestidad. Esos mismos estudiantes preferían tareas del mundo real y basadas en datos como solución.(Beyond Detection: How Students Use—and Hide—AI in Online Assessments and What Authentic Tasks Can Do About It) Esperar, declarar y escrutar el uso de IA supera a vigilarlo, porque la autenticidad hay que diseñarla, no imponerla.(Beyond Detection: Redesigning Authentic Assessment in an AI-Mediated World)
Haz que declarar honestamente sea la opción segura. Las políticas vagas o punitivas impulsan el ocultamiento; los marcos de declaración específicos ligados a etapas cognitivas, acompañados de la garantía de que declarar con veracidad no se penaliza, sacan más información del estudiantado que la vigilancia.(Addressing student non-compliance in AI use declarations: implications for academic integrity and assessment in higher)("Should I Tell My Teacher?" Student AI Disclosure Practices, Stigma, and Self-Regulated Learning in Higher Education)
5. Las objeciones que oirás
- "Nuestro proveedor anuncia una tasa de falsos positivos del 1%." El detector con licencia de Vanderbilt afirmaba exactamente eso, y cuando la universidad quiso validar la cifra no pudo: el 1% de 75,000 entregas anuales implicaba unos 750 estudiantes mal etiquetados, así que desactivó la herramienta. Los benchmarks independientes no sitúan ninguna herramienta por encima del 80% de precisión.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
- "Solo lo usamos como una pieza de evidencia." El estándar no es "alguna evidencia" sino evidencia que alcance el balance de probabilidades, y las puntuaciones de detectores combinadas con marcadores, comparaciones de estilo, juicios de LLM o el silencio siguen sin satisfacerlo. Si no dirías el razonamiento en voz alta en una audiencia, no es evidencia.(Heads We Win, Tails You Lose: AI Detectors in Education)
- "Si dejamos de detectar, gana el fraude." No es la detección lo que detiene a quien está decidido: el 94% de las entregas de IA inyectadas pasaron desapercibidas en un examen en línea real, la humanización derrota a la detección en más del 96% de los casos y el fraude por encargo ya no dejaba rastro fiable.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) Lo que los detectores sí atrapan, con fiabilidad medida, es la edición ligera honesta y la prosa no nativa.(Why AI Detection Fails for Academic Integrity)
- "Solo lo usamos en privado, para iniciar una conversación." Ese es el uso menos dañino, y aun así cuesta algo: el estudiantado con más probabilidad de ser señalado es el que menos probabilidad tiene de estar abusando de la IA, así que la sospecha recae de forma desproporcionada en las personas equivocadas.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) La respuesta de Grand Canyon fue dejar de partir de la sospecha por completo.(The Best Response to Student AI Use Is Not Detection, It Is Dialog)
6. Si redactas o revisas una política, incluye esto
- La salida de un detector nunca es prueba aislada, nunca activa una consecuencia automática y nunca fundamenta una conclusión. Dilo en la propia política, no en un memorando.(Why AI Detection Fails for Academic Integrity)
- El estudiantado debe poder ver la acusación y responder a ella, con el derecho al silencio preservado y una vía de verificación oral disponible para cualquier acusación que se base solo en el estilo.(Heads We Win, Tails You Lose: AI Detectors in Education)
- Los términos de contratación deben cubrir la retención de datos, el uso para entrenamiento de modelos, la ubicación del almacenamiento, la notificación de brechas y los derechos de apelación: el riesgo es de tu institución, no del proveedor.(Heads We Win, Tails You Lose: AI Detectors in Education)
- Financia la alternativa. La queja documentada del profesorado es la "sospecha sin recurso", así que la partida que importa es la capacidad de verificación y la orientación, no una licencia de detección.(The Best Response to Student AI Use Is Not Detection, It Is Dialog)
- Pide por escrito las tasas de error y luego intenta validarlas localmente. Si la tasa anunciada no puede reproducirse con tus propias entregas, como le ocurrió a Vanderbilt, esa es tu respuesta.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
7. El riesgo legal cuando se acusa erróneamente a un estudiante
Una puntuación de detector que se convierte en acusación es donde esto deja de ser una cuestión de enseñanza. Las instituciones no quedan expuestas porque alguien fuera acusado, sino por cómo se construyó y se gestionó la acusación, y la exposición suele aflorar primero como una apelación interna o una queja ante un regulador, y no como una demanda ante los tribunales.
- El procedimiento es lo primero que se pone a prueba. Los principios de justicia natural exigen que se informe al estudiantado de la acusación y se le dé la oportunidad de responder antes de que se tome cualquier determinación, obligaciones codificadas tanto en estándares regulatorios como en una política de integridad académica sólida; la oportunidad de responder suele ser una reunión de investigación o una entrevista ante un panel, y todo lo que diga el estudiante pasa a formar parte del registro probatorio. Una conclusión alcanzada sin ese paso es vulnerable, con independencia de si la sospecha de fondo era razonable.(How strong is the evidence in generative AI-related academic misconduct allegations? A mixed-methods analysis)
- El estándar probatorio es lo segundo. Las conclusiones de mala conducta exigen pruebas que alcancen el balance de probabilidades, y la salida de un detector no llega ahí por sí sola: las puntuaciones no pueden validarse contra la verdad de referencia en entregas reales, no se puede interrogar a las herramientas sobre cómo se llegó a un veredicto concreto, y un estudiante no puede interrogar a un número. Si tu caso no puede enunciarse sin la puntuación del detector, el caso es débil de entrada.(Heads We Win, Tails You Lose: AI Detectors in Education)
- El error sistemático convierte un defecto técnico en un problema de justicia y de igualdad. El error de los detectores no es aleatorio: la evidencia más sólida de la base de conocimiento muestra que el señalamiento se concentra en la escritura de hablantes no nativos de inglés y en las convenciones de prosa de una disciplina frente a otra, con una precisión medida de 0.69 y 0.61 para dos herramientas comerciales muy usadas y con ambas fallando en texto híbrido de humano e IA. Una conclusión construida sobre un instrumento que clasifica erróneamente por origen lingüístico es una conclusión que invita a un argumento de discriminación.(Evaluating the accuracy and reliability of AI content detectors in academic contexts)(Who wrote this? Evaluating the reliability of AI detection tools in higher education)
- Las prohibiciones generales del "uso de IA" pueden eliminar un ajuste. Las reglas que no separan la transcripción y el OCR de la redacción generativa pueden criminalizar las herramientas de apoyo en las que confía el estudiantado con afecciones que afectan al control motor, a la legibilidad de la escritura a mano o a la precisión al teclear, varias de las cuales se han discontinuado mientras la transcripción con IA cubría el hueco. Una política excesivamente inclusiva es una exposición legal, no solo algo impreciso.(Transcription is not generation: Distinguishing non-generative AI tool use from academic misconduct in higher education assessment)
- Los datos son tu responsabilidad. Los detectores almacenan el trabajo del estudiantado en servidores de terceros, a veces en el extranjero y bajo protecciones de privacidad más débiles, lo que sitúa la brecha, la retención y el uso comercial posterior dentro del registro de riesgos de tu institución y no del marketing del proveedor.(Heads We Win, Tails You Lose: AI Detectors in Education)
- Las afirmaciones del proveedor no te protegerán. Un detector con licencia que anunciaba una tasa de falsos positivos del 1% no superó la validación cuando la universidad intentó reproducirla, lo que implicaba unos 750 estudiantes mal etiquetados entre 75,000 entregas anuales; esa institución desactivó la herramienta. La afirmación del contrato no transfiere el riesgo en la audiencia.(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI)
Lo que reduce el riesgo es procesal y no técnico: nunca trates la salida de un detector como prueba aislada ni como desencadenante automático; documenta el estándar probatorio que aplica tu proceso; da aviso y una oportunidad real de responder con constancia en el registro; ofrece una vía de verificación oral cuando el caso se base solo en el estilo; incluye en la contratación los términos de retención, uso para entrenamiento y brechas; redacta el alcance de la política de modo que las herramientas de apoyo y de transcripción queden abordadas de forma explícita; y conserva la pista de auditoría que demuestra que todo eso ocurrió. El relato que da la base de conocimiento sobre la propia exposición legal está en Legal Issues and Risks, y es honesta sobre sus límites: documenta procedimientos, categorías de prueba y fiabilidad de los instrumentos, no resultados litigados.
En qué se diferencia esta página de las FAQ vecinas
- ¿Cómo puedo reducir las trampas con IA en mi curso? es el manual de diseño del docente: herramientas con barreras, rediseño de la evaluación, verificación, declaraciones y alfabetización en IA. Esta página responde a la pregunta previa y más acotada de si la salida de un detector puede usarse en absoluto.
- ¿Cómo puedo rediseñar la evaluación para que una calificación siga diciéndome algo defendible sobre lo que el estudiante sabe o puede hacer? cubre en profundidad el rediseño de la evaluación; esta página solo señala los movimientos de rediseño que sustituyen específicamente a la detección.
- ¿Cómo redacto una política de IA para un curso y la comunico al estudiantado? cubre cómo escribir y comunicar una política de curso; la sección 6 de esta página cubre las cláusulas específicas de detección que necesita una política institucional.
- Legal Issues and Risks es la página de concepto que hay detrás de la sección 7, y cubre juntas la acusación errónea, la vigilancia, la accesibilidad y la exposición en materia de protección de datos.
La conclusión
No construyas una conclusión sobre la puntuación de un detector, y no compres uno esperando que asegure tus evaluaciones. El comportamiento medido de estas herramientas es lo contrario de su marketing: atrapan trabajo honesto, declarado y ligeramente editado y escritura competente en segunda lengua, mientras que la evasión deliberada pasa el 96% de las veces y las entregas totalmente generadas pasaron un sistema de examen real el 94% de las veces.(Why AI Detection Fails for Academic Integrity)(Detecting the Undetectable? Reassessing Academic Misconduct Procedures in the Era of Generative AI) La pregunta de integridad que sí puedes responder es si un estudiante puede demostrar que entiende lo que entregó, y esa es una capacidad docente que merece financiación.