En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

La IA puede quitar trabajo real de un proyecto de investigación educativa: encontrar bibliografía, cribar miles de resúmenes, redactar código de análisis, resumir respuestas abiertas, ajustar un manuscrito. Lo que no puede hacer es asumir la responsabilidad de lo que el proyecto concluye. La imagen honesta, y la que respalda la evidencia, es una división del trabajo y no un traspaso: asigne la automatización a la carga procedimental, verifique cada resultado y mantenga las decisiones interpretativas en manos humanas (Wang et al., 2026).

Esta página trata de la IA como el instrumento del trabajo de investigación —búsqueda, cribado, síntesis, codificación, análisis y redacción, incluida la indagación sobre su propia práctica que un docente realiza sobre su propia enseñanza—. Si una intervención concreta de IA ayuda a quien aprende es una pregunta distinta, tratada en las FAQ enlazadas al final y en Investigación educativa asistida por IA. Gran parte de lo que sigue es, honestamente, advertencia: la base de evidencia es escasa y varios de los modos de fallo son silenciosos.

La versión breve

1. Decida por escrito qué tareas de investigación pueden usar IA y cuáles no, antes de que empiece el proyecto. Quienes investigan en el estudio de grupos focales de Dai y Chan (2026) calibraron el uso según el nivel de apuesta y la centralidad intelectual en lugar de mediante un permiso general: más peso en el trabajo procedimental de baja apuesta y cautela donde la contribución académica era central.

2. Mantenga la automatización sobre la carga procedimental. El cribado es donde más ayuda; la extracción de datos, la reconciliación y la síntesis quedaron en manos de revisores humanos en el único equipo que informó de su flujo de trabajo (Wang et al., 2026).

3. Verifique cada resultado contra un estándar humano y diga quién realizó la adjudicación. La concordancia entre un modelo y una persona codificadora —o entre dos modelos— es una medida de similitud, no evidencia de que la codificación sea correcta (Agreement Is Not Quality: Blind Expert Verification of Human and LLM Qualitative Coding When Human Consensus Is Not Ground Truth).

4. Fije sus rúbricas y sus libros de códigos antes de que se ejecute el análisis automatizado; los constructos, las rúbricas de codificación y los datos de entrenamiento son decisiones humanas, no resultados del modelo (Martin et al., 2026).

5. Verifique a mano cada referencia que cite, sobre todo los campos de autoría, cuando la IA haya intervenido en la redacción (Denny et al., 2026).

6. Registre las indicaciones, las versiones de los modelos y las versiones del corpus, declare el papel de la IA y presupueste tiempo para la verificación y la documentación: para la mayoría de los equipos esto es trabajo añadido, no eliminado.

Dónde ahorra trabajo de verdad la IA — y dónde lo añade

Búsqueda y recuperación de bibliografía

La búsqueda generativa resume, recomienda, sintetiza y conversa, lo que desestabiliza el supuesto de que el sistema encuentra las fuentes mientras la interpretación permanece en quien lee (Report on CHIIR 2026 Workshop on Generative AI and Academic Search (GAI&AS)). Es una forma rápida de localizar bibliografía candidata. Dos advertencias de ese taller: la capacidad es desigual —quienes investigan y reciben muchas citas se reconstruyeron aproximadamente al doble de la tasa de sus pares menos citados— y una bibliotecaria informó de una brecha de confianza en la que el estudiantado confiaba en exceso en la búsqueda generativa mientras el profesorado desconfiaba de ella. Úsela para descubrir y después verifique cada fuente usted mismo.

Cribado y revisiones sistemáticas

Las revisiones sistemáticas son donde la automatización ha avanzado más. Herramientas como ASReview, SWIFT-Review, Covidence, AIScreenR y MetaMate redujeron la carga procedimental sobre todo en el cribado de resúmenes, mientras que la extracción y la síntesis permanecieron humanas (Wang et al., 2026). Escriba reglas de decisión para los casos de zona gris antes de que empiece el cribado, conserve categorías de «quizá» y registre cada adjudicación en un registro compartido para que se aplique el mismo juicio de forma coherente.

Codificación y análisis cualitativos

El análisis cualitativo es la etapa en la que la interpretación es el producto. La IA puede escalar una primera pasada sobre respuestas abiertas, pero desplaza su papel de codificar a validar los resultados del modelo y cambia las destrezas que exige la tarea (Martin et al., 2026). Delegue por código y no en bloque: un estudio de verificación ciega clasificó 15 de 72 elementos del libro de códigos como manifiestamente necesitados de experiencia humana, 12 como mejor atendidos por un modelo y 16 como aptos para un triaje basado en la confianza.

Análisis de datos

Las funciones de medición automatizadas pueden parecer precisas y predictivas mientras siguen siendo opacas, y por eso importa aquí la IA explicable: puede revelar si un modelo sigue la comprensión semántica o solo las palabras clave (Martin et al., 2026). Trate cualquier puntuación automatizada como una hipótesis que hay que validar contra una medida ligada a la capacidad que pretende estudiar. Para las medidas en sí, véase ¿Qué medidas y métodos de investigación puede usar un docente para evaluar intervenciones relacionadas con la IA?.

Redacción, citación y edición

La redacción, la estructuración y la edición son donde la mayoría de quienes investigan ya usan estas herramientas: 27 de 28 investigadores de posgrado en Dai y Chan (2026) usaron IA generativa en algún punto del flujo de trabajo, incluida la escritura académica y la traducción. El único paso no negociable es la verificación de las referencias.

Ejecutar el flujo de trabajo: registros, declaración y presupuesto de esfuerzo

Un estudio de caso de 115 días con un solo investigador sobre un agente de investigación persistente encontró que el patrón más fuerte era la ampliación de la capacidad y no una sustitución de trabajo demostrada: a medida que se acumulaban la memoria y los procedimientos, el alcance del trabajo delegado crecía en lugar de encogerse la aportación humana. Esa es la expectativa realista. Conserve registros de indicaciones y respuestas y versiones del corpus —una lista de temas generada con fluidez parece inevitable mucho antes de que haya comenzado su trabajo probatorio (Holster, 2026)— y declare el papel de la IA como una vía, no como una casilla que marcar.

Consejos prácticos para docentes que investigan

La erudición de la enseñanza y el aprendizaje y la indagación en el aula —un docente que estudia su propio curso, a menudo a pequeña escala— son el hilo más fino del corpus. Investigación educativa asistida por IA lo afirma como una laguna y no como un hallazgo: la indagación del docente asistida por IA es plausiblemente generalizada y casi no está documentada, y la evidencia sobre la automatización de revisiones y la bibliometría no resuelve cómo debería un docente estudiar su propia enseñanza. Lo que se transfiere es una disposición y no un resultado.

1. Use la IA donde su entorno local no sea la variable: buscar bibliografía de su campo, transcribir y resumir sus propias grabaciones y redactar instrumentos o textos de consentimiento.

2. Conserve como propios los movimientos interpretativos —qué cuenta como tema, qué significa el comentario de un estudiante, qué permite concluir su evidencia de aula— y diga en el informe qué movimientos hizo el modelo y cuáles hizo usted (Holster, 2026).

3. Defina de antemano sus criterios y manténgalos visibles, porque un estudio local pequeño no puede recuperarse de un constructo definido después de que llegaran los datos.

4. Informe del papel de la IA, de la verificación que realizó y de los límites de un diseño de un solo curso y un solo investigador. No presente un relato del flujo de trabajo como si fuera un resultado de eficacia.

5. Trate la simulación de una cohorte como una opción avanzada y no como algo por defecto: quienes aprenden simulados tienden a cubrir el cuadrante más fácil del comportamiento real del estudiantado y rara vez se validan después de su uso (Simular estudiantes). Véase ¿Cómo hacemos que un estudiante simulado se comporte como un estudiante real? antes de confiar en el veredicto de un simulador.

Advertencias y cuestiones a considerar

Referencias fabricadas y errores de citación

La redacción asistida por IA abarata la producción de una cita inventada y plausible, y los fallos se concentran de forma desproporcionada en los campos de autoría, el campo que otorga el crédito. En una auditoría de 723.930 publicaciones y 15.872.533 referencias, Denny et al. (2026) verificaron 30 referencias fabricadas en 14 artículos de educación en informática, todas de 2025 y 2026; 17 de las 30 eran híbridos que combinaban un título real con autores fabricados o incorrectos, y el recuento verificado en un simposio técnico pasó de 3 en 2025 a 17 en 2026, apareciendo en el 2,3% de los artículos de las actas de ese año. Su recuento es un límite inferior deliberado, y los comprobadores automatizados heredan los defectos de los metadatos que tratan como verdad de referencia. Verifique cada cita usted mismo y compruebe primero la autoría.

La laguna de notificación y auditoría

La adopción ha ido por delante de la notificación. Zabaleta y Lin (2026) analizaron 888 artículos sobre automatización de revisiones: desde 2023, el 38,0% de los artículos sobre software y productos no informaba de ninguna evaluación, frente al 9,3% de los artículos sobre LLM, y el acceso a los modelos era abrumadoramente propietario (84,1%). Incluso una valoración global favorable no implicaba aptitud para delegar: el 52% de 118 artículos sobre LLM solo con resultados positivos seguía informando de una preocupación de que el flujo de trabajo quedaba por debajo del umbral exigido por su función. Su marco, PRISMA-LLM, separa la declaración de la implementación de la evaluación sensible a las consecuencias, y trata sus cinco niveles como niveles de declaración y no como niveles de riesgo. La conclusión práctica es que la profundidad de evaluación de un flujo de trabajo debería enunciarse, no darse por supuesta: nombre el sistema, la versión, las indicaciones, qué comprobaron las personas y dónde falló.

La concordancia no es evidencia de calidad

Una concordancia alta con personas codificadoras —o entre dos modelos— se informa sistemáticamente como si estableciera la corrección. No lo hace. Liu et al. (2026) hicieron que un experto independiente juzgara 855 conjuntos de códigos por pares a ciegas respecto de la fuente: la concordancia persona–LLM (Jaccard media 0,30) quedó muy por debajo de la concordancia persona–persona (0,52), y aun así el verificador ciego prefirió la codificación humana y la de la máquina a tasas indistinguibles (51,5% frente a 48,5%, p = 0,537). En ocasiones, el consenso humano codificaba un sesgo compartido que el verificador rechazó en favor del modelo. Adopte la verificación ciega, informe del estándar de referencia y de quién adjudicó, y encamine por código en lugar de tratar el proceso como un único entorno uniforme de revisión humana.

Validez de constructo cuando una medida automatizada se convierte en instrumento

Cuando el resultado de un modelo se convierte en el instrumento de investigación, la cuestión de medición es una cuestión de validez de constructo. Martin et al. (2026) lo enmarcan con el problema de la medición nomológica de Chang: medir una cantidad exige una ley que la relacione con algo observable, pero esa ley no puede probarse sin conocer ya la cantidad. Las funciones de medición derivadas de la IA surgen de los datos de entrenamiento y de la optimización y no de quien investiga, por lo que pueden parecer precisas mientras siguen siendo opacas; y la comparabilidad tiene que extenderse a través de las poblaciones de estudiantes, porque el aprendizaje automático tiende a codificar mejor las ideas canónicas que las diversas formas en que el estudiantado expresa las más débiles. Una puntuación automatizada cómoda también puede indexar el constructo equivocado: en una evaluación de ocho agentes de enseñanza con IA, el agente clasificado en tercer lugar por la puntuación de la propia plataforma quedó último en una rúbrica validada por expertos. El desacuerdo persona–máquina es sistemático y no aleatorio, y la operacionalización de la rúbrica suele importar más que la destreza al formular indicaciones (Tseng et al., 2026).

Usted sigue siendo responsable de la interpretación

Alguien debe responder de un estudio excluido, un tema codificado o una afirmación de prevalencia. Los modelos preentrenados añaden una capa de dependencia epistémica —sus datos de entrenamiento, su ajuste fino y sus objetivos pueden ser desconocidos— y, como emergen de redes sociotécnicas, la responsabilidad se vuelve difícil de atribuir, un «problema de muchas manos» (Martin et al., 2026). Nombrar el papel de la IA en los métodos forma parte de la respuesta, pero no transfiere la rendición de cuentas. Mantenga la vía interpretativa inspeccionable, contestable y revisable (Holster, 2026) y mantenga a una persona nombrada responsable de cada decisión de consecuencias.

Privacidad y consentimiento para los datos del estudiantado en herramientas de terceros

Los datos del aula y del estudiantado que pasan por herramientas de terceros conllevan obligaciones de consentimiento, gobernanza y confidencialidad que preceden a cualquier argumento de eficiencia. Zabaleta y Lin (2026) encontraron que el acceso a los modelos era abrumadoramente propietario (84,1%), lo que significa que el texto del estudiantado normalmente sale de su institución. Recoja solo lo que necesite el propósito educativo, haga transparente el uso y las limitaciones de los datos de la herramienta, compruebe si los datos de quien aprende entrenan los modelos del proveedor y prefiera datos locales o sintéticos cuando la sensibilidad sea alta. El tratamiento completo de estas obligaciones —junto con la equidad, la accesibilidad y la seguridad pedagógica— está en ¿Cómo debería la investigación sobre IA en educación incorporar la equidad, la accesibilidad, la privacidad, la ética y la seguridad pedagógica?.

Lo que la evidencia aún no establece

  • Ninguna comparación directa. El trabajo de referencia plantea la comparación entre métodos asistidos por IA y métodos tradicionales como trabajo futuro; ningún estudio aquí muestra que una metodología de IA produzca conclusiones más válidas (Martin et al., 2026).
  • Diseños endebles en todo el conjunto. La evidencia es una propuesta de marco, el relato reflexivo de un equipo, un informe de taller, un estudio de grupos focales y bibliometría observacional, no un ensayo controlado de un método asistido por IA. Las afirmaciones sobre el desplazamiento de roles y la ampliación de la capacidad proceden de relatos de un solo centro y un solo investigador.
  • Una laguna de notificación, no una auditoría de la práctica. PRISMA-LLM lee el silencio a nivel de artículo; un flujo de trabajo sin evaluación en su artículo puede seguir estando validado en un informe de producto, un protocolo o un repositorio.
  • La investigación del docente está infrarrepresentada. El corpus no puede fundamentar afirmaciones sobre cómo debería el profesorado usar la IA para estudiar su propia práctica.
  • Las herramientas son un blanco móvil. Un hallazgo sobre un flujo de trabajo de 2025 describe una generación de sistemas que puede que ya no exista en esa forma, por lo que la reproducibilidad tiene que ir ligada a una versión del modelo y una fecha.

Preguntas relacionadas

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.