En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.

La evaluación entre pares — la práctica en la que el estudiantado evalúa, califica o da comentarios sobre el trabajo de sus compañeros, mediante la revisión por pares escrita, la calificación entre pares, la revisión de código entre pares o la evaluación en grupo y por equipos. En la enseñanza de la escritura y su pedagogía es una buena práctica de larga tradición: el estudiantado aprende tanto al recibir comentarios basados en criterios como al darlos, y la conversación entre pares sobre un trabajo compartido se correlaciona con un aprendizaje más profundo, la conciencia del público destinatario y el desarrollo social. En la era de la IA se está reexaminando como una decisión de diseño de la evaluación y no como una única actividad: un complemento humano de los comentarios generados por IA, un terreno de entrenamiento para la alfabetización en retroalimentación y un espacio donde se renegocian la integridad académica y la agencia del estudiantado.

Preguntas para reflexionar

  • Piense en alguna ocasión en que un par evaluó su trabajo, o en que usted evaluó el suyo. ¿De qué aprendió más: de dar los comentarios o de recibirlos, y por qué?
  • ¿Por qué los comentarios de un estudiante podrían ser más conscientes del contexto y más afectuosos que los de una IA, aun cuando los de la IA son más consistentes y se guían por una rúbrica? ¿Cómo podrían complementarse ambos?
  • Los pares tienden a calificar por debajo el trabajo bueno y la IA tiende a inflar el trabajo flojo. Si ninguna de las dos fuentes es fiablemente precisa en todo el rango de calidad, ¿para qué debería usarse una nota procedente de cualquiera de ellas?
  • La evaluación entre pares depende en gran medida del andamiaje y de criterios claros, y el sesgo de amistad y la ansiedad social pueden hacer que una revisión entre pares sin formación sea peor que ninguna. ¿Cómo es una formación adecuada en su contexto?
  • Si la IA puede redactar comentarios sobre la organización y la estructura, ¿eso hace redundante la evaluación entre pares o libera a los pares para dar los comentarios específicos y conscientes del público destinatario que solo ellos pueden dar?
  • Los comentarios entre pares apoyados con IA generativa superaron a los comentarios entre pares sin más en un estudio, pero solo cuando se añadía un andamiaje de prompts. ¿Qué se está andamiando ahí: la IA, el estudiantado o la evaluación?
  • Se describe la evaluación crítica de los comentarios generados por IA como una forma de construir alfabetización en IA y agencia como escritor. ¿Qué significa tener agencia sobre el propio trabajo cuando las máquinas comentan cada vez más sobre él?

Introducción

La evaluación entre pares es una decisión de diseño de la evaluación en la que el estudiantado asume parte del trabajo evaluativo que normalmente se reserva al profesorado. Sus formas difieren en lo que el estudiantado produce y en lo que está en juego: los comentarios entre pares (observaciones sobre un borrador, normalmente formativos y de bajo riesgo), la calificación entre pares (una nota que contribuye a una calificación), la revisión de código entre pares y la evaluación en grupo o por equipos (en la que los pares evalúan el producto colectivo o las contribuciones de cada cual). La forma determina qué practica el estudiantado: dar un comentario basado en criterios construye el juicio evaluativo de forma distinta a asignar un número, y defender el propio código oralmente construye algo distinto todavía. La autoevaluación, la práctica hermana, dirige ese mismo escrutinio basado en criterios al propio trabajo de quien aprende, mientras que la evaluación entre pares lo dirige a la entrega de un par y a la conciencia del público destinatario que la acompaña.

La base de investigación coincide en que la evaluación entre pares produce aprendizaje y discrepa sobre cuánto depende del diseño. Da al estudiantado un público destinatario auténtico, desarrolla el juicio evaluativo mediante la respuesta basada en criterios y construye el contexto social que sostiene la implicación y la motivación. Su calidad depende en gran medida del andamiaje —de lo bien estructurada que esté y de si el estudiantado recibe criterios claros y formación—. Esa dependencia es donde entra la IA, como complemento consistente y guiado por rúbricas de los comentarios específicos y conscientes del contexto que dan los pares, y cada vez más como un andamiaje integrado en el propio proceso de evaluación entre pares.

Qué aprende el estudiantado al evaluar a sus pares

El argumento más sólido a favor de la evaluación entre pares es que quien evalúa aprende. Fowles et al. (2026) sometieron cada entrega de CS1 a una entrevista de revisión de código oral de 15 minutos con un ayudante docente formado, con un peso del 70% de la nota de la tarea. Los caracteres pegados sobre el total subieron del 61,0% al 68,1% (p < 0,0001), y aun así las notas del examen no bajaron y el tiempo dedicado a la tarea se mantuvo estable; el 90% del estudiantado dijo que las revisiones le motivaron a entender mejor su código y el 65% que le ayudaron a evitar la dependencia excesiva de la IA. Exigir al estudiantado que explicara su trabajo a un par formado convirtió una posible dependencia excesiva en una oportunidad de práctica autorregulada.

El mecanismo se repite en toda la literatura. En una revisión sistemática PRISMA 2020 de 22 artículos de 203 examinados, Martínez-Peláez et al. (2025) encontraron que los LLM apoyan la colaboración en parte al facilitar los comentarios entre pares y al simular evaluaciones basadas en rúbricas, y que el estudiantado que verifica y corrige la salida del modelo desarrolla pensamiento crítico. El aprender enseñando aparece incluso entre máquinas: el discurso similar al aprendizaje entre pares de más de 2,4 millones de agentes de IA fue en su mayoría afirmación más que indagación (una ratio de afirmaciones a preguntas de 11,4:1, con reflexión metacognitiva en solo el 7% de una taxonomía codificada en 28.683 publicaciones), algo que Chen et al. (2026) tratan como una advertencia de que un discurso superficial no demuestra que se aprenda nada.

Formación, calibración y alfabetización en retroalimentación

La evaluación entre pares falla de forma predecible cuando el estudiantado no está formado. Gu, Chen y Yan (2026) realizaron un cuasiexperimento de métodos mixtos con 118 estudiantes de grado de primer año en China, comparando ChatGPT-4o con rúbricas preentrenadas frente a hojas de revisión entre pares estructuradas con un ejemplo de alta calidad. La alfabetización en retroalimentación subió algo más en el grupo de IA generativa (ANCOVA p = 0,049, η²p = 0,03), pero los hallazgos cualitativos importan más: el estudiantado del grupo de pares elegía las fuentes de comentarios por conveniencia social —pares cercanos, pares de la misma carrera, compañeros de piso—, rara vez tenía objetivos concretos de retroalimentación y afrontaba ansiedad social a la hora de buscarla. La evaluación entre pares se distorsionaba con más frecuencia por el sesgo de amistad y la competencia percibida de los pares, y la reflexión entre pares a menudo se posponía hasta exámenes posteriores. Los autores recomiendan diseños multietapa con comentarios anónimos entre pares, ya que la revisión entre pares sigue construyendo de forma única la conciencia del público destinatario y el juicio evaluativo a través del acto de dar comentarios.

Los marcos de diseño atacan esos cuellos de botella. Irwin y Muller (2026) proponen dos roles de la IA generativa en los comentarios entre pares sobre la expresión oral en contextos de inglés como lengua extranjera o segunda lengua, un caso que consideran más difícil que la escritura por la presión de tiempo, la fugacidad de la actuación oral y el aumento de la afectividad: un Entrenador que apoya a quienes dan los comentarios mediante una calibración basada en ejemplos y comentarios sobre los comentarios, y un Sintetizador que agrega los comentarios de los pares en un informe de aprovechamiento vinculado a los criterios que normaliza formatos, preserva las opiniones minoritarias y señala las contradicciones. Sus principios son una sincronización y secuenciación cuidadosas, unidades breves y repetidas del Entrenador, preservar la voz de quienes dan los comentarios y barreras de seguridad que mantienen al profesorado en el bucle sin calificación automatizada. El artículo es conceptual, sin nuevos datos empíricos.

Validez, equidad y precisión de la calificación: pares frente a IA frente a profesorado

Cuando la evaluación entre pares produce una nota, la pregunta es si esa nota es defendible. Usher y Faraon (2026) encontraron que la alineación entre pares y profesorado era más fuerte en el trabajo de menor calidad (r = 0,51 en el tramo de baja calidad) y se debilitaba en los proyectos de alta calidad, que los pares tendían a calificar por debajo, reflejo plausible de la reticencia a criticar el trabajo sólido. ChatGPT mostró el patrón opuesto: mejor alineación en el trabajo de alta calidad, pero notas infladas en las entregas flojas. El estudiantado percibía las notas de los pares como más coherentes con los propios comentarios escritos de esos pares, y valoraba el juicio de los pares consciente de la relación junto con la consistencia neutral de ChatGPT. La precisión de los pares depende de la calidad y es sensible a la relación, y ninguna fuente única es fiable en todo el rango.

Eso limita para qué debería usarse una nota entre pares. Una nota calibrada en el centro de la distribución no tiene por qué estarlo en la parte alta o baja, así que las notas entre pares son más defendibles como insumo para una decisión moderada o como evidencia del juicio de quien evalúa que como nota final de un trabajo sólido. Suen y Hung (2026) subrayan por qué las instituciones siguen buscando alternativas escalables: los comentarios entre pares y el acompañamiento experto consumen mucho tiempo, son costosos y difíciles de escalar con consistencia. Su sistema de bucle cerrado puntuó a 204 personas adultas en formación en habilidades de presentación con una arquitectura XGBoost que se acercaba a la fiabilidad de evaluadores expertos (ρ = 0,69–0,78) y con ganancias pre-post de d de Cohen = 0,39–0,90: un único estudio de campo pre-post, no una comparación con la evaluación entre pares, que sustituye el juicio de las máquinas en lugar de aumentar el de los pares.

Evaluación entre pares aumentada con IA: PAIRR y la división Entrenador/Sintetizador

El patrón de diseño dominante mantiene a los pares en el centro y añade la IA a su alrededor. El modelo de Revisión de Pares y de IA + Reflexión (PAIRR) es el caso mejor documentado. Sperber et al. (2025) implementaron PAIRR en 10 cursos de escritura y tres cursos de STEM con alta carga de escritura, con 654 estudiantes (37% de primera generación, 13% internacionales, 68% multilingües). El estudiantado redactaba un borrador, intercambiaba la revisión entre pares, pedía a ChatGPT comentarios guiados por la rúbrica sobre ese mismo borrador, evaluaba críticamente ambos, planificaba revisiones y reflexionaba. El 58% prefirió los comentarios combinados, el 36% solo los de los pares y solo el 6% solo los de la IA. Las dos fuentes a menudo coincidían (el 75% informó de similitudes, descritas como confirmación y refuerzo mutuo) y, cuando diferían, eran complementarias: los comentarios de la IA se tachaban a menudo de demasiado generales (31%), pero ofrecían estrategias de revisión accionables sobre la organización y la estructura, mientras que los de los pares eran más específicos y detallados (28%) y se apoyaban en el conocimiento contextual de la tarea. Evaluar críticamente la salida de la IA construyó alfabetización en IA, y solo el 5,3% del estudiantado mostró exceso de confianza en ella.

El patrón se generaliza a la escritura profesional. MacArthur et al. (2025) aplicaron PAIRR a un curso de escritura empresarial de nivel avanzado en el que cinco tareas principales exigían cada una un borrador, un análisis del público destinatario, una revisión por parte de 2–3 pares y una revisión final (participaron 34 de los 46 estudiantes matriculados; el 69% multilingües). El estudiantado valoraba los comentarios de la IA, pero a veces los encontraba demasiado generales, y valoraba el conocimiento contextual de los pares: «mis compañeros lo miraban desde la perspectiva del empleador… ChatGPT no lo hacía tanto». Una cuarta parte de las reflexiones codificadas en el estudio más amplio de PAIRR expresaba escepticismo sobre los comentarios de la IA o señalaba imprecisiones, lo que los autores leen como desarrollo de la alfabetización en IA. El estudio es descriptivo y específico del curso.

La IA generativa como andamiaje dentro de los comentarios entre pares y la evaluación en grupo

La prueba más rigurosa de cuánto importa el diseño es un experimento aleatorizado por conglomerados en varios centros. Ateş (2026) aleatorizó 48 secciones de 4 universidades —1.176 estudiantes de grado de primer año de biología, química y física— a cuatro condiciones para la argumentación científica: solo comentarios entre pares, comentarios directos de IA generativa, comentarios reflexivos de IA generativa (autoevaluación y luego crítica de la IA) y un híbrido de autoevaluación → comentarios entre pares → crítica de IA. La IA generativa directa superó a los comentarios entre pares en la calidad inmediata de la argumentación, pero mostró una transferencia más débil; los diseños reflexivo e híbrido produjeron un mayor aprovechamiento de los comentarios y un mejor aprendizaje autorregulado; el híbrido mostró la ventaja más clara en aprendizaje conceptual; y ambos superaron a la IA generativa directa en la transferencia diferida sin IA. El valor de la IA generativa, concluyen los autores, depende menos del acceso que de si el entorno preserva la agencia y la propiedad del estudiantado durante la revisión.

Ese patrón —una ventaja temprana que no se sostiene— reaparece cuando la comparación es entre los comentarios del profesorado y los comentarios entre pares asistidos por IA, y no la IA generativa sola. Tang, Li y Luo (2026) realizaron un cuasiexperimento de ocho semanas con 61 escritores chinos de L2 (244 textos calificados) trabajando a partir de una única lista de comprobación de cinco dimensiones, con una clase que recibía comentarios escritos del profesorado y la otra comentarios entre pares asistidos por IA. Los comentarios del profesorado produjeron muchos más ítems —316 frente a 185 en la primera tarea, concentrados en el vocabulario y los detalles técnicos— y la ganancia inmediata algo mayor, pero su mejora cayó bruscamente en la segunda tarea, mientras que la clase de comentarios entre pares asistidos por IA se mantuvo estable y terminó con la puntuación de revisión más alta. Los comentarios entre pares asistidos por IA eran menos numerosos, pero se mantenían anclados en el contenido y la estructura, y su ventaja inicial en diversidad léxica no persistió; ningún modo movió la complejidad sintáctica. Los autores leen los dos modos como andamiajes complementarios y proponen un híbrido IA–Pares–Profesorado, en el que la IA señala los errores superficiales durante la redacción, los pares negocian el contenido en la revisión y el profesorado se centra en lo que ninguno de los dos alcanzó.

Añadir IA generativa también puede elevar la calidad de los propios comentarios entre pares, pero al parecer solo con apoyo de prompts. Chang et al. (2026) compararon tres condiciones entre 45 docentes en formación de 12 grupos a lo largo de cuatro rondas de argumentación colaborativa: comentarios entre pares sin más, comentarios entre pares con IA generativa y comentarios entre pares con IA generativa bajo andamiaje de prompts. Los grupos apoyados con IA generativa superaron a los comentarios entre pares sin más en el rendimiento argumentativo, y el grupo con andamiaje de prompts rindió mejor en elementos avanzados como «datos y garantía de la refutación» y «abordar la visión contraria». Los grupos apoyados con IA generativa produjeron más explicaciones, sugerencias y comentarios neutros o negativos, y el grupo con andamiaje combinó emociones negativas con contenido de retroalimentación de orden superior: evaluación crítica en lugar de aceptación pasiva. Es un experimento único y pequeño, pero aísla el andamiaje de prompts como el ingrediente activo.

La evaluación en grupo cambia el problema, porque el estudiantado debe negociar qué uso de la IA es aceptable. Chen y Zou (2026) entrevistaron a 15 grupos focales de 52 docentes en formación inicial en un curso donde una presentación grupal que valía el 30% de la nota final exigía integración y coherencia. Emergieron tres patrones: agencia orientada a la cooperación en cinco grupos, que intensificaron el uso de IA generativa para mantener el trabajo unido y proteger una nota compartida; agencia normativa en siete grupos, que restringieron el uso para proteger la autenticidad y la equidad —un estudiante razonó que generar una parte con IA sería «injusto para los demás compañeros de grupo»—; y agencia no enactada en tres grupos cuya práctica nunca cambió respecto al trabajo individual. Los autores sostienen que la capacidad individual no se convierte por sí sola en agencia colectiva y que la negociación del uso aceptable de la IA debería ser en sí misma un resultado evaluable, con tareas de revisión entre pares que alimenten el producto final.

Arquitectura de la retroalimentación, declaración y condiciones sociales de la evaluación entre pares

La evaluación entre pares también depende de lo que el estudiantado puede ver de los demás y de lo que está dispuesto a admitir. Hao y Cukurova (2026) probaron un diseño de aprendizaje con resúmenes generados por IA a lo largo de tres iteraciones con 128 estudiantes durante ocho semanas. El estudiantado de las iteraciones apoyadas por IA mostró una centralidad de grado de salida estandarizada significativamente mayor que la línea de base (β = 0,547 y β = 0,438, ambas p < 0,001): veían o interactuaban con más pares. Las entrevistas describieron los resúmenes como un mapa de navegación que reducía el esfuerzo de encontrar contribuciones sepultadas en hilos mal titulados, y el estudiantado atendía a colaboradores activos elegidos por sus opiniones contrastantes y no por amistad. El diseño no evitó el descenso de la actividad de consulta bajo una carga de trabajo creciente, así que las posibilidades tecnológicas por sí solas no sostienen la implicación.

Las normas entre pares también configuran la honestidad, lo que importa allí donde los pares evalúan trabajo influido por la IA. Qu y Wang (2026) encuestaron a 409 estudiantes de grado singapurenses sobre por qué el estudiantado oculta el uso de IA generativa pese a los mandatos de declaración, y encontraron que dominaban las variables relacionales: la declaración percibida de los pares y la comodidad con el profesorado fueron los predictores más fuertes de la declaración, mientras que la desconexión moral era más débil. La no declaración era una adaptación estratégica a las normas percibidas de los pares y a una baja confianza interpretativa, no una negligencia moral. Las normas entre pares pueden, por tanto, sostener la honestidad, como cuando el estudiantado de la evaluación en grupo restringió el uso de IA por obligación hacia sus compañeros, o suprimirla, como cuando la adopción colectiva redujo el riesgo percibido de mal uso. La transparencia, sostienen los autores, depende menos del cumplimiento que de la confianza y de climas normativos positivos: una condición relacional que los diseños de evaluación entre pares crean o destruyen.

Implicaciones de diseño y preguntas abiertas

De aquí se derivan varias decisiones de diseño. Dé a quienes evalúan formación, ejemplos y criterios antes de que evalúen, porque la evaluación entre pares sin formación es vulnerable al sesgo de amistad, a la selección de fuentes por conveniencia y a la ansiedad social. Secuencie el trabajo de modo que la autoevaluación preceda a los comentarios entre pares y a la crítica de la IA, ya que la condición híbrida produjo el aprendizaje conceptual más fuerte y la mejor transferencia diferida. Donde entre la IA generativa, andamie cómo la usa el estudiantado. Mantenga al profesorado en el bucle para todo lo que se convierta en nota, trate las notas entre pares como evidencia dependiente de la calidad y no como marcas uniformes, y haga que el propio uso de la IA sea algo que los grupos negocien y documenten.

Las preguntas abiertas son sobre la solidez de la evidencia, no solo sobre el diseño. Buena parte de la evidencia sobre pares e IA es pequeña y ligada al contexto: 45 docentes en formación en un curso, 34 estudiantes en un curso de escritura empresarial, 52 docentes en formación inicial en 15 grupos focales. La encuesta de PAIRR es el conjunto de datos más grande de este conjunto y mide las percepciones del estudiantado, no la calidad de las salidas de IA que el estudiantado juzgó. Solo los 1.176 estudiantes de grado del experimento multicéntrico se acercan a una escala causal-comparativa, y evalúa el diseño de los comentarios para la argumentación científica, no la evaluación entre pares como tal. Mientras tanto, O'Neill (2026) auditó 14 metaanálisis revisados por pares que afirman que la IA mejora la educación y encontró que ninguno ofrecía una base válida para sus afirmaciones: todos menos dos definían el tratamiento como una herramienta y no como una intervención pedagógica, la heterogeneidad era alta en todos los metaanálisis que informaban de I² (77,2% a 94,4%) y una auditoría de 59 estudios primarios encontró que el 61% tenía problemas de validez, a menudo un desajuste entre el resultado medido y la afirmación realizada. Las afirmaciones sobre lo que la IA hace en la evaluación entre pares deberían tratarse como afirmaciones sobre una actividad diseñada, puestas a prueba en los términos de esa actividad.

Conceptos conectados

Artículos conectados

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.