Conceptos
Evaluación orientada al proceso
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
La evaluación orientada al proceso — el diseño de la evaluación en torno a cómo llega quien aprende a una conclusión y no solo en torno al artefacto que entrega: entregas por etapas, justificación reflexiva, intercambio dialógico y oral, historial de borradores y versiones, y criterios que el estudiantado puede aplicarse a sí mismo. No es sinónimo de realismo de la tarea ni una afirmación sobre quién califica el trabajo: una tarea realista cuya única evidencia es un único producto sin supervisión queda expuesta al mismo problema de sustitución que el ensayo al que reemplazó. La IA generativa es lo que hace urgente la distinción, porque ahora se puede producir un resultado fluido a demanda y un archivo terminado ya no lleva información sobre el razonamiento de quién lo produjo.
Preguntas para reflexionar
- Si un estudiante entrega un ensayo pulido, ¿qué permite afirmar realmente ese artefacto sobre su pensamiento, y qué afirmaciones solo parece respaldar?
- La evidencia de proceso pide borradores, justificación y diálogo. ¿Quién en su contexto domina ese tipo de autoexpresión académica, y a quién podrían juzgar por su comodidad con ella y no por su comprensión?
- La detección no es fiable y rediseñar en torno al proceso es caro. ¿Dónde gastaría un presupuesto institucional limitado, y qué evidencia cambiaría su respuesta?
Introducción
La evaluación en la educación superior ha inferido durante mucho tiempo el pensamiento a partir del producto. Un ensayo, un informe o una respuesta de examen entregados hacían las veces del razonamiento que había detrás, y la calificación trataba un artefacto bien argumentado como prueba de un proceso bien argumentado. Thapa y Lewis (2026) nombran el supuesto que rompe la IA generativa: una respuesta pulida «puede ya no representar el proceso de pensamiento de nadie», de modo que la inferencia del artefacto a la comprensión deja de ser segura. Su respuesta no es un mejor detector, sino una base de evidencia distinta. La evaluación orientada al proceso recoge evidencia de interpretación, justificación y construcción de conocimiento mientras se desarrollan, de modo que el razonamiento permanece visible cuando el resultado se puede producir a demanda.
Conviene decir qué no es el concepto. No es evaluación auténtica, que pregunta si una tarea refleja una práctica del mundo real que vale la pena; Thapa y Lewis mantienen los ejes separados e insisten en que una tarea auténtica con un único producto sin supervisión sigue expuesta. No es detección de IA, que pregunta si se usó la herramienta y no cómo se tomó una decisión. Y no es evaluación automatizada, que se refiere a quién o qué califica: un portafolio por etapas calificado por una máquina puede ser orientado al proceso, y un ensayo final calificado por una persona puede no serlo. El concepto se refiere a qué evidencia se recoge, durante qué periodo y en qué condiciones se produce.
La idea ha pasado de ser una propuesta a ser una recomendación recurrente en toda la base de conocimiento. Aparece como prioridad nombrada en la agenda de AIED para la agencia y la motivación de quien aprende, como la agenda de investigación organizadora del problema de retención y transferencia en la investigación sobre desempeño frente a aprendizaje, como «evaluación de caja negra» en el relato de Brunnström y Palmqvist sobre el aprendizaje autorregulado con IA, y como una petición de formadores de docentes en ejercicio que comprobaron que su trabajo escrito para llevar a casa ya no podía evidenciar aprendizaje alguno.
Cómo se ve la evidencia de proceso en la práctica
El vocabulario de diseño más explícito proviene de Thapa y Lewis, cuyos cuatro compromisos llevan el argumento al diseño de tareas: justificación reflexiva, diseño de tareas por etapas, participación dialógica y transparencia evaluativa. En la práctica, el estudiantado explica decisiones interpretativas en lugar de presentar solo conclusiones, entrega trabajo que se desarrolla a lo largo de puntos de control, participa en intercambios orales o dialógicos sobre su razonamiento y trabaja con criterios que puede aplicarse por sí mismo: el terreno de la alfabetización en retroalimentación y la autoevaluación. La propuesta de Boysen (2026) de prácticas de aprendizaje abierto traduce la misma lógica en un rastro de auditoría: un plan de aprendizaje compartido fijado antes de que empiece el proyecto, un plan de análisis del aprendizaje que nombra las fuentes obligatorias y las prohibidas, y borradores e historiales de versiones documentados, conservados mediante Control de cambios y versiones guardadas de los archivos, que exponen el proceso de trabajo y explican qué informó cada revisión. Lo enmarca como autorregulación hecha visible.
Los relatos de profesionales y de marcos completan los artefactos. El marco LEARN de Uden y Hwang (2026), dirigido a la evaluación del aprendizaje basado en problemas, pide rúbricas centradas en el proceso, justificaciones orales, entregas por etapas y rastros de razonamiento con divulgación del uso de IA, y trata la reflexión mediante diarios de aprendizaje y protocolos de pensamiento en voz alta como el motor metacognitivo de la secuencia. Moganadas y sus colegas (2026) convierten la evaluación transparente en el uso de IA y orientada al proceso en una de cinco proposiciones investigables, que exige documentación, verificación y justificación reflexiva en lugar de prohibición o uso de detectores. Padhy (2026) recomienda capturar el historial de revisiones, los patrones de interacción y el tiempo en la tarea, junto con una divulgación transparente. Goldstein, Marae-Haj y Zidan (2026) informan de los mismos artefactos surgidos de la práctica tras una crisis de confianza: registros de prompts, historial de versiones de documentos, contribuciones grupales monitorizadas y «diarios de viaje» reflexivos llevados en cuadernos físicos, junto con el hallazgo llano de que el trabajo escrito para llevar a casa ya no podía evidenciar aprendizaje.
Un eje distinto del de la autenticidad y del de la calificación
Mantener los ejes separados importa, porque confundirlos es la manera de que un rediseño parezca terminado mientras la exposición permanece. Sharma (2026) establece la distinción complementaria entre autenticidad y diseño orientado a la integridad: la autenticidad pregunta si una tarea refleja una práctica que vale la pena, mientras que el diseño orientado a la integridad pregunta si quien aprende puede justificar sus decisiones y asumir responsabilidad en relación con los estándares disciplinares, razón por la cual las prácticas que ofrece —rastros de decisión anotados, verificación de las afirmaciones aportadas por la IA generativa, defensa oral, diferencias entre borradores con historial de versiones— se eligen por el juicio que hacen visible y no por su realismo. La revisión de diez años de Espino y Espino (2026) sobre la educación en negocios llega a la misma conclusión de diseño desde el lado de la literatura, y encuentra que el campo converge hacia tareas auténticas y de proceso visible que exigen interpretación, aplicación contextual y refinamiento iterativo, y trata la adopción aislada de herramientas dentro de estructuras de evaluación sin cambios como su fallo más persistente.
El constructo también se distingue de la cuestión de cómo se puntúa la evidencia. El razonamiento sobre la validez es donde ambos se encuentran: Brunnström y Palmqvist (2026) sostienen que cuando un chatbot puede producir una respuesta de examen plausible, el producto entregado se convierte en un indicador más débil de lo que aprendió el estudiantado, un problema de validez de la evaluación y no solo de integridad. Es la misma inferencia en riesgo en el argumento de desempeño frente a aprendizaje de Yan, Greiff, Lodge y Gašević, donde las ganancias de desempeño que se reducen cuando se retira la asistencia muestran una ganancia que vive en la herramienta y no en quien aprende, y donde el remedio propuesto son medidas de proceso como las pruebas de retención y transferencia y no el éxito inmediato en la tarea.
Por qué la detección no puede cargar con esto
La evaluación orientada al proceso se propone normalmente como alternativa a la detección, y la evidencia sobre la detección explica por qué. La literatura sobre la detección encuentra tasas de error, dependencia de la tarea y sesgo sistemático contra quienes escriben en una segunda lengua y contra las personas con discapacidad, y el trabajo más reciente llega a una conclusión procedimental: una puntuación de detector puede motivar una revisión más atenta, pero no es un hallazgo. Munoz y sus colegas (2026) muestran lo que eso cuesta en la práctica. Al codificar 1.162 acusaciones de mala conducta con IA generativa, encontraron que los tipos de evidencia más sólidos los genera la investigación o la supervisión, que la evidencia de proceso —borradores, reuniones de supervisión, presentaciones— solo aparece donde esas prácticas ya existen, de modo que en una evaluación no rediseñada simplemente está ausente, y que la salida del detector obtuvo las valoraciones probatorias más bajas de todas las categorías. La consecuencia de diseño es de orden: la evidencia de proceso tiene que existir antes de que un caso la necesite, y el razonamiento de Weidlich (2026) sobre qué inferencia está en riesgo plantea lo mismo desde el lado de la validez, ya que los intentos de restaurar la seguridad de la evaluación mediante la detección introducen varianza irrelevante para el constructo en lugar de evidencia sobre quien aprende.
Los costes de diseño y de carga de trabajo
Las fuentes son inusualmente francas en que esto es caro. Thapa y Lewis formulan la advertencia de equidad directamente: las tareas reflexivas y dialógicas pueden privilegiar al estudiantado con más confianza en la autoexpresión académica, a menos que se diseñen de forma inclusiva y con andamiaje, y el trabajo relacional e intensivo en retroalimentación intensifica el esfuerzo emocional y profesional del profesorado en contextos grandes o con recursos limitados, una contradicción con las expectativas institucionales de escalabilidad, estandarización y desempeño medible. Sharma añade la versión interpretativa: exigir razonamiento documentado privilegia a Quienes aprenden con más fluidez en el discurso reflexivo, y el juicio como evidencia «sigue siendo relacional y situado en lugar de verificable mecánicamente».
Los costes operativos se detallan en otros lugares. Boysen enumera tecnología nueva, tareas y programas revisados, enseñar al estudiantado habilidades que no conoce y material adicional que recoger y calificar, advierte de que los créditos de bajo riesgo por el proceso pueden inflar las calificaciones y concede que el modelo se adapta mucho mejor a grandes proyectos de desarrollo de habilidades que al trabajo cotidiano de adquisición de conocimiento; también señala que el seguimiento del proceso es lo que algunos críticos llaman vigilancia con IA. Los participantes de Goldstein, Marae-Haj y Zidan informaron de que establecer la documentación del proceso costaba trabajo real, de que nueve de trece financiaron herramientas avanzadas de su propio bolsillo de un modo que podía profundizar la brecha digital, y de que varios recurrieron a exámenes supervisados y anticiparon defensas orales de tesis. La preocupación por la equidad tiene un matiz específico de la IA en el hallazgo de Brunnström y Palmqvist de que el uso de la herramienta sin guía exige una habilidad de gestión de la interacción que se distribuye de forma desigual, de modo que la IA «puede beneficiar sobre todo al estudiantado ya aventajado»: el mismo riesgo distributivo que conlleva pedir al estudiantado que gestione un proceso documentado. Lopez-López, Bru-Cordero y Correa-Álvarez (2026) encontraron que el estudiantado que invirtió más tiempo de estudio independiente juzgaba el uso de IA con más severidad, y recomiendan probar si las plantillas de divulgación, las defensas orales y la evaluación basada en el proceso reducen la incertidumbre ética: un estudio que el campo todavía necesita.
Lo que sigue sin resolverse
El relato de Thapa y Lewis es conceptual: sin participantes, sin recogida de datos y sin ensayo de implementación, de modo que los cuatro principios se argumentan y no se prueban, y el propio artículo reclama trabajo empírico sobre la experiencia del estudiantado, la carga de trabajo del profesorado y la viabilidad a largo plazo. La factibilidad queda sin diferenciar entre contextos: no se aborda la transferencia a clases magistrales grandes, laboratorios, estudios o prácticas clínicas. El documento de posición de Lane (2026) señala el techo institucional: la evaluación basada en el proceso se ve amortiguada por estructuras de calificación y expedientes académicos que recompensan artefactos finales pulidos, de modo que el rediseño del aula por sí solo no cambia el incentivo. La medición también es escasa: la revisión de Jin y sus colegas (2026) sobre instrumentos de alfabetización en IA reclama evaluación basada en el desempeño y orientada al proceso y medición de rastros conductuales del diseño de prompts y la verificación, pero informa de que los instrumentos existentes se apoyan en el autoinforme. Ninguna fuente aquí informa de un ensayo controlado de un rediseño orientado al proceso frente a uno orientado al producto, lo que deja la afirmación central —que la evidencia de proceso es a la vez más difícil de falsificar y más justa de juzgar— argumentada desde principios, informes de profesionales y evidencia de expedientes de casos, y no demostrada a escala.
Conceptos conectados
- Evaluación
- Evaluación auténtica
- Detección de IA
- Validez de la evaluación
- Juicio evaluativo
- Evaluación formativa
- Evaluación sumativa
- Retroalimentación
- Autoevaluación
- Evaluación oral
- Portafolio electrónico
- Declaraciones de uso y divulgación de la IA
- Aprendizaje autorregulado
- Integridad académica
- Equidad
Artículos conectados
- Preserving epistemic authenticity: process-oriented assessment in the age of generative AI — autenticidad epistémica y los cuatro compromisos de diseño detrás de la evaluación orientada al proceso (Thapa y Lewis 2026)
- Distinguishing performance gains from learning when using generative AI — el desempeño no es el aprendizaje: una agenda de investigación construida sobre medidas de proceso (Yan et al. 2026)
- AIED's Unfinished Mission: Centering Agency and Motivation in the Age of Effortless Bypass — amplificar la evaluación basada en el proceso como una de las cinco prioridades de AIED (Lane 2026)
- AI-interaction literacy: reflections on how generative AI might be used to support self-regulated learning in higher education — la evaluación de caja negra y la trayectoria de aprendizaje en los exámenes para llevar a casa (Brunnström y Palmqvist 2026)
- The Safety Gap: Restoring Productive Struggle Through Pedagogically Aligned Generative AI — la brecha de seguridad y la priorización de la evaluación basada en el proceso en la educación médica (Wang y Shan 2026)
- Human-centered AI for teacher educators: Designing professional learning for critical AI literacy — formadores de docentes que piden tareas resistentes a la IA y basadas en el proceso, construidas sobre la justificación y la reflexión (Baran et al. 2026)
- Pioneering Teacher Educators Navigating AI Integration in Pre-Service Teacher Preparation: Strategies and Challenges — prompts, historial de versiones, contribuciones monitorizadas y diarios de viaje tras una crisis de confianza (Goldstein et al. 2026)
- Academic Integrity in the Age of AI: University Students' Study Practices and Ethical Judgments — prácticas de estudio, juicios éticos y el argumento para probar defensas orales y evidencia de proceso
- The LEARN Framework for Responsible Use of Generative AI in Education: A Neuroscience-Informed Model for Problem-Based Learning — el marco LEARN: rúbricas centradas en el proceso, justificaciones orales, entregas por etapas (Uden y Hwang 2026)
- Generative AI as a Didactic-Pedagogical Mediator: Rethinking Human Roles and Pedagogical Design in Higher Education — la evaluación orientada al proceso y transparente en el uso de IA como proposición investigable (Moganadas et al. 2026)
- Is using artificial intelligence tools for academic work cheating? Student perceptions, ethics, and the impact — historial de revisiones, patrones de interacción y tiempo en la tarea con divulgación (Padhy 2026)
- Mapping the Integration of AI into Business Education: Insights from a Decade of Research — una década de investigación en educación en negocios convergiendo hacia tareas de proceso visible
- Measuring Artificial Intelligence Literacy: A Systematic Review of Instrument Development, Conceptual Foundations, and Psychometric Quality — la agenda de medición: evaluación basada en el desempeño y orientada al proceso (Jin et al. 2026)
- A Proposal for Open Learning Practices in Response to Generative Artificial Intelligence — borradores e historiales de versiones documentados como registro de proceso auditable (Boysen 2026)
- Educational integrity in GenAI-augmented assessment: making judgment visible — rastros de decisión anotados, defensa oral y diferencias entre borradores elegidos por el juicio visible
- How strong is the evidence in generative AI-related academic misconduct allegations? A mixed-methods analysis — qué contienen los expedientes de casos de mala conducta y qué evidencia de proceso les falta
- Which inference is at risk? Assessment validity reasoning and generative AI — qué inferencia está en riesgo cuando se sustituye la evidencia de evaluación
- Beyond Detection: Redesigning Authentic Assessment in an AI-Mediated World — la autenticidad debe rediseñarse, no vigilarse
- From authentic products to authenticated processes: a systematic conceptual review of authentic assessment in AI-rich — productos auténticos y los procesos que los produjeron
- Reconsidering the Use of Oral Exams and Assessments: An Old Way to Move Into a New Future — el examen oral como formato resistente a la IA que hace vivo el razonamiento
Recursos relacionados
- Process FeedbackA free, process-based alternative to AI detection: it records how a piece of writing was produced and turns that into a report for a conversation about learning rather than a verdict.