Preguntas frecuentes
¿Cómo podemos hacer que la IA apoye mejor el aprendizaje en nuestra propia materia?
Traducción automática de la página en inglés, todavía sin revisar por una persona hablante nativa.
Un modelo de propósito general responderá con gusto la pregunta de un estudiante en su lugar, y no sabe nada de su plan de estudios, su rúbrica ni de los errores que sus estudiantes cometen en realidad. Cerrar esa brecha suele plantearse como un problema de entrenamiento. En esta base de conocimiento es sobre todo un problema de fundamentación y prompting, y la evidencia de ese orden es inusualmente directa: un estudio sobre un asistente de curso encontró que la recuperación, y no el modelo, era la decisión de primer orden, y que un modelo general sin fundamentación obtuvo una puntuación por debajo de una línea base TF-IDF.
El entrenamiento es real y a veces necesario, pero es la tercera o cuarta cosa que conviene probar, no la primera. Lo que sigue es la escalera en el orden que evita desperdiciar cómputo.
La versión corta
Hay cinco palancas, en orden creciente de coste y compromiso: el prompting, la recuperación sobre sus propios materiales, la adaptación eficiente en parámetros (LoRA y similares), el ajuste fino completo y el post-entrenamiento con señales de preferencia o recompensa. Cada peldaño cuesta más datos, más cómputo y más disciplina de evaluación que el anterior, y cada uno es una peor primera opción salvo que una medición justifique la subida.
La literatura de investigación informa sobre todo de la parte alta de esa escalera, y por eso es fácil recurrir al entrenamiento cuando la fundamentación habría bastado.
Paso 1: Obtenga una línea base que pueda superar de verdad
Antes de cambiar nada, registre lo que obtiene con un prompt simple. Después registre lo que obtiene un método trivial, porque ese es el número que le mantiene honesto.
El estudio del asistente de base de conocimiento del curso merece leerse solo por esto. Un LLM local sin recuperación alcanzó un 52.3% de precisión. Una línea base TF-IDF —un método léxico de hace décadas— alcanzó el 55.4%. El modelo era peor que el método clásico.
Si se salta este paso no podrá saber si su ajuste fino ayudó, y puede acabar publicando algo que una búsqueda por palabras clave supera.
Paso 2: Fundamente el modelo en sus propios materiales
Añadir generación aumentada por recuperación sobre los materiales del curso, sin ningún ajuste fino, elevó ese mismo sistema del 52.3% al 66.6%. Es la mayor ganancia única que se reporta en esta base de conocimiento para su coste, y es reversible: cuando sus documentos cambien, vuelve a indexar en lugar de reentrenar.
Otros dos resultados apuntan en la misma dirección. Una revisión PRISMA de 23 estudios empíricos sobre personalización de la IA para la enseñanza de la escritura encontró predominio del prompt engineering (N = 13), por delante del ajuste fino (N = 7) (Customizing AI for writing pedagogy: a systematic review of pedagogical goals, theoretical principles, and technical design). Y cuando una base de conocimiento tiene que mantenerse actualizada, la recuperación es la única palanca que se mantiene actual sin volver a ejecutar un entrenamiento.
La recuperación también tiene una forma pedagógica. Fundamentar un modelo en sus propios ejemplos resueltos y rúbricas es lo que hace que se mantenga dentro del andamiaje que usted diseñó en lugar de derivar hacia consejos genéricos.
Paso 3: Trabaje el prompt contra una rúbrica
El trabajo de prompt no es un preliminar que se hace mientras se espera para entrenar. Dos resultados muestran lo que consigue por sí solo:
- El prompting guiado por rúbrica, co-refinado de forma iterativa, elevó la concordancia entre LLM y personas en el trabajo de diseño del estudiantado del 54.75% al 81.25% (alfa de Cronbach 0.393 → 0.798), sin ningún ajuste fino (From evaluation to emulation: LLMs as agents of iterative pedagogical design).
- Un prompt personalizado fundamentado en la literatura provocó los errores conceptuales matemáticos objetivo con una presencia de 0.98, frente a 0.40 de un prompt genérico (Integrating ChatGPT in Mathematics Teacher Education: AI-Based Simulation Role-Playing to Support Practice-based Teaching).
La señal práctica es la meseta. En el estudio de generación de ítems, el refinamiento iterativo del prompt dejó de mejorar, y el ajuste fino de GPT-4.1 sobre el prompt optimizado añadió entonces la ganancia restante (How to Train Your Dragon: Evaluating Prompting and Fine-Tuning for GPT-Based Item Generation in L2 Listening Assessment). Una meseta tras un trabajo real de prompt es su evidencia de que el entrenamiento podría aportar algo. Recurrir al entrenamiento antes de haber llegado a una es adivinar.
Paso 4: Adapte el modelo cuando el objetivo sea estable y específico
La adaptación compensa cuando necesita que el modelo mantenga una propiedad de forma fiable: un nivel de lectura, un formato de salida, un dominio que desconoce. El resultado recurrente es que apuntar bien gana al tamaño.
- Tres modelos 8B ajustados sobre un currículo de lectura infantil diseñado por especialistas superaron a GPT-4o y Llama 3.3 70B en modo zero-shot en métricas relacionadas con la dificultad, con problemas de seguridad insignificantes. Los autores lo formulan como controlabilidad frente a escala (Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety).
- Un conjunto de instrucciones de 24,795 ejemplos fundamentado en los sistemas de conocimiento indios produjo un ajuste fino de 7B con una puntuación de 6.39 en un panel externo de cinco jueces, a 0.15 de un modelo de referencia general fuerte y a una fracción del coste de despliegue, mientras que el mismo modelo base puntuó cerca de cero en dimensiones específicas del dominio sin el ajuste fino (IKS-Instruct: A 24,000-Example Multilingual Dataset for Teaching Language Models Indian Knowledge Systems). Esa brecha entre «competente en general» y «competente aquí» es todo el argumento a favor de la adaptación de dominio.
- Un único adaptador LoRA entrenado con unos 3,900 ejemplos calificados agrupados llevó a cinco modelos abiertos pequeños (4B–30B) a la paridad o mejor con un calificador humano en dos exámenes de informática (Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams). Un adaptador, un conjunto de datos, varios modelos base: esa es la forma de un despliegue que un equipo pequeño puede ejecutar de verdad.
Fíjese en la palabra estable del título. El formato, la rúbrica, el nivel de lectura y el vocabulario del dominio son objetivos estables. La prosa cargada de juicio no lo es, y ahí es donde falla la adaptación.
Paso 5: Cambie cómo se comporta, no solo lo que produce
La adaptación enseña al modelo qué producir. El post-entrenamiento le enseña cómo comportarse, y para la tutoría esa distinción es todo el problema: los modelos generales se post-entrenan con preferencia humana por la utilidad, lo que significa responder con prontitud, mientras que enseñar exige retener la respuesta.
Aquí es donde viven los resultados educativos más sólidos. El modelo de recompensa de EduQwen priorizó explícitamente las respuestas que guían por encima de las respuestas directas, y su pipeline de tres etapas alcanzó un 96.52% en el benchmark CDPK frente al 90.55% de Gemini-3 Pro (Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised). El simulador de escritura SWIM pasó del prompting guiado por rúbrica (mejor QWK 0.577) al ajuste fino supervisado (0.474 ± 0.023) y al aprendizaje por refuerzo (0.618 ± 0.005) en todos los rasgos y prompts (SWIM: Student Writing Simulation via Proficiency-Conditioned Generation).
Un hallazgo de esta área es fácil de pasar por alto y caro de ignorar: la calidad de la supervisión gana a la cantidad. Los modelos ajustados con instrucciones aprendieron errores conceptuales de álgebra solo cuando se entrenaron con trazas de solución paso a paso; entrenados solo con respuestas finales, la precisión se mantuvo por debajo del 30% en todos los tamaños de datos (Misconception Acquisition Dynamics in Large Language Models). Si sus ejemplos de entrenamiento son pares de pregunta y respuesta correcta, está entrenando lo que no es.
Cuando adaptar el modelo no ayuda
Esta es la parte que el entusiasmo suele saltarse.
- Texto cargado de juicio. En WrAFT, el mismo proyecto que se ajustó con éxito para calificar ensayos (QWK 0.84) produjo una salida truncada e ilegible cuando se ajustó para retroalimentar, mientras que promptear directamente Claude 3.7 produjo la retroalimentación que el profesorado valoró mejor (WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays). El ajuste fino enseñó al modelo a acertar una nota; no le enseñó a escribir.
- La escala no es un predictor fiable del rendimiento posterior bajo adaptación LoRA, y hiperparámetros idénticos produjeron comportamientos de adaptación cualitativamente distintos según la arquitectura (AiAWE: An Open-Source LLM Automated Writing Evaluation System Using LoRA-Adapted Instruction-Tuned Models). Una receta que funcionó en un modelo no es una receta.
- La arquitectura puede importar más que el número de parámetros. El ajuste fino de tres modelos abiertos de texto a imagen sobre 1,000 imágenes de ingeniería nuclear con leyendas mejoró sustancialmente Stable Diffusion XL, dio ganancias limitadas para SD-v3.5-Medium y no produjo ninguna mejora medible en Flux.1 (NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts).
- A veces la respuesta es validar en lugar de entrenar. Un GPT-4 de frontera sin entrenar produjo aproximadamente un 35% de pistas demasiado generales, incorrectas o que revelaban la respuesta al redactar retroalimentación para tutoría, y sus propias comprobaciones automáticas de calidad discreparon del juicio humano (Generating In-Context, Personalized Feedback for Intelligent Tutors with Large Language Models).
Qué exige en la práctica
Para el peldaño de la adaptación, el listón es más bajo de lo que la mayoría de los equipos supone: unos cientos o unos miles de ejemplos y una sola GPU. LoRA entrena un número pequeño de parámetros añadidos y deja congelados los pesos base, de modo que varios modelos pueden servirse desde un único adaptador.
El rango es un compromiso y no un dial que haya que maximizar: la ganancia por millón de parámetros del adaptador cayó de forma monótona al subir el rango, y la alineación a nivel de curso fue una decisión de escala y rango y no una mejora gratuita (LoRA Fine-Tuned Models for Control Systems Course Q&A: A Multidimensional Evaluation of Model Scale and Rank Effects). Qué capas adaptar es también una decisión real: actualizar solo las cuatro últimas capas Transformer de un analizador de discurso basado en BERT superó tanto adaptar solo la capa superior como el ajuste fino de las 12 capas (Automatic discourse relation classification and feedback optimization in English teaching based on transformer BERT model).
El coste que es fácil subestimar es la evaluación, no el cómputo. Véase ¿Cómo sabemos que una IA educativa funciona correctamente y no solo que puntúa bien?
Calibre lo que espera
La elección de modelo y de prompt juntas explican solo alrededor del 15% del desajuste entre los LLM y las ganancias de aprendizaje del estudiantado, y en ese estudio la ponderación por benchmark y los ensembles de voto unánime hicieron la alineación peor (Knowledge without Wisdom: Measuring Misalignment between LLMs and Intended Impact). Los datos de preentrenamiento son la palanca dominante sobre cómo se comporta un modelo, y es la única palanca que no puede accionar.
Eso no es un argumento contra el trabajo anterior. Es un argumento contra esperar que un ajuste fino arregle un problema de diseño. Si el problema es que su tutor responde con demasiada facilidad, el entrenamiento puede abordarlo. Si el problema es que su estudiantado no se implica, el entrenamiento no lo hará.
Un orden de decisión breve
1. Registre una línea base solo con prompt, incluida una trivial. 2. Añada recuperación sobre sus propios materiales. 3. Trabaje el prompt de forma iterativa contra su rúbrica y vigile la meseta. 4. Adapte el modelo con LoRA cuando el objetivo sea un formato, una rúbrica, un nivel o un dominio estables. 5. Post-entrene solo cuando necesite cambiar cómo se comporta, y escriba la recompensa contra un benchmark, porque se va a explotar. 6. Supervise a nivel de paso, no de respuesta. 7. Mantenga a una persona en el circuito donde la confianza sea baja. 8. Pruebe la seguridad en conversaciones completas, no en turnos sueltos.
Preguntas relacionadas
- ¿Cómo entrenamos a un tutor de IA para que guíe a los estudiantes en lugar de responderles? — la mitad de post-entrenamiento en detalle
- ¿Cómo sabemos que una IA educativa funciona correctamente y no solo que puntúa bien? — cómo saber si algo de esto funcionó
- ¿Cuáles son las buenas prácticas para desarrollar un tutor de IA eficaz? — la cara de diseño de interacción del mismo objetivo
- ¿Cuáles son las buenas prácticas y consejos para diseñar software educativo de IA eficaz?
- Entrenamiento y ajuste fino de LLM — la página de concepto completa
Preguntas frecuentes relacionadas
- ¿Cómo entrenamos a un tutor de IA para que guíe a los estudiantes en lugar de responderles?
- ¿Cómo sabemos que una IA educativa funciona correctamente y no solo que puntúa bien?
- ¿Cuáles son las buenas prácticas para desarrollar un tutor de IA eficaz?
- ¿Cuáles son las mejores prácticas y consejos para diseñar software educativo de IA eficaz?