En esta página

Esta página está traducida al español. Las páginas de artículo siguen escritas en inglés. Leer esta página en inglés

Traducción automática de la página en inglés, todavía sin revisar por una persona hablante nativa.

Un modelo de propósito general responderá con gusto la pregunta de un estudiante en su lugar, y no sabe nada de su plan de estudios, su rúbrica ni de los errores que sus estudiantes cometen en realidad. Cerrar esa brecha suele plantearse como un problema de entrenamiento. En esta base de conocimiento es sobre todo un problema de fundamentación y prompting, y la evidencia de ese orden es inusualmente directa: un estudio sobre un asistente de curso encontró que la recuperación, y no el modelo, era la decisión de primer orden, y que un modelo general sin fundamentación obtuvo una puntuación por debajo de una línea base TF-IDF.

El entrenamiento es real y a veces necesario, pero es la tercera o cuarta cosa que conviene probar, no la primera. Lo que sigue es la escalera en el orden que evita desperdiciar cómputo.

La versión corta

Hay cinco palancas, en orden creciente de coste y compromiso: el prompting, la recuperación sobre sus propios materiales, la adaptación eficiente en parámetros (LoRA y similares), el ajuste fino completo y el post-entrenamiento con señales de preferencia o recompensa. Cada peldaño cuesta más datos, más cómputo y más disciplina de evaluación que el anterior, y cada uno es una peor primera opción salvo que una medición justifique la subida.

La literatura de investigación informa sobre todo de la parte alta de esa escalera, y por eso es fácil recurrir al entrenamiento cuando la fundamentación habría bastado.

Paso 1: Obtenga una línea base que pueda superar de verdad

Antes de cambiar nada, registre lo que obtiene con un prompt simple. Después registre lo que obtiene un método trivial, porque ese es el número que le mantiene honesto.

El estudio del asistente de base de conocimiento del curso merece leerse solo por esto. Un LLM local sin recuperación alcanzó un 52.3% de precisión. Una línea base TF-IDF —un método léxico de hace décadas— alcanzó el 55.4%. El modelo era peor que el método clásico.

Si se salta este paso no podrá saber si su ajuste fino ayudó, y puede acabar publicando algo que una búsqueda por palabras clave supera.

Paso 2: Fundamente el modelo en sus propios materiales

Añadir generación aumentada por recuperación sobre los materiales del curso, sin ningún ajuste fino, elevó ese mismo sistema del 52.3% al 66.6%. Es la mayor ganancia única que se reporta en esta base de conocimiento para su coste, y es reversible: cuando sus documentos cambien, vuelve a indexar en lugar de reentrenar.

Otros dos resultados apuntan en la misma dirección. Una revisión PRISMA de 23 estudios empíricos sobre personalización de la IA para la enseñanza de la escritura encontró predominio del prompt engineering (N = 13), por delante del ajuste fino (N = 7) (Customizing AI for writing pedagogy: a systematic review of pedagogical goals, theoretical principles, and technical design). Y cuando una base de conocimiento tiene que mantenerse actualizada, la recuperación es la única palanca que se mantiene actual sin volver a ejecutar un entrenamiento.

La recuperación también tiene una forma pedagógica. Fundamentar un modelo en sus propios ejemplos resueltos y rúbricas es lo que hace que se mantenga dentro del andamiaje que usted diseñó en lugar de derivar hacia consejos genéricos.

Paso 3: Trabaje el prompt contra una rúbrica

El trabajo de prompt no es un preliminar que se hace mientras se espera para entrenar. Dos resultados muestran lo que consigue por sí solo:

La señal práctica es la meseta. En el estudio de generación de ítems, el refinamiento iterativo del prompt dejó de mejorar, y el ajuste fino de GPT-4.1 sobre el prompt optimizado añadió entonces la ganancia restante (How to Train Your Dragon: Evaluating Prompting and Fine-Tuning for GPT-Based Item Generation in L2 Listening Assessment). Una meseta tras un trabajo real de prompt es su evidencia de que el entrenamiento podría aportar algo. Recurrir al entrenamiento antes de haber llegado a una es adivinar.

Paso 4: Adapte el modelo cuando el objetivo sea estable y específico

La adaptación compensa cuando necesita que el modelo mantenga una propiedad de forma fiable: un nivel de lectura, un formato de salida, un dominio que desconoce. El resultado recurrente es que apuntar bien gana al tamaño.

Fíjese en la palabra estable del título. El formato, la rúbrica, el nivel de lectura y el vocabulario del dominio son objetivos estables. La prosa cargada de juicio no lo es, y ahí es donde falla la adaptación.

Paso 5: Cambie cómo se comporta, no solo lo que produce

La adaptación enseña al modelo qué producir. El post-entrenamiento le enseña cómo comportarse, y para la tutoría esa distinción es todo el problema: los modelos generales se post-entrenan con preferencia humana por la utilidad, lo que significa responder con prontitud, mientras que enseñar exige retener la respuesta.

Aquí es donde viven los resultados educativos más sólidos. El modelo de recompensa de EduQwen priorizó explícitamente las respuestas que guían por encima de las respuestas directas, y su pipeline de tres etapas alcanzó un 96.52% en el benchmark CDPK frente al 90.55% de Gemini-3 Pro (Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised). El simulador de escritura SWIM pasó del prompting guiado por rúbrica (mejor QWK 0.577) al ajuste fino supervisado (0.474 ± 0.023) y al aprendizaje por refuerzo (0.618 ± 0.005) en todos los rasgos y prompts (SWIM: Student Writing Simulation via Proficiency-Conditioned Generation).

Un hallazgo de esta área es fácil de pasar por alto y caro de ignorar: la calidad de la supervisión gana a la cantidad. Los modelos ajustados con instrucciones aprendieron errores conceptuales de álgebra solo cuando se entrenaron con trazas de solución paso a paso; entrenados solo con respuestas finales, la precisión se mantuvo por debajo del 30% en todos los tamaños de datos (Misconception Acquisition Dynamics in Large Language Models). Si sus ejemplos de entrenamiento son pares de pregunta y respuesta correcta, está entrenando lo que no es.

Cuando adaptar el modelo no ayuda

Esta es la parte que el entusiasmo suele saltarse.

Qué exige en la práctica

Para el peldaño de la adaptación, el listón es más bajo de lo que la mayoría de los equipos supone: unos cientos o unos miles de ejemplos y una sola GPU. LoRA entrena un número pequeño de parámetros añadidos y deja congelados los pesos base, de modo que varios modelos pueden servirse desde un único adaptador.

El rango es un compromiso y no un dial que haya que maximizar: la ganancia por millón de parámetros del adaptador cayó de forma monótona al subir el rango, y la alineación a nivel de curso fue una decisión de escala y rango y no una mejora gratuita (LoRA Fine-Tuned Models for Control Systems Course Q&A: A Multidimensional Evaluation of Model Scale and Rank Effects). Qué capas adaptar es también una decisión real: actualizar solo las cuatro últimas capas Transformer de un analizador de discurso basado en BERT superó tanto adaptar solo la capa superior como el ajuste fino de las 12 capas (Automatic discourse relation classification and feedback optimization in English teaching based on transformer BERT model).

El coste que es fácil subestimar es la evaluación, no el cómputo. Véase ¿Cómo sabemos que una IA educativa funciona correctamente y no solo que puntúa bien?

Calibre lo que espera

La elección de modelo y de prompt juntas explican solo alrededor del 15% del desajuste entre los LLM y las ganancias de aprendizaje del estudiantado, y en ese estudio la ponderación por benchmark y los ensembles de voto unánime hicieron la alineación peor (Knowledge without Wisdom: Measuring Misalignment between LLMs and Intended Impact). Los datos de preentrenamiento son la palanca dominante sobre cómo se comporta un modelo, y es la única palanca que no puede accionar.

Eso no es un argumento contra el trabajo anterior. Es un argumento contra esperar que un ajuste fino arregle un problema de diseño. Si el problema es que su tutor responde con demasiada facilidad, el entrenamiento puede abordarlo. Si el problema es que su estudiantado no se implica, el entrenamiento no lo hará.

Un orden de decisión breve

1. Registre una línea base solo con prompt, incluida una trivial. 2. Añada recuperación sobre sus propios materiales. 3. Trabaje el prompt de forma iterativa contra su rúbrica y vigile la meseta. 4. Adapte el modelo con LoRA cuando el objetivo sea un formato, una rúbrica, un nivel o un dominio estables. 5. Post-entrene solo cuando necesite cambiar cómo se comporta, y escriba la recompensa contra un benchmark, porque se va a explotar. 6. Supervise a nivel de paso, no de respuesta. 7. Mantenga a una persona en el circuito donde la confianza sea baja. 8. Pruebe la seguridad en conversaciones completas, no en turnos sueltos.

Preguntas relacionadas

Preguntas frecuentes relacionadas

Incrustar esta página

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.