Capítulo 08 · Alineamiento · 9 min
Del modelo bruto al asistente
Fine-tuning, RLHF, IA constitucional. Cómo hacer que un LLM sea útil e inofensivo.
Un completador no es un asistente
Después del pre-entrenamiento, el modelo sabe continuar texto. Pero "continuar texto" no es lo mismo que "ayudar a una persona".
Si escribes una pregunta, un modelo bruto puede continuar con otra pregunta, repetir el estilo de un foro, inventar una respuesta insegura o completar una instrucción peligrosa. No tiene todavía la noción de conversación útil.
Compara las dos columnas de abajo en los tres prompts. Empieza por la pregunta abierta y termina por la petición problemática: ahí es donde la diferencia habla más alto.
Tres prompts idénticos, dos modelos: a la izquierda el modelo crudo, a la derecha el mismo tras fine-tuning supervisado y RLHF. El crudo continúa el texto; el alineado responde — y rechaza las solicitudes problemáticas.
Lo que hay que ver: el modelo crudo nunca es incorrecto. Hace exactamente aquello para lo que fue entrenado — continuar un texto plausible. En la petición problemática no "decide" ser peligroso: completa como lo haría cualquier página de su corpus. Todo lo que parece intención en la columna de la derecha — responder, estructurar, rechazar — se añadió después. Ese "después" es justo lo que vamos a detallar ahora.
Varias etapas sucesivas
El alineamiento moderno se hace en varias fases apiladas sobre el pre-entrenamiento.
1. Instruction tuning (SFT)
El primer paso es el instruction tuning: entrenar el modelo con ejemplos del tipo:
instrucción → respuesta esperada
En vez de aprender solo "qué token viene después", aprende que una instrucción humana suele pedir una respuesta directa, clara y estructurada.
No cambia la arquitectura. Cambia los datos y, por tanto, el comportamiento.
Es la primera etapa del paso de GPT-3 a InstructGPT (2022), el antepasado directo de ChatGPT. La diferencia es espectacular: el modelo por fin empieza a responder. Ojo, eso sí: ese salto no viene del SFT solo, sino de su encadenamiento con la etapa siguiente.
2. RLHF
El RLHF añade una señal humana.
Se generan varias respuestas para el mismo prompt. Personas las comparan: ¿cuál es más útil, más honesta, más segura? Con esas preferencias se entrena un modelo de recompensa, y luego se ajusta el LLM para producir respuestas que ese modelo prefiera.
La idea no es hacer al modelo "bueno" en sentido filosófico. Es darle una dirección de comportamiento: sigue instrucciones, evita daño, explica límites.
2bis. DPO: PPO, en más simple
El RLHF tal como lo acabamos de describir se apoya en un algoritmo de RL (PPO) pesado de entrenar: reward model aparte, inestabilidad numérica, coste de cómputo enorme.
En 2023, un equipo de Stanford propone DPO (Direct Preference Optimization). La idea: cortocircuitar el reward model y el paso de RL. Matemáticamente se puede derivar una simple loss supervisada que optimiza directamente el LLM para que prefiera la respuesta "ganadora" a la "perdedora" en cada par de comparaciones.
En concreto, partiendo de los mismos pares (prompt, respuesta_A_mejor_que_respuesta_B) que usaba el RLHF clásico, DPO entrena el modelo en una sola pasada — como un fine-tuning supervisado clásico. Sin reward model aparte, sin PPO, sin inestabilidad.
El resultado es casi indistinguible de PPO-RLHF en los benchmarks, por una fracción del coste. A partir de 2023-2024, DPO y sus variantes (IPO, KTO, ORPO) se vuelven la norma para la parte de "preferencias humanas", en Llama, Mistral y la mayoría de los labs open source.
2ter. La vuelta del RL, con un juez que no se equivoca
Durante un tiempo se creyó que DPO había matado al reinforcement learning. Ha pasado justo lo contrario.
El problema del RLHF es su juez: un reward model que imita preferencias humanas. Es aproximado, tiene sus sesgos, y un modelo espabilado aprende rápido a explotarlo — a escribir respuestas que le gustan al juez sin ser mejores.
Pero para ciertas tareas no hace falta un juez aproximado. Un programa pasa sus tests unitarios o no los pasa. Un cálculo está bien o está mal. Un teorema se verifica. En esas tareas se puede sustituir el reward model por una verificación automática — es lo que se llama RLVR (reinforcement learning from verifiable rewards).
El modelo produce intentos, se comprueba mecánicamente cuáles funcionan, y se refuerzan los caminos que llegan a buen puerto. Ya no hay juez al que engañar: la recompensa es la realidad. DeepSeek-R1 hizo famoso el enfoque en enero de 2025, con algoritmos como GRPO, más ligeros que PPO.
El pipeline moderno apila por tanto las tres etapas:
| Etapa | Lo que aprende | Su juez |
|---|---|---|
| SFT | Responder en vez de completar | Respuestas escritas por humanos |
| DPO (o variantes) | El tono, el formato, lo que gusta | Preferencias humanas, aprendidas |
| RLVR (GRPO...) | Razonar bien en matemáticas y código | Un verificador automático |
Sigues leyendo "RLHF" en todas partes: se ha vuelto un término genérico para "todo lo que se le hace al modelo después del pre-entrenamiento". Bajo el capó es un apilamiento — y es la última capa la que explica los avances recientes en razonamiento. Volvemos a ello en el capítulo 17.
3. RLAIF / Constitutional AI
Una variante: en vez de humanos, se usa otro modelo (a menudo el mismo) para dar el feedback según una constitución escrita — un conjunto de principios ("no des instrucciones ilegales", "no inventes fuentes", "explica tu razonamiento cuando sea útil"...). Es lo que se llama Constitutional AI.
Ventajas: escalable (los humanos son caros y lentos), reproducible (la constitución es explícita), modificable (se pueden ajustar los principios sin reanotar todo).
Es el procedimiento que usa Anthropic para Claude, y que muchos otros laboratorios han adoptado desde entonces.
Seguridad y rechazos
Un asistente alineado también debe saber decir no. Esa parte es delicada:
- rechazar instrucciones claramente dañinas
- no rechazar preguntas legítimas por exceso de prudencia
- proponer alternativas seguras cuando sea posible
Un buen rechazo no es una pared. Es una redirección: "no puedo ayudar con eso, pero si el problema real es X, aquí tienes una opción segura".
Por qué los LLMs alucinan
Es probablemente la crítica más frecuente que se hace a los LLMs: inventan hechos con aplomo. Una referencia bibliográfica que no existe, una cita que nunca se pronunció, un evento deformado. ¿Por qué?
Se combinan tres mecanismos.
1. La cross-entropy no recompensa la incertidumbre. Durante el pre-entrenamiento (capítulo 06), el modelo aprende a minimizar la log-probabilidad del token correcto. En ningún momento aprende a decir "no sé" — el objetivo es siempre predecir algo. Si la respuesta correcta no está en sus parámetros, produce la cadena más plausible al olfato.
2. El RLHF recompensa la confianza más que la honestidad. Cuando los humanos anotan preferencias, en promedio prefieren una respuesta confiada y bien formulada antes que un "no estoy seguro, no sé". El reward model aprende ese sesgo, y el LLM aprende a parecer seguro, incluso cuando no lo está.
3. Sin bucle de verificación interna. Un humano que inventa se detiene, duda, verifica. Un LLM que genera token a token no tiene ese mecanismo de forma nativa — avanza, sin control externo.
Por eso las alucinaciones no desaparecen con un alineamiento más refinado. Son estructurales. Las contramedidas eficaces son sistémicas:
- Conectar el modelo a herramientas (capítulo 11) — calcular en vez de estimar, consultar una base en vez de memorizar.
- RAG (capítulo 10) — proveer fuentes fiables en lugar de depender de la memoria de los parámetros.
- Razonamiento extendido (capítulo 17) — un modelo que se toma el tiempo de pensar alucina menos.
- Fine-tuning explícito sobre la incertidumbre — enseñar al modelo a decir "no sé" cuando su probabilidad interna es baja (investigación activa).
Una alucinación no es un bug del modelo. Es lo que pasa cuando un sistema entrenado para siempre producir texto plausible se topa con una pregunta cuya respuesta no está en sus pesos.
Fin de la parte II
Acabas de recorrer todo el pipeline interno de un LLM moderno, desde los bytes brutos del texto hasta el comportamiento alineado:
- 01 — Predecir la siguiente palabra, una y otra vez.
- 02 — Tokenizar el texto.
- 03 — Embeber cada token en un espacio de sentido.
- 04 — Dejar que los tokens se miren entre sí vía la atención.
- 05 — Apilar bloques Transformer.
- 06 — Entrenar por descenso de gradiente.
- 07 — Muestrear la siguiente palabra.
- 08 — Alinear con las preferencias humanas.
Ninguno de estos mecanismos es misterioso por sí solo. Ninguno, aislado, basta para explicar lo que ves cuando un LLM resume un artículo científico o escribe un soneto: la inteligencia emerge de su composición a gran escala.
El milagro no está en una sola de las piezas. Está en la cadena entera, multiplicada por miles de millones de parámetros y entrenada sobre billones de tokens.
¿Y ahora?
El modelo está listo. Sabe predecir, razonar, seguir instrucciones. Pero entre él y la experiencia que tienes cuando usas ChatGPT o Claude, queda toda una infraestructura: la ventana de contexto que define lo que recuerda, el RAG que le da acceso a tus documentos, los agentes que lo conectan a herramientas.
Es el tema de la parte III — El modelo en producción.
Y más allá, la parte IV — Ir más lejos entra en los temas de investigación actuales: fine-tuning, multimodalidad, razonamiento extendido, leyes de escalado, interpretabilidad, difusión.
El pipeline está puesto. Lo que sigue es todo lo que construimos encima.
Actualizado el