Capítulo 13 · Alucinaciones · 9 min

Por qué los LLMs inventan

Calibración, certezas falsas, contramedidas. El mecanismo estructural detrás de la crítica más frecuente — y qué se puede hacer al respecto.

La crítica más frecuente

Le haces a un LLM una pregunta sobre un tema puntual. Te responde con aplomo: una referencia bibliográfica, una fecha, una cita. Verificas. El libro no existe. La fecha es falsa. La cita es inventada.

Este fenómeno tiene un nombre oficial — hallucination — y probablemente es lo primero que se le reprocha a los LLMs. No un bug ocasional: una propiedad estructural. Para entender por qué, hay que volver a la forma en que el modelo fue entrenado.

Tres mecanismos que se combinan

1. La cross-entropy no recompensa la incertidumbre. Durante el pre-entrenamiento (capítulo 06), el objetivo es minimizar la log-probabilidad negativa del token correcto — dicho de otro modo, maximizar la probabilidad que le asigna. En ningún momento el modelo aprende a decir "no sé": aprende a predecir siempre algo, lo más plausible posible. Si la respuesta correcta no está en sus pesos, produce la cadena más verosímil, no una admisión de ignorancia.

2. El RLHF recompensa la confianza más que la honestidad. Durante el alineamiento (capítulo 08), humanos clasifican las respuestas. En promedio, prefieren una respuesta confiada y bien formulada a un "no estoy seguro". El reward model aprende ese sesgo, y el LLM aprende a parecer seguro — incluso cuando no lo está.

3. Sin bucle de verificación interna. Un humano que inventa una cita se detiene, duda, va a verificar. Un LLM que genera token a token no tiene ese mecanismo. Avanza, sin control externo, y cada token engendra el siguiente bajo la misma lógica de plausibilidad.

Una alucinación no es un bug. Es lo que pasa cuando un sistema entrenado para siempre producir texto plausible se topa con una pregunta cuya respuesta no está en sus pesos.

El problema de calibration

Un modelo bien calibrado es aquel cuya confianza expresada coincide con la probabilidad de estar en lo correcto. Si dice "estoy seguro al 80%", debería tener razón aproximadamente el 80% de las veces.

Los LLMs en bruto (antes del RLHF) están sorprendentemente bien calibrados sobre sus probabilidades internas. Pero el alineamiento descalibra el modelo: al recompensar la confianza, lo aleja de la verdad estadística de sus propias predicciones.

Eso explica el modo "alucina con aplomo": no es que el modelo no sepa que no sabe. Es que su entrenamiento lo empujó a enmascarar esa incertidumbre.

Elige una pregunta abajo y compara dos cifras: la confianza expresada por el modelo y la probabilidad real de que tenga razón. Quédate primero en modo Bruto, luego activa + RAG o + Razonamiento y mira cómo se mueve la brecha.

El modelo asigna una probabilidad a cada una de sus afirmaciones. Una afirmación falsa pero coherente recibe a menudo un score alto: ese es el mecanismo estructural de las alucinaciones, no un bug puntual que un parche pueda corregir.

La brecha entre esas dos cifras es toda la historia de este capítulo. En una pregunta factual corriente es prácticamente nula — el modelo sabe, y su confianza lo refleja. En una pregunta cuya respuesta no está en sus pesos, la confianza expresada se mantiene alta mientras la probabilidad real se desploma: eso es exactamente una alucinación, vista por dentro. Y te darás cuenta de que las contramedidas reducen la brecha sin llegar nunca a cerrarla. Quédate con ese punto, porque manda sobre todo lo que sigue: las alucinaciones no se suprimen, se contienen.

Cuatro familias de contramedidas

Las alucinaciones no desaparecen con un mejor alineamiento. Son estructurales. Para reducirlas en la práctica, hacen falta palancas sistémicas, no solo un mejor modelo.

1. Conectar el modelo a herramientas (capítulo 11)

La regla: todo lo que un LLM hace mal, lo delegamos a un sistema determinístico. ¿Calcular una derivada? Code interpreter. ¿Recuperar una cotización bursátil? API. ¿Verificar que un archivo existe? File system tool. El modelo ya no intenta adivinar el resultado — lo observa.

Efecto: las alucinaciones sobre los dominios cubiertos por las herramientas se desploman — sin desaparecer del todo, porque el modelo todavía puede formular mal la llamada o leer mal el resultado. Las alucinaciones sobre los demás dominios se mantienen.

2. RAG (capítulo 10)

En vez de preguntarle al modelo lo que recuerda sobre un tema, le damos fuentes fiables en el momento de responder. Las alucinaciones bibliográficas o factuales disminuyen mucho, porque el modelo puede citar lo que lee, no solo lo que imagina.

Límite: si las fuentes son malas o están mal recuperadas, el modelo alucina sobre su contenido. E incluso con buenas fuentes, puede sobre-extrapolar ("la fuente dice X, así que forzosamente Y").

3. Razonamiento extendido (capítulo 17)

Un modelo que se toma el tiempo de verificar su borrador antes de responder se equivoca menos. Los modelos de razonamiento generan una cadena de pensamiento invisible, en la que pueden recalcular, contradecir un paso, partir de otra pista. o1 y DeepSeek-R1 abrieron el camino en 2024-2025; hoy todos los grandes modelos ofrecen un modo de este tipo.

Es imperfecto — un modelo puede alucinar dentro de su razonamiento también — pero el simple hecho de desplegar los pasos atrapa una parte significativa de los errores.

4. Fine-tuning explícito sobre la incertidumbre

El ángulo más prometedor del lado de la investigación: entrenar al modelo para la abstention. Se le muestran pares (pregunta, respuesta) donde, cuando la probabilidad interna es baja, la respuesta correcta es "no sé" o "no tengo esa información". El modelo aprende a reconocer su propio nivel de confianza, y a comunicarlo.

El artículo "Why Language Models Hallucinate" (OpenAI, 2025) popularizó la explicación del atasco: nuestras evaluaciones son binarias — acierto o fallo — y no dan ni un punto por un "no lo sé". Adivinar renta siempre más que abstenerse. Desde entonces, el entrenamiento a la abstención y a la calibración ha entrado en las recetas de post-entrenamiento de los grandes labs (OpenAI, Anthropic, DeepMind). Los avances son medibles, pero el problema no está resuelto: mientras los benchmarks premien el farol, los modelos farolearán.

Detectar una alucinación en la práctica

Algunas heurísticas útiles del lado del usuario:

  • Pide fuentes. Si el modelo no puede citar sus fuentes, o las inventa, trata la respuesta como sospechosa.
  • Verifica lo que es preciso. Los nombres propios, fechas, cifras exactas, citas son las zonas de riesgo. El contenido general suele estar OK.
  • Reformula la pregunta de otra manera. Un modelo que inventa suele dar respuestas coherentes a la misma pregunta reformulada — pero incoherentes a reformulaciones muy diferentes.
  • Pregúntale al modelo su nivel de confianza. Imperfecto, pero correlacionado con la calidad real de la respuesta, sobre todo en los modelos recientes.
  • Cruza con otro modelo. Las alucinaciones rara vez son las mismas de un modelo a otro. Una respuesta sobre la que convergen dos modelos de familias distintas tiene muchas más probabilidades de ser correcta.

Lo que hay que retener

Tres cosas.

Una. Las alucinaciones no son un defecto del modelo: son la consecuencia de su objetivo de entrenamiento. Ningún fine-tuning superficial las hace desaparecer.

Dos. Las contramedidas que funcionan en producción son sistémicas (RAG, herramientas, razonamiento, abstention). Ninguna es perfecta aislada; combinadas, llevan la tasa de alucinación a un nivel aceptable para la mayoría de los casos.

Tres. Para el usuario final, la mejor defensa sigue siendo no confiar a ciegas, sobre todo en los detalles precisos (fuentes, fechas, cifras). Un LLM que te responde con aplomo no es prueba de que tenga razón.

Preguntarle a un LLM "¿estás seguro?" no es una verificación. Es solo otra generación de texto plausible.

De estas cuatro contramedidas, solo una toca al modelo en sí: reentrenarlo, para la abstención o para cualquier otra cosa. Pero reentrenar por completo un modelo de 70 mil millones de parámetros cuesta decenas de miles de dólares — y nadie hace eso para ajustar un tono o cubrir un dominio. ¿Cómo se especializa un modelo sin tocarlo de verdad? El siguiente capítulo responde.

Actualizado el