Capítulo 17 · Razonamiento · 9 min

Pensar antes de responder

Tokens de pensamiento, razonamiento extendido, presupuestos de reflexión. Cómo los modelos de razonamiento generan una cadena de pensamiento oculta antes de responder.

La respuesta rápida suele ser falsa

¿Cuál es el último dígito de 7¹⁰⁰?

Si le haces esa pregunta a un LLM clásico, probablemente te responderá "7" en una fracción de segundo. Tiene sentido: 7 empieza por 7, 7² = 49, y si no piensas demasiado, podrías suponer que sigue siendo 7. Esa respuesta es falsa — es 1.

Pero si le haces la misma pregunta a un modelo de razonamiento, duda. "Piensa" durante 10, 20, a veces 60 segundos. Y llega a la respuesta correcta. OpenAI abrió esa vía con o1 a finales de 2024, DeepSeek-R1 la hizo pública a principios de 2025; hoy todos los grandes modelos tienen un modo de este tipo.

La diferencia no está en la arquitectura — es el mismo Transformer. Está en cómo se entrenó el modelo, y en lo que se le permite hacer antes de responder.

Los thinking tokens

Todo LLM genera tokens, uno a la vez, de izquierda a derecha. Lo que distingue a los modelos de razonamiento es que primero generan una larga secuencia de tokens de trabajo — un monólogo interno — antes de producir la respuesta final. Según el proveedor, lo ves entero, ves solo un resumen, o no lo ves en absoluto.

Esos tokens ocultos se llaman thinking tokens (o tokens de reflexión).

El modelo puede escribir cualquier cosa ahí: cálculos intermedios, hipótesis que luego refuta, ramas de exploración abandonadas, verificaciones. Es un borrador que borra antes de mostrarte el resultado limpio.

No es magia. Es simplemente espacio adicional para resolver un problema difícil.

Pruébalo tú mismo

Pon el presupuesto de reflexión en "Ninguno" y haz clic en "Razonar". Observa la respuesta instantánea. Después, cambia el presupuesto a "Completo" y vuelve a lanzarlo.

Los bloques en gris son la cadena de pensamiento interna — el modelo hipotetiza, verifica, a veces retrocede. Estos thinking tokens cuestan en latencia y precio, pero desbloquean problemas que el modo directo no resuelve.

La diferencia entre los dos no está en la capacidad del modelo — está en el tiempo de cómputo en inferencia que se le permite usar.

Cómo funciona técnicamente

No es una arquitectura diferente. Es el mismo Transformer, el mismo mecanismo de atención, la misma generación autoregresiva.

Lo que cambia es el entrenamiento y el decodificado. Y al contrario de lo que se imagina, no se le enseñan miles de razonamientos bien redactados para que los imite.

Se hace algo más astuto: se le deja buscar. El modelo produce sus propios intentos, se verifica mecánicamente cuáles llegan al resultado correcto — un cálculo se comprueba, un programa pasa sus tests — y se refuerzan los caminos que funcionaron. Nadie escribió esos razonamientos: el modelo los encontró, y nos quedamos con los que llegaban a buen puerto. Es el RLVR descrito en el capítulo 08. DeepSeek incluso demostró con R1-Zero que un modelo puede desarrollar esas estrategias partiendo de cero, sin un solo ejemplo de razonamiento anotado.

En inferencia, se le da un presupuesto de tokens de pensamiento — un límite de cuántos tokens ocultos puede generar. Cuanto mayor es el presupuesto, más puede explorar. A partir de cierto presupuesto, las mejoras de calidad en tareas difíciles empiezan a estancarse.

Un detalle importante: los thinking tokens se generan antes de la respuesta, en el mismo flujo de tokens. El modelo no "piensa" en paralelo — piensa en serie, y eso cuesta tokens como todo lo demás.

Razonamiento extendido vs chain-of-thought

Quizás hayas visto la técnica del chain-of-thought (CoT), donde se le pide explícitamente al modelo "piensa paso a paso". Es algo distinto, pero emparentado.

Chain-of-Thought (prompted)Razonamiento extendido (nativo)
Quién lo activaEl usuario, en el promptEl propio modelo
VisibilidadVisible en la respuestaOculto (thinking tokens)
ControlEl usuario puede guiar los pasosEl modelo elige su plan
EjemplosGPT-4 con "let's think step by step"o1, o3, Claude con extended thinking

El CoT prompted también mejora el rendimiento — pero el razonamiento nativo va más allá, porque el modelo no está obligado a escribir un razonamiento legible. Puede explorar caminos sucios, hacer cálculos que luego descarta, contradecirse y autocorregirse, todo dentro del espacio oculto.

Cuándo vale la pena

El razonamiento extendido mejora significativamente el rendimiento en:

  • Matemáticas y lógica — pruebas, combinatoria, aritmética exacta
  • Código complejo — depuración multi-archivo, algoritmos no triviales
  • Razonamiento estructurado — puzzles, deducciones encadenadas
  • Planificación — tareas que requieren trazar una estrategia antes de actuar

En cambio, para una pregunta factual simple ("¿cuál es la capital de Francia?"), texto creativo o traducción, el razonamiento extendido no aporta nada — y cuesta más.

Sobre las alucinaciones (capítulo 13), el efecto hay que matizarlo, porque la intuición engaña. Donde el razonamiento ayuda de verdad es en los errores verificables: un cálculo mal hecho, una deducción coja, un caso olvidado. El modelo despliega, se relee, se corrige.

En la factualidad pura — un nombre, una fecha, una cita — la ganancia no está garantizada. OpenAI publicó sus propias mediciones mostrando que o3 alucinaba más que su predecesor en algunas pruebas de conocimiento. Pensar más rato no hace aparecer una información que el modelo no tiene: solo le da más espacio para construir una historia coherente alrededor de lo que cree saber.

El coste es el verdadero freno. Los thinking tokens se facturan como los tokens normales. Un modelo que genera 1 000 tokens de pensamiento antes de una respuesta de 30 tokens te factura 1 030. Sobre millones de peticiones, eso suma.

Test-time compute scaling

Lo que han revelado los modelos de razonamiento es que se puede comprar inteligencia en el momento de la inferencia: cuantos más tokens de pensamiento se asignen, mejor son las respuestas en tareas difíciles.

Esto se llama test-time compute scaling — en contraposición al scaling habitual que aumenta los parámetros del modelo durante el entrenamiento.

La curva se parece a las scaling laws clásicas: doblar el presupuesto de reflexión mejora el rendimiento, pero con rendimientos decrecientes. En cierto punto, pensar más tiempo deja de compensar.

Y este es un descubrimiento importante: la inteligencia de un LLM no es una constante fija marcada por sus pesos. También depende del cómputo que se le da en el momento de responder.

Un modelo que piensa largo y duro sobre un problema difícil puede superar a un modelo más grande que responde rápido. La velocidad no siempre es una virtud.

Pero "pensar mucho rato" significa, en concreto, generar miles de tokens uno a uno antes siquiera de empezar la respuesta. Y en el capítulo 09 vimos que cada token debe mirar a todos los que le preceden. Si el token número mil tuviera que releerlo todo desde el principio, ninguno de estos modos de razonamiento sería facturable. ¿Qué hace que el token número mil sea tan rápido como el segundo? El siguiente capítulo abre el capó de la inferencia.

Actualizado el