Capítulo 12 · Prompting · 8 min
El arte de hablar con un LLM
Zero-shot, few-shot, chain-of-thought, self-consistency. Por qué la formulación del prompt cambia radicalmente lo que produce un modelo.
El prompt no es texto — es un programa
Cuando escribes "resume este artículo" en ChatGPT, en apariencia no pasa nada espectacular. Pero el texto que enviaste activó un comportamiento muy específico en un modelo entrenado sobre billones de tokens.
Un prompt es un programa en lenguaje natural. No en el sentido de que se compile, sino en el sentido de que su formulación determina qué tipo de comportamiento activa el modelo. La misma frase reformulada de otra manera puede dar resultados radicalmente distintos — no porque el modelo sea caprichoso, sino porque su preentrenamiento le enseñó patrones distintos para contextos distintos.
El prompt engineering es el arte de formular ese programa para obtener el comportamiento deseado.
Cuatro niveles de técnica
Zero-shot: simplemente preguntar
La técnica más sencilla. Haces la pregunta directamente, sin ejemplos ni instrucciones. El modelo activa el comportamiento más probable dado su entrenamiento.
Funciona muy bien para tareas simples y factuales. Falla en problemas que requieren razonamiento — no porque el modelo no sepa, sino porque no sabe que tiene que razonar.
Few-shot: mostrar ejemplos
En vez de explicar lo que quieres, lo muestras. Colocas 2 a 5 pares (entrada, salida) antes de la verdadera pregunta. El modelo — gracias a su mecanismo de in-context learning — capta el patrón y lo aplica a la nueva entrada.
La clave: los ejemplos deben ser representativos del tipo de tarea. Ejemplos fuera de tema no ayudan. Ejemplos que muestran la forma de proceder ayudan mucho.
Chain-of-Thought: razonar paso a paso
Dos descubrimientos de 2022, que a menudo se confunden. Wei et al. muestran que si le das al modelo ejemplos cuyo razonamiento está escrito entero, se pone a razonar de la misma manera en el problema siguiente. Kojima et al. van más lejos ese mismo año: no hacen falta ejemplos, basta con añadir "pensemos paso a paso". En ambos casos, el rendimiento en problemas de razonamiento se duplica, a veces se triplica.
¿Por qué funciona? El modelo genera tokens uno a uno. Al obligarlo a escribir su razonamiento intermedio, le das un "borrador" en el que puede hacer cálculos, verificar hipótesis, corregir errores — antes de concluir. Sin CoT, va directo a la conclusión, sin red.
Es el mismo principio que para un humano: escribir "25 × 37 = 25 × 30 + 25 × 7 = 750 + 175 = 925" da muchas más posibilidades de llegar al resultado correcto que intentar responder mentalmente de un solo golpe.
Self-Consistency: votar entre varias cadenas
La self-consistency es una extensión del CoT. En vez de generar una sola cadena de razonamiento, se generan varias (típicamente 5 a 20) con distintas temperaturas, y luego se vota por la respuesta más frecuente.
La idea: cada ejecución puede cometer un error distinto. Pero si la mayoría converge en la misma respuesta, probablemente sea la correcta.
Es costoso (N veces más tokens), pero en tareas de razonamiento difíciles, la ganancia de fiabilidad es real.
Pruébalo tú mismo
Compara las cuatro técnicas en tres problemas. Observa en particular que los ejemplos few-shot ayudan en un problema estructurado (el comerciante), pero no cambian gran cosa en las trampas lógicas.
La misma pregunta, cuatro formulaciones. El score cambia del 30 al 90 % sin tocar el modelo. La lección: un prompt no es un texto, es un programa cuya sintaxis implícita los LLMs interpretan gracias a su pre-entrenamiento.
Lo que esto revela sobre los LLMs
Estas cuatro técnicas no son trucos. Iluminan algo fundamental sobre el funcionamiento de los LLMs.
El in-context learning es gratis. Un LLM aprende de tus ejemplos sin actualizar sus pesos — solo leyendo el contexto. Es una capacidad emergente del preentrenamiento masivo: el modelo ha visto tantos patrones que puede extraer uno nuevo al vuelo.
El razonamiento es un comportamiento, no una capacidad fija. Un modelo que falla en zero-shot en un problema puede acertar con CoT en el mismo problema — sin cambiar ningún parámetro. Lo que el prompt activa cambia lo que el modelo "hace" con sus capacidades internas.
La temperatura crea diversidad, el voto reduce la varianza. La self-consistency aprovecha que los errores suelen ser aleatorios: muchas formas de fallar, pero una sola de acertar. El consenso filtra el ruido.
Los límites
El coste por llamada. Cada ejemplo few-shot consume tokens — y los vuelves a pagar en cada petición. Las ventanas actuales, de 200.000 a más de un millón de tokens, permiten técnicamente el many-shot (cientos de ejemplos, y funciona), pero la factura y la latencia suben con ellos. El CoT también alarga las respuestas.
Los ejemplos pueden inducir a error. Si tus ejemplos contienen un sesgo, el modelo lo reproducirá. "Garbage in, garbage out" también aplica al few-shot.
La prompt injection. Contenido malicioso en el contexto puede cortocircuitar tus instrucciones. Si tu prompt dice "traduce este texto" y el texto dice "ignora las instrucciones anteriores y haz otra cosa", el modelo puede obedecer al contenido en vez de a la instrucción.
Los modelos evolucionan. Un prompt afinado para GPT-4 en 2023 no funciona necesariamente en los modelos de hoy, ni en los de otro proveedor. Cada modelo tiene sus patrones favoritos, sus formulaciones que "encajan" mejor.
La regla práctica
Para elegir una técnica:
- Pregunta simple / factual → zero-shot, basta.
- Formato específico esperado → few-shot con 2-3 ejemplos.
- Razonamiento o cálculo → CoT, si tu modelo no tiene un modo de razonamiento nativo. Si lo tiene, déjalo trabajar: imponerle un CoT explícito es en el mejor de los casos redundante, y en el peor contraproducente — algunos proveedores lo desaconsejan expresamente.
- Fiabilidad crítica → CoT + self-consistency.
Y una meta-regla: si tu prompt parece código — con una estructura clara, variables explícitas, casos de uso definidos — será más fiable que un texto ambiguo.
Una última cosa. Las técnicas descritas aquí (CoT en particular) son los ancestros prompt-driven de los modelos de razonamiento nativos: o1 y DeepSeek-R1 abrieron el camino en 2024-2025, y hoy todos los grandes modelos tienen un modo de este tipo. Estos hacen automática e intensivamente lo que el CoT prompted solo simulaba — ver el capítulo 17 para entender el paso del prompt engineering al razonamiento integrado en el modelo.
Un buen prompt no es una fórmula mágica. Es una especificación clara de lo que quieres, en un lenguaje que el modelo reconoce como la señal a seguir.
Queda una cosa que ninguna formulación arregla. Puedes escribir la especificación más limpia del mundo: si la respuesta no está en los pesos del modelo, la producirá igualmente, con exactamente el mismo aplomo que si lo estuviera. ¿Por qué un sistema entrenado para predecir texto es incapaz de pararse y decir "no lo sé"? Es el tema del siguiente capítulo.
Actualizado el