Capítulo 11 · Agentes · 10 min

Del modelo que responde al modelo que actúa

Tool use, bucle ReAct, tareas multi-paso. Cómo un LLM se convierte en un agente capaz de actuar en el mundo.

Pensar, actuar, observar

Un agente no es un modelo más inteligente por definición. Es un modelo colocado dentro de un bucle donde puede decidir una acción, llamar una herramienta, observar el resultado y continuar.

Observa el bucle: el modelo piensa, elige una herramienta, lee su resultado, vuelve a empezar. Cada ciclo es una nueva predicción de token — el «agente» emerge de un LLM al que se le enseñó a llamar funciones, no de una nueva arquitectura.

Lo que hay que retener: en ningún momento el modelo ejecuta nada. Produce texto — una reflexión, y luego una llamada de herramienta bien formada — y es el sistema que lo rodea el que ejecuta de verdad la llamada y le devuelve el resultado. La otra cosa visible en pantalla es que el contexto no para de engordar: cada vuelta le añade el pensamiento, la llamada y la observación. Un agente no es, por tanto, un nuevo tipo de modelo. Es un bucle de predicción de tokens en el que se reinyecta el mundo exterior en cada vuelta — y esas dos propiedades explican todo el resto del capítulo, del formato de las herramientas hasta los riesgos.

El ciclo ReAct

El patrón clásico se llama ReAct: Reason + Act.

  1. El modelo razona sobre el siguiente paso.
  2. Produce una acción estructurada: llamar una herramienta, buscar, calcular.
  3. El sistema ejecuta esa acción.
  4. El resultado vuelve al contexto.
  5. El modelo decide si necesita otro paso o si puede responder.

El modelo no ejecuta la herramienta dentro de sus pesos. Solo escribe una llamada que el programa alrededor interpreta.

Por qué funciona

Un LLM es bueno para lenguaje, planificación aproximada y transformación de información. Es malo para aritmética exacta, datos en tiempo real y acciones externas.

Las herramientas compensan esas debilidades:

  • calculadora para números exactos
  • buscador para información reciente
  • base de datos para datos internos
  • API para actuar en un sistema

El agente combina lenguaje y ejecución.

Riesgos

Dar herramientas a un modelo también aumenta el riesgo:

  • puede elegir la herramienta equivocada
  • puede interpretar mal una observación
  • puede entrar en bucles
  • puede ejecutar acciones demasiado amplias
  • puede caer en el reward hacking: si el objetivo está mal especificado, encuentra atajos inesperados para maximizar su puntuación sin hacer lo que de verdad queríamos

Por eso un agente serio necesita límites: permisos, validaciones, logs, confirmaciones humanas para acciones sensibles.

MCP: hacia un estándar para herramientas

Al principio, cada proveedor definía su propio formato de tool use: OpenAI tenía function calling, Anthropic sus bloques tool_use / tool_result, cada framework agéntico reinventaba la rueda. Formatos públicos y documentados, pero cada uno el suyo. El resultado: incompatibilidades, integraciones rehechas para cada modelo, ecosistema fragmentado.

En noviembre de 2024, Anthropic publica el Model Context Protocol (MCP): un estándar abierto para describir herramientas, recursos y prompts de manera independiente del modelo. Un servidor MCP expone un conjunto de herramientas (por ejemplo "leer este archivo", "consultar esta base de datos"). Cualquier cliente compatible con MCP — Claude Desktop, Cursor, extensiones VSCode, frameworks agénticos — puede conectarse a él.

La analogía que vuelve a menudo: MCP es a los LLMs lo que USB-C es a los periféricos. Un enchufe común.

La adopción fue rápida: OpenAI, Microsoft y la mayoría de los proveedores grandes anunciaron en 2025 su compatibilidad con MCP. Se ha vuelto el protocolo estándar de facto para tool use.

Code interpreter, sandboxes, computer use

Algunas clases de herramientas particularmente importantes:

Code interpreter. Un sandbox Python (a veces JavaScript) donde el modelo puede ejecutar código arbitrario. Cálculos precisos, manipulación de datos, generación de gráficos — todo lo que los LLMs hacen mal de forma nativa lo pueden delegar a Python. Disponible en OpenAI, Claude, Google.

Browser / web automation. Una herramienta que da al modelo la capacidad de hacer clic, scroll, rellenar formularios en páginas web. Anthropic lo llama computer use, y OpenAI abrió camino a principios de 2025 con Operator — un producto aparte, integrado después en ChatGPT. Hoy todos los grandes proveedores ofrecen un modo de este tipo. Aún frágil, pero la evolución es rápida.

File system & shell. Una herramienta que da acceso a un disco virtual, a un terminal. Corazón de los "coding agents" como Cursor, Cline, Aider, Claude Code.

Memoria a largo plazo

El contexto de un agente crece, pero sigue acotado. ¿Cómo te reconoce un asistente en la conversación siguiente? Con una memoria a largo plazo externa.

Varias aproximaciones:

  • Memoria vectorial — cada interacción importante se resume y se almacena como embedding. En cada nueva conversación, se recuperan los recuerdos relevantes (RAG, versión memoria).
  • Perfil de usuario estructurado — el agente actualiza un dossier sobre el usuario (preferencias, proyectos en curso, historial).
  • Memoria procedural — el agente guarda traza de las recetas que funcionaron ("para resumir un paper, sigue estos pasos").

ChatGPT introdujo una memoria en 2024, Claude en 2025. Es uno de los frentes más activos en el diseño agéntico.

Lo siguiente

Otra forma de adaptar un modelo no es darle herramientas, sino cambiar una pequeña parte de sus pesos para un dominio concreto. Es el fine-tuning, y en particular LoRA.

Actualizado el