Capítulo 15 · Multimodalidad · 8 min

Cuando el modelo lee imágenes

Patch embedding, ViT, CLIP. Cómo un Transformer de texto se vuelve multimodal tratando una imagen como una cuadrícula de tokens.

Una imagen también puede ser tokens

Un Transformer no exige palabras. Exige una secuencia de vectores.

Para aplicar la misma arquitectura a imágenes, podemos cortar la imagen en pequeños cuadrados, convertir cada cuadrado en un vector y alimentar la secuencia al modelo. Es la idea de los Vision Transformers.

Nota sobre el alcance de este capítulo. Aquí hablamos de modelos que comprenden imágenes (las describen, responden a preguntas, leen un gráfico). Para los modelos que generan imágenes a partir de un texto — Stable Diffusion, DALL-E, Midjourney — la arquitectura es diferente y es el tema del capítulo 21.

La imagen se divide en patches cuadrados, y cada patch se convierte en un token mediante una proyección lineal. El Transformer ya no sabe si la entrada es texto o una rejilla de imágenes — procesa la secuencia de la misma forma.

El compromiso salta a la vista en cuanto mueves el control: patches más pequeños dan una imagen mejor definida, pero el número de tokens se dispara — y como la atención cuesta O(n²) (capítulo 04), dividir por dos el tamaño de los patches cuadruplica el número de tokens y multiplica el coste por dieciséis. Ese es exactamente el arbitraje que hace cada modelo de visión: patches suficientes para leer un gráfico, no tantos como para arruinar la inferencia.

Patches

Una imagen de 224×224 píxeles puede dividirse en patches de 16×16. Eso produce 14×14 = 196 patches, y por tanto 196 tokens visuales.

Cada patch se aplana primero: 16 × 16 × 3 canales de color = 768 valores puestas en una sola lista. Esa lista pasa después por una proyección lineal aprendida — una matriz entrenada junto con el resto del modelo — que la convierte en un vector de embedding. No es, por tanto, una media de los píxeles: no se aplasta nada, la disposición interna del patch se conserva en el vector. Pero la representación sigue siendo muy local: ese vector no sabe nada de lo que pasa en el resto de la imagen. La posición indica dónde estaba el patch.

Es la atención entre todos esos vectores la que reconstruye las relaciones espaciales, detecta los bordes, reconoce las formas. El modelo no tiene ningún concepto integrado de "círculo" o de "cara" — los descubre estadísticamente.

Texto e imagen juntos

Un modelo multimodal puede mezclar tokens de texto y tokens visuales en una misma secuencia:

[tokens de imagen] + [tokens de texto] → respuesta

La atención permite que una palabra mire una región de la imagen, y que una región visual influya en una palabra generada.

Los modelos multimodales actuales — la generación de GPT-4V, Claude 3 y Gemini abrió el camino en 2023-2024, y hoy todos los grandes modelos saben hacerlo — funcionan así: los tokens de patches se concatenan a los tokens de texto en una única secuencia. A partir de ahí no hay que hacer nada especial: la self-attention de siempre deja que cada palabra mire cada trozo de imagen, y al revés. Eso es lo que hace el enfoque tan económico — ninguna maquinaria dedicada, se reutiliza el Transformer tal cual.

Existe una variante en la que la imagen se queda en una secuencia aparte y el texto la consulta por atención cruzada (es la elección de Flamingo, o de Llama 3.2 Vision). Más modular, pero menos sencilla.

Coste

Más resolución significa más patches. Y más patches significa más tokens. Como la atención cuesta O(n²), duplicar la resolución puede aumentar mucho el coste.

Por eso los sistemas multimodales usan trucos: compresión visual, resoluciones adaptativas, selección de regiones, modelos especializados.

¿Y el audio?

El mismo principio — convertir una modalidad en secuencia de tokens — se aplica a la voz. El modelo de OpenAI Whisper (2022) sigue siendo la referencia en open source para la transcripción habla→texto — los modelos nativamente multimodales lo hacen ya mejor, pero son cerrados. Su arquitectura es un Transformer encoder-decoder, exactamente como un modelo de traducción.

El truco: se transforma la señal audio en un espectrograma Mel — una imagen 2D donde el eje vertical es la frecuencia y el horizontal el tiempo. Cada pequeño cuadrado de ese espectrograma se convierte en un token de entrada, igual que los patches de ViT para las imágenes. Whisper produce después tokens de texto a la salida.

Para la generación vocal (text-to-speech), el principio se invierte: se generan tokens de audio a partir de texto. ElevenLabs, OpenAI TTS, Suno (para música) usan todos Transformers entrenados para predecir el siguiente token de audio. La voz clonada de un ser querido es exactamente la tokenización de unos minutos de grabación usados como condicionamiento.

El salto vino de los modelos de voz nativamente multimodales, inaugurados por GPT-4o realtime y Gemini Live en 2024. Estos modelos ya no hacen el ida y vuelta texto ↔ audio internamente: razonan directamente en un espacio que mezcla tokens de texto y tokens de audio. De ahí una latencia baja (~300 ms) y una prosodia natural — el modelo puede sonreír mientras habla, porque nunca abandonó el dominio audio.

La distinción importa, porque muchos asistentes de voz no lo son. El modo de voz de Claude, por ejemplo, encadena tres piezas separadas: transcripción, luego modelo de texto, luego síntesis de voz. Funciona muy bien, pero el modelo nunca percibe tu voz — solo el texto que se ha sacado de ella.

Como ocurre con la visión, la arquitectura subyacente sigue siendo un Transformer. La única diferencia está en la modalidad del token.

Lo siguiente

Ya vimos cómo el modelo predice, aprende, usa contexto, herramientas y datos multimodales. Queda una pregunta difícil: ¿cómo sabemos si realmente es bueno?

Y se vuelve cada vez más incómoda. Un mismo modelo lee texto, describe una foto, transcribe una voz y escribe código: ¿sobre qué se decide que es mejor que otro? Hace falta una nota — y toda nota es una reducción. El siguiente capítulo mira lo que los benchmarks miden de verdad, y sobre todo lo que forzosamente dejan pasar.

Necesitamos evaluarlo.

Actualizado el