Capítulo 01 · Fundamentos · 6 min
Prever uma palavra de cada vez
O que é um modelo de linguagem? Por que prever a próxima palavra é suficiente para fazer emergir a inteligência.
A grande surpresa
Aqui está a coisa mais estranha da IA moderna: tudo o que um grande modelo de linguagem faz se apoia em uma única capacidade — prever a próxima palavra.
Você dá o começo de uma frase:
"O céu é azul porque..."
O modelo calcula, entre as dezenas de milhares de fragmentos de palavras que conhece, qual é o mais provável logo depois. Depois recomeça com essa nova palavra adicionada. E de novo. E de novo. Só isso.
Dessa operação minúscula e mecânica emerge todo o resto: tradução, resumo, código, explicações de física quântica, piadas, poemas.
Por que funciona
Para prever bem a próxima palavra, é preciso entender muita coisa sobre o mundo.
Considere esta frase:
"O médico mandou a enfermeira para casa dela porque ela..."
Para adivinhar o que vem depois, o modelo precisa saber que "ela" provavelmente se refere à enfermeira (e não ao médico): precisa entender a gramática, o contexto, talvez até as convenções sociais da profissão médica.
Prever palavras significa modelar o mundo que as produziu.
Essa é a ideia central. Obrigar um sistema a prever texto humano em larga escala significa obrigá-lo a aprender, indiretamente, como funciona o mundo em que esse texto foi escrito.
Uma distribuição, não uma palavra
Quando dizemos "o modelo prevê a próxima palavra", é um atalho. Na verdade, a cada passo ele produz uma distribuição de probabilidade sobre todo o vocabulário: cada token recebe uma pontuação, e a soma vale 1.
Para gerar texto, depois é preciso escolher um token dessa distribuição. Aqui as coisas ficam interessantes: o mesmo modelo, com o mesmo prompt, pode produzir textos muito diferentes dependendo da estratégia de amostragem usada.
A cada passo, o modelo propõe uma distribuição sobre todos os tokens do vocabulário. A barra mais alta raramente é o único candidato plausível — é isso que torna a continuação do texto aberta em vez de mecânica.
Três controles para manipular acima:
- Temperatura — divide os logits — as pontuações brutas que o modelo atribui a cada token, antes de qualquer normalização — e depois os passa pelo softmax, a função que transforma essas pontuações em probabilidades cuja soma vale 1. Com temperatura baixa (0.1-0.3), a distribuição se concentra no candidato mais provável: o modelo fica previsível, quase determinístico. Com temperatura alta (1.5-2.0), ela se achata: opções mais incomuns voltam a ser plausíveis.
- Top-k — mantém apenas os k candidatos mais prováveis, eliminando a longa cauda de opções raras.
- Top-p (nucleus sampling) — mantém o menor conjunto cuja massa acumulada passa de p. É mais esperto que top-k: se um passo tem uma resposta óbvia, p pode cortar para um único candidato. Se o modelo hesita entre 20 opções próximas, ele mantém todas.
Teste o prompt Capital. A distribuição está tão concentrada em Brasília que a temperatura quase não tem efeito: é preciso subir acima de 1.8 para dar chance a outras opções. O modelo está seguro.
Ao contrário, em O céu no segundo passo, várias continuações são plausíveis ( luz, cor, mar...). É ali que a temperatura muda de verdade o resultado.
O ciclo que faz tudo
Tudo o que um LLM faz cabe neste ciclo:
- Ler o contexto (os tokens já presentes).
- Produzir uma distribuição de probabilidade sobre o próximo token.
- Amostrar um token dessa distribuição.
- Adicioná-lo ao contexto. Recomeçar.
É mecânico, repetitivo, chato de descrever. Ainda assim, executado bilhões de vezes em um modelo com centenas de bilhões de parâmetros, esse ciclo produz diálogos, demonstrações, código que compila.
O plano do site
O percurso está organizado em quatro partes, do mais mecânico ao mais acabado.
I. Anatomia de um modelo (cap. 2 a 6). Vamos desmontar a máquina. Tokenização, embeddings, atenção, Transformer, treinamento — como o texto vira uma sequência de vetores, e como bilhões de parâmetros aprendem a manipulá-los.
II. Responder como um assistente (cap. 7 a 9). Amostragem, alinhamento, memória do contexto — o que separa um completador de texto bruto de algo com quem se pode conversar.
III. O modelo em produção (cap. 10 a 14). O que acontece de verdade quando você envia um prompt. RAG, agentes, prompt engineering, alucinações, fine-tuning — a engenharia que torna os LLMs úteis no dia a dia, e o que ainda quebra.
IV. Indo mais longe (cap. 15 a 21). Os temas que ocupam a pesquisa. Multimodalidade, avaliação, raciocínio estendido, KV cache, leis de escala, interpretabilidade, difusão — para entender para onde isso vai.
Cada capítulo contém pelo menos uma visualização manipulável. O objetivo não é fazer você decorar fórmulas, mas dar uma intuição mecânica do que acontece por dentro.
Vamos.
Atualizado em