Engenharia de Contexto: A Janela Não É o Gargalo
Todo mundo está atrás de uma janela de contexto maior. A habilidade que importa é decidir o que o modelo nunca deve ver. Notas sobre atenção, julgamento e a disciplina da curadoria.
Há algumas semanas, tentei deixar o Jarvis mais inteligente dando mais coisa pra ele trabalhar. Mais histórico. Mais documentos. A pilha inteira, carregada de uma vez, tudo que ele poderia precisar pra me responder bem.
Ficou pior.
Mais lento. Mais vago. Confiantemente errado sobre coisas que tinha acertado na semana anterior, com muito menos. Eu tinha dado a ele um cérebro maior e ganhado um colega pior.
Foi aí que a ficha caiu. O gargalo nunca foi o quanto o modelo conseguia segurar. Era o quanto eu estava pedindo pra ele segurar de uma vez só. Eu tinha confundido memória com atenção... e é na distância entre essas duas palavras que a maioria dos sistemas de IA desmorona em silêncio.

A Mesa, Não o Depósito
A janela de contexto é a memória de trabalho do modelo. Tudo que ele consegue "ver" num único instante, ou seja, o seu prompt, os documentos, o histórico, a própria resposta se formando... disputa o mesmo espaço finito, medido em tokens.
As pessoas ouvem "janela" e imaginam um depósito. Quanto maior, melhor. Guarde mais, saiba mais.
Não é um depósito. É uma mesa.
Um depósito premia o volume. Já uma mesa pune. Coloque três documentos na frente de alguém e essa pessoa raciocina. Enterre esses três embaixo de quarenta e ela só remexe papel. Com o modelo é igual. A janela não é onde o conhecimento mora, é onde o pensamento acontece. E pensar precisa de espaço, não de bagunça.
Perdido no Meio
E aqui está a parte que ninguém que te vende uma janela de um milhão de tokens quer comentar: modelos não dão a mesma atenção a tudo que você entrega.
Dê a um deles um contexto longo e a memória dele desenha um U. Ele segura o começo. Segura o fim. O meio borra.
Se isso soa familiar, é porque é. É assim que você lembra de uma reunião, de uma conversa, de um livro. A abertura e o fechamento ficam nítidos, o meio se dissolve numa vaga sensação de que algumas coisas foram discutidas. Primazia e recência. A máquina herdou o nosso formato.
Então uma janela maior não te compra mais entendimento. Compra mais meio. Mais espaço pra única coisa que realmente importava afundar exatamente no ponto onde a atenção vai morrer.
A Armadilha do Mais
Essa é a sedução, e é a mesma sobre a qual escrevi falando de velocidade pura na hora de codar: a ferramenta fica tão capaz que te convida a parar de fazer a parte difícil.
Por que curar o que o modelo vê se você pode simplesmente... dar tudo pra ele? Por que decidir o que importa quando a janela é grande o bastante pra pular a decisão?
Porque a conta sempre chega. De três formas:
- O custo dispara. Cada token que você passa é um token que você paga, em cada chamada. "É só carregar tudo" é uma linha de orçamento que cresce enquanto você dorme.
- A performance degrada. Mais ruído, respostas mais lentas, a curva em U engolindo o seu sinal em silêncio.
- A confiança erode. O sistema fica vago de um jeito que você não consegue reproduzir, e você perde a capacidade de dizer por que ele respondeu daquele jeito.
Um modelo com uma janela enorme e nenhuma curadoria é basicamente um júnior com memória fotográfica e zero discernimento. Impressionante numa festa e praticamente perigoso em produção.
Engenharia de Contexto É Discernimento
Mas a disciplina que resolve isso já tem nome: engenharia de contexto, a prática de decidir o que entra na atenção do modelo, e o que nunca entra.
Tudo se resume a quatro movimentos:
- Escrever (write): empurrar a informação pra algum lugar durável, fora da janela, pra que ela esteja lá quando você precisa e suma quando não precisa.
- Selecionar (select): trazer só o que esta tarefa precisa. Não o que talvez ajude. O que ela precisa.
- Comprimir (compress): reduzir o que é longo até o significado que sustenta tudo. Mantenha o sinal, descarte o resto.
- Isolar (isolate): manter contextos sem relação separados, pra que o modelo não esteja raciocinando sobre a sua lógica de cobrança e o seu fluxo de autenticação no mesmo fôlego.
Leia de novo e repare numa coisa. Nenhum deles é sobre encanamento. Escrever, selecionar, comprimir, isolar... isso não é um pipeline de RAG. É o que um engenheiro sênior faz com a própria atenção todo santo dia (ou pelo menos deveria fazer). É o que um bom arquiteto faz com o foco de um time. Passamos décadas aprendendo a gerenciar contexto humano. Agora o mesmo discernimento é a diferença entre um sistema de IA que funciona e um que apenas roda.
O Trabalho de Verdade É Decidir o Que Ele Nunca Vê
A maior parte do ferramental (como retrieval, ranking, chunking) existe pra responder bem a uma única pergunta: de tudo que eu sei, o que o modelo realmente precisa ver agora?
É isso. É o jogo inteiro. Recupere o que é relevante, ordene pra que o melhor venha primeiro, e coloque o que importa nas bordas, onde a atenção de fato vive. As técnicas vão mudar a cada trimestre. O princípio não.
Aprendi isso construindo um segundo cérebro. O problema difícil nunca foi armazenamento, armazenamento é barato e resolvido. O problema difícil foi aquele que eu apontei e deixei passar da última vez: saber quando recorrer ao histórico, e quando simplesmente trabalhar com o que está na sua frente. Essa decisão é a engenharia. Todo o resto é implementação.
O seu veto sobre o que a máquina vê não é uma configuração. É o trabalho.
Então uma janela maior segura mais. Um engenheiro melhor mostra menos.