Blog

O que é context window?

7 min de leitura

A definição curta

A janela de contexto é o número total de tokens que um LLM pode processar em uma única requisição. Tokens incluem tudo enviado ao modelo: a instrução do sistema, histórico de conversa, documentos recuperados, definições de ferramentas e a mensagem do usuário. Qualquer coisa além do limite da janela é invisível para o modelo. Não existe da perspectiva do modelo.

Por que é medida em tokens, não em palavras

LLMs não processam caracteres ou palavras. Processam tokens, fragmentos de texto produzidos por um tokenizador. Texto em inglês tem em média cerca de 0,75 tokens por palavra. Textos em português geralmente usam mais tokens por palavra do que em inglês, o que é relevante ao estimar se um caso de uso cabe em uma janela específica. Código é mais eficiente. Isso importa ao calcular se seu use case cabe em uma determinada janela.

Como os tamanhos de janela mudaram

Modelos de produção iniciais em 2020 e 2021 tinham janelas de 2.048 ou 4.096 tokens. Em 2023, o frontier avançou para 32.000 e 100.000 tokens. Em 2025 e 2026, janelas de 1.000.000 tokens ou mais estão disponíveis.

A expansão desbloqueou casos de uso que antes eram impossíveis: analisar contratos jurídicos completos, processar um codebase inteiro em uma única requisição, resumir semanas de histórico de conversa de cliente.

Janelas maiores não significam resultados melhores

Um equívoco persistente é que preencher a janela de contexto é gratuito ou benéfico. Não é nenhum dos dois. Inputs mais longos custam mais por requisição, produzem respostas mais lentas e frequentemente produzem outputs piores.

Pesquisas sobre modelos de contexto longo consistentemente encontram um fenômeno chamado lost in the middle: material no início e no fim de um contexto longo recebe mais atenção do que material no meio. Gerenciamento deliberado de contexto supera o preenchimento ingênuo. Cobrimos isso em profundidade em engenharia de contexto.

O que acontece quando você excede a janela

A API retorna um erro, ou a requisição é silenciosamente truncada dependendo da implementação. Nenhuma das duas é aceitável em produção. Sistemas precisam lidar com o caso em que o input excede a janela.

As abordagens padrão são: chunkar o input e processá-lo em passagens, usar recuperação para selecionar apenas as porções mais relevantes, resumir o histórico de conversa anterior em vez de enviá-lo verbatim, ou rotear para um modelo com janela maior.

Uso da janela em produção

Em uma requisição de produção típica, instruções do sistema consomem 500 a 2.000 tokens. Chunks de documentos recuperados consomem 2.000 a 10.000 tokens. Histórico de conversa consome 500 a 5.000 tokens dependendo do tamanho. Definições de ferramentas consomem 500 a 3.000 tokens. A mensagem do usuário frequentemente consome menos de 200 tokens.

Registrar o consumo real de tokens por componente em produção é como você encontra onde a janela está sendo desperdiçada.

A implicação prática para o design de sistema

Projete para o caso em que o contexto está cheio, não para o caso médio. Imponha limites rígidos no comprimento do histórico de conversa. Recupere seletivamente usando RAG em vez de incluir documentos inteiros. Defina apenas as ferramentas que o modelo realmente precisa para a requisição atual. Meça e monitore a utilização da janela em produção.

Os times que fazem isso deliberadamente têm sistemas mais rápidos, mais baratos e mais precisos.

Se seu sistema está atingindo limites de contexto ou você não tem certeza de como estruturar workflows de documentos longos, uma call é a forma mais rápida de diagnosticar o que precisa mudar.

Agendar uma call Ou envie os detalhes por escrito
Voltar para o blog