Janela de contexto é o limite de informação que um modelo de linguagem consegue considerar de uma vez ao gerar uma resposta. Quanto maior essa janela, mais documento, histórico e regra de negócio você entrega ao modelo sem picotar. E foi esse número que disparou nos últimos ciclos: saímos de alguns milhares de tokens para janelas de 1 milhão em modelos como Claude e Gemini.
Na prática, isso reabre decisões de arquitetura que pareciam resolvidas. Vale a pena montar um sistema de recuperação de trechos ou simplesmente colocar o manual inteiro no prompt? A resposta muda conforme o custo por token, a latência aceitável e o quanto de informação precisa mesmo estar presente a cada chamada.
O que a janela de contexto realmente mede
Token não é palavra. Em português, um token equivale, em média, a três ou quatro caracteres — algo perto de 0,7 a 0,8 palavra. Uma janela de 200 mil tokens comporta, grosso modo, um livro de 150 mil palavras. A de 1 milhão absorve várias horas de transcrição de atendimento, uma base de artigos inteira ou meses de histórico de um cliente.
Esse limite é compartilhado entre entrada e saída. Tudo conta: instrução do sistema, histórico da conversa, documentos anexados e a própria resposta que o modelo vai escrever. Estourar a janela não gera um erro elegante — o modelo perde o começo da conversa ou corta a resposta no meio.
O salto para 1 milhão de tokens muda o cálculo
Com janelas pequenas, você era obrigado a recuperar só os trechos mais relevantes antes de chamar o modelo. Com 1 milhão de tokens disponíveis, surge a tentação de mandar tudo de uma vez e deixar a IA se virar. Funciona — mas nem sempre é a decisão certa, porque contexto grande cobra caro em dois lugares.
Contexto longo não substitui RAG
Colocar a base inteira no prompt parece simples, mas tem teto. Bases de conhecimento reais passam de milhões de tokens, mudam toda semana, e reenviar tudo a cada mensagem multiplica o custo. RAG continua ganhando quando o volume de dados é grande, muda com frequência ou precisa citar a fonte exata. Contexto longo brilha quando o material é fechado e cabe: um contrato, um manual, uma conversa longa.
O custo escondido do contexto grande
Cada token enviado é cobrado. Encher 500 mil tokens de contexto a cada pergunta, mesmo quando o cliente só quer saber o horário de funcionamento, transforma uma operação barata em conta salgada no fim do mês. Além do dinheiro, há latência: quanto mais tokens o modelo precisa ler, mais tempo até a primeira palavra da resposta aparecer.
- Custo por token: mais contexto significa mais tokens de entrada faturados em toda chamada
- Latência: janelas cheias aumentam o tempo de resposta, o que pesa no atendimento em tempo real
- Diluição: uma informação relevante perdida no meio de um contexto enorme pode receber menos atenção do modelo
- Cache: recursos como cache de prompt reduzem o custo de reenviar o mesmo contexto, mas exigem desenho cuidadoso
Como isso aparece no atendimento com IA
Num assistente de WhatsApp, o próprio histórico da conversa já consome contexto. Somar a isso a base de produtos, a política de troca e os dados do cliente exige planejar quanto entra em cada chamada. Um projeto bem feito de chatbot e atendimento com IA decide, mensagem a mensagem, o que precisa estar no contexto e o que pode ficar de fora.
A saída costuma ser híbrida: contexto longo para o que é da conversa atual e recuperação sob demanda para a base de conhecimento. Quando o assistente precisa consultar estoque ou registrar um pedido, entram as integrações via API, que buscam só o dado necessário em vez de despejar o banco inteiro no prompt. É esse equilíbrio que mantém a automação inteligente com IA rápida e barata em escala.
Janela grande não é desculpa para parar de pensar no que entra no prompt: o modelo lê tudo que você manda e cobra por tudo que lê.
Perguntas frequentes
Janela de contexto é a memória do modelo?+
Não exatamente. É a quantidade de informação que ele considera em uma única chamada. Entre uma mensagem e outra nada fica guardado por padrão — o histórico precisa ser reenviado a cada requisição, e é isso que consome contexto.
Quanto texto cabe em 1 milhão de tokens?+
Algo entre 1.500 e 2.000 páginas de texto corrido, dependendo da densidade. É espaço para um livro grande, um conjunto de contratos ou várias horas de transcrição de atendimento.
Contexto maior deixa a resposta melhor?+
Nem sempre. Informação relevante perdida no meio de um contexto enorme pode ser menos aproveitada. Contexto certo e enxuto costuma superar contexto grande e desorganizado.
Vale mais a pena contexto longo ou RAG?+
Depende do dado. Material fechado e estável cabe bem no contexto. Base grande, que muda muito ou precisa citar a fonte, pede RAG. Muitos sistemas usam as duas abordagens juntas.
Como reduzir o custo de contextos grandes?+
Enviando só o necessário em cada chamada, usando cache de prompt para o conteúdo repetido e recuperando trechos sob demanda em vez de reenviar a base inteira toda vez.
Se você está montando ou revisando um assistente de IA e não sabe quanto contexto cada resposta realmente precisa, dá para desenhar isso antes de a conta pesar. A VELTRIX faz um diagnóstico gratuito da sua arquitetura de atendimento com IA e aponta onde o custo de tokens pode ser cortado sem perder qualidade. Chame o time e traga um exemplo real do seu fluxo.
Quer aplicar isso no seu negócio?
Diagnóstico gratuito com nosso time. Sem compromisso.
