O contexto é a parte da despesa que mais cresce sem que ninguém a decida. Ninguém aprova “vamos pagar o triplo”: acrescenta-se um documento ao prompt, depois outro, e a fatura sobe. Cada token de contexto é cobrado em cada solicitação, e é isso que transforma uma janela longa num problema de custo.
Porque fica caro
Um modelo não se lembra de nada entre solicitações. Tudo o que quer que ele saiba —instruções, exemplos, histórico, documentos— viaja outra vez em cada pedido e é faturado outra vez. Se o seu prompt leva 20.000 tokens de contexto e faz 50.000 solicitações por mês, paga mil milhões de tokens de entrada só pelo contexto, sejam quais forem as respostas.
As três fugas típicas
| Fuga | O que a causa | Como se corrige |
|---|---|---|
| Histórico completo | Reenvia-se toda a conversa em cada turno | Resumir turnos antigos e enviar só os recentes |
| Documentos inteiros | Anexa-se o PDF completo “por precaução” | Recuperar apenas os fragmentos relevantes |
| Prompt de sistema inchado | Instruções que se acumulam e nunca se podam | Reescrevê-lo e medir se a qualidade cai |
Recuperar em vez de anexar
A correção estrutural é não meter o corpus no prompt. Indexam-se os documentos, recuperam-se os três ou quatro fragmentos que respondem à pergunta e enviam-se só esses. A qualidade costuma subir —menos ruído— e o contexto desce uma ordem de grandeza. Desenvolvemo-lo em RAG, fine-tuning e contexto.
O que convém manter longo
Nem todo o corte é bom. As instruções estáveis e os exemplos que fixam o formato são caros de retirar e baratos de manter se usar prompt caching: o bloco fixo fica em cache e paga-se a uma fração. A regra prática é contexto fixo e em cache em cima, contexto variável e mínimo em baixo.
Ponha-lhe um número
Antes de redesenhar seja o que for, meça. Meta os seus tokens de entrada atuais e o seu volume na calculadora de custo de tokens e compare o mesmo trabalho com metade do contexto: verá a diferença mensal de imediato. E siga o custo por tarefa antes e depois para confirmar que a qualidade não caiu.
Perguntas frequentes
Porque é que o contexto longo aumenta tanto o custo? Porque o contexto é enviado e faturado em cada solicitação. Um prompt grande não se paga uma vez: paga-se tantas vezes quantos pedidos fizer.
Quanto contexto é demasiado? Não há um número absoluto. O sinal é a proporção: se os tokens de entrada superam muito os de saída e boa parte são documentos ou histórico, tem margem.
Reduzir contexto piora as respostas? Muitas vezes melhora-as, porque o modelo deixa de competir com informação irrelevante. O que não se pode fazer é cortar sem medir o custo por tarefa e a qualidade antes e depois.
Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.