O prompt caching guarda o bloco de contexto que se repete entre solicitações —instruções, exemplos, um documento base— e cobra-o uma só vez em vez de em cada pedido. Nas cargas com muito contexto repetido, a poupança nesses tokens chega aos 50-90 %. É das alavancas mais baratas de implementar e não toca na qualidade das respostas.
É a segunda das 7 alavancas para reduzir a fatura da OpenAI e uma das que têm melhor relação poupança/esforço.
Num relance
| O que faz cache | O contexto estável: system prompt, instruções, exemplos, documentos base |
| Poupança típica | 50-90 % sobre os tokens em cache |
| Esforço | Baixo: marcar o bloco estável e reutilizá-lo |
| Quando compensa | Pedidos que repetem o mesmo contexto longo |
Como funciona
A primeira solicitação processa o contexto inteiro e guarda-o em cache durante uma janela curta. As solicitações seguintes que começam pelo mesmo bloco não voltam a pagar o processamento dessa parte: reutilizam o que está em cache e só pagam o novo. Quanto maior e mais estável for o bloco que reutiliza, mais compensa.
Quanto poupa de verdade
A poupança aplica-se só aos tokens em cache, não a toda a fatura. Se o seu system prompt e os exemplos ocupam 3.000 tokens e se repetem em cada solicitação, esses 3.000 passam a custar uma fração a partir do segundo pedido. Em volume alto é o desconto que se nota mais depressa sem mudar nada do modelo nem da saída.
Quando compensa (e quando não)
Compensa quando o mesmo contexto se repete entre pedidos: assistentes com um system prompt longo, RAG com um documento base fixo, classificação com muitos exemplos. Não acrescenta nada se cada solicitação leva um contexto diferente, porque não há nada para reutilizar.
Como ativá-lo
Separe o estável do variável: ponha primeiro o bloco que se repete (instruções, exemplos, documento) e no fim o que muda em cada pedido. Assim o prefixo em cache é o mais longo possível. Consulte a documentação do seu fornecedor para marcar o bloco; a mudança costuma ser de minutos.
Ponha número
Antes de mexer em nada, meça de onde vem o seu gasto. Ponha os seus tokens de contexto e o seu volume na calculadora de custo de tokens e compare com o que pagaria reutilizando o bloco estável: verá a poupança mensal antes de a implementar. Tudo isto faz parte do custo por tarefa que a e-ficient mede.
Perguntas frequentes
Quanto poupa o prompt caching? Nos tokens de contexto que se repetem entre solicitações, a poupança chega aos 50-90 %. Quanto maior e mais estável for o bloco que reutiliza, mais compensa.
Afeta a qualidade das respostas? Não. O modelo recebe exatamente o mesmo contexto; só muda como se cobra o processamento da parte repetida.
Em que difere do RAG? O caching baixa o custo do contexto que já envia; o RAG reduz quanto contexto precisa de enviar. Combinam-se bem.
Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.