Il prompt caching conserva il blocco di contesto che si ripete tra le richieste —istruzioni, esempi, un documento di base— e te lo addebita una sola volta invece che a ogni richiesta. Sui carichi con molto contesto ripetuto, il risparmio su quei token arriva al 50-90 %. È tra le leve più economiche da implementare e non tocca la qualità delle risposte.

È la seconda delle 7 leve per ridurre la bolletta di OpenAI e una di quelle con il miglior rapporto risparmio/sforzo.

In sintesi

Cosa mette in cacheIl contesto stabile: system prompt, istruzioni, esempi, documenti di base
Risparmio tipico50-90 % sui token in cache
SforzoBasso: marcare il blocco stabile e riutilizzarlo
Quando convieneRichieste che ripetono lo stesso contesto lungo

Come funziona

La prima richiesta elabora tutto il contesto e lo mette in cache per una finestra breve. Le richieste successive che iniziano con lo stesso blocco non pagano di nuovo l’elaborazione di quella parte: riutilizzano ciò che è in cache e pagano solo il nuovo. Più grande e stabile è il blocco che riutilizzi, più conviene.

Quanto fa risparmiare davvero

Il risparmio si applica solo ai token in cache, non a tutta la bolletta. Se il tuo system prompt e gli esempi occupano 3.000 token e si ripetono a ogni richiesta, quei 3.000 costano una frazione dalla seconda richiesta in poi. Ad alto volume è lo sconto che si nota più in fretta senza cambiare nulla del modello né dell’output.

Quando conviene (e quando no)

Conviene quando lo stesso contesto si ripete tra le richieste: assistenti con un system prompt lungo, RAG con un documento di base fisso, classificazione con molti esempi. Non aggiunge nulla se ogni richiesta porta un contesto diverso, perché non c’è niente da riutilizzare.

Come attivarlo

Separa lo stabile dal variabile: metti prima il blocco che si ripete (istruzioni, esempi, documento) e alla fine ciò che cambia a ogni richiesta. Così il prefisso memorizzabile è il più lungo possibile. Consulta la documentazione del tuo fornitore per marcare il blocco; la modifica di solito è di minuti.

Mettici un numero

Prima di toccare qualcosa, misura da dove viene la tua spesa. Inserisci i tuoi token di contesto e il tuo volume nel calcolatore di costo dei token e confrontalo con quello che pagheresti riutilizzando il blocco stabile: vedrai il risparmio mensile prima di implementarlo. Tutto questo fa parte del costo per attività che misura e-ficient.

Domande frequenti

Quanto fa risparmiare il prompt caching? Sui token di contesto che si ripetono tra le richieste, il risparmio arriva al 50-90 %. Più grande e stabile è il blocco che riutilizzi, più conviene.

Influisce sulla qualità delle risposte? No. Il modello riceve esattamente lo stesso contesto; cambia solo come viene addebitata l’elaborazione della parte ripetuta.

In cosa differisce dal RAG? Il caching abbassa il costo del contesto che già invii; il RAG riduce quanto contesto devi inviare. Si combinano bene.


In e-ficient misuriamo il costo per attività di aziende che hanno già l’IA in produzione e ti diciamo quanto risparmieresti con ogni leva al tuo volume reale. Il primo audit è gratuito se attivi un piano con impegno di tre mesi e restituisce una diagnosi in 72 ore.