Il batch API elabora richieste che non hanno bisogno di risposta immediata in cambio di uno sconto —di solito intorno al 50 %— rispetto alle richieste in tempo reale. Conviene su tutto ciò che non è interattivo: report, arricchimento di dati, classificazione in massa. È scambiare minuti (o ore) con denaro.
È la terza delle 7 leve per ridurre la bolletta di OpenAI: quella con il maggior risparmio per unità di sforzo quando hai lavoro che può attendere.
In sintesi
| Cosa fa | Elabora lotti di richieste in modo asincrono |
| Risparmio tipico | ~50 % rispetto al tempo reale |
| In cambio di | Non essere immediato (finestra da minuti a ore) |
| Quando conviene | Tutto ciò che non è interattivo |
Come funziona
Invece di chiamare una richiesta alla volta e aspettare la risposta subito, invii un lotto intero e il fornitore lo elabora quando ha capacità, entro una finestra concordata. Quando finisce, raccogli tutti i risultati insieme. Lo sconto è la contropartita del rinunciare all’immediatezza.
Quanto fa risparmiare
Lo sconto si aggira sulla metà del prezzo del tempo reale, quindi sui carichi che puoi rimandare il costo per attività cala di colpo senza toccare il modello né il prompt. Più grande è il volume che muovi per lotto, più si nota in bolletta.
Quali attività ci stanno
Ci sta tutto ciò che nessun utente sta aspettando: report notturni, arricchire un database, classificare o etichettare in massa, generare descrizioni di catalogo, riassumere file storici. Se il risultato può arrivare in qualche ora, è candidato al batch.
Quando non usarlo
Non serve per nulla di interattivo: una chat, un assistente dal vivo, qualsiasi flusso in cui l’utente aspetta la risposta ora. Lì comanda la latenza e il tempo reale è obbligatorio. La regola è semplice: se qualcuno sta aspettando davanti allo schermo, non è batch.
Mettici un numero
Prima di spostare qualcosa in batch, misura quanta parte della tua spesa è rimandabile. Inserisci i tuoi token e il tuo volume nel calcolatore di costo dei token e applica lo sconto a quella parte: vedrai di quanto cala il costo mensile. Tutto questo fa parte del costo per attività che misura e-ficient.
Domande frequenti
Quanto fa risparmiare il batch API? Di solito circa la metà del prezzo del tempo reale, in cambio di una risposta non immediata. Conviene su tutto ciò che non è interattivo.
Quali attività posso inviare in lotto? Qualsiasi che non abbia bisogno di risposta subito: report, arricchimento di dati, classificazione in massa, generazione in blocco.
Si combina con le altre leve? Sì. Il batch si somma a scegliere il modello per attività e al prompt caching: uno sconto su un prezzo già ottimizzato.
In e-ficient misuriamo il costo per attività di aziende che hanno già l’IA in produzione e ti diciamo quanto risparmieresti con ogni leva al tuo volume reale. Il primo audit è gratuito se attivi un piano con impegno di tre mesi e restituisce una diagnosi in 72 ore.