El contexto es la parte del gasto que más crece sin que nadie lo decida. Nadie aprueba “vamos a pagar el triple”: simplemente se añade un documento al prompt, luego otro, y la factura sube. Cada token de contexto se paga en cada petición, y eso es lo que convierte una ventana larga en un problema de coste.
Por qué sale caro
Un modelo no recuerda nada entre peticiones. Todo lo que quieres que sepa —instrucciones, ejemplos, historial, documentos— viaja otra vez en cada petición y se factura otra vez. Si tu prompt lleva 20.000 tokens de contexto y haces 50.000 peticiones al mes, pagas mil millones de tokens de entrada solo por el contexto, respondas lo que respondas.
Las tres fugas típicas
| Fuga | Qué la causa | Cómo se corrige |
|---|---|---|
| Historial completo | Se reenvía toda la conversación en cada turno | Resumir turnos antiguos y enviar solo los últimos |
| Documentos enteros | Se adjunta el PDF completo “por si acaso” | Recuperar solo los fragmentos relevantes |
| Prompt de sistema hinchado | Instrucciones que se acumulan y nunca se podan | Reescribirlo y medir si la calidad cae |
Recuperar en vez de adjuntar
La corrección estructural es no meter el corpus en el prompt. Se indexan los documentos, se recuperan los tres o cuatro fragmentos que responden a la pregunta y se envían solo esos. La calidad suele subir —menos ruido— y el contexto baja un orden de magnitud. Lo desarrollamos en RAG, fine-tuning y contexto.
Lo que sí conviene mantener largo
No todo recorte es bueno. Las instrucciones estables y los ejemplos que fijan el formato son caros de quitar y baratos de mantener si usas prompt caching: el bloque fijo se cachea y se paga a una fracción. La regla práctica es contexto fijo y cacheado arriba, contexto variable y mínimo abajo.
Ponle un número
Antes de rediseñar nada, mide. Mete tus tokens de entrada actuales y tu volumen en la calculadora de coste de tokens y compara el mismo trabajo con la mitad de contexto: verás la diferencia mensual de golpe. Y sigue el coste por tarea antes y después para confirmar que la calidad no ha caído.
Preguntas frecuentes
¿Por qué el contexto largo aumenta tanto el coste? Porque el contexto se envía y se factura en cada petición. Un prompt grande no se paga una vez: se paga tantas veces como peticiones hagas.
¿Cuánto contexto es demasiado? No hay un número absoluto. La señal es la proporción: si los tokens de entrada superan con mucho a los de salida y buena parte son documentos o historial, tienes margen.
¿Recortar contexto empeora las respuestas? Con frecuencia las mejora, porque el modelo deja de competir con información irrelevante. Lo que no se puede hacer es recortar sin medir el coste por tarea y la calidad antes y después.
En e-ficient medimos el coste por tarea de empresas que ya tienen IA en producción y te decimos cuánto ahorrarías con cada palanca a tu volumen real. La primera auditoría es gratuita si contratas un plan con compromiso de tres meses y devuelve un diagnóstico en 72 horas.