El contexto es la parte del gasto que más crece sin que nadie lo decida. Nadie aprueba “vamos a pagar el triple”: simplemente se añade un documento al prompt, luego otro, y la factura sube. Cada token de contexto se paga en cada petición, y eso es lo que convierte una ventana larga en un problema de coste.

Por qué sale caro

Un modelo no recuerda nada entre peticiones. Todo lo que quieres que sepa —instrucciones, ejemplos, historial, documentos— viaja otra vez en cada petición y se factura otra vez. Si tu prompt lleva 20.000 tokens de contexto y haces 50.000 peticiones al mes, pagas mil millones de tokens de entrada solo por el contexto, respondas lo que respondas.

Las tres fugas típicas

FugaQué la causaCómo se corrige
Historial completoSe reenvía toda la conversación en cada turnoResumir turnos antiguos y enviar solo los últimos
Documentos enterosSe adjunta el PDF completo “por si acaso”Recuperar solo los fragmentos relevantes
Prompt de sistema hinchadoInstrucciones que se acumulan y nunca se podanReescribirlo y medir si la calidad cae

Recuperar en vez de adjuntar

La corrección estructural es no meter el corpus en el prompt. Se indexan los documentos, se recuperan los tres o cuatro fragmentos que responden a la pregunta y se envían solo esos. La calidad suele subir —menos ruido— y el contexto baja un orden de magnitud. Lo desarrollamos en RAG, fine-tuning y contexto.

Lo que sí conviene mantener largo

No todo recorte es bueno. Las instrucciones estables y los ejemplos que fijan el formato son caros de quitar y baratos de mantener si usas prompt caching: el bloque fijo se cachea y se paga a una fracción. La regla práctica es contexto fijo y cacheado arriba, contexto variable y mínimo abajo.

Ponle un número

Antes de rediseñar nada, mide. Mete tus tokens de entrada actuales y tu volumen en la calculadora de coste de tokens y compara el mismo trabajo con la mitad de contexto: verás la diferencia mensual de golpe. Y sigue el coste por tarea antes y después para confirmar que la calidad no ha caído.

Preguntas frecuentes

¿Por qué el contexto largo aumenta tanto el coste? Porque el contexto se envía y se factura en cada petición. Un prompt grande no se paga una vez: se paga tantas veces como peticiones hagas.

¿Cuánto contexto es demasiado? No hay un número absoluto. La señal es la proporción: si los tokens de entrada superan con mucho a los de salida y buena parte son documentos o historial, tienes margen.

¿Recortar contexto empeora las respuestas? Con frecuencia las mejora, porque el modelo deja de competir con información irrelevante. Lo que no se puede hacer es recortar sin medir el coste por tarea y la calidad antes y después.


En e-ficient medimos el coste por tarea de empresas que ya tienen IA en producción y te decimos cuánto ahorrarías con cada palanca a tu volumen real. La primera auditoría es gratuita si contratas un plan con compromiso de tres meses y devuelve un diagnóstico en 72 horas.