El relato del sector es que los tokens no paran de bajar de precio, y a medias es cierto: cada generación de modelos pequeños llega más barata que la anterior. Pero en 2026 se han consolidado cuatro maneras de que tu factura suba sin que tú cambies una sola línea de código. Ninguna es un truco: están todas publicadas en las páginas de precios de los proveedores. El problema es que no aparecen en la comparativa que miraste el día que elegiste modelo.

1. Las promociones tienen fecha

OpenAI vende hoy GPT-5.6 Sol a 4 $ de entrada y 20 $ de salida por millón de tokens. Su página de precios dice, literalmente, que ese precio promocional está disponible «al menos hasta el 21 de noviembre de 2026».

«Al menos» es un suelo, no un techo: puede prorrogarse y puede terminar ese día. Si presupuestaste el año con la tarifa promocional, tienes una fecha en el calendario y un riesgo sin cuantificar, porque cuánto costará el modelo después no está publicado.

2. El contexto largo se cobra en otro tramo

Este es el que más sorprende, porque no depende del modelo sino de cuánto le mandas.

OpenAI publica dos tramos por modelo, contexto corto y contexto largo. En GPT-5.6 Sol la entrada pasa de 4 $ a 8 $ y la salida de 20 $ a 30 $. Google lo marca por umbral: en Gemini 3.1 Pro, por debajo de 200.000 tokens la entrada son 2 $ y por encima 4 $, y la salida sube de 12 $ a 18 $.

El detalle importante es que en la página de OpenAI aparecen los dos tramos pero no el umbral que los separa. Sabes que hay un precio distinto, pero no en qué punto exacto entras en él. Y en la práctica se entra solo: un RAG que va acumulando documentos, un historial de conversación que nadie poda, un prompt de sistema que crece a base de parches. La tarea es la misma, el modelo es el mismo, y el precio unitario cambia.

Anthropic ha ido en dirección contraria: desde Claude 4.6, la ventana de un millón de tokens entra a precio estándar, sin recargo. Merece la pena tenerlo en cuenta si estás comparando.

3. Los recargos por dónde y cómo se procesa

Son banderas de configuración, no decisiones de modelo, y cada una tiene precio.

Residencia de datos. OpenAI cobra un 10 % adicional en los endpoints regionales, para los modelos publicados a partir del 5 de marzo de 2026 que la admiten. Anthropic aplica un multiplicador de 1,1 a la inferencia restringida a Estados Unidos.

Modo rápido. En OpenAI duplica la tarifa estándar. En Anthropic, el modo rápido de Opus 5 pasa de 5 $/25 $ a 10 $/50 $: exactamente el doble.

Ninguno de los dos cambia lo que hace el modelo, solo dónde se ejecuta o con qué prioridad. Una bandera mal puesta en una integración duplica la factura de esa ruta y no se nota hasta el cierre de mes.

4. Las subidas anunciadas con fecha

Google publica sus precios actuales como vigentes hasta el 31 de diciembre de 2026 y ya ha anunciado que a partir del 1 de enero de 2027 se duplican, de forma aproximada, en toda la línea. Gemini 3.8 Flash pasa de 0,75 $ a 1,50 $ de entrada. El almacenamiento de caché de contexto pasa de 0,50 $ a 1 $ por millón de tokens y hora.

Es la subida más grande de las cuatro y también la más fácil de planificar, porque está publicada con casi cuatro meses de antelación. También es la que más gente se va a encontrar en la factura de enero sin haberla mirado antes.

Y a veces la subida no llega

Anthropic tenía anunciado que Claude Sonnet 5 pasaría de 2 $/10 $ a 3 $/15 $ el 1 de septiembre de 2026. No ha ocurrido: la tarifa de lanzamiento se ha quedado como precio estándar.

Es una buena noticia y, a la vez, el mejor argumento del artículo. El precio de los tokens es una variable, no una constante: sube, baja y a veces se anuncia y se retira. Enterarse leyendo es barato; enterarse por la factura, no.

Qué hacer con esto

Guarda la fecha de caducidad junto al precio. En tu hoja de costes, cada tarifa debería llevar de dónde salió, cuándo la verificaste y hasta cuándo es válida. Un precio sin fecha es un dato que caduca en silencio.

Mide coste por millón de tokens, no gasto total. Si tu uso crece un 20 % y el precio sube un 15 %, el gasto total sube y no sabes cuánto corresponde a cada cosa. El coste unitario lo separa.

Revisa las banderas antes que los modelos. Contexto largo, residencia y modo rápido son tres comprobaciones de diez minutos que explican subidas aparentemente inexplicables.

Los descuentos estructurales siguen ahí. La lectura de caché cuesta una décima parte de la entrada en OpenAI y en Anthropic, y el procesamiento por lotes está al 50 % en los tres proveedores. Buena parte del ahorro real está aquí, sin cambiar de modelo ni de proveedor.

Cambiar de proveedor no es cambiar de modelo. El mismo modelo servido desde otro sitio puede tener otro precio, otra residencia y otros recargos. Son dos decisiones distintas y conviene no mezclarlas.

Preguntas frecuentes

¿Han subido los precios de los tokens en 2026? Los precios de lista de la gama pequeña han bajado, pero han aparecido tramos y recargos que suben el coste efectivo: contexto largo, residencia de datos y modo rápido. Además, Google ha anunciado una subida de aproximadamente el doble para el 1 de enero de 2027.

¿Qué es el tramo de contexto largo? Un precio por token distinto cuando la petición supera cierto tamaño. En Gemini 3.1 Pro el umbral son 200.000 tokens y la entrada pasa de 2 $ a 4 $. OpenAI publica los dos tramos, pero no el umbral que los separa.

¿Cómo sé si me está afectando? Mira el coste por millón de tokens mes a mes, separado por modelo y por ruta. Si sube sin que hayas cambiado de modelo, la causa suele ser un tramo o un recargo, no el proveedor.

Esta pieza forma parte del clúster sobre el coste por tarea de IA. Si quieres poner tus propios números, tienes la calculadora de coste de tokens.


Precios verificados el 7 de septiembre de 2026 en las páginas oficiales de OpenAI, Anthropic y Google. Cambian a menudo: comprueba siempre la tarifa vigente antes de decidir.

En e-ficient medimos el coste por tarea de empresas que ya tienen IA en producción. La auditoría inicial es gratuita si contratas un plan con compromiso de tres meses y devuelve un diagnóstico en 72 horas.