Cuando la factura de la API empieza a doler, la primera idea suele ser la misma: montar un modelo propio. A veces es la decisión correcta, pero casi nunca por las razones que se dan, y casi siempre más tarde de lo que se piensa. La pregunta no es cuál es más barato por token, sino a partir de qué volumen el ahorro cubre lo que cuesta operarlo.

Lo que se compara mal

Se compara el precio por millón de tokens de la API contra el precio por hora de una GPU, y el self-hosting gana siempre sobre el papel. Falta la mitad de la ecuación: la GPU se paga esté ocupada o no, y su coste real depende de la utilización. Una GPU al 8% de uso es diez veces más cara por token que la misma GPU al 80%.

Los costes que nadie suma

PartidaAPISelf-hosting
CómputoPor token consumidoPor hora reservada, se use o no
IngenieríaCasi nulaServir, escalar, actualizar, vigilar
DisponibilidadDel proveedorTuya, con guardias incluidas
Cambio de modeloUna línea de códigoReevaluar, reajustar, revalidar

Cuándo sí compensa

Hay tres situaciones en las que el self-hosting gana de verdad. La primera es volumen alto y estable: mucho tráfico y bastante plano, que mantiene la GPU ocupada casi todo el tiempo. La segunda es una restricción de datos que impide sacarlos fuera —normativa, contrato, sector regulado—, y ahí la decisión ya no es de coste. La tercera es una tarea muy estrecha y repetitiva, donde un modelo pequeño afinado hace el trabajo de uno grande a una fracción del cómputo.

Cuándo casi nunca compensa

Tráfico irregular o con picos, catálogo de tareas variado, o un equipo sin quien mantenga la infraestructura. Si tu carga tiene valles largos, pagas GPU parada. Y antes de mover la infraestructura conviene agotar las palancas baratas: elegir bien el modelo por tarea, prompt caching y batch API suelen recortar más y en días, no en meses.

Cómo decidirlo con números

Calcula tu coste mensual real por API y compáralo contra el coste de las GPU que necesitarías para tu pico, no para tu media. Añade el tiempo de ingeniería a precio de mercado. Si el ahorro no supera con holgura ese total, no compensa. Ponle cifras con la calculadora de coste de tokens y mide siempre en coste por tarea, que es lo único comparable entre las dos opciones.

Preguntas frecuentes

¿A partir de qué volumen compensa el self-hosting? No hay una cifra universal, porque depende de la utilización, no del volumen. La señal es tener tráfico suficiente y estable para mantener la GPU ocupada la mayor parte del tiempo; con valles largos, la API sale más barata.

¿Es más barato un modelo abierto que uno de pago? Por token de cómputo, sí. Sumando ingeniería, disponibilidad y GPU parada, no siempre. La comparación honesta es coste por tarea, todo incluido.

¿Puedo mezclar las dos cosas? Es lo más habitual en la práctica: un modelo propio para la tarea de alto volumen y APIs para el resto. Repartir por tarea suele ganar a elegir un único proveedor.


En e-ficient medimos el coste por tarea de empresas que ya tienen IA en producción y te decimos cuánto ahorrarías con cada palanca a tu volumen real. La primera auditoría es gratuita si contratas un plan con compromiso de tres meses y devuelve un diagnóstico en 72 horas.