Le 30 juillet 2026, OpenAI a réduit de 80 % le prix de l’API GPT-5.6 Luna, passant d’un dollar à vingt centimes par million de tokens en entrée. Terra a baissé de 20 %. Les titres étaient prévisibles : l’IA devient moins chère, la barrière à l’entrée s’effondre.

Quelques semaines plus tard, plusieurs entreprises exploitant ces modèles en production ont vu leur facture augmenter.

Ce n’est ni une contradiction ni une erreur de facturation. C’est que le prix par token et le coût de votre exploitation sont deux choses différentes, et une seule des deux apparaît dans votre budget.

L’unité que facture le fournisseur n’est pas celle que consomme votre activité

Votre fournisseur facture au token. Votre activité ne consomme pas des tokens : elle consomme des tâches résolues. Une demande de support traitée. Un document classé. Une facture extraite.

Tant qu’une tâche équivalait à une requête au modèle, les deux unités évoluaient ensemble et la distinction restait théorique. Si le token baissait de 30 %, votre facture baissait de 30 %.

Cela a cessé d’être vrai quand les applications sont passées d’une requête unique à l’orchestration de plusieurs. Un agent qui interroge un outil, évalue le résultat, décide de l’étape suivante et rappelle le modèle ne fait pas une requête par tâche : il en fait huit, ou quinze. Et il renvoie l’intégralité du contexte à chacun d’eux.

Un exemple chiffré

Prenons un assistant de support qui traite les demandes des clients. Prompt système de 1 200 tokens, demande utilisateur de 800, réponse de 400.

Version en une seule requête :

TokensCoût
Entrée2 0000,0040 $
Sortie4000,0048 $
Total par tâche0,0088 $

La même tâche, traitée par un agent en huit étapes. Chaque étape renvoie le prompt système, la demande initiale et tout ce qui s’est accumulé jusque-là. En supposant que chaque étape ajoute environ 600 tokens d’historique :

ÉtapeTokens en entrée
12 000
22 600
33 200
43 800
54 400
65 000
75 600
86 200
Total32 800

Avec 250 tokens de sortie par étape, cela fait 2 000 tokens en sortie. Aux tarifs de Terra (2 $ en entrée et 12 $ en sortie par million), le coût par tâche grimpe à 0,0896 $.

Dix fois plus pour résoudre exactement la même chose.

Appliquez maintenant la baisse de 80 %. Si votre tâche en une requête ne coûte plus qu’un cinquième, tant mieux. Mais si vous avez migré ce même trimestre vers une architecture d’agent, vous avez multiplié par dix la consommation par tâche. Le prix a baissé de 80 % et votre facture a doublé.

Les trois multiplicateurs absents de la grille tarifaire

Le contexte renvoyé. C’est le plus coûteux et le plus invisible. Dans une conversation de vingt tours, le premier message a été facturé vingt fois. Non pas parce que votre application est mal écrite, mais parce que les API de chat fonctionnent ainsi : elles n’ont pas de mémoire, et l’historique voyage à chaque requête.

Les définitions d’outils. Un agent disposant de douze outils envoie leurs schémas complets à chaque requête, qu’il en utilise un ou aucun. Ce sont des tokens d’entrée facturables à chacune des huit étapes.

Les nouvelles tentatives et les impasses. Un agent qui explore une voie, comprend qu’elle ne mène nulle part et en essaie une autre a payé les deux. Les rapports d’usage du fournisseur ne font pas la différence : tout apparaît comme de la consommation, sans indiquer si elle a servi à quelque chose.

Comment mesurer le coût par tâche

La mauvaise nouvelle, c’est que le tableau de bord de votre fournisseur ne vous le donnera pas. Il vous donne des tokens par modèle et par jour. Arriver au coût par tâche exige quelque chose qu’il n’a pas : savoir où commence et où s’arrête une tâche dans votre activité.

Ce que vous pouvez faire sans instrumentation compliquée :

Rapportez à une unité métier. Divisez la dépense mensuelle du modèle par le nombre de demandes traitées, de documents traités, ou quelle que soit votre unité. C’est une moyenne grossière et cela fonctionne quand même : si ce chiffre monte mois après mois alors que le prix du token baisse, vous avez votre réponse.

Segmentez par type de tâche. Presque toujours, une minorité de types de tâches concentre l’essentiel de la dépense. Sans cette segmentation, vous optimiserez le mauvais modèle.

Comptez les requêtes par tâche. C’est l’indicateur le plus prédictif que nous connaissions. S’il passe de trois à neuf, votre coût va monter même sans changer de modèle ni de fournisseur.

Que faire

Avant de négocier des tarifs ou de changer de fournisseur, déterminez si votre problème relève du prix ou de l’architecture. C’est généralement le second, et il se traite autrement.

Le cache de prompts vient en premier, parce que c’est le moins coûteux à mettre en œuvre : le prompt système que vous renvoyez huit fois peut être facturé avec une remise substantielle si votre fournisseur le propose et si votre code en tire parti. Dans l’exemple ci-dessus, ces 1 200 tokens répétés représentent près d’un tiers de l’entrée totale.

Élaguer l’historique au lieu de le traîner en entier. Très peu de tâches ont besoin des vingt tours complets.

Et router selon la complexité : réserver le modèle coûteux aux tâches qui en ont réellement besoin. C’est là qu’il y a le plus d’économies et là qu’il faut le plus de prudence, car c’est aussi là qu’il est le plus facile de dégrader la qualité sans s’en rendre compte. D’où l’intérêt de mesurer la qualité avant de toucher à quoi que ce soit, et non après.

Une mise en garde honnête

Les chiffres de cet article sont un exemple construit pour illustrer le mécanisme, pas une mesure de votre cas. Le multiplicateur réel dépend du nombre de requêtes que votre application effectue par tâche, de la quantité de contexte qu’elle traîne et de la part de tâches qui empruntent le chemin coûteux. Cela peut être trois fois. Cela peut être trente.

Et les prix évoluent vite : ceux cités ici datent d’août 2026 et méritent d’être vérifiés sur la page officielle de chaque fournisseur avant tout budget.

Ce qui ne change pas, c’est le mécanisme. Tant que vous mesurerez en tokens, vous continuerez à ne pas comprendre ce que fait votre facture.

Le cluster complet du coût de l’IA

Ce guide en est le centre ; chaque article développe une partie du problème.

Comprendre le coût

Le réduire

Choisir l’architecture

Le garder sous contrôle


Chez e-ficient, nous mesurons le coût par tâche d’entreprises qui exploitent déjà l’IA en production. L’audit initial est gratuit si vous souscrivez un forfait avec un engagement de trois mois et rend un diagnostic sous 72 heures.