Analyse, Budget et infrastructure IA
Coût réel d'une API IA en entreprise : la méthode de calcul
Un agent IA ne se facture pas au nombre d'appels mais au volume de texte traité. Voici comment se décompose vraiment la facture, pourquoi le contexte cumulé est presque toujours le poste qui dérape, et une méthode de calcul par conversation qui reste valable quand les tarifs changent.
Pourquoi votre facture d'API ne ressemble jamais à votre devis
Parce que vous payez du texte, pas des requêtes. La plupart des dirigeants raisonnent en nombre de conversations par mois, alors que le fournisseur facture le volume de texte qui entre et qui sort du modèle. Deux agents qui traitent le même nombre de demandes peuvent avoir des factures dans un rapport de un à vingt, simplement parce que l'un renvoie tout son historique à chaque tour et l'autre non.
C'est la seule chose à comprendre avant de signer quoi que ce soit. Le reste de cet article démonte la facture poste par poste et vous donne une méthode de calcul qui reste valable même quand les grilles tarifaires changent, ce qu'elles font plusieurs fois par an.
Qu'est-ce qu'un jeton, en langage de dirigeant ?
Un jeton est un morceau de mot. Les modèles ne lisent pas des caractères ni des mots entiers, ils découpent le texte en fragments. En français, comptez comme ordre de grandeur qu'un mot courant vaut à peu près un jeton et demi, et qu'une page A4 bien remplie tourne autour de six à huit cents jetons. Un devis de trois pages, c'est donc environ deux mille jetons.
Il y a deux compteurs distincts, et c'est là que se joue votre budget.
Les jetons d'entrée sont tout ce que vous envoyez au modèle : la consigne système qui définit son rôle, l'historique de la conversation, les extraits de documents que vous lui donnez, la question du client. Les jetons de sortie sont uniquement ce que le modèle écrit en réponse.
Les jetons de sortie coûtent systématiquement plus cher à l'unité que les jetons d'entrée, souvent trois à cinq fois plus selon les familles de modèles. Mais ils sont aussi beaucoup moins nombreux. Une réponse d'agent fait rarement plus de deux cents jetons, alors que l'entrée peut en peser dix mille. Dans la pratique, sur un agent de production, l'entrée représente très souvent l'essentiel de la dépense.
Pourquoi le poste qui explose est presque toujours le contexte
Parce que le contexte est renvoyé en entier à chaque tour de conversation. Un modèle n'a pas de mémoire. À chaque nouveau message du client, votre système lui réexpédie l'intégralité de l'échange précédent pour qu'il sache de quoi on parle. Vous payez donc l'historique autant de fois qu'il y a de tours.
Prenons une conversation de dix échanges avec une consigne système de mille jetons et des extraits documentaires de deux mille jetons injectés à chaque tour. Au premier tour, vous envoyez environ trois mille jetons. Au dixième, vous envoyez les trois mille de base plus les neuf échanges accumulés. Le total de la conversation n'est pas dix fois trois mille, il est nettement supérieur, parce que la charge grossit à chaque tour. C'est une progression qui s'apparente à un cumul, pas à une multiplication simple.
Trois conséquences très concrètes :
- Une consigne système bavarde de trois mille jetons vous coûte à chaque tour, pas une fois. La raccourcir de moitié divise mécaniquement une part importante de votre facture.
- Injecter dix extraits de documents quand trois suffisent triple ce poste sur toute la durée de l'échange.
- Une conversation qui traîne parce que l'agent ne sait pas conclure coûte bien plus cher que deux conversations courtes.
C'est aussi pour cela que l'argument commercial de la fenêtre de contexte géante est trompeur. Pouvoir envoyer l'équivalent de mille pages ne veut pas dire qu'il faut le faire. Vous payez chaque page, à chaque tour.
La mise en cache change-t-elle la donne ?
Oui, et c'est le levier le plus rentable une fois l'agent en production. La mise en cache du contexte permet au fournisseur de conserver temporairement la partie stable de ce que vous envoyez, typiquement la consigne système et votre base documentaire, pour ne pas la retraiter intégralement à chaque appel. Cette portion mise en cache est facturée à un tarif fortement réduit à la lecture.
Deux conditions pour que cela fonctionne :
D'abord, la partie stable doit être au début de votre requête et ne jamais bouger. Si vous insérez la date du jour ou le prénom du client en tête de consigne, vous cassez le cache à chaque appel et vous ne bénéficiez de rien. Mettez le variable à la fin.
Ensuite, le cache a une durée de vie courte, de l'ordre de quelques minutes chez la plupart des fournisseurs, prolongée à chaque réutilisation. Il est donc très efficace pendant une conversation active ou en période de trafic soutenu, et inutile pour un agent qui reçoit trois demandes par jour. Certains fournisseurs facturent l'écriture initiale du cache un peu plus cher que l'entrée normale, ce qui est neutre dès que vous relisez deux ou trois fois.
Modèle léger ou modèle lourd : comment trancher
Ne choisissez pas un modèle, choisissez un modèle par tâche. Chaque famille propose au moins trois gammes : un modèle rapide et économique, un modèle intermédiaire, un modèle haut de gamme. L'écart de prix entre le plus léger et le plus lourd d'une même famille se compte en dizaines de fois, pas en pourcentages.
La bonne pratique consiste à router. Classer une demande entrante, extraire un numéro de commande, reformuler une réponse, détecter une intention : un modèle léger fait cela très bien et coûte presque rien. Rédiger une réponse commerciale nuancée, raisonner sur des conditions contractuelles, arbitrer un cas ambigu : là, le modèle lourd se justifie.
Sur un agent de service client bien construit, la majorité des appels part vers le modèle léger et seule une minorité remonte vers le modèle lourd. C'est ce routage, plus que la négociation tarifaire, qui fait la différence entre un agent rentable et un agent qu'on débranche au bout de trois mois. Nous concevons systématiquement nos automatisations IA avec cette logique à deux étages.
Et pour un agent téléphonique, qu'est-ce qui s'ajoute ?
Trois postes supplémentaires, et le modèle de langage n'est plus le principal. Un agent vocal enchaîne trois briques facturées séparément.
La transcription convertit la voix du client en texte. Elle est facturée à la minute d'audio traitée, et vous payez le silence comme la parole si la détection de fin de tour est mal réglée.
Le modèle de langage produit la réponse, selon la logique de jetons décrite plus haut.
La synthèse vocale transforme le texte en voix. Elle est facturée au caractère produit ou à la minute générée selon les fournisseurs, et les voix les plus naturelles coûtent nettement plus cher que les voix standard.
À cela s'ajoute la téléphonie elle-même, c'est-à-dire le coût de la minute d'appel entrant ou sortant, qui n'a rien à voir avec l'IA et qu'on oublie systématiquement dans les budgets. Sur un agent vocal, la synthèse vocale et la téléphonie pèsent souvent autant que le modèle. Une réponse deux fois plus courte coûte deux fois moins cher en voix, et le client raccroche plus satisfait.
Le tableau de méthode : calculez votre coût par conversation
Ne cherchez pas un prix mensuel, cherchez un coût unitaire. Remplissez ce tableau une fois, en relevant les valeurs réelles sur vingt conversations enregistrées, puis multipliez par votre volume. C'est la seule méthode qui survit aux changements de grille.
| Étape | Ce que vous mesurez | Comment l'obtenir | Ce qui le fait exploser |
|---|---|---|---|
| 1. Tours par conversation | Nombre moyen d'allers-retours | Moyenne sur 20 échanges réels | Agent qui ne sait pas conclure |
| 2. Contexte fixe | Jetons de la consigne système et des règles | Compter une fois, il ne bouge pas | Consigne rédigée sans relecture |
| 3. Contexte variable | Jetons des extraits documentaires injectés | Nombre d'extraits fois leur taille | Trop d'extraits par requête |
| 4. Entrée cumulée | Somme des entrées sur tous les tours | Contexte fixe et variable, plus historique accumulé | Conversations longues |
| 5. Sortie cumulée | Jetons écrits par l'agent | Longueur moyenne de réponse fois nombre de tours | Réponses verbeuses |
| 6. Part mise en cache | Fraction de l'entrée réellement mise en cache | Relevé dans les journaux du fournisseur | Variable placée en tête de requête |
| 7. Postes voix | Minutes transcrites, caractères synthétisés, minutes télécom | Uniquement pour un agent téléphonique | Voix premium, silences non coupés |
| 8. Coût unitaire | Total en euros pour une conversation | Appliquer la grille en vigueur à chaque poste | Rien, si les étapes 1 à 7 sont tenues |
Multipliez l'étape 8 par votre volume mensuel, ajoutez une marge de sécurité de trente pour cent pour les reprises et les erreurs, et vous avez un budget défendable. Refaites l'exercice tous les trimestres.
Les trois erreurs de budget les plus fréquentes
Sous-estimer le volume de test. Pendant la phase de mise au point, vous consommez souvent plus qu'en production, parce que vous rejouez des dizaines de fois les mêmes scénarios. Prévoyez une enveloppe dédiée.
Oublier les appels invisibles. Un agent qui reformule une question, qui vérifie sa propre réponse ou qui décide s'il doit escalader fait plusieurs appels au modèle pour une seule réponse visible par le client. Comptez les appels internes, pas les messages affichés.
Ignorer l'observabilité. Sans journalisation des jetons par conversation, vous découvrez la dérive sur la facture, un mois trop tard. Un simple tableau de bord qui suit le coût moyen par conversation et son évolution hebdomadaire vous évite ce genre de surprise.
Ce qu'il faut retenir
Le coût d'un agent IA n'est pas un abonnement, c'est une fonction de votre architecture. Deux équipes avec le même volume et le même fournisseur peuvent avoir des factures sans rapport, selon la longueur de leur consigne, leur usage du cache, leur routage entre modèles et la discipline de leurs réponses.
Avant de demander un prix, demandez une méthode de calcul. Si votre prestataire vous annonce un montant mensuel sans jamais parler de jetons d'entrée, de contexte cumulé ni de mise en cache, il devine.
Si vous voulez chiffrer votre cas précis, réservez un premier échange de 15 minutes, gratuit et sans engagement. Nous décomposons ensemble votre coût par conversation et nous vous disons où il partirait en dérive.
Questions fréquentes
Combien coûte un agent IA par mois pour une PME ?
Il n'existe pas de prix mensuel type, parce que la facture dépend du volume de texte traité et non du nombre de conversations. Le bon réflexe est de calculer un coût par conversation en mesurant les jetons d'entrée cumulés, les jetons de sortie et, pour un agent téléphonique, les minutes de voix. Vous multipliez ensuite par votre volume réel et vous ajoutez une marge de trente pour cent. Deux agents au même volume peuvent avoir des factures dans un rapport de un à vingt selon leur architecture.
C'est quoi un jeton d'entrée et un jeton de sortie ?
Un jeton est un fragment de mot utilisé par le modèle pour découper le texte. Les jetons d'entrée correspondent à tout ce que vous envoyez au modèle : consigne système, historique de conversation, extraits de documents et question du client. Les jetons de sortie sont uniquement le texte que le modèle écrit en réponse. La sortie est plus chère à l'unité, mais l'entrée est bien plus volumineuse, ce qui en fait le poste dominant en production.
Pourquoi ma facture d'API augmente alors que mon trafic est stable ?
Le plus souvent parce que le contexte envoyé à chaque appel a grossi. Une consigne système rallongée, des extraits documentaires plus nombreux ou des conversations qui durent plus longtemps augmentent l'entrée cumulée sans changer le nombre de demandes traitées. Vérifiez aussi que la mise en cache fonctionne encore : une variable placée en tête de requête suffit à la désactiver. Une journalisation des jetons par conversation permet de repérer ce type de dérive en quelques jours.
La mise en cache du contexte fait-elle vraiment baisser le coût ?
Oui, à condition que la partie stable de votre requête soit placée en tête et ne change jamais. La portion mise en cache est relue à un tarif fortement réduit, ce qui allège la part la plus lourde de la facture. Le cache a une durée de vie courte, de l'ordre de quelques minutes, prolongée à chaque réutilisation. Il est donc très efficace en trafic soutenu et sans effet pour un agent qui reçoit quelques demandes par jour.
Faut-il prendre le modèle le plus performant pour un agent client ?
Non, il vaut mieux répartir les tâches entre plusieurs modèles. Classer une demande, extraire une référence ou détecter une intention se fait très bien avec un modèle léger dont le coût unitaire est très inférieur. Le modèle haut de gamme est réservé aux réponses nuancées et aux cas ambigus. Ce routage à deux étages est ce qui différencie le plus nettement un agent rentable d'un agent abandonné après quelques mois.
Qu'est-ce qui coûte le plus cher dans un agent vocal ?
Rarement le modèle de langage. Un agent téléphonique cumule la transcription facturée à la minute d'audio, le modèle facturé aux jetons, la synthèse vocale facturée au caractère ou à la minute, et la téléphonie facturée à la minute d'appel. La synthèse vocale et la téléphonie pèsent souvent autant que le modèle. Raccourcir les réponses réduit donc doublement la facture, et améliore l'expérience de l'appelant.
Comment budgéter la phase de test d'un agent IA ?
Prévoyez une enveloppe séparée, car la mise au point consomme souvent plus que la production. Vous rejouez des dizaines de fois les mêmes scénarios pour ajuster les consignes et vérifier les réponses. Comptez aussi les appels invisibles : un agent qui reformule, vérifie sa propre réponse ou décide d'escalader effectue plusieurs appels pour un seul message affiché. Ce sont ces appels internes, et non les messages visibles, qu'il faut compter.
À lire aussi
Nos pages sur ce sujet
Passer à l'action
Ce sujet correspond à notre agence d'automatisation IA. Voir aussi l'ensemble des secteurs accompagnés et les zones d'intervention.
Découvrir YZ Automation · Lire les avis clients · Réserver un échange de 15 min