
Coût des tokens LLM : comment calculer et estimer votre budget
Coût des tokens LLM : comment calculer et estimer votre budget

Pour estimer le coût tokens, appliquez cette formule : coût = (tokens totaux / — 000) × prix par million. Les grilles tarifaires varient fortement selon le fournisseur et le type de token, avec des prix d’entrée (input) généralement inférieurs aux prix de sortie (output), comme le montrent les tableaux de tarification officiels de Gemini. Mesurez d’abord le nombre moyen de tokens par requête, puis multipliez par votre volume mensuel pour obtenir un budget réaliste.
En bref:
- Mesurez le texte de la personne, les instructions système et l’historique, car ces éléments s’ajoutent à la réponse et leur tokenisation varie selon le fournisseur.
- Les fournisseurs facturent souvent les tokens d’entrée et de sortie séparément, tandis que le raisonnement intermédiaire, les fonctions multimodales et le mode d’inférence peuvent ajouter des coûts.
- Dans l’exemple étudié, une requête moyenne mobilise 800 tokens en entrée et 200 en sortie, mais le budget dépend du tarif du modèle choisi.
- L’écriture en cache coûte environ 1,25 fois le tarif de base pour cinq minutes, contre deux fois pour une heure ; la lecture revient généralement à 0,1 fois ce tarif.
- Comparez la même instruction chez deux ou trois fournisseurs, puis réservez le traitement par lots aux tâches non urgentes et raccourcissez les réponses.
Table des matières
- Qu’est-ce qu’un token et comment le mesurer
- Pourquoi la même requête coûte différemment selon le fournisseur
- Calculer le coût d’une intégration LLM : méthode et exemple chiffré
- Caching et optimisations : réduire la facture sans sacrifier la qualité
- Tableau des fourchettes de prix par million de tokens
- Notre approche du dimensionnement et de la maîtrise du coût tokens
- Questions fréquentes
- Sources
Qu’est-ce qu’un token et comment le mesurer
Un token correspond à un fragment de texte, souvent plus petit qu’un mot entier. En anglais, la règle empirique courante situe un token autour de quatre caractères, soit environ 0,75 mot. Le français, avec ses accents et ses constructions plus longues, tokenise généralement de façon légèrement moins efficace : comptez plutôt un ratio proche de 1 token pour 3 à 4 caractères selon le modèle utilisé.
Pour mesurer la consommation réelle d’une intégration, il faut isoler chaque composant du prompt avant de lancer le moindre calcul budgétaire.
- Le prompt utilisateur, c’est-à-dire la question ou l’instruction envoyée par la personne.
- Les instructions système, souvent invisibles pour l’utilisateur mais facturées à chaque appel.
- L’historique de conversation, qui s’accumule à mesure que les échanges se prolongent.
- La réponse générée, dont la longueur dépend du modèle et des paramètres choisis.
Des tokeniseurs en ligne permettent de coller un texte et d’obtenir instantanément son nombre de tokens pour un modèle donné. Ces outils restent indispensables avant tout chiffrage, car deux fournisseurs peuvent tokeniser la même phrase différemment. Avant de signer un budget prévisionnel, vérifiez toujours la tokenisation réelle plutôt que de vous fier à une estimation générique.
Pourquoi la même requête coûte différemment selon le fournisseur
La facture finale ne dépend pas uniquement du volume de texte échangé. Elle varie selon la nature du token facturé et le mode d’inférence choisi.
- Les tokens d’entrée et de sortie sont presque toujours tarifés séparément, l’output coûtant généralement plusieurs fois plus cher que l’input.
- Certains modèles facturent aussi des tokens de raisonnement intermédiaire, invisibles dans la réponse finale mais bien comptés dans la note.
- Les modes d’inférence Standard, Flex, Priority ou Batch, décrits dans la documentation d’optimisation de Gemini, modifient le prix et la latence pour un même modèle.
- Les fonctionnalités additionnelles comme la multimodalité, le grounding ou les requêtes de recherche web ajoutent des lignes de facturation distinctes.
Un traitement en mode Batch, qui accepte une latence plus longue, revient souvent nettement moins cher qu’un appel en temps réel facturé en Priority.
Conseil de pro : avant de choisir un modèle, testez le même prompt sur deux ou trois fournisseurs et comparez le nombre de tokens générés, pas seulement le prix affiché par million.
Calculer le coût d’une intégration LLM : méthode et exemple chiffré
Pour transformer une hypothèse d’usage en budget mensuel fiable, suivez cette méthode en quatre étapes.
- Mesurez le nombre moyen de tokens d’entrée par requête, en incluant instructions système et historique.
- Estimez le nombre de tokens de sortie attendus, qui dépend de la longueur moyenne des réponses souhaitées.
- Appliquez le prix par million de tokens de votre fournisseur, séparément pour l’input et l’output.
- Multipliez le coût par requête par le nombre de requêtes mensuelles pour obtenir le budget global.
Prenons un exemple illustratif pour un chatbot conversationnel traitant un volume mensuel modéré de requêtes. Disons qu’une requête moyenne, incluant l’historique multi-tours, mobilise environ 800 tokens en entrée et 200 tokens en sortie. Le coût total dépendra des tarifs spécifiques appliqués par votre fournisseur.
Ce calcul reste purement illustratif : vos propres prix par million dépendent du modèle réellement choisi et doivent être vérifiés sur la grille officielle de votre fournisseur. L’enjeu principal apparaît vite : dans une conversation multi-tours, chaque nouveau message renvoie tout l’historique précédent, ce qui fait grimper le nombre de tokens d’entrée de façon cumulative. C’est précisément ce mécanisme qui justifie de surveiller la longueur des échanges et d’envisager des mécanismes de caching dès que le volume de requêtes dépasse quelques milliers par mois.
Caching et optimisations : réduire la facture sans sacrifier la qualité
Le prompt caching change radicalement l’équation de coût lorsqu’un même contexte est réutilisé plusieurs fois. La documentation d’Anthropic sur le caching distingue deux mécanismes : l’écriture en cache, facturée avec une majoration selon la durée de rétention choisie, et la lecture en cache, facturée à un tarif réduit par rapport au prix de base.
- Un cache écrit pour cinq minutes coûte environ 1,25 fois le prix de base, tandis qu’une rétention d’une heure coûte environ le double.
- Une lecture depuis le cache coûte généralement autour de 0,1 fois le prix de base, un écart qui justifie largement l’investissement initial dès la deuxième utilisation.
- La documentation Gemini sur le context caching précise qu’un volume minimal de tokens est requis pour bénéficier du mécanisme implicite ou explicite.
Dans une application conversationnelle où les mêmes instructions système et le même contexte documentaire reviennent à chaque appel, le point de rentabilité du cache arrive presque immédiatement : le surcoût de l’écriture initiale se rembourse dès que ce contexte est relu une ou deux fois.
Conseil de pro : découpez vos prompts pour isoler la partie statique (instructions système, documents de référence) de la partie dynamique (question de l’utilisateur), et mettez en cache uniquement la première.
D’autres leviers opérationnels complètent le caching : le traitement par lots (batch) pour les tâches non urgentes, le choix d’un tier d’inférence adapté à la criticité de chaque usage, et la limitation volontaire de la longueur des réponses attendues.

Tableau des fourchettes de prix par million de tokens
Les grilles tarifaires évoluent fréquemment et doivent toujours être vérifiées sur la source officielle avant tout engagement budgétaire. Le tableau suivant reflète la structure de tarification telle que documentée par Gemini, à titre de repère méthodologique plutôt que de référence figée.
| Profil d’offre | Caractéristique input | Caractéristique output | Caractéristique cache |
|---|---|---|---|
| Mode Standard | Prix de base par million de tokens | Prix généralement supérieur à l’input | Lecture en cache à tarif réduit |
| Mode Batch | Traitement différé, tarif avantageux | Tarif avantageux également | Compatible selon fournisseur |
| Mode Priority | Latence minimale, tarif majoré | Tarif majoré pour la rapidité | Moins pertinent sur ce mode |
Une hausse généralisée des prix du token a d’ailleurs été observée récemment, un mouvement que l’Humanité a analysé comme un risque croissant pour les budgets IA des entreprises. Convertir ces prix en euros et suivre les mises à jour mensuelles fait partie des réflexes à adopter dès qu’un projet passe en production.
Pour approfondir le choix du modèle en fonction de vos contraintes opérationnelles, notre article sur comment choisir un LLM pour entreprise détaille les critères techniques et budgétaires à croiser.
Notre approche du dimensionnement et de la maîtrise du coût tokens
Nous abordons chaque projet de chatbot ou d’agent conversationnel par un audit de l’usage réel attendu, suivi d’une simulation de coût basée sur des volumes et des longueurs de conversation concrets. Cette étape précède systématiquement le développement d’un PoC, ce qui permet de valider le budget avant tout engagement durable. Nous mettons ensuite en place un suivi des dépenses tokens avec des seuils d’alerte, pour éviter les dérives budgétaires une fois la solution en production. Si vous préparez une intégration conversationnelle, notre page de conseil en intégration IA détaille cette démarche.
— Botiqueai
Questions fréquentes
Quel fournisseur d’API LLM propose les tokens les plus économiques ?
Le fournisseur le plus économique dépend du cas d’usage : certains modèles affichent des prix d’entrée très bas mais une facturation de sortie plus élevée, tandis que d’autres équilibrent davantage les deux. Les grilles tarifaires officielles de Gemini permettent de comparer directement ces profils avant de choisir.
Qu’est-ce qu’un token en intelligence artificielle ?
Un token est un fragment de texte, souvent plus court qu’un mot entier, que le modèle traite comme unité de base pour lire et générer du texte. En anglais, on compte environ quatre caractères par token, un ratio légèrement différent en français du fait des accents et des constructions linguistiques.
Combien coûte un token d’IA ?
Le coût d’un token dépend du fournisseur, du modèle et du type de token, input ou output, avec des écarts de prix importants entre les deux. La formule pratique reste : coût = (nombre de tokens / — 000) × prix par million, en consultant la grille officielle du modèle retenu.
Combien coûte un chatbot basé sur un LLM ?
Le coût mensuel d’un chatbot dépend du volume de requêtes, de la longueur moyenne des échanges et du modèle choisi, sans montant universel applicable à tous les cas. Une estimation fiable nécessite de mesurer les tokens moyens par conversation et de les multiplier par le volume mensuel attendu, comme détaillé dans la méthode de calcul présentée plus haut.
Sources
- Gemini Developer API pricing | Gemini API | Google AI for Developers
- Prompt caching | Anthropic docs
- La flambée des prix du token, une bombe à retardement …