Calculateur de tokens
Calculez le coût d’utilisation des modèles de langage IA. Estimez les tokens à partir du texte et comparez les prix entre les modèles comme GPT-5, Claude et Gemini.
$
$
$0.02
Entrée : $0.0050 · Sortie : $0.01
$1.75
100 requêtes par jour
$52.50
30 jours
$638.75
365 jours
Estimer les tokens à partir du texte
Caractères
0
Mots
0
Tokens estimés
~0
Calculateur de coût des tokens. Prix par million de tokens et facture d'API pour GPT, Claude, Gemini, Mistral et DeepSeek.
Ce calculateur chiffre n'importe quel appel d'API LLM à partir de vos tokens d'entrée et de sortie : GPT, Claude, Gemini, Grok, DeepSeek ou Mistral. Choisissez un modèle dans la liste et ses deux tarifs se remplissent tout seuls ; les quatre cartes affichent alors le coût par requête, par jour, par mois et par an.
Qu'est-ce qu'un token, et pourquoi la même phrase coûte plus cher en français
Un token est le fragment de texte qu'un modèle de langage lit et écrit réellement : un morceau de mot produit par un algorithme de tokenisation de type BPE. Les mots courants — « le », « de », « est » — tiennent en un seul token, tandis que « développement » en demande plusieurs. En anglais, un token pèse en moyenne quatre caractères, soit environ 0,75 mot ; mille mots anglais tournent donc autour de 1 330 tokens. C'est cette unité, et elle seule, que les fournisseurs d'API facturent : le compteur démarre au premier fragment du prompt et s'arrête au dernier caractère de la réponse.
Le français n'entre pas dans ce moule au même prix. Le guide de tokenisation de quelllm.fr avance 15 à 30 % de tokens supplémentaires pour un contenu équivalent ; une mesure publiée sur le blog Kathane, qui fait passer les 50 000 mots les plus fréquents de chaque langue — pondérés par leur fréquence d'usage réelle dans le corpus OpenSubtitles — dans le tokeniseur o200k_base d'OpenAI, donne 1,52 token par mot en français contre 1,16 en anglais, soit 31 % de plus. Les vocabulaires BPE ont été construits en priorité sur de l'anglais, les élisions et les accents coupent les mots là où l'anglais ne coupe pas, et la morphologie française multiplie les formes fléchies d'un même verbe. Mistral, de son côté, écrit de son tokeniseur Tekken qu'il est « ~30 % plus efficace » que celui de Llama 3 pour compresser le français, l'italien, l'allemand, l'espagnol, le russe, le chinois et le code source. La comparaison porte sur deux tokeniseurs et non sur deux langues, mais elle dit que le découpage du français est un problème que les fournisseurs traitent explicitement.
Aucune grille tarifaire ne montre ce surcoût : il agit sur le nombre de tokens facturés et laisse le prix unitaire intact. Pour une équipe qui sert des utilisateurs francophones, c'est pourtant le seul multiplicateur qui s'applique à toutes les lignes à la fois : prompt système, historique de conversation, documents récupérés, réponse générée. Il traverse le coût par requête, le coût quotidien, le coût mensuel et le coût annuel sans jamais s'atténuer.
Les fournisseurs tiennent deux compteurs séparés : les tokens d'entrée (prompt système, contexte, historique et question) et les tokens de sortie (la réponse). Les deux sont annoncés au million, et la sortie coûte presque toujours plus cher. Le multiple est une signature de famille : toute la gamme Claude facture la sortie 5 fois l'entrée, les paliers de GPT-5.6 tournent entre 5 et 6 fois, Grok 4.5 est à 3 fois et Grok 4.3 à 2 fois. Un appel isolé coûte une fraction de centime ; multiplié par des milliers de requêtes quotidiennes, le poste devient une ligne budgétaire à part entière.
Le compte exact pour un même texte change aussi d'un modèle à l'autre, parce que chaque fournisseur livre son propre tokeniseur. Il change même entre deux générations d'une même famille : d'après la documentation tarifaire d'Anthropic, les Claude 4.7 et suivants comptent environ 30 % de tokens de plus que Sonnet 4.6 et les versions antérieures pour un texte identique, et la question qui leur est consacrée plus bas chiffre ce que cela donne sur une facture. Le code, le JSON, les nombres et les emoji se fragmentent encore davantage, ce qui est la raison de fond pour laquelle un tarif par token ne se convertit jamais proprement en tarif par page.
Ce calculateur embarque les tarifs standard publiés par OpenAI, Anthropic, Google, xAI, DeepSeek, Mistral, Amazon, Meta et Cohere. L'amplitude approche les trois ordres de grandeur : Amazon Nova Micro est à 0,035/0,14 USD le million, GPT-5.5 Pro à 30/180 USD, soit 857,1 fois sur la seule entrée. Entre les deux : Claude Fable 5 à 10/50 USD, GPT-5.6 Sol à 4/20 USD, Claude Opus 5 à 5/25 USD, Claude Sonnet 5 à 2/10 USD, GPT-5.6 Terra à 2/12 USD, Gemini 3.6 Flash à 0,75/3,75 USD, GPT-5.6 Luna à 0,20/1,20 USD et Mistral Small 4 à 0,15/0,60 USD.
Toutes ces valeurs sont des tarifs standard à la demande : pas de remise Batch, pas d'entrée mise en cache, pas de palier négocié. Plusieurs modèles changent de grille au-delà d'un seuil de contexte — c'est le cas des trois paliers GPT-5.6, ainsi que des Grok et des Gemini concernés au-delà de 200 000 tokens — et c'est toujours le tarif court contexte qui est retenu ici, parce qu'un tarif plat par token est ce qu'un calculateur peut représenter honnêtement. DeepSeek divise ses tarifs par deux en heures creuses. Et Gemini 3.6 Flash double le 1er janvier 2027, passant à 1,50 USD en entrée et 7,50 USD en sortie. Si votre modèle n'est pas dans la liste, l'option « Personnalisé » accepte n'importe quel tarif au millier ou au million.
Pour un acheteur français, une question arrive juste après le prix : où tourne l'inférence. Les grandes grilles sont publiées en dollars, y compris celle de Mistral sur sa propre plateforme ; les passerelles souveraines françaises, OVHcloud AI Endpoints et Scaleway Generative APIs, hébergent l'inférence en France et publient leurs grilles en euros. Les deux reviennent en détail dans le dernier cas chiffré de cette page. Côté conformité, la CNIL place la responsabilité légale d'un mauvais usage de l'IA par le personnel sur l'organisme utilisateur et recommande de limiter au maximum la saisie de données personnelles dans un service d'IA générative ; ses formulations exactes sont reprises dans la question qui lui est consacrée. Cela n'apparaît sur aucune facture et cela décide pourtant quel tarif vous avez le droit de comparer.
Comment utiliser le calculateur de coût des tokens
Passer d'un nom de modèle à un budget annuel prend moins d'une minute.
1. Choisissez un modèle. La liste « Modèle » est groupée par fournisseur et chaque ligne porte déjà son tarif, ce qui permet de comparer avant même de cliquer. Sélectionner une ligne remplit les deux champs de prix. Le calculateur s'ouvre sur Claude Opus 5.
2. Vérifiez l'unité. Les deux champs de prix, « Entrée » et « Sortie », sont libellés en dollars par million de tokens. L'interrupteur 1K / 1M bascule vers le millier, et il convertit ce qui est déjà saisi au lieu de le réinterpréter : un tarif de 5 par million devient 0,005 par millier. Si votre fournisseur ne publie qu'un tarif au millier, basculez plutôt que de diviser à la main.
3. Sachez que taper un prix à la main renvoie la liste sur « Personnalisé ». C'est voulu : dès que le tarif n'est plus celui du catalogue, le nom du modèle ne veut plus rien dire. Le cas souverain chiffré plus bas passe par ce mode pour une passerelle d'inférence française.
4. Renseignez « Tokens d'entrée », « Tokens de sortie » et « Requêtes par jour ». Les valeurs de départ sont 1 000, 500 et 100. Le troisième champ est celui qu'on oublie, et c'est lui qui transforme une fraction de centime en ligne budgétaire.
5. Lisez les quatre cartes. « Coût par requête » porte en sous-titre le détail entrée / sortie, ce qui indique tout de suite si le problème vient d'un prompt trop long ou d'une réponse bavarde. Viennent ensuite « Coût quotidien », « Coût mensuel » sur 30 jours et « Coût annuel » sur 365.
6. Estimez les tokens depuis votre texte. La section « Estimer les tokens à partir du texte » reste masquée tant que rien n'est collé ; dès qu'il y a du texte, elle affiche « Caractères », « Mots » et « Tokens estimés ». Le champ accepte 2 000 caractères, et il part aussitôt dans l'adresse de la page : le calculateur y écrit l'état en continu, sans attendre le bouton « Partager ». Videz le champ avant de copier ou d'envoyer un lien contenant un extrait confidentiel.
Le coût d'un appel tient en une ligne :
où Te et Ts sont les tokens d'entrée et de sortie, Pe et Ps les tarifs par million. En mots : tokens d'entrée × tarif d'entrée, plus tokens de sortie × tarif de sortie, le tout ramené du million au token. Multipliez par les requêtes quotidiennes pour la carte du jour, puis par 30 pour le mois et par 365 pour l'année. Ce mois de 30 jours pleins est un choix assumé : il n'y a pas de calendrier, donc deux projections faites à un mois d'intervalle restent comparables.
Une même saisie sert deux fois. Entrez vos comptes mesurés, lisez la carte annuelle, puis remplacez-les par les mêmes comptes majorés de 31 % et relisez-la : l'écart entre les deux lignes est ce que la langue coûte sur un an, et c'est le chiffre qui surprend au premier relevé. Reste à savoir sur quel modèle vous le payez — la liste déroulante rejoue ces deux comptes sur le palier au-dessus et sur le palier en dessous sans rien ressaisir d'autre, et « Personnalisé » fait entrer une passerelle française dans la même comparaison.
Tout est calculé dans votre navigateur. Le texte collé dans l'estimateur n'est envoyé à aucun serveur et ne consomme aucun quota de modèle. Il reste en revanche dans l'adresse de la page, donc videz le champ avant de partager un lien.
Prix par million de tokens, modèle par modèle (entrée, sortie et rapport)
| Modèle | Entrée (USD / million) | Sortie (USD / million) | Sortie ÷ entrée |
|---|---|---|---|
| Amazon Nova Micro | 0,035 USD | 0,14 USD | 4× |
| Cohere Command R7B | 0,0375 USD | 0,15 USD | 4× |
| Gemini 2.5 Flash-Lite | 0,10 USD | 0,40 USD | 4× |
| Mistral Small 4 | 0,15 USD | 0,60 USD | 4× |
| GPT-5.6 Luna | 0,20 USD | 1,20 USD | 6× |
| GPT-5.4 Nano | 0,20 USD | 1,25 USD | 6,3× |
| Gemini 3.1 Flash-Lite | 0,25 USD | 1,50 USD | 6× |
| Codestral | 0,30 USD | 0,90 USD | 3× |
| DeepSeek V4 Flash | 0,30 USD | 1,20 USD | 4× |
| Gemini 3.5 Flash-Lite | 0,30 USD | 2,50 USD | 8,3× |
| Gemini 2.5 Flash | 0,30 USD | 2,50 USD | 8,3× |
| Mistral Large 3 | 0,50 USD | 1,50 USD | 3× |
| Llama 3.3 70B | 0,59 USD | 0,79 USD | 1,3× |
| Gemini 3.6 Flash | 0,75 USD | 3,75 USD | 5× |
| GPT-5.4 Mini | 0,75 USD | 4,50 USD | 6× |
| Amazon Nova Pro | 0,80 USD | 3,20 USD | 4× |
| Claude Haiku 4.5 | 1 USD | 5 USD | 5× |
| Grok 4.3 | 1,25 USD | 2,50 USD | 2× |
| Gemini 2.5 Pro | 1,25 USD | 10 USD | 8× |
| DeepSeek V4 Pro | 1,32 USD | 3,96 USD | 3× |
| Mistral Medium 3.5 | 1,50 USD | 7,50 USD | 5× |
| Gemini 3.5 Flash | 1,50 USD | 9 USD | 6× |
| GPT-5.3 Codex | 1,75 USD | 14 USD | 8× |
| Grok 4.5 | 2 USD | 6 USD | 3× |
| Claude Sonnet 5 | 2 USD | 10 USD | 5× |
| GPT-5.6 Terra | 2 USD | 12 USD | 6× |
| Gemini 3.1 Pro | 2 USD | 12 USD | 6× |
| Cohere Command R+ | 2,50 USD | 10 USD | 4× |
| Amazon Nova Premier | 2,50 USD | 12,50 USD | 5× |
| GPT-5.4 | 2,50 USD | 15 USD | 6× |
| Claude Sonnet 4.6 | 3 USD | 15 USD | 5× |
| GPT-5.6 Sol | 4 USD | 20 USD | 5× |
| Claude Opus 5 | 5 USD | 25 USD | 5× |
| Claude Opus 4.8 | 5 USD | 25 USD | 5× |
| GPT-5.5 | 5 USD | 30 USD | 6× |
| Claude Fable 5 | 10 USD | 50 USD | 5× |
| GPT-5.5 Pro | 30 USD | 180 USD | 6× |
Cas chiffrés avec les vrais nombres du moteur de calcul
Assistant de support francophone : ce que la langue ajoute à la facture
Une équipe produit dimensionne un assistant de support à partir de mesures faites sur un corpus anglais : 2 000 tokens d'entrée et 500 de sortie par conversation, 1 000 conversations par jour. Le service est ensuite lancé en français, sans que rien d'autre ne change.
Avec une fertilité de 1,52 token par mot en français contre 1,16 en anglais, le même contenu pèse 31 % de plus : la conversation passe de 2 000 / 500 à 2 620 / 655 tokens. Comme le multiplicateur s'applique aux deux côtés, il traverse le calcul tel quel et le surcoût est exactement celui de la langue.
Sur Claude Sonnet 5, à 2/10 USD le million : la version anglaise coûte 270,00 USD par mois et 3 285,00 USD par an ; la française, 353,70 USD et 4 303,35 USD.
Même exercice sur GPT-5.6 Terra, à 2/12 USD : 300,00 USD mensuels en anglais contre 393,00 USD en français, soit 4 781,50 USD annuels.
Et sur Mistral Small 4, à 0,15/0,60 USD : 18,00 USD contre 23,58 USD par mois.
Aucun modèle n'échappe au multiplicateur, et aucun ne l'aggrave : le rapport reste le même partout. Ce qui change d'un palier à l'autre, c'est l'écart en valeur absolue, qui grandit avec le tarif. Un tiers de plus sur un palier économique reste anecdotique ; un tiers de plus sur un palier haut de gamme finance un poste de travail. D'où la règle : mesurez les comptes de tokens sur du français avant de chiffrer quoi que ce soit.
Chatbot à 5 000 conversations par jour : le palier économique modèle par modèle
Un chatbot grand public traite 2 000 tokens d'entrée et 800 de sortie par conversation, 5 000 fois par jour. C'est le volume à partir duquel le choix du modèle cesse d'être une question de goût.
| Modèle | Tarif (entrée / sortie) | Par mois | Par an |
|---|---|---|---|
| Amazon Nova Micro | 0,035/0,14 USD | 27,30 USD | 332,15 USD |
| Cohere Command R7B | 0,0375/0,15 USD | 29,25 USD | 355,88 USD |
| Gemini 2.5 Flash-Lite | 0,10/0,40 USD | 78,00 USD | 949,00 USD |
| Mistral Small 4 | 0,15/0,60 USD | 117,00 USD | 1 423,50 USD |
| Codestral | 0,30/0,90 USD | 198,00 USD | 2 409,00 USD |
| GPT-5.6 Luna | 0,20/1,20 USD | 204,00 USD | 2 482,00 USD |
| DeepSeek V4 Flash | 0,30/1,20 USD | 234,00 USD | 2 847,00 USD |
| Mistral Large 3 | 0,50/1,50 USD | 330,00 USD | 4 015,00 USD |
| Claude Haiku 4.5 | 1/5 USD | 900,00 USD | 10 950,00 USD |
| Claude Sonnet 5 | 2/10 USD | 1 800,00 USD | 21 900,00 USD |
| Claude Opus 5 | 5/25 USD | 4 500,00 USD | 54 750,00 USD |
Mistral Small 4 est le nom à retenir dans ce tableau : son entrée représente 15 % de celle de Claude Haiku 4.5 et 75 % de celle de GPT-5.6 Luna, ce qui installe le modèle français au cœur du palier économique. Pour une équipe qui cherchait une raison technique de tester une option domestique, le tarif en fournit une.
Reste la colonne sortie ÷ entrée, que le tableau de référence plus haut donne modèle par modèle. Quatre modèles du catalogue partagent exactement le même tarif d'entrée et n'ont pas du tout la même facture de sortie : Codestral sort à 3 fois son entrée, DeepSeek V4 Flash à 4 fois, Gemini 2.5 Flash et Gemini 3.5 Flash-Lite à 8,3 fois. Dès que l'usage génère beaucoup de texte, c'est elle qui décide du classement.
RAG sur une base documentaire française : 8 000 tokens d'entrée, 1 000 requêtes par jour
Un moteur de recherche interne récupère des extraits de documentation et les envoie au modèle avec la question : 8 000 tokens d'entrée, 500 tokens de réponse, 1 000 requêtes par jour.
Sur GPT-5.6 Sol : 0,042 USD par requête, 42,00 USD par jour, 1 260,00 USD par mois, 15 330,00 USD sur l'année.
Sur Claude Sonnet 5 : 0,021 USD l'appel, ce qui donne 630,00 USD mensuels et 7 665,00 USD annuels.
Sur Gemini 3.6 Flash : 0,0079 USD, soit 236,25 USD par mois. Attention à la date : ce modèle double le 1er janvier 2027, à 1,50 USD et 7,50 USD, ce qui doublera aussi cette ligne.
Sur DeepSeek V4 Flash : 0,003 USD l'appel et 90,00 USD par mois.
La particularité du RAG francophone tient au côté où tombe le surcoût de langue. Les extraits récupérés sont en français, donc l'inflation de tokens frappe l'entrée, c'est-à-dire précisément le côté qu'aucun paramètre ne plafonne : max_tokens borne la réponse, rien ne borne le contexte que vous avez décidé d'envoyer. Majorés de 31 %, les 8 000 tokens deviennent 10 480, et la ligne Gemini 3.6 Flash passe de 236,25 USD à 309,49 USD par mois.
Le levier est structurel : récupérer moins d'extraits mais mieux ciblés, découper les documents plus finement, et mettre en cache la partie fixe du prompt. Un passage de huit extraits à quatre divise la ligne d'entrée par deux, ce qu'aucun changement de modèle du même palier ne fait.
Estimer les tokens d'une phrase française avec l'estimateur de la page
L'estimateur convertit avec max(⌈caractères ÷ 4⌉, ⌈mots × 1,33⌉) et garde la plus grande des deux branches.
Sur « Le service de développement logiciel a entièrement révisé la base de calcul des coûts pour les modèles de langage et l'a documentée. » : 132 caractères, 22 mots, donc ⌈132 ÷ 4⌉ = 33 d'un côté et ⌈22 × 1,33⌉ = 30 de l'autre. L'outil affiche ~33 tokens.
Sur « Bonjour le monde, comment vas-tu aujourd'hui ? » : 46 caractères, 7 mots, résultat ~12 tokens. Sur « L'élève a préféré réécrire l'énoncé après avoir vérifié les données. » : 68 caractères, 10 mots, résultat ~17 tokens.
Le contrôle anglais est instructif : une phrase de 84 caractères et 18 mots donne ~24 tokens, et c'est la branche des mots qui l'emporte. En français, c'est presque toujours la branche des caractères, parce que les mots y sont plus longs. Les deux branches restent à une dizaine de pour cent l'une de l'autre sur de la prose française courante.
Ce chiffre est un plancher. Sur la première phrase, 22 mots à 1,52 token par mot prédisent environ 33 tokens, ce qui tombe pile ; mais l'heuristique ne compte séparément ni la ponctuation, ni les élisions comme « l' » et « d' », ni les majuscules en début de phrase, qui sont autant de frontières de découpage pour un vrai tokeniseur BPE. Comptez une marge, et pour un chiffre à la ligne de facture près, lisez le champ usage que l'API renvoie sur quelques appels réels.
L'écart se creuse franchement sur le code et le JSON, qui se fragmentent beaucoup plus que la prose, et sur les modèles Claude récents, dont le tokeniseur ajoute environ 30 % de tokens pour le même texte d'après la documentation tarifaire d'Anthropic. L'estimateur reste une approximation générique de BPE ; le compte exact d'un modèle donné vient de son propre tokeniseur.
Point de sortie souverain : chiffrer une passerelle française avec « Personnalisé »
La liste déroulante contient les grilles standard des grands fournisseurs. Elle ne contient pas les passerelles d'inférence européennes, et c'est exactement le cas d'usage de l'option « Personnalisé ».
OVHcloud AI Endpoints est hébergé en France et indique que « les données ne sont jamais utilisées pour entraîner ou améliorer des modèles d'IA ». Scaleway Generative APIs fait tourner l'inférence sur des GPU installés à Paris. Les deux facturent au million de tokens, et les deux publient leurs grilles en euros — alors que les grandes grilles américaines, et celle de Mistral sur sa propre plateforme, sont en dollars.
La marche à suivre tient en trois gestes : sélectionnez « Personnalisé », tapez le tarif d'entrée et le tarif de sortie de votre passerelle, vérifiez l'interrupteur 1K / 1M si la grille est publiée au millier. Les quatre cartes se recalculent immédiatement. Une précision d'usage : les cartes impriment toujours le symbole du dollar, quel que soit ce que vous avez saisi. Si vous y avez entré des euros, lisez les quatre montants comme des euros.
Cette comparaison ne se résume pas au tarif. La CNIL place la responsabilité légale d'un mauvais usage de l'IA par le personnel sur l'organisme utilisateur, et elle conseille de privilégier un déploiement sur site pour les données sensibles ou stratégiques ; ses formulations exactes figurent dans la question qui lui est consacrée plus bas. Avant de chercher quel modèle est le moins cher, il faut donc établir lesquels vous avez le droit de mettre dans la comparaison.
Dernier point, celui qu'un calculateur ne peut pas modéliser : si votre fournisseur facture en dollars et que vous budgétez en euros, la carte annuelle bouge avec le taux de change même quand votre trafic ne bouge pas. Les grilles sont par ailleurs affichées hors taxes.
Les erreurs qui font déraper un budget d'API IA
- Estimer un prompt français avec des repères anglais. La règle « 1 token ≈ 0,75 mot » vient de l'anglais. Sur du français, comptez une fertilité autour de 1,5 token par mot : un prompt système de 400 mots ne pèse pas 300 tokens mais près de 600, et il repart en entrée à chaque appel.
- Confondre le tarif d'entrée et le tarif de sortie. La sortie est presque toujours la plus chère, et le multiple est une signature de famille : toute la gamme Claude facture la sortie 5 fois l'entrée, Grok 4.5 3 fois, Grok 4.3 2 fois. Regardez d'abord la colonne « Sortie ÷ entrée » du tableau : plafonner la longueur de réponse rapporte souvent plus que raccourcir le prompt.
- Lire le coût par requête et oublier de le multiplier. Un appel à quelques millièmes de dollar paraît gratuit ; ce qui fait la facture, c'est le produit tarif × requêtes par jour × jours. Le champ « Requêtes par jour » décide à lui seul des cartes mensuelle et annuelle.
- Oublier que chaque tour renvoie tout l'historique. L'API est sans état : au dixième tour, les neuf précédents repartent en entrée, et une conversation ordinaire atteint des dizaines de milliers de tokens par appel. En français, cet historique repart lui aussi majoré de 31 % à chaque tour, ce qui fait de la conversation longue l'endroit où le surcoût de langue s'accumule le plus vite. Une fenêtre glissante sur les derniers échanges, complétée d'un résumé périodique, tient la ligne d'entrée à peu près constante d'un tour à l'autre.
- Prendre le modèle phare pour tout le trafic. L'écart entre le haut et le bas du comparatif atteint 857,1 fois sur la seule entrée. Classification, extraction, routage et reformulation passent très bien sur un palier économique ; un routeur « petit modèle d'abord, escalade si nécessaire » divise souvent la facture par deux sans que l'utilisateur voie la différence.
- Ignorer le cache de prompts et le tarif Batch. Les deux sont des remises documentées par les fournisseurs, applicables sans négociation : un succès de cache est facturé 10 % du tarif d'entrée standard, et l'API Batch coupe de moitié l'entrée et la sortie sur les traitements différés. Placez le texte fixe tout au début du prompt pour maximiser les succès de cache.
- Budgéter sur un tarif qui a une date de péremption. Un tarif de lancement expire à une date publiée, et plusieurs modèles changent de grille selon le contexte ou selon l'heure : DeepSeek divise ses tarifs par deux en heures creuses, et Gemini 3.6 Flash passe à 1,50 USD et 7,50 USD le 1er janvier 2027. Ce calculateur retient le tarif standard à la demande, court contexte, sans remise — un budget bâti dessus ne casse pas quand une promotion se termine.
- Raisonner en euros sur une grille en dollars. Les tarifs repris ici sont en dollars et hors taxes. Un budget annuel signé sur ces chiffres porte un risque de change que le calculateur ne modélise pas. Portez cette marge en ligne distincte, à côté du montant annuel qu'elle concerne.
- Prendre le mois du calculateur pour un mois calendaire. Le mois vaut 30 jours pleins et l'année 365, sans calendrier. C'est ce qui rend comparables deux projections faites à un mois d'intervalle, et c'est aussi pourquoi un mois de 31 jours sortira environ 3 % au-dessus du chiffre affiché.
Questions fréquentes sur les tokens et le coût des API d'IA
Combien de tokens fait un texte de 1 000 mots en français ?
Environ 1 500 tokens. La mesure publiée sur le blog Kathane — les 50 000 mots les plus fréquents de chaque langue, pondérés par leur fréquence d'usage dans le corpus OpenSubtitles et passés dans le tokeniseur o200k_base d'OpenAI — donne 1,52 token par mot en français contre 1,16 en anglais. Un article de 1 000 mots pèse donc autour de 1 520 tokens en français, quand 1 000 mots d'anglais en pèsent près de 1 160 dans le même tokeniseur. Pour un chiffre sur votre propre prose, collez-la dans l'estimateur de cette page.
Le français consomme-t-il vraiment plus de tokens que l'anglais ?
Oui, de l'ordre d'un tiers. Les mesures publiées situent l'écart entre 15 % (guide de tokenisation de quelllm.fr) et 31 % (mesure o200k_base sur OpenSubtitles) selon le corpus et le tokeniseur. En cause : des vocabulaires BPE construits surtout sur de l'anglais, les accents, et les élisions qui coupent les mots.
Combien coûte GPT-5.6 Sol par million de tokens ?
GPT-5.6 Sol est facturé 4 USD le million de tokens en entrée et 20 USD en sortie, au tarif standard à la demande. Terra est à 2/12 USD et Luna à 0,20/1,20 USD : entre le haut et le bas de la famille, il y a 20 fois d'écart sur l'entrée.
Combien coûte Claude Opus 5, et est-il moins cher que GPT-5.6 Sol ?
Claude Opus 5 est à 5/25 USD le million, exactement la grille de Claude Opus 4.8. GPT-5.6 Sol, à 4/20 USD, est moins cher des deux côtés : son entrée représente 80 % de celle d'Opus 5. Sur un assistant à 2 000 tokens d'entrée et 500 de sortie, 1 000 requêtes par jour, cela fait 675,00 USD par mois contre 540,00 USD. Les deux gardent le même rapport sortie ÷ entrée de 5 fois, donc le classement ne s'inverse pas quand votre mélange change.
Quels sont les modèles les moins chers du comparatif ?
Classés par tarif d'entrée : Amazon Nova Micro (0,035/0,14 USD), Cohere Command R7B (0,0375/0,15 USD), Gemini 2.5 Flash-Lite (0,10/0,40 USD), Mistral Small 4 (0,15/0,60 USD), GPT-5.6 Luna (0,20/1,20 USD) et GPT-5.4 Nano (0,20/1,25 USD). Attention, le classement par entrée n'est pas le classement par facture : si votre charge génère beaucoup de texte, c'est la colonne « Sortie ÷ entrée » du tableau qui décide. Et un modèle bon marché qui demande trois tentatives revient plus cher qu'un modèle cher qui réussit du premier coup.
Où se situe Mistral par rapport aux autres modèles économiques ?
Mistral Small 4 est à 0,15/0,60 USD le million, Codestral à 0,30/0,90 USD et Mistral Large 3 à 0,50/1,50 USD ; Mistral Medium 3.5 monte à 1,50/7,50 USD. Sur l'entrée, Mistral Small 4 demande 15 % de ce que demande Claude Haiku 4.5 et 75 % de GPT-5.6 Luna. Sur le chatbot du deuxième exemple — 2 000 tokens d'entrée, 800 de sortie, 5 000 requêtes par jour — cela donne 117,00 USD par mois. Sur le seul critère du tarif, l'option française tient donc sa place dans la comparaison.
Pourquoi les tokens de sortie coûtent-ils plus cher que les tokens d'entrée ?
Parce que la génération est séquentielle : le modèle produit un token, le rajoute au contexte et recalcule le suivant, alors que l'entrée est lue en un seul passage parallèle. Toute la gamme Claude facture la sortie 5 fois l'entrée ; Grok 4.3 s'en tient à 2 fois.
Combien coûte un chatbot IA par mois ?
Cela dépend du modèle et du volume. Pour un agent qui traite 2 000 tokens d'entrée et 800 de sortie sur 5 000 conversations par jour : 4 500,00 USD par mois avec Claude Opus 5, 1 800,00 USD avec Claude Sonnet 5, 2 040,00 USD avec GPT-5.6 Terra, 234,00 USD avec DeepSeek V4 Flash et 117,00 USD avec Mistral Small 4. Saisissez vos propres nombres dans les trois champs : la facture est le produit du tarif, du volume et des jours.
Un tarif en baisse fait-il vraiment une facture en baisse ?
Pas dans les mêmes proportions. La documentation tarifaire d'Anthropic indique que les modèles Claude 4.7 et suivants utilisent un tokeniseur plus récent qui produit environ 30 % de tokens de plus pour le même texte, quand Sonnet 4.6 et les versions antérieures restent sur le précédent. Sur la grille actuelle, Sonnet 5 est à 2/10 USD et Sonnet 4.6 à 3/15 USD : la baisse de tarif absorbe l'inflation de tokens, et une charge qui coûtait 405,00 USD par mois revient à 351,00 USD une fois retokenisée. Le tarif a baissé d'un tiers et la facture de 13 % seulement : c'est l'inflation de tokens qui mange la différence. Remesurez vos comptes de tokens sur le modèle cible avant de valider une migration.
Je budgète en euros et la grille est en dollars : comment faire ?
Les grandes grilles d'API sont publiées en dollars et hors taxes, y compris celle de Mistral sur sa propre plateforme, et les quatre cartes de ce calculateur le sont aussi. Le montant annuel bouge donc avec le taux de change même quand votre trafic ne bouge pas, et aucune taxe n'est incluse dans ce qui est affiché. Placez la marge de change sur la carte annuelle, où l'écart se voit ; sur la carte quotidienne, il se perd dans les arrondis.
Puis-je faire tourner l'inférence en France, et est-ce plus cher ?
Oui, par une passerelle d'inférence européenne : OVHcloud AI Endpoints, hébergé en France, et Scaleway Generative APIs, dont l'inférence tourne sur des GPU installés à Paris, facturent l'un et l'autre au million de tokens et publient leurs grilles en euros. Aucune n'est dans la liste déroulante : choisissez « Personnalisé », tapez les deux tarifs, et les quatre cartes se recalculent. Un détail à connaître : les cartes impriment toujours le symbole du dollar, donc si vous avez saisi des euros, lisez les montants comme des euros. Le dernier cas chiffré de cette page déroule la manœuvre et ce que la CNIL en dit.
Que dit la CNIL sur l'envoi de données personnelles à une API LLM ?
La CNIL rappelle que « c'est l'organisme utilisateur qui engagera sa responsabilité légale en cas de mauvaise utilisation de l'IA par son personnel » : le fournisseur du modèle n'endosse pas votre conformité. Elle recommande d'éviter « autant que possible la saisie de données personnelles » dans un service d'IA générative et, pour des données sensibles ou stratégiques, de privilégier un déploiement « sur site ». Côté budget, cela déplace la question plus qu'elle ne la résout : un modèle auto-hébergé n'a plus de prix par token mais un prix par GPU-heure, et c'est un calcul que cet outil ne fait pas.
Qu'est-ce que la fenêtre de contexte, et quel est son effet sur le coût ?
La fenêtre de contexte est le nombre maximal de tokens qu'un modèle accepte en une seule requête, entrée et sortie confondues. Elle plafonne ce que vous pouvez envoyer ; elle ne rend pas gratuit ce que vous envoyez. Certains modèles changent de grille au-delà d'un seuil de contexte — les Grok et les Gemini concernés basculent au-delà de 200 000 tokens — et ce calculateur retient toujours le tarif court contexte, parce qu'un tarif plat par token est ce qu'il peut représenter honnêtement. Une grande fenêtre encourage par ailleurs à tout envoyer : un historique renvoyé en entier à chaque tour est facturé en entier à chaque tour.
Pourquoi une conversation de dix tours brûle-t-elle autant de tokens ?
Parce que l'API est sans état : au dixième tour, vous renvoyez les neuf précédents, et les tokens d'entrée grossissent presque comme le carré du nombre de tours. La parade la plus rapide est le cache de prompts, qui facture le préfixe fixe 10 % du tarif d'entrée.
Les images et les fichiers consomment-ils des tokens ?
Oui. Les modèles multimodaux découpent chaque image en tuiles converties en tokens, de quelques centaines à plus d'un millier selon la résolution. Les PDF, documents Word et tableurs sont le plus souvent convertis en texte puis facturés comme du texte, ce qui pénalise deux fois un corpus français : la conversion produit du français, et le français consomme environ un tiers de tokens en plus. Mesurez sur un échantillon réel avant de figer un budget d'OCR ou d'analyse de captures d'écran.
Comment compter les tokens exactement avant d'appeler l'API ?
Trois méthodes, de la plus fiable à la plus rapide. Le champ usage renvoyé par l'API sur quelques appels réels est la seule source qui corresponde à la ligne de facture. La bibliothèque tiktoken donne le compte exact pour les modèles OpenAI récents, qui utilisent l'encodage o200k_base. L'estimateur de cette page donne un ordre de grandeur en collant simplement le texte. Claude, Gemini et Llama emploient leurs propres tokeniseurs, dont tous ne sont pas publics : c'est de là que vient l'écart entre une estimation générique et le relevé réel.
Comment estimer le budget d'API mensuel de mon application ?
Partez d'une mesure réelle. Prenez une vingtaine d'appels représentatifs en production, relevez leurs tokens d'entrée et de sortie dans le champ usage de l'API, faites-en la moyenne, puis saisissez ces deux moyennes et votre volume quotidien dans le calculateur. La carte mensuelle est votre base. Ajoutez par-dessus une marge pour les pics de trafic et, si vous budgétez en euros, une marge de change. Si votre pilote a été mesuré en anglais et que le service sera francophone, majorez les comptes de tokens d'un tiers avant de saisir quoi que ce soit.
Mon modèle n'est pas dans la liste : que faire ?
Choisissez « Personnalisé » et tapez les deux tarifs. C'est aussi la voie pour un modèle interne, un tarif négocié ou une passerelle souveraine facturée en euros. Utilisez l'interrupteur 1K / 1M si votre fournisseur publie au millier plutôt qu'au million : il convertit ce qui est déjà saisi.
Ce calculateur est-il gratuit, et le texte que je colle reste-t-il chez moi ?
Oui aux deux. L'outil est gratuit et sans inscription, et le texte collé dans l'estimateur est traité dans votre navigateur : rien n'est envoyé à un serveur, aucun quota de modèle n'est consommé, donc aucun prompt confidentiel ne part chez un fournisseur. Une réserve tout de même : le calculateur écrit l'état en continu dans l'adresse de la page, et le texte collé y figure — tronqué à 2 000 caractères — avant même que vous ouvriez « Partager ». Videz le champ avant de copier ou de diffuser le lien.
Quelle est la précision de cette estimation ?
Sur les nombres que vous saisissez, l'arithmétique est exacte au centime : le calculateur multiplie vos comptes de tokens par les tarifs publiés, sans arrondi ni minimum de facturation. Ce qui bouge, ce sont les comptes eux-mêmes. Un volume mesuré sur un pilote anglophone puis servi en français arrive 31 % plus haut : les 2 000 tokens d'entrée du premier cas chiffré deviennent 2 620. L'estimateur de cette page donne un ordre de grandeur ; le compte qui colle à la ligne de facture est celui du champ usage renvoyé par l'API sur quelques appels réels. Le mois vaut ensuite 30 jours pleins, connus d'avance : un mois de 31 jours sort environ 3 % au-dessus de la carte mensuelle et février environ 7 % en dessous. Aucune remise n'est appliquée non plus, puisque cache de prompts, API Batch et accords entreprise facturent tous sous le tarif standard. Et si vous signez en euros, la marge de change s'ajoute par-dessus, hors de ces chiffres.
J'ai mon coût mensuel : comment faire baisser la facture ?
Le plus gros levier est le routage par difficulté : entre GPT-5.6 Sol et GPT-5.6 Luna il y a 20 fois d'écart sur la seule entrée, et classification, extraction et reformulation passent très bien sur Luna, Mistral Small 4, Claude Haiku 4.5 ou DeepSeek V4 Flash, en gardant GPT-5.6 Sol ou Claude Opus 5 pour le raisonnement. Vient ensuite le cache de prompts sur le préfixe fixe, facturé 10 % du tarif d'entrée : l'entrée en cache de GPT-5.6 Sol tombe à 0,40 USD, et l'API Batch coupe de moitié les deux côtés sur tout ce qui peut attendre. Côté sortie, max_tokens agit là où le multiple de 5 fois de la gamme Claude fait le plus mal. Un dernier levier est propre à la langue : le prompt système est la seule partie du contexte qui repart intégralement à chaque appel, il est rédigé en français, et il paie donc le surcoût de langue autant de fois qu'il y a de requêtes. Cent mots retirés d'un prompt système français, ce sont environ 150 tokens de moins par appel — à 5 000 requêtes par jour, 750 000 tokens d'entrée en moins chaque jour. Changez un paramètre à la fois dans le calculateur pour voir lequel de ces leviers paie le plus sur votre propre charge.