Coûts en tokens des agents IA : ce que vous payez réellement
Mesuré sur 157 670 tours réels de Claude Code, la sortie visible représente 12 % de la facture, les lectures de cache 48 %, et la majorité des tokens que vous payez ne vous sont jamais montrés.

Tout le monde optimise ce que le modèle écrit. L'écriture représente environ un huitième de la facture.
La réponse courte
L'argent se trouve dans le contexte que vous renvoyez à chaque tour, et dans le raisonnement qui vous est facturé mais que vous ne voyez jamais. Nous avons instrumenté un poste de travail et enregistré l'objet usage sur 157 670 réponses API Claude Code dédupliquées entre le 26 avril et le 26 juillet 2026, figées à 08h25 UTC le dernier jour. Enregistré, pas estimé.
Dans ce corpus, la sortie visible représente 12,1 % des dépenses Opus 4.8. Les lectures de cache prennent 48 %. Les écritures de cache prennent 39 %, et l'entrée réellement non mise en cache est l'erreur d'arrondi, à moins de 1 %.
Il s'agit d'un seul poste de travail exécutant un seul type de travail, donc traitez ces ratios comme une tendance plutôt qu'une constante universelle. C'est la tendance qui compte, et ce n'est pas ce qu'on dit généralement aux gens d'optimiser.

Ce qui vous est réellement facturé
Un tour d'agent n'est pas un message de chat. Chaque tour renvoie l'intégralité du contexte de travail, le prompt système, les définitions d'outils, les fichiers déjà lus, et toute la transcription précédente. Si ce mécanisme vous est nouveau, nous l'avons détaillé dans comment fonctionne réellement la fenêtre de contexte.
La documentation d'Anthropic sur la mise en cache des prompts, vérifiée le 26 juillet 2026, tarife ces renvois sur trois paliers distincts. Une écriture de cache avec un TTL de 5 minutes coûte 1,25 fois le tarif d'entrée de base, une écriture avec un TTL d'1 heure coûte 2 fois, et une lecture de cache coûte 0,1 fois. Définir un point de rupture est gratuit, selon la même documentation, donc vous n'êtes facturé que pour les tokens réellement écrits ou lus.
Voici l'anatomie d'une facture réelle, en utilisant nos parts mesurées.
| Type de token | Part de la facture mesurée | Tarif vs entrée de base | Ce que c'est réellement |
|---|---|---|---|
| Lectures de cache | 48% | 0,1x | contexte renvoyé et retrouvé lors d'un tour ultérieur |
| Écritures de cache | 39% | 1,25x à 5 min, 2x à 1 heure | contexte stocké pour que le tour suivant puisse le lire à bas coût |
| Sortie | 12,1% | 5x sur Opus 5 | texte visible plus raisonnement facturé |
| Entrée non mise en cache | moins de 1% | 1x | le rare échec de cache à froid |
Relisez ce tableau deux fois. La ligne la moins chère par token est la plus grosse ligne de la facture, parce que le volume l'emporte sur le tarif.

La plupart de vos tokens de sortie sont invisibles

Les tokens de raisonnement sont facturés comme de la sortie, au tarif de sortie standard. La documentation d'Anthropic sur le raisonnement étendu indique clairement que vous êtes facturé pour l'intégralité des tokens de réflexion pendant que l'API renvoie un résumé condensé, donc le nombre que vous payez et le nombre que vous pouvez lire sont deux nombres différents.
Le corollaire important, tiré de la documentation d'Anthropic sur le raisonnement adaptatif, est que la réflexion facturée ne change pas avec le paramètre display. Désactiver le panneau de raisonnement rend votre terminal plus silencieux et votre facture identique.
Nous pouvons observer cet écart de l'extérieur. Sur les tours composés uniquement de prose, notre corpus enregistre 2,7 caractères visibles par token de sortie facturé sur Opus 5, contre environ 4,0 caractères par token pour du texte anglais courant. Environ un tiers de ce que vous avez payé en sortie n'a jamais atteint votre écran.
Ce n'est pas un scandale. C'est le produit qui fonctionne comme prévu, et la profondeur du raisonnement est un curseur que vous contrôlez via les niveaux d'effort, pas via les paramètres d'affichage.
Les lectures de cache sont la vraie facture

Une lecture de cache est bon marché et constante. Le contexte lu grossit tout au long de la session, et il est relu à chaque tour, si bien que la chose bon marché s'accumule jusqu'à devenir la chose dominante.
C'est aussi pour cela que le temps d'inactivité coûte de l'argent. La documentation d'Anthropic sur la mise en cache des prompts, vérifiée le 26 juillet 2026, fixe la durée de vie par défaut du cache à cinq minutes, rafraîchie à chaque utilisation du contenu mis en cache. Laissez une session inactive plus longtemps que ça, et le tour suivant paiera une écriture neuve à 1,25 fois le tarif d'entrée au lieu d'une lecture à 0,1 fois. Une pause café est un événement facturable dans un flux de travail d'agent.
La documentation d'Anthropic sur les coûts de Claude Code situe elle-même l'usage en entreprise autour de 13 $ par développeur et par jour actif, et de 150 à 250 $ par développeur et par mois, 90 % des utilisateurs restant sous les 30 $ par jour actif. Notre corpus se situe dans cette fourchette, à 0,25 $ par tour sur Opus 4.8. La variable, c'est le nombre de tours multiplié par la taille du contexte, pas la verbosité.
Opus 5 écrit plus et coûte à peu près pareil
Claude Opus 5 est nettement plus bavard qu'Opus 4.8. Sur des tours comparables de notre corpus, Opus 5 produit en moyenne 3 882 tokens de sortie contre 2 582 pour Opus 4.8, soit une hausse de 50 %, avec des intervalles bootstrap à 95 % qui ne se chevauchent pas. C'est une réelle différence de comportement, pas un bruit d'échantillonnage.
Voici la partie que la plupart des gens comprennent mal. Le tableau de tarification publié par Anthropic, vérifié le 26 juillet 2026, donne à Opus 5 et Opus 4.8 une grille de prix identique : 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie, avec des paliers de cache identiques. Si la sortie ne représente que 12,1 % de la facture, une hausse de 50 % de la sortie ne fait bouger le total que d'environ 6 %.
Nous avons retarifé la totalité de la charge de travail de deux mois selon les tarifs de chaque modèle. Opus 5 ressort environ 5 % au-dessus d'Opus 4.8. Si vous appréciiez l'économie du modèle précédent, comme nous l'avons montré dans nos notes de terrain sur Opus 4.8, le nouveau n'est pas le séisme budgétaire qu'il semble être.
| Modèle | Entrée par MTok | Écriture cache 5 min | Écriture cache 1 heure | Lecture de cache | Sortie par MTok |
|---|---|---|---|---|---|
| Claude Opus 5 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Opus 4.8 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Fable 5 | $10.00 | n/d | n/d | n/d | $50.00 |
| Claude Sonnet 5, introductif jusqu'au 31 août 2026 | $2.00 | n/d | n/d | n/d | $10.00 |
| Claude Sonnet 5, à partir du 1er septembre 2026 | $3.00 | n/d | n/d | n/d | $15.00 |
| Claude Haiku 4.5 | $1.00 | n/d | n/d | n/d | $5.00 |
Les multiplicateurs de cache sont structurels, donc vous pouvez déduire chaque ligne à partir de son tarif d'entrée de base. La documentation d'Anthropic mentionne le tarif introductif de Sonnet 5 ainsi que les 3 $ et 15 $ qui le remplacent le 1er septembre 2026.
Le modèle cher est celui dont le tarif d'entrée est élevé
Voir le tableau des prix sur platform.claude.com
Comme l'entrée domine, le modèle qui fait mal est celui dont le tarif d'entrée est élevé, pas celui qui affiche le plus gros chiffre de sortie. Claude Fable 5 est à 10 $ par million en entrée contre 5 $ pour Opus 5, selon le tableau de tarification d'Anthropic, et ce tarif d'entrée doublé s'applique aux 87 % de votre facture qui relèvent du trafic de cache.
Retarifé sur cette même charge de travail de deux mois, Fable 5 ressort à environ 1,9 fois le coût d'Opus 5. Presque exactement son multiplicateur d'entrée, ce qui est précisément le propos. Nous avons détaillé où cette capacité vaut le coût dans notre évaluation de Fable 5.
Vers le bas, la logique s'inverse joliment. À 2 $ par million en entrée au tarif introductif, Sonnet 5 réduit la ligne dominante de 60 % par rapport au palier Opus, et nos données sur des tours comparables montrent qu'il écrit légèrement moins par tour qu'Opus 4.8, plutôt que plus.
Deux leviers qui fonctionnent, un qui ne fonctionne pas

Le levier qui ne fonctionne pas, c'est de demander des réponses plus courtes. Vous optimisez 12 % de la facture tout en dégradant la chose que vous achetez réellement, et c'est la raison pour laquelle nous avons pointé ce piège dans le piège du régime de tokens IA.
Les deux qui fonctionnent :
- Réduisez ce qui est renvoyé. Moins de fichiers dans le contexte, des lectures plus ciblées, une compaction avant que la transcription ne gonfle, et terminez une session au lieu de la laisser inactive au-delà du TTL
- Adaptez le modèle au tarif d'entrée. Routez les tours d'agent routiniers vers un palier d'entrée moins cher et réservez le palier coûteux aux tours où la précision paie
Les deux relèvent de la discipline de contexte, pas de la discipline de prompt. Les mécaniques pratiques se trouvent dans notre guide de gestion du contexte Claude Code.
Comment mesurer votre propre dépense
Voir la référence de l'API sur platform.claude.com
Ne faites confiance aux ratios de personne, y compris les nôtres. Chaque réponse API porte un objet usage, et c'est la vérité terrain pour votre propre charge de travail.
- Enregistrez
usagesur chaque réponse, pas un échantillon, et dédupliquez par identifiant de réponse avant d'agréger - Répartissez l'entrée en quatre catégories, lecture de cache, écriture 5 minutes, écriture 1 heure, et non mise en cache, car elles sont tarifées différemment
- Multipliez chaque catégorie par son propre tarif plutôt que de reporter des comptes de tokens bruts, car les comptes masquent l'écart de 50x entre une lecture de cache et un token de sortie
- Comparez les caractères visibles aux tokens de sortie facturés pour voir combien de raisonnement vous financez
Deux après-midis d'instrumentation vous en apprendront plus que tous les blogs de tarification d'internet réunis, celui-ci y compris.
FAQ
Masquer la sortie du raisonnement réduit-il ma facture ?
Non. La documentation d'Anthropic sur le raisonnement adaptatif indique que les tokens de réflexion facturés ne changent pas avec le paramètre d'affichage, seul ce qui vous est renvoyé change.
Claude Opus 5 est-il plus cher qu'Opus 4.8 ?
À peine. Il partage la même grille de prix qu'Opus 4.8, à 5 $ et 25 $ par million de tokens selon le tableau de tarification d'Anthropic, et bien que notre corpus montre qu'il écrit 50 % de plus par tour, retarifer la même charge de travail le place à environ 5 % plus cher au global.
Dois-je passer à Sonnet 5 pour économiser de l'argent ?
Pour les tours d'agent routiniers, probablement. Le tableau de tarification d'Anthropic liste des tarifs introductifs de 2 $ par million en entrée jusqu'au 31 août 2026, ce qui s'attaque à la plus grosse ligne de votre facture plutôt qu'à la plus petite.
Demander des réponses plus courtes économise-t-il de l'argent ?
Presque aucune. La sortie représentait 12,1 % de notre facture mesurée, donc la diviser par deux ne fait bouger le total que d'environ six pour cent, tout en dégradant le travail.
Pourquoi ma facture a-t-elle explosé un jour où j'ai à peine travaillé ?
De longues périodes d'inactivité. La documentation d'Anthropic fixe la durée de vie par défaut du cache à cinq minutes, donc une fois qu'elle expire, le tour suivant réécrit tout le contexte à 1,25 fois le tarif d'entrée au lieu de le lire à 0,1 fois.
Quelle est une dépense mensuelle normale ?
La documentation d'Anthropic sur les coûts de Claude Code cite environ 13 $ par développeur et par jour actif, et 150 à 250 $ par mois, 90 % des utilisateurs restant sous les 30 $ par jour actif. Un usage agentique intensif dépasse largement ces chiffres.
La facture est un problème de contexte
Votre facture n'est pas une mesure de la quantité de propos tenus par le modèle. C'est une mesure du nombre de fois où vous lui avez fait relire votre projet.
Tout ce qui est présenté ici a été mesuré sur un seul poste de travail pendant trois mois, sur 157 670 réponses API du 26 avril au 26 juillet 2026. Cela n'établit pas une référence sectorielle, et ce n'est pas une prévision de fournisseur. Cela établit où est parti notre argent, avec assez de détails pour que vous puissiez vérifier si c'est aussi vrai chez vous.
Tarifez ensuite votre travail en conséquence, parce que le coût d'outillage par tour est désormais une vraie ligne dans une mission de design, pas une erreur d'arrondi. Nous avons expliqué comment gérer cela dans tarifer le travail de design augmenté par l'IA.
Want the working version of this, every week? Join the Brainy creator list.
Get Started




