Lien copié !

Plus l'IA est bon marché, plus votre facture est élevée

Les prix de l'IA par token se sont effondrés de plus de 280 fois en environ deux ans, et pourtant les factures d'IA continuent de grimper. Les charges de travail des agents ont multiplié la consommation, GitHub a migré Copilot vers une facturation à l'usage, et Anthropic a suspendu sa propre modification tarifaire à la dernière minute. Voici le calcul derrière ce paradoxe.

🌐
Traduction automatique

Cet article a été traduit automatiquement depuis l’original en anglais. Lire l’original en anglais

Une comptable sereine admire un simple centime à son bureau tandis qu'une vague de tsunami géante de centimes s'enroule au-dessus d'elle, sur le point de s'effondrer

Points clés à retenir

  • La déflation est réelle : l’interrogation d’un modèle d’intelligence artificielle (IA) au niveau GPT-3,5 a chuté de 20,00 $ à 0,07 $ par million de jetons entre novembre 2022 et octobre 2024, soit un effondrement de plus de 280 fois.
  • Les factures ont quand même augmenté : 98 % des organisations interrogées par la Fondation FinOps gèrent désormais activement les dépenses en IA, contre 31 % il y a à peine deux ans.
  • Juin 2026 a été le mois où les frais forfaitaires ont disparu : GitHub a déplacé chaque plan Copilot vers une facturation mesurée et basée sur des jetons le 1er juin. Anthropic a annoncé une répartition similaire, puis l’a suspendue le 15 juin, jour où elle devait prendre effet.
  • Le coupable est le volume, pas le prix : les charges de travail agentiques consomment des ordres de grandeur plus de jetons par tâche qu’une requête de chat. Des unités moins chères multipliées par une consommation qui explose équivaut à une facture plus élevée. C’est le paradoxe de Jevons, appliqué à l’échelle du datacenter.

Le mois où le plan à 20 $ a cessé d’avoir du sens

Pendant trois ans, l’accord était simple : verser à un fournisseur d’IA un forfait mensuel et utiliser le modèle comme un buffet à volonté. En juin 2026, le buffet a fermé.

Advertisement

Le 1er juin, GitHub a remplacé les « demandes premium » de Copilot par des crédits GitHub AI pour chaque plan, avec une utilisation consommée « en fonction de l’utilisation des jetons, y compris les jetons d’entrée, de sortie et en cache, selon les tarifs d’API publiés pour chaque modèle ». Deux semaines plus tard, Anthropic devait lancer sa propre version : déplacer l’utilisation du SDK (Software Development Kit) de Claude Agent et des agents tiers hors des pools d’abonnements et vers des crédits mensuels distincts, allant de 20 $ sur le plan Pro jusqu’à 200 $ sur le niveau supérieur. Cela n’est jamais arrivé. Le 15 juin, jour où le changement devait entrer en vigueur, Anthropic l’a mis en pause, affirmant que “rien ne change pour l’instant” et qu’il “travaillait à mieux aligner le plan sur les modèles d’utilisation réels”.

Voici ce qui rend cette vague de retarification vraiment étrange : elle est arrivée au moment précis où les jetons IA sont devenus les moins chers qu’ils aient jamais été. Comprendre pourquoi les deux choses sont vraies à la fois explique où se dirige réellement votre facture d’IA.

La grande déflation est réelle

Commencez par le point de vue des vendeurs. Cela a l’avantage d’être vrai.

L’AI Index de Stanford, le rapport annuel le plus cité sur les progrès de l’IA, a révélé que le coût d’interrogation d’un modèle qui obtient l’équivalent de GPT-3.5 sur MMLU (Massive Multitask Language Understanding, une référence de connaissances standard) « a chuté de 20,00 $ par million de jetons en novembre 2022 à seulement 0,07 $ par million de jetons en octobre 2024 », soit une réduction de plus de 280 fois en environ 18 mois. Selon la tâche, le même rapport révèle que les prix d’inférence ont chuté de 9 à 900 fois par an. Grâce au logiciel, les coûts du matériel d’apprentissage automatique ont chuté d’environ 30 % par an, tandis que l’efficacité énergétique s’est améliorée d’environ 40 % par an.

Advertisement

Un effondrement des prix de cette ampleur devrait faire des budgets de l’IA une erreur d’arrondi. Au lieu de cela, c’est le contraire qui s’est produit.

L’explosion de la consommation

La Fondation FinOps, l’organisme industriel des opérations financières dans le cloud (FinOps), a constaté dans son rapport State of FinOps 2026 que 98 % des organisations gèrent désormais les dépenses en IA, sur la base des 693 praticiens qui ont répondu à cette question, contre 63 % en 2025 et 31 % en 2024. La gestion des coûts de l’IA est classée comme la première compétence que les équipes doivent développer. On ne construit pas toute une discipline autour d’un coût qui diminue.

Ce qui a changé, ce n’est pas le prix d’un token. Il s’agit du nombre de jetons consommés par un seul travail.

Un échange de chatbots de l’ère 2023 était une demande : une question posée, une réponse sortie, quelques milliers de jetons bout à bout. Une session de codage agent est un tout autre animal. L’agent lit votre référentiel, planifie, appelle les outils, lit leur sortie, échoue, réessaye et vérifie son propre travail. Chacune de ces étapes est un nouvel appel de modèle portant le contexte accumulé de tout ce qui se présente devant elle. Une saisie semi-automatique de quatre secondes et une refactorisation autonome de quarante-cinq minutes se situent aux extrémités opposées d’un écart symbolique qui s’étend sur environ trois ordres de grandeur.

Gartner a fixé une date pour savoir où cela nous mènerait. Fin juin 2026, le cabinet de recherche prévoyait que les dépenses en agents de codage d’IA seraient en passe de dépasser le salaire moyen d’un développeur de logiciels d’ici 2028, rapportant que près d’un quart des leaders technologiques dépensent déjà entre 200 et 500 dollars par développeur chaque mois en jetons de codage d’IA, et environ 6 % déclarent dépenser plus de 2 000 dollars par développeur et par mois. Que cette prévision spécifique atterrisse ou non, la direction n’est pas contestée. L’unité est devenue bon marché ; la charge de travail est devenue énorme.

Advertisement

Anatomie d’une retarification silencieuse

L’abonnement forfaitaire était tarifé pour l’ère des chatbots, et l’ère des agents a brisé ses calculs. Ce qui a suivi a été moins une hausse coordonnée des prix qu’une série de corrections de plus en plus maladroites.

GitHub est allé le premier et est allé le plus loin. Dans le cadre du nouveau programme Copilot, les prix des forfaits restent les mêmes, mais chaque forfait comprend désormais une allocation correspondante de crédits IA : Pro à 10 $ par mois comprend 10 $ de crédits, Business à 19 $ par utilisateur comprend 19 $, Enterprise à 39 $ comprend 39 $. Un crédit vaut 0,01 $. Les complétions de code et les suggestions de prochaine modification restent illimitées, de sorte que l’utilisateur occasionnel de saisie semi-automatique ne remarque rien. En revanche, l’utilisateur de l’agent dépense désormais un compteur de jetons fonctionnant aux tarifs API (Application Programming Interface) publiés.

Anthropic a essayé, puis a cligné des yeux. Le plan aurait maintenu le chat et l’interface de ligne de commande (CLI) officielle de Claude Code sur les limites d’abonnement standard, tout en empêchant le SDK de l’agent, la commande sans tête claude -p et les applications tierces de s’appuyer sur ces limites, en les facturant aux tarifs API en vigueur, amortis par ces crédits mensuels. La pause du 15 juin est intervenue alors que le Wall Street Journal a rapporté qu’OpenAI envisageait de fortes baisses de prix pour sa propre API, ce qui aurait rendu une augmentation unilatérale des prix effectifs une décision inconfortable. Une révision des prix qu’un fournisseur expédie et que son rival abandonne le jour du lancement vous indique que l’industrie n’a pas encore trouvé le terrain.

Le levier le plus subtil est le tokenizer. La propre documentation de tarification d’Anthropic indique que Claude Opus 4.7 et les modèles ultérieurs utilisent un tokenizer qui “produit environ 30 % de tokens en plus pour le même texte”. Même prix catalogue, même texte, plus d’unités facturables. Le site a signalé exactement cette dynamique lorsque Opus 4.7 a été lancé à un prix global inchangé.

Et les prix catalogue eux-mêmes ont tranquillement cessé de baisser à la frontière. La grille de prix d’Anthropic montre Claude Sonnet 5 à un prix de lancement de 2 $ par million de jetons d’entrée et de 10 $ par million de jetons de sortie jusqu’au 31 août 2026, après quoi le prix standard de 3 $ et 15 $ entre en vigueur, soit une augmentation prévue de 50 %. Le nouveau Claude Fable 5 de premier plan coûte 10 $ en entrée et 50 $ en sortie, soit le double des 5 $ et 25 $ de Claude Opus 4.8. Même l’échelon budgétaire a augmenté : Claude Haiku 4.5 coûte 1 $ et 5 $, au-dessus des 0,80 $ et 4 $ du Haiku 3.5 à la retraite qu’il a remplacé. Sur cette grille tarifaire unique, chaque niveau est réévalué à la hausse. La déflation qui subsiste réside dans la concurrence, chez les concurrents moins chers et les modèles à poids ouvert, et non dans les prix catalogue de l’opérateur historique.

Les données

Tout le paradoxe tient dans une seule ligne arithmétique. Le coût d’une tâche correspond au prix d’un jeton multiplié par le nombre de jetons consommés par la tâche :

Ctask=Ptoken×TtaskC_{task} = P_{token} \times T_{task}

Entre 2022 et 2024, $P_{token}$ a chuté d’environ 280 fois pour une qualité constante. Mais pour les charges de travail qui dominent désormais, $T_{task}$ a augmenté d’un facteur de centaines, voire de milliers. Lorsque le deuxième facteur augmente plus vite que le premier ne diminue, $C_{task}$ augmente même si chaque jeton individuel devient moins cher.

Exécutez les chiffres du nouveau plan Copilot pour voir à quelle vitesse un compteur se vide. Participez à une session agent sur un modèle frontière au prix de Claude Opus 4.8, à 5 $ par million de jetons d’entrée et 25 $ par million de jetons de sortie. Une session qui traite 1,5 million de jetons d’entrée et génère 100 000 jetons de sortie coûte exactement 10,00 $ à ces tarifs :

Élément de campagneVolumeTarif (par M jetons)Coût
Jetons d’entrée1 500 000$5\7,50 $
Jetons de sortie100 000$25\2,50 $
Total de la session\10,00 $

Deux sessions comme celle-là et un siège Copilot Business ont épuisé la totalité de son crédit mensuel de 19 $. Tout ce qui suit est un dépassement mesuré. Le forfait n’est pas devenu plus cher. Cela ne couvre tout simplement plus la façon dont les gens travaillent actuellement.

Le faux sol

Alors, qui est le méchant ici ? Choisissez votre théorie.

Une lecture est cynique : les tarifs forfaitaires étaient des accaparements de terres subventionnés, et juin était la récupération, au moment où le plancher subventionné a commencé à se briser. L’autre lecture est ennuyeuse : personne n’avait besoin de planifier quoi que ce soit. Un tarif forfaitaire bon marché appliqué à une charge de travail qui peut consommer des centaines de dollars de calcul aux tarifs de l’API est une arithmétique qui échoue d’elle-même, sans aucune méchanceté.

L’évidence privilégie la lecture ennuyeuse, avec une touche d’originalité. Il ne s’agit pas d’une compression de l’offre. La même semaine où la pause d’Anthropic s’est installée, Reuters a rapporté que Meta prévoyait de vendre sa capacité de calcul excédentaire en matière d’IA via une activité cloud, selon Bloomberg News. La capacité n’est pas rare ; la consommation à l’échelle des frontières dépasse tout juste les modèles de tarification conçus pour le chat.

Et les clients ont un endroit où aller. Reuters a rapporté le 2 juillet qu’un nouveau modèle d’IA chinois peu coûteux est en train de rattraper les offres frontières d’Anthropic et d’OpenAI. Tom’s Hardware a documenté que des entreprises transféraient leurs charges de travail vers des modèles chinois et ouverts spécifiquement pour étirer les budgets d’IA alors que les abonnements se heurtaient à un mur de prix. Chaque facture mesurée est une publicité pour le modèle le moins cher à un appel d’API. C’est là, plus que la bonne volonté du client, le contrôle de la mesure dans laquelle la révision des prix peut aller.

La comptine de 1865

Rien de tout cela n’est nouveau. En 1865, l’économiste William Stanley Jevons a observé qu’à mesure que la technologie de combustion du charbon devenait plus efficace, la consommation totale de charbon en Grande-Bretagne augmentait plutôt que diminuait, car l’efficacité rendait l’industrie alimentée au charbon économique dans beaucoup plus d’endroits. Unités moins chères, combustion plus totale. Échangez du charbon contre des jetons et l’industrie de l’IA mène la même expérience avec le même résultat.

La rime la plus proche est la fibre. À la fin des années 1990, les opérateurs de télécommunications ont emprunté d’énormes sommes pour développer une capacité qui a augmenté bien plus rapidement que la demande, et lorsque le financement s’est tari après l’éclatement de la bulle Internet, leur endettement a provoqué une vague de faillites qui a fait tomber des géants comme WorldCom et Global Crossing. La leçon de cette époque n’est pas que la demande était fausse. La demande n’a cessé de croître ; elle s’est simplement développée plus lentement que l’infrastructure et les modèles économiques construits pour la servir, et la correction est arrivée d’un seul coup. L’économie de la génération vidéo IA a déjà atteint ce mur ; les agents de texte le frappent au ralenti.

Que se passe-t-il ensuite

La trajectoire à court terme est visible dans l’épave de juin.

Le comptage se propage. GitHub a déjà montré que la version politiquement viable est « le prix du plan inchangé, l’utilisation des agents mesurée », et la pause chez Anthropic se lit comme une révision, pas un retrait ; la société a déclaré qu’elle réalignait le plan et ne l’abandonnait pas. Regardez le 1er septembre, lorsque l’augmentation prévue de 50 % du prix catalogue de Sonnet 5 entrera en vigueur et testera si les prix de niveau intermédiaire peuvent réellement augmenter sans perdre de charge de travail au profit d’alternatives à poids ouvert.

Attendez-vous à ce que la couche de routage devienne un champ de bataille intéressant. Les entreprises associent déjà des modèles pionniers à des alternatives qui coûtent environ dix fois moins cher pour les travaux de routine. Une fois que chaque jeton est mesuré, l’envoi de la majorité facile des requêtes sur le chemin bon marché cesse d’être une optimisation et commence à être le jeu dans son ensemble. Et attendez-vous à ce que « token FinOps » devienne un titre de poste. Alors que 98 % des organisations gèrent les dépenses en IA et que le manque de compétences numéro un est la gestion des coûts en IA, quelqu’un est embauché pour posséder le compteur.

Ce que cela signifie pour vous

Si vous écrivez du code avec des outils d’IA :

  • Vérifiez lesquels de vos outils sont passés à la facturation au compteur en juin. Le niveau de saisie semi-automatique est toujours effectivement plat ; le niveau d’agent ne l’est pas.
  • Faites correspondre le modèle à la tâche. L’exécution d’un modèle frontière sur le travail géré par un modèle bon marché est désormais un élément de campagne visible, et l’écart de prix entre les niveaux est d’un ordre de grandeur.

Si vous possédez un budget IA :

  • Prévisions sur les jetons par tâche, pas sur les sièges. C’est grâce à la budgétisation basée sur les sièges que se sont produits les dépassements de 2026.
  • Considérez les prix catalogue des fournisseurs comme le début du calcul et non comme la réponse. Les changements de tokenizer et la croissance de la consommation modifient les coûts réels même si la grille de prix ne le fait pas.

Questions fréquemment posées

Si les prix des jetons continuent de baisser, cela ne va-t-il pas se réparer ?

Les prix unitaires continueront probablement de baisser ; Les données de Stanford montrent des baisses de 9 à 900 fois par an selon la tâche. Mais la consommation par tâche a augmenté plus vite que les prix n’ont baissé, et les agents continuent de gagner en autonomie. Parier votre budget sur une déflation dépassant votre propre consommation a été un pari perdant pendant deux années consécutives.

Anthropic a-t-il annulé son changement de facturation ou l’a-t-il simplement retardé ?

En pause, pas annulé. La société a déclaré que « rien ne change pour l’instant » et qu’elle s’efforçait de réaligner le plan sur les modèles d’utilisation réels. La pression structurelle à l’origine du changement n’a pas disparu.

S’agit-il simplement de prix abusifs des fournisseurs d’IA ?

Les preuves indiquent le contraire. La facturation au compteur aux tarifs API publiés est plus transparente qu’un tarif forfaitaire qui subventionnait discrètement les gros utilisateurs, et la concurrence des modèles chinois et ouverts bon marché limite jusqu’où chacun peut pousser. La véritable histoire est que l’unité de tarification (un mois d’accès) ne correspondait plus à l’unité de coût (un jeton), et le décalage a finalement pris fin.

Le résultat

L’ère des jetons bon marché et l’ère des factures géantes d’IA sont la même histoire racontée aux extrémités opposées de la facture. La déflation a rendu l’intelligence suffisamment bon marché pour la dépenser de manière imprudente, les agents ont industrialisé leurs dépenses et l’abonnement forfaitaire qui cachait le compteur est mort à cause de l’arithmétique en juin 2026. La correction en cours est inconfortable mais honnête : des compteurs visibles, des prix réels et un marché où le coût d’une tâche vous dit enfin la vérité sur ce qu’il fallait pour fonctionner. Les budgets fondés sur cette vérité feront l’affaire. Les budgets construits sur le buffet restant ouvert ne le seront pas.

Nos sources

Advertisement

🦋 Discussion sur Bluesky

Discuter sur Bluesky

Recherche de publications...