En 2026, la baisse du prix des tokens des grands modèles d’IA n’enlève rien à la pression qui pèse sur Nvidia et sur tout l’univers des centres de données. C’est même l’inverse qui se produit. La demande de calcul continue de monter, tirée par l’automatisation, par les assistants désormais intégrés aux logiciels, et par la progression des agents capables d’enchaîner seuls des tâches complexes.
Le décalage commence à ressembler à un vieux cas d’école, celui du paradoxe de Jevons : quand une ressource devient moins chère, on en consomme plus au total. Pour Nvidia et pour l’ensemble de l’écosystème des data centers, difficile d’imaginer meilleur scénario. Le logiciel coûte moins cher. Le matériel, lui, reste sous tension.
En 2026, d’après des données de marché, certaines références tarifaires des grands modèles sont passées sous le seuil de 1 dollar par million de tokens. Les mêmes données montrent qu’un des indices les plus suivis est même tombé autour de 0,97 dollar par million en septembre 2026, soit moins de la moitié de son pic du début d’année.
Sur le papier, une baisse pareille devrait alléger la facture globale. Dans les faits, elle ouvre surtout la porte à autre chose : plus de génération de texte, plus d’automatisation dans les entreprises, davantage de fonctions embarquées dans les applications grand public, et surtout des systèmes capables de lancer eux-mêmes une série de requêtes. Au bout du compte, le volume total de calcul consommé avance plus vite que les prix ne reculent.
Le signal le plus parlant se trouve peut-être, assez curieusement, du côté du marché de la location de GPU haut de gamme. D’après des données de marché, après un reflux en 2024 puis en 2025, les tarifs des Nvidia H100 sont repartis à la hausse, d’environ 40 % entre octobre 2025 et le début de 2026.
Au milieu de 2026, toujours selon des données de marché, les prix observés restaient compris entre 1,49 et 6,98 dollars de l’heure, avec un niveau médian qui tournait autour de 2,95 à 3,46 dollars. Et sur les puces plus récentes, pas de vraie détente en vue. Les mêmes données indiquent que les Nvidia B200, très recherchées pour les charges les plus lourdes, se louent autour de 4,50 à 7,00 dollars de l’heure.
Même chose du côté des puces Blackwell de Nvidia. L’offre prévue pour 2025 aurait été pratiquement vendue dès la fin de 2024, d’après des données de marché. Les clients continuent donc de réserver des volumes longtemps à l’avance.
Une part grandissante des tokens consommés ne vient d’ailleurs plus directement d’utilisateurs humains. Elle vient de systèmes qui en appellent d’autres.
Ces flux de travail dits « agentiques » peuvent avaler des volumes massifs de tokens pour chercher, tester, vérifier, reformuler. Pour les fournisseurs d’infrastructure, c’est une excellente nouvelle. En revanche, cela complique nettement l’anticipation de la demande.
Le vrai risque, lui, reste le même : un ralentissement brutal de l’usage. Toute la mécanique tient à une condition assez simple. L’adoption doit continuer à progresser plus vite que les prix ne baissent.
Si l’usage commence à plafonner, le choc pourrait se diffuser bien au-delà des fabricants de puces, jusqu’aux fournisseurs de mémoire, aux grands acteurs du cloud, et même aux entreprises liées à l’énergie et aux infrastructures électriques. Mieux vaut donc garder la tête froide. De simples informations laissant entendre que le chiffre d’affaires annualisé d’OpenAI pourrait être inférieur à certaines estimations ont déjà suffi à peser sur les actions américaines. Ça montre à quel point beaucoup de valorisations reposent encore sur un scénario de croissance soutenue.
Pendant ce temps, les goulets d’étranglement changent d’endroit. Le problème ne se limite plus à la fabrication des puces. Il touche aussi le packaging avancé, et surtout la mémoire HBM.
Micron estime d’ailleurs que la demande continuera de dépasser l’offre en 2027 et en 2028. Dit plus simplement, même avec des tokens moins chers, la bataille autour des composants stratégiques est loin d’être finie.