Les coûts d'inférence IA par workflow agentique vont être multipliés par plus de cinq d'ici 2028, il n'y a donc pas de modèle universel fiable et économique en vue, d'après Gartner
Gartner prévoit que les coûts d'inférence IA par workflow agentique vont être multipliés par plus de cinq d'ici 2028. Les responsables produit sont confrontés au paradoxe de l’inférence : l’amélioration de la rentabilité unitaire fait grimper le coût global de l’IA sans offrir de voie claire vers une valeur proportionnelle et prévisible. Cette dynamique signifie que les jetons deviennent plus rentables, mais pas aussi rapidement que les capacités d’IA et les coûts associés à ces capacités augmentent. Le rythme de l’innovation dépasse la courbe des coûts.
Le tokenmaxxing a été institué dans le développement de logiciels comme mesure superficielle de la productivité et signal d'adoption de l'intelligence artificielle, encouragé par des classements internes et l'idée que plus de consommation d'IA équivaut à plus de performance. La tendance qui a pris son envol à l’entame de l’année 2026 n’est plus soutenable par les entreprises sur le long terme. En effet, les rapports se succèdent et font état de ce que « l’intelligence artificielle coûte trop cher et n’est rentable pour personne. »
Selon Gartner, société spécialisée dans les analyses commerciales et technologiques, les coûts d’inférence IA par workflow agentique vont être multipliés par plus de cinq d’ici 2028. À mesure que les produits d’IA évoluent, passant de simples fonctionnalités d’assistance à une exécution en plusieurs étapes, les responsables produit sont confrontés à un nouveau défi en matière de marges : la baisse des prix des modèles subventionne des flux de travail plus complexes et entraîne une escalade des coûts totaux liés à l’IA. En conséquence, la gestion des coûts d’inférence est devenue une priorité absolue pour les responsables produit.
« Les responsables produit ne peuvent pas compter sur une économie des jetons plus efficace pour rationaliser les coûts de l’IA », a déclaré Will Sommer, analyste directeur senior. « Chaque nouvelle génération de capacités d’IA nécessitera davantage de jetons, souvent plus coûteux. Aucun modèle universel, fiable et économique ne se profile à l’horizon. La production de produits d’IA compétitifs exigera le développement et la maintenance d’écosystèmes multimodèles complexes. »
Gartner a identifié trois tendances fondamentales qui déterminent l’économie des jetons :
1. L’économie des coûts des modèles de base s’améliore rapidement.
2. L’amélioration de l’efficacité de l’IA permet le déploiement de modèles plus puissants, et plus coûteux, afin de rendre possibles des applications d’IA plus sophistiquées et à plus forte valeur ajoutée.
3. Les workflows d’IA plus sophistiqués utilisent bien plus de jetons que de simples interactions avec des chatbots, ce qui entraîne une hausse des coûts globaux d’inférence.
Cette dynamique signifie que les jetons deviennent plus rentables, mais pas aussi rapidement que les capacités d’IA et les coûts associés à ces capacités augmentent. Le rythme de l’innovation dépasse la courbe des coûts.
La complexité de l’IA dépasse la baisse des coûts des jetons
C’est ce qu’on appelle le « paradoxe de l’inférence », défini comme le fait qu’une meilleure rentabilité unitaire fasse grimper le coût global de l’IA sans offrir de voie claire vers une valeur proportionnelle et prévisible. « Les réalités économiques rigoureuses du paradoxe de l’inférence sont illustrées par les différences entre un simple chatbot et un agent IA », a déclaré Sommer. « Alors qu’un simple chatbot doit lire et interpréter une requête puis répondre rapidement par une réponse probabilistiquement raisonnable, un agent IA doit constamment raisonner, négocier et s’interroger. »
Toutes ces responsabilités s’additionnent. Par rapport à une interaction basique avec un chatbot, le routage d’une tâche vers un modèle de raisonnement agentique multiplie par au moins cinq les coûts d’inférence du fournisseur, et souvent bien davantage à mesure que la complexité de la tâche augmente. « Se rabattre par défaut sur une intelligence autonome générique entraînera des coûts illimités, d’un ordre de grandeur supérieur à ceux des écosystèmes de produits optimisés », a déclaré Sommer.
Pour garantir le retour sur investissement (ROI) d’une IA avancée, telle que les agents raisonneurs, il faut soit des rendements exponentiellement plus élevés par rapport aux modèles de base, soit une hiérarchisation, un acheminement et une orchestration hautement optimisés de l’inférence afin d’adapter les tâches complexes à une intelligence plus rentable. Ces deux résultats sont tout à fait possibles, mais nécessiteront des efforts considérables à travers des flux de travail complexes.
Malgré des centaines de milliards de dollars investis et un discours techno-optimiste omniprésent, une vaste étude du National Bureau of Economic Research auprès de près de 6 000 dirigeants d'entreprises aux États-Unis, au Royaume-Uni, en Allemagne et en Australie a révélé que neuf entreprises sur dix n'ont observé aucun gain de productivité ni aucun effet sur l'emploi grâce à l'IA au cours des trois dernières années. Un constat qui renvoie les économistes à un déjà-vu troublant : le paradoxe de productivité formulé en 1987 par le prix Nobel Robert Solow au sujet de l'informatique. Histoire d'une promesse qui tarde à tenir.
Source : Gartner
Et vous ?
Pensez-vous que cette prévision est crédible ou pertinente ?
Quel est votre avis sur le sujet ?
Voir aussi :
L'IA coûte trop cher et n'est rentable pour personne : seuls Nvidia, les fabricants de matériel et le BTP en tirent profit, portés par la frénésie des centres de données, selon l'analyste Ed Zitron
L'IA peut désormais coûter plus cher que la main-d'œuvre humaine, car les dépenses IA des entreprises explosent, certaines d'entre elles payant davantage pour la puissance de calcul que pour le travail humain
En 2030, l'exécution de tâches d'inférence sur un grand modèle de langage (LLM) comportant 1 000 milliards de paramètres coûtera aux fournisseurs de GenAI plus de 90 % moins cher qu'en 2025, d'après Gartner






Pensez-vous que cette prévision est crédible ou pertinente ?
Répondre avec citation




Partager