AMD acquiert Taalas, un pionnier dans le domaine des puces spécialisées pour l'inférence IA, alors que l'inférence IA devient l'un des segments du marché de l'IA qui connaît la croissance la plus rapide
AMD a annoncé avoir racheté Taalas, une start-up torontoise fondée en 2023, dont les puces « intègrent directement les poids des modèles dans le silicium grâce à un procédé qui promet d'augmenter les performances d'inférence d'un ordre de grandeur, voire davantage ». La première puce de test de Taalas traitait le modèle Llama 3.1 8B de Meta à un rythme de 16 960 tokens par seconde, soit une vitesse 48 fois supérieure à celle des GPU de Nvidia. AMD aurait l'intention d'associer ses racks Helios aux puces Taalas dans une configuration où la génération de jetons serait déchargée vers les accélérateurs Taalas. D'un point de vue stratégique, AMD souhaite conclure sa propre version de l'accord de licence signé par Nvidia avec Groq.
Advanced Micro Devices, Inc. (AMD) est une multinationale américaine spécialisée dans les semi-conducteurs, dont le siège social est situé à Santa Clara, en Californie. Elle développe des processeurs centraux (CPU), des processeurs graphiques (GPU), des matrices de portes programmables (FPGA), des systèmes sur puce (SoC) et des composants informatiques haute performance. AMD dessert un large éventail de marchés professionnels et grand public, notamment ceux des ordinateurs personnels (PC), des jeux vidéo, des centres de données et des systèmes embarqués.
Dans le domaine de l'intelligence artificielle (IA), un moteur d'inférence est un composant logiciel d'un système intelligent qui applique des règles logiques à la base de connaissances afin d'en déduire de nouvelles informations. Les premiers moteurs d'inférence faisaient partie intégrante des systèmes experts. Un système expert typique se composait d'une base de connaissances et d'un moteur d'inférence. La base de connaissances stockait des faits sur le monde. Le moteur d'inférence appliquait des règles logiques à la base de connaissances et en déduisait de nouvelles connaissances. Ce processus s'itérerait, car chaque nouveau fait ajouté à la base de connaissances pouvait déclencher des règles supplémentaires dans le moteur d'inférence. Les moteurs d'inférence fonctionnent principalement selon l'un des deux modes suivants, en fonction des règles ou des faits : le chaînage avant et le chaînage arrière. Le chaînage avant part des faits connus et en déduit de nouveaux. Le chaînage arrière part des objectifs et remonte en amont pour déterminer quels faits doivent être établis afin que les objectifs puissent être atteints.
Ce qui est intéressant dans le rachat de Taalas par AMD, ce n’est pas l’acquisition en soi, mais ce qu’elle révèle de la façon dont les plus grands acheteurs de puces d’IA envisagent désormais l’inférence. AMD a annoncé, à la clôture des marchés, avoir racheté cette start-up torontoise fondée en 2023, dont les puces « intègrent directement les poids des modèles dans le silicium grâce à un procédé qui promet d’augmenter les performances d’inférence d’un ordre de grandeur, voire davantage ». D’une certaine manière, comme le souligne l’article, il s’agit de circuits intégrés spécifiques à un modèle, ou MSIC.
Les conditions de l’accord n’ont pas été divulguées, et sous réserve de l’approbation des autorités réglementaires, la transaction devrait être finalisée au quatrième trimestre. L'argument de vente, ce sont les performances. La première puce de test de Taalas, la HC1, a été fabriquée selon le procédé 6 nm de TSMC. Selon les premiers chiffres, elle traitait le modèle Llama 3.1 8B de Meta à un rythme de 16 960 tokens par seconde, ce qui, selon l'entreprise lors de son annonce en février dernier, représentait une vitesse 48 fois supérieure à celle des GPU de Nvidia et 8,5 fois supérieure à celle des accélérateurs de Cerebras.
Une puce HC2 de deuxième génération devrait sortir cet été, avec 20 milliards de paramètres par puce. Taalas affirme que 50 accélérateurs suffiraient pour prendre en charge un modèle d’un billion de paramètres. AMD aurait l’intention d’associer ses racks Helios basés sur Instinct aux puces Taalas dans une configuration désagrégée où le traitement des prompts, très gourmand en calcul, s’effectuerait sur les GPU, tandis que la génération de jetons serait déchargée vers les accélérateurs Taalas. Vamsi Boppana, vice-président senior chargé de l’IA chez AMD, a présenté ce projet comme la construction d’« une plateforme d’IA complète offrant aux clients la flexibilité nécessaire pour déployer les solutions de calcul adaptées à chaque charge de travail d’IA ».
D'un point de vue stratégique, on peut en déduire qu'AMD souhaite conclure sa propre version de l'accord de licence de 20 milliards de dollars signé par Nvidia avec Groq en décembre dernier, et qu'elle est prête à payer cette somme en une seule fois plutôt que par le biais de redevances de partenariat. C'est au niveau de l'inférence que se concentre réellement la charge de calcul une fois qu'un modèle est en production ; si un modèle stable peut être gravé dans un ASIC offrant une efficacité supérieure d'un ordre de grandeur par jeton, les hyperscalers et les entreprises exécutant des charges de travail fixes ont une véritable raison de se lancer dans l'aventure.
À l'horizon 2030, le coût de l'exécution d'inférences sur un grand modèle de langage (LLM) de mille milliards de paramètres sera inférieur de plus de 90 % à celui de 2025, selon Gartner. Le cabinet attribue cette baisse aux progrès réalisés dans le domaine des semi-conducteurs, à l'efficacité des infrastructures et à la conception des modèles. Toutefois, la baisse du coût des jetons chez les fournisseurs d'IA générative ne sera pas entièrement répercutée sur les entreprises clientes et ne démocratisera pas l'intelligence de pointe, estime l'entreprise de conseil.
En mars 2026, Nvidia serait en train de développer une nouvelle puce d'inférence IA pour OpenAI, marquant ainsi un changement stratégique majeur par rapport à sa stratégie axée sur les GPU, après avoir investi 30 milliards de dollars dans l'éditeur de ChatGPT. Ce processeur, qui devait être dévoilé lors de la prochaine conférence GTC de Nvidia, était conçu pour optimiser les charges de travail d'inférence, un type de traitement qui permet aux modèles d'IA de répondre à des requêtes, plutôt que l'entraînement des modèles. Reposant sur la technologie LPU de la start-up Groq, cette nouvelle puce devait rivaliser directement avec les processeurs d'inférence développés par Google ou Amazon.
Voici l'annonce d'AMD :
AMD acquiert Taalas afin de faire progresser ses solutions de calcul destinées au marché en pleine expansion de l'inférence IA
Le 6 août 2026, AMD a annoncé avoir conclu un accord définitif en vue de l’acquisition de Taalas, pionnier dans le domaine des puces spécialisées pour l’inférence IA. Alors que l’inférence IA devient l’un des segments du marché de l’IA connaissant la croissance la plus rapide et que les charges de travail se spécialisent de plus en plus, cette acquisition renforce la feuille de route à long terme d’AMD en matière d’IA grâce à une technologie d’inférence différenciée et à une expertise technique de classe mondiale.
Fondée en 2023 et basée à Toronto, au Canada, la technologie de Taalas optimise les flux de données d’inférence, réduisant considérablement les goulots d’étranglement liés au calcul et à la mémoire associés aux architectures à usage général et permettant des capacités d’inférence IA hautement optimisées. La technologie de Taalas viendra compléter la plateforme d’IA « full-stack » d’AMD, qui comprend les solutions rack-scale AMD Helios, les GPU AMD Instinct, les processeurs AMD EPYC, le logiciel AMD ROCm et l’écosystème d’IA en pleine expansion de la société. AMD prévoit d’intégrer cette technologie dans sa feuille de route des accélérateurs et de développer des solutions au niveau système avec les GPU AMD Instinct.
« AMD met en place une plateforme d’IA complète qui offre aux clients la flexibilité nécessaire pour déployer les solutions de calcul adaptées à chaque charge de travail d’IA », a déclaré Vamsi Boppana, vice-président senior du groupe Intelligence artificielle chez AMD. « La technologie de Taalas et son équipe d’ingénieurs de classe mondiale renforcent notre portefeuille d’IA en offrant des performances et une efficacité de déduction différenciées. »
« Nous avons fondé Taalas pour repenser l’inférence IA de A à Z en concevant le matériel autour du modèle », a déclaré Ljubisa Bajic, cofondateur et PDG de Taalas. « Notre équipe basée au Canada allie une expertise technique approfondie à une volonté de remettre en question les approches conventionnelles. Rejoindre AMD nous apportera l’envergure, les ressources d’ingénierie et la portée mondiale nécessaires pour accélérer notre innovation. »
Alors que l’IA s’étend à des applications de plus en plus en temps réel et à haut débit, AMD et Taalas aideront les clients à déployer plus efficacement leurs charges de travail d’inférence dans un éventail croissant d’applications. Destinée à accélérer l’innovation en matière d’IA, cette acquisition s’appuie sur la présence de longue date d’AMD au Canada – où l’entreprise est fière de contribuer à l’écosystème national des semi-conducteurs et de l’IA – et reflète un engagement continu à retenir et à développer les talents canadiens. L’acquisition est soumise aux conditions de clôture habituelles et aux autorisations réglementaires.
Source : AMD
Et vous ?
Pensez-vous que cette annonce est crédible ou pertinente ?
Quel est votre avis sur le sujet ?
Voir aussi :
AMD rachète la startup finlandaise Silo AI pour 665 millions de dollars afin de concurrencer Nvidia, notamment en proposant des services d'IA de pointe basés sur les modèles open source de Silo AI
OpenAI signe un accord pluriannuel avec AMD pour l'achat de puces IA d'une valeur de plusieurs dizaines de milliards $, incluant jusqu'à 6 GW de GPU Instinct dès 2026 et une option de participation dans AMD
AMD dépasse Intel dans les revenus des centres de données pour le deuxième trimestre consécutif, générant 13,5 % de revenus supplémentaires dans le domaine des centres de données et de l'IA






Pensez-vous que cette annonce est crédible ou pertinente ?
Répondre avec citation
Partager