IBM lance Granite 4.2, les tout derniers grands modèles de langage de sa gamme à poids ouvert, conçus pour être téléchargés et hébergés en interne, avec des capacités « agentiques » étendues
IBM a dévoilé sa gamme Granite 4.2 de grands modèles de langage, des modèles à poids ouvert pouvant être déployés localement, avec trois variantes : un modèle compact de 3 milliards de paramètres pour les appareils en périphérie, une option de 8 milliards, et un modèle de 30 milliards capable d'étendre sa fenêtre de contexte jusqu'à 512 000 tokens. Ces modèles sont publiés sous licence Apache 2.0, permettant aux entreprises de les télécharger, modifier et déployer sans redevance. La principale caractéristique architecturale est une fenêtre de contexte native de 128 000 tokens commune à toute la gamme.
International Business Machines Corporation, opérant sous le nom d'IBM (surnommée « Big Blue »), est une multinationale américaine du secteur des technologies dont le siège social est situé à Armonk, dans l'État de New York, et qui est présente dans plus de 175 pays. Il s'agit d'une société cotée en bourse qui figure parmi les 30 entreprises composant l'indice Dow Jones Industrial Average. IBM est la plus grande organisation de recherche industrielle au monde, avec 19 centres de recherche répartis dans une douzaine de pays ; pendant 29 années consécutives, de 1993 à 2021, elle a détenu le record du plus grand nombre de brevets américains déposés chaque année par une entreprise.
IBM Granite est une série de modèles de base d'IA exclusivement basés sur des décodeurs, créés par IBM. Elle a été annoncée le 7 septembre 2023, et un premier article a été publié quatre jours plus tard. Initialement destinés à être utilisés au sein de Watsonx, la plateforme cloud d'IBM dédiée aux données et à l'IA générative, aux côtés d'autres modèles, IBM a rendu public le code source de certains de ces modèles. Les modèles Granite sont entraînés sur des ensembles de données issus d'Internet, de publications universitaires, d'ensembles de données de code, ainsi que de documents juridiques et financiers.
En mai 2024, IBM a annoncé la publication d'une famille de modèles code "Granite" pour la communauté open-source, dans le but de simplifier le codage pour les développeurs de diverses industries. Les modèles code Granite sont conçus pour résoudre les problèmes auxquels les développeurs sont confrontés lorsqu'ils écrivent, testent, déboguent et livrent des logiciels fiables.
IBM a lancé le 25 août sa gamme Granite 4.2 de grands modèles de langage (LLM), un ensemble de modèles à poids ouvert pouvant être déployés localement. Trois variantes sont proposées d’un seul coup : un modèle compact de 3 milliards de paramètres destiné aux appareils en périphérie, une option de milieu de gamme de 8 milliards de paramètres, et un modèle « poids lourd » de 30 milliards de paramètres capable d’étendre sa fenêtre de contexte jusqu’à 512 000 tokens. Ces trois modèles sont publiés sous licence Apache 2.0, ce qui signifie que les entreprises peuvent les télécharger, les modifier et les déployer sans redevance ni restriction liée à la propriété intellectuelle.
Ce que fait vraiment Granite 4.2
La principale caractéristique architecturale est une fenêtre de contexte native de 128 000 tokens commune à toute la gamme. IBM a conçu ces modèles comme des décodeurs purs et y a intégré des modes de raisonnement par « chaîne de pensée » commutables, qui permettent au modèle de basculer entre des réponses rapides et une inférence plus approfondie, étape par étape, en fonction de la tâche à accomplir.
Les variantes 8B et 30B ont bénéficié d’un traitement supplémentaire grâce à un bloc d’apprentissage par renforcement agentique, un processus d’entraînement qui a fait fonctionner les modèles dans des environnements simulés inspirés du monde réel afin de leur apprendre à utiliser des terminaux, à exécuter du code, à effectuer des recherches sur le Web et à interagir avec des outils logiciels externes. Le modèle 3B prend également en charge l’appel d’outils, mais sans avoir bénéficié de cette phase d’entraînement agentique spécialisée.
Ces trois modèles ont tous fait l’objet d’un entraînement post-formation sur environ 15 000 milliards de tokens, en combinant la génération de code synthétique et des techniques d’apprentissage par renforcement en plusieurs étapes.
Les résultats des tests de performance
IBM a publié les scores obtenus lors de deux tests de performance bien connus. Sur AIME25, qui évalue le raisonnement mathématique, le modèle 3B a obtenu un score de 78,33 et le modèle 30B, un score de 89,17. Sur SWE-Bench Verified, qui évalue la capacité d’un modèle à résoudre de manière autonome de véritables problèmes d’ingénierie logicielle sur GitHub, le modèle 8B a obtenu un score de 47,67 et le modèle 30B, un score de 57,00. Parallèlement à cette version linguistique, IBM a également lancé les modèles Granite Speech 5.0 Turbo CTC, élargissant ainsi la gamme Granite au traitement audio et vocal.
Pourquoi l'aspect déploiement local compte-t-il autant ?
Les modèles sont disponibles via Hugging Face, Ollama et GitHub. Ils prennent également en charge les appels d’outils compatibles avec OpenAI et les frameworks d’inférence tels que vLLM et SGLang, ce qui signifie que les équipes peuvent intégrer les modèles Granite dans des pipelines agentiques existants sans avoir à réécrire la couche d’intégration. La variante 3B est spécialement conçue pour les environnements de périphérie et à ressources limitées, c’est-à-dire le type de matériel que l’on trouve dans les usines, les points de vente ou les appareils sur le terrain, où il est impossible d’exécuter un modèle à 70 milliards de paramètres et où la connexion Internet n’est pas garantie.
Granite 4.1 a été lancé en avril 2026, ce qui correspond à un cycle d’itération d’environ quatre mois. La fenêtre de contexte extensible de 512K du modèle 30B est la fonctionnalité la plus susceptible de favoriser son adoption dans certains secteurs d’activité spécifiques à forte valeur ajoutée : l’examen de documents juridiques, l’analyse de documents financiers et la compréhension de bases de code volumineuses sont autant de tâches pour lesquelles la longueur du contexte détermine directement l’utilité d’un modèle.
En mai 2026, IBM a lancé un nouvel agent de codage appelé Bob. Contrairement aux agents de codage disponibles sur le marché, IBM Bob sélectionne automatiquement le modèle d'IA le plus adapté selon la tâche. Il est actuellement utilisé par 80 000 développeurs en interne. Son développement est dirigé par Neel Sundaresan, un ancien ingénieur de GitHub Copilot. Il affirme que « le succès de l'IA en entreprise repose moins sur la puissance brute des modèles que sur une architecture intelligente » capable de réduire les coûts et les frictions. Pour cette raison, Neel Sundaresan prône un « routage automatique » vers des modèles adaptés aux besoins spécifiques.
Voici l'annonce de Granite 4.2 :
Granite 4.2 apporte le raisonnement natif aux agents d'entreprise
Les nouveaux modèles Granite ouverts d'IBM sont conçus pour l'IA agentique, alliant raisonnement, utilisation d'outils, codage, exécution d'instructions et capacités vocales. Les grands modèles de langage (LLM) évoluent sous nos yeux. En l’espace de quelques années seulement, ils sont passés de simples moteurs de chatbots réactifs à des piliers d’agents autonomes capables de raisonner pour résoudre des problèmes, de planifier, d’exécuter et de s’autocorriger si nécessaire. On attend de plus en plus des LLM qu’ils accomplissent des tâches, et non plus qu’ils se contentent de générer des réponses. Cette attitude proactive est intégrée aux derniers modèles de langage et vocaux Granite d’IBM.
Aujourd’hui, IBM lance la mise à jour de ses modèles de langage Granite 4.2. Disponible avec 3 milliards, 8 milliards et 30 milliards de paramètres, Granite 4.2 est spécialement conçu pour les flux de travail autonomes requis par les cas d’utilisation des entreprises d’aujourd’hui. Ces modèles de langage intègrent des capacités de « réflexion », un raisonnement natif étape par étape qui leur permet de planifier avant d’agir, d’évaluer les compromis avant de choisir une voie et de détecter les erreurs avant qu’elles ne se concrétisent dans la réalité.
Dans les flux de travail d’entreprise, les tâches peuvent être ambiguës et nécessiter de nombreuses étapes pour être menées à bien. Un modèle d’IA doit être capable de suivre des instructions complexes, d’extraire les informations pertinentes, de choisir les bons outils, d’agir dans le bon ordre et de vérifier le résultat. Le raisonnement aide Granite 4.2 à gérer ce processus de manière plus fiable. Les puissantes capacités de Granite 4.2 en matière d’appel d’outils et de raisonnement lui permettent d’évaluer quelles applications utiliser et dans quel ordre, plutôt que d’exécuter les tâches à l’aveuglette. Les agents d’ingénierie logicielle basés sur Granite 4.2 peuvent parcourir des bases de code, gérer des tâches de développement en plusieurs étapes et fonctionner de manière transparente dans des environnements de terminal.
Granite 4.2 est conçu pour être déployé dans des environnements cloud, sur site et en périphérie. Son architecture dense garantit une large compatibilité, et ses différentes tailles offrent une grande flexibilité aux équipes. Les modèles plus petits peuvent gérer efficacement des tâches d’agent à haut débit. Les modèles plus grands peuvent être réservés à un raisonnement plus approfondi et à des workflows de codage plus complexes. Granite 4.2 étant distribué sous licence Apache 2.0, les entreprises peuvent le télécharger, le personnaliser et le mettre en production sans aucune restriction liée à la licence.
Une nouvelle structure d’entraînement
Ces capacités d’action ne découlent pas uniquement de la taille des modèles. L’équipe Granite a repensé le processus d’entraînement afin de mieux préparer les modèles aux tâches du monde réel. S’appuyant sur les modèles de base de Granite 4.0, l’équipe IBM Research a mis en place un programme d’apprentissage par renforcement (RL) étendu et en plusieurs étapes afin d’approfondir leurs capacités.
L’entraînement commence par un ajustement supervisé et se poursuit à travers plusieurs phases d’apprentissage par renforcement. La première étape, appelée « apprentissage par renforcement fondamental », a été appliquée à tous les modèles Granite 4.2, renforçant ainsi leurs capacités en mathématiques, en sciences, en programmation, en raisonnement et dans l’utilisation d’outils. Cette étape combine des récompenses vérifiables avec une évaluation basée sur un modèle de récompense, aidant les modèles à apprendre à la fois la précision et des signaux de qualité de plus haut niveau.
Pour les modèles 8B et 30B, l’entraînement se poursuit par une phase spécialisée d’« apprentissage par renforcement agentique » (agentic RL) axée sur des tâches de type professionnel, notamment l’ingénierie logicielle, le codage en mode terminal et les flux de travail basés sur la recherche. Associée à l’alignement par apprentissage par renforcement à partir de retours d’expérience humains (RLHF), cette approche permet d’obtenir des modèles mieux adaptés aux tâches agentiques complexes comportant plusieurs étapes.
Deux autres innovations ont contribué aux améliorations apportées au codage et au raisonnement dans Granite 4.2. Les modèles ont été entraînés sur 1 000 milliards de tokens de code synthétique générés à l’aide du pipeline CodeAlchemy d’IBM. Ils ont également été soumis à une étape d’entraînement intermédiaire, appelée « mid-training », qui s’est avérée capable de libérer davantage de puissance de raisonnement. De plus, ces modèles disposent d’une couche de décodage spéculatif qui leur permet de générer du texte plus rapidement tout en desservant un plus grand nombre d’utilisateurs. Cela améliore l’expérience d’inférence de l’IA pour les utilisateurs et contribue à réduire les coûts d’exploitation pour les entreprises.
L’équipe collabore également avec Hirundo afin d’améliorer la robustesse des modèles en réduisant les résultats indésirables après l’entraînement. La technologie de « désapprentissage » d’Hirundo sera utilisée pour cibler et réduire les résultats indésirables des modèles, sans qu’il soit nécessaire de les réentraîner entièrement.
Modèles de reconnaissance vocale conçus pour les périphériques
Dans le cadre de cette annonce, IBM présente d’ores et déjà deux nouveaux modèles de reconnaissance vocale. Ces modèles constituent une avancée structurelle majeure par rapport aux modèles 4.1 précédents, raison pour laquelle l’équipe a décidé de les baptiser Granite Speech 5.0 Turbo CTC et 5.0 Turbo CTC NC. Avec seulement 470 millions de paramètres, ces modèles comptent parmi les plus légers de la gamme Granite et sont parfaitement adaptés à un déploiement sur des ordinateurs portables, des smartphones et d’autres appareils en périphérie. La technologie CTC (classification temporelle connexionniste) aide les modèles de reconnaissance vocale à transcrire efficacement l’audio en texte et à apprendre directement à partir de données audio et textuelles brutes.
Grâce à la CTC, ces modèles sont très performants en matière de streaming audio, ce qui signifie qu’ils sont capables de transcrire rapidement des enregistrements audio. Contrairement aux précédents modèles Granite Speech, ils ne disposent pas d’une architecture LLM. Cela permet de maintenir la taille du modèle à un niveau minime tout en conservant une grande efficacité pour les tâches de reconnaissance vocale automatique (ASR). Les modèles actuellement en tête du classement Hugging Face Open ASR affichent un score de débit de traitement (RTFx) d’environ 6 000, tandis que lors des tests, les chercheurs ont constaté que Granite Speech 5.0 Turbo CTC avoisinait les 12 600 — sur un seul GPU H200.
Le résultat est un modèle de reconnaissance vocale optimisé pour les tâches de transcription à haut débit. La réduction de la fréquence d’échantillonnage permet de traiter la voix beaucoup plus rapidement, ce qui signifie qu’il est capable de transcrire trois heures d’enregistrements vocaux en une seconde. Ce modèle est suffisamment léger pour qu’un utilisateur puisse l’exécuter lors de la transcription en temps réel d’un chat vidéo, ou pendant le développement d’une application de reconnaissance vocale, directement depuis son ordinateur portable. Une autre application clé concerne les transcriptions à grand volume nécessaires à l’analyse à grande échelle des données des centres d’appels. L’équipe publie également une version non commerciale (NC) du modèle, entraînée sur des données à usage restreint.
Conçu pour l’avenir
Cette version vient enrichir la famille Granite avec un objectif clair : aider les entreprises à créer des agents capables de raisonner, d’agir et de s’adapter au cours de workflows concrets. À l’heure où l’on demande aux systèmes d’IA d’effectuer des tâches dans le monde réel, nos attentes ont augmenté. Il ne suffit plus de répondre de manière claire et concise. Un système d’IA doit être capable de planifier, d’appeler des applications et d’exécuter des tâches complexes de manière fiable et cohérente — tout en restant suffisamment léger pour être réellement utilisable sans coûter une fortune.
Ces derniers modèles ont été conçus en tenant compte précisément de ces exigences. Grâce aux progrès réalisés en matière de raisonnement, de codage, d’utilisation d’outils et de traitement de la parole, ils rapprochent l’IA d’entreprise de systèmes capables de participer de manière fiable au travail dans le monde réel.
Source : IBM
Et vous ?
Pensez-vous que cette annonce est crédible ou pertinente ?
Quel est votre avis sur le sujet ?
Voir aussi :
IBM a connu un effondrement historique à Wall Street le 14 juillet, son action ayant chuté de 23 %, soit la pire performance depuis 39 ans, après la publication de résultats financiers décevants
Red Hat prévoit d'ajouter l'IA à Fedora et GNOME avec Granite, l'IA open-source d'IBM afin d'améliorer les outils de développement, tels que les EDI, et de créer un assistant de code alimenté par l'IA
IBM et Red Hat s'engagent à investir 5 milliards $ pour sécuriser les logiciels open source : le projet Lightwell mobilisera plus de 20 000 ingénieurs et des outils d'IA afin d'identifier les vulnérabilités






Pensez-vous que cette annonce est crédible ou pertinente ?
Répondre avec citation
Partager