Cerebras Systems présente son nouveau système de serveurs à l'échelle d'un rack CS-4, affirmant qu'il offre une inférence IA jusqu'à 30 fois plus rapide que les systèmes basés sur des GPU

Le CS-4 de Cerebras, récemment dévoilé lors de l'événement SUPERNOVA 2026 organisé par l'entreprise, est l'un des rares lancements de matériel d'IA à atteindre des gains de performances aussi spectaculaires sans recourir à une nouvelle puce. Ce système à l'échelle d'un rack intègre trois processeurs Wafer Scale Engine 3 Turbo fonctionnant à une fréquence d'horloge environ deux fois supérieure à celle de leurs prédécesseurs. Ce qui a changé, c’est la manière dont Cerebras alimente la puce en énergie — et cette seule décision d’ingénierie transforme une architecture vieille de deux ans en un système qui, selon l’entreprise, peut générer des jetons jusqu’à 30 fois plus rapidement que les services d’inférence basés sur des GPU.

Cerebras Systems Inc., dont le siège social est situé à Sunnyvale, en Californie, développe des semi-conducteurs, des supercalculateurs et des logiciels associés destinés à alimenter des applications d'intelligence artificielle basées sur l'apprentissage profond, telles que les moteurs d'inférence. Parmi ses produits figurent ses semi-conducteurs « Wafer Scale Engine (WSE)-3 », ses supercalculateurs CS-3, ainsi que ses API « AI inference cloud » et « AI training cloud », qui permettent aux utilisateurs d’accéder à la puissance de calcul de l’entreprise sans avoir à acheter son matériel. L’entreprise construit également des centres de données utilisant ses processeurs et ses supercalculateurs afin de fournir directement des services de cloud computing à ses clients.

Le CS-4 de Cerebras, récemment dévoilé lors de l'événement SUPERNOVA 2026 organisé par l'entreprise, est l'un des rares lancements de matériel d'IA à atteindre des gains de performances aussi spectaculaires sans recourir à une nouvelle puce. Ce système à l'échelle d'un rack intègre trois processeurs Wafer Scale Engine 3 Turbo fonctionnant à une fréquence d'horloge environ deux fois supérieure à celle de leurs prédécesseurs — sur la même plaquette TSMC de 5 nanomètres, avec les mêmes 4 000 milliards de transistors, les mêmes 900 000 cœurs et les mêmes 44 gigaoctets de mémoire RAM statique intégrée qui équipaient le CS-3.

Ce qui a changé, c’est la manière dont Cerebras alimente la puce en énergie — et cette seule décision d’ingénierie transforme une architecture vieille de deux ans en un système qui, selon l’entreprise, peut générer des jetons jusqu’à 30 fois plus rapidement que les services d’inférence basés sur des GPU, un chiffre tiré des données de benchmark de vitesse du CS-4 d’Artificial Analysis citées dans les documents officiels de lancement de Cerebras.

Sur une carte GPU classique, les régulateurs de tension qui convertissent l’alimentation aux niveaux utilisables par le processeur se trouvent à environ 50 millimètres (environ 2 pouces) de la puce elle-même. À cette distance, les pertes par résistance dans la carte consomment une part non négligeable de l’énergie fournie, limitant ainsi la puissance — et donc la fréquence d’horloge — que la puce peut supporter.

Cerebras a conçu l’architecture en rack Nexus du CS-4 autour d’un principe fondamental : rapprocher cette conversion de puissance à environ 0,5 millimètre de la plaquette, soit 100 fois plus près que la norme des cartes GPU. Les pertes au niveau de la carte tombent alors à près de zéro. La puissance fournie au processeur est doublée. La fréquence d’horloge double. Les spécifications du système d’alimentation haute densité Nexus confirment que cette distance de 0,5 millimètre et le doublement de la puissance fournie sont à l’origine du gain de vitesse.


Le résultat, sur le papier, est saisissant : chaque puce WSE-3 Turbo offre 250 pétaFLOPS de puissance de calcul IA et 43,2 pétaoctets par seconde (PB/s) de bande passante mémoire — contre 125 pétaFLOPS et 21,6 PB/s pour le WSE-3 d’origine. Mais ces chiffres phares s’accompagnent d’une précision que tout acheteur d’infrastructure devrait comprendre : le chiffre de 250 pétaFLOPS repose sur la parcimonie, ce qui ne profite pas à l’inférence des grands modèles linguistiques (LLM) dans la pratique, puisque les poids des modèles sont denses.

Une analyse comparative sur le FP16 dense estime le chiffre en FP16 dense — la valeur pertinente pour les charges de travail LLM — à environ 25 pétaFLOPS par puce. Ce chiffre reste compétitif par rapport aux meilleurs accélérateurs de Nvidia et d’AMD en termes de puissance de calcul brute. C’est en matière de bande passante mémoire que Cerebras conserve son avance écrasante : 43,2 PB/s par plaquette, ce qui, selon l’entreprise, représente environ 2 000 fois la bande passante du GPU de nouvelle génération de Nvidia sur ce critère.

Concrètement, un cabinet d’évaluation indépendant a mesuré que le CS-4 délivrait 4 400 tokens par seconde et par utilisateur sur le modèle GPT-OSS-120B, contre environ 350 tokens par seconde pour le service d’inférence basé sur GPU le plus rapide. Cela représente un avantage d’environ 12,6 fois en conditions réelles sur ce modèle et cette configuration spécifiques — un résultat significatif, bien qu’il ne corresponde pas au chiffre maximal de 30 fois cité par Cerebras dans l’ensemble de sa suite de tests de performance. Des analystes indépendants ont estimé que l’amélioration réelle de l’interactivité se situait entre 20 et 40 fois pour la plupart des déploiements de modèles de pointe, qualifiant ce chiffre de 30 fois de raisonnable étant donné que l’inférence GPU en conditions réelles fonctionne rarement à son pic théorique.

Cette annonce intervient alors qu'une nouvelle étude met en lumière une facette méconnue de l'impact climatique de l'IA : les émissions facilitées (enabled emissions). Au-delà de la consommation électrique massive des centres de données, l'IA sert de levier technologique aux compagnies pétrolières pour accroître leur productivité et leurs profits. Cette aide à l'extraction de combustibles fossiles génère une pollution bien plus importante que le fonctionnement matériel de l'IA lui-même. Bien que ces outils puissent également soutenir les énergies renouvelables, les recherches démontrent que ce bénéfice ne suffit pas à compenser les dommages environnementaux globaux.

Nom : 1.jpg
Affichages : 785
Taille : 18,2 Ko

Voici l'annonce de Cerebras CS-4 :

Présentation du Cerebras CS-4 : l'IA la plus rapide vient de gagner encore en rapidité

Aujourd’hui, nous présentons la quatrième génération de notre système Cerebras : le CS-4. Il s’agit de l’accélérateur d’IA le plus rapide du secteur, qui constitue une nouvelle base pour l’IA de pointe. Construit à partir de trois nouveaux processeurs Wafer Scale Engine 3 Turbo, le CS-4 associe un processeur plus puissant à un nouveau rack et à un nouveau système entièrement repensés. Il offre une inférence jusqu’à 30 fois plus rapide que les systèmes GPU, une meilleure rentabilité et une voie simple vers le déploiement d’une capacité à très grande échelle.

Le CS-4 repose sur un principe simple : le prochain bond en avant dans l’infrastructure IA ne peut pas provenir de l’amélioration isolée d’un seul composant. La puissance de calcul, l’alimentation, le refroidissement et les E/S doivent évoluer de concert. Le résultat est un système conçu pour générer rapidement des tokens afin d’offrir des expériences hautement interactives, tout en fournissant la capacité totale en tokens dont les opérateurs à grande échelle ont besoin.

Cette combinaison est essentielle dans l’ensemble du paysage de l’IA :

1. Les développeurs veulent un raisonnement réactif et des applications autonomes 30 fois plus rapides.

2. Les opérateurs de centres de données recherchent un débit plus élevé par gigawatt (GW).

3. Les « néoclouds » et les hyperscalers ont besoin de systèmes modulaires pouvant être rapidement fabriqués, installés, étendus et mis à niveau à l’échelle du gigawatt.

Le CS-4 concrétise ces priorités au sein d’une seule plateforme à l’échelle du rack.

Nom : 2.jpg
Affichages : 706
Taille : 33,6 Ko

Conçu pour la vitesse à grande échelle

Le CS-4 atteint des performances jusqu’à 30 fois supérieures grâce à une innovation coordonnée à l’échelle de l’ensemble du système. Une communication plus rapide entre les plaquettes, une alimentation électrique haute densité et la plateforme modulaire Nexus à l’échelle d’un rack fonctionnent comme une architecture unique.

Nom : 3.jpg
Affichages : 684
Taille : 43,7 Ko

Jusqu’à 30 fois plus rapide que les GPU

Le CS-4 établit un nouveau record de rapidité d’inférence en production. Sur l’ensemble des modèles présentés ci-dessous, le CS-4 génère des tokens à des vitesses que les systèmes GPU ne peuvent même pas approcher, atteignant une inférence jusqu’à 30 fois plus rapide.

Cette vitesse s’étend à l’ensemble du spectre de l’IA : des petits modèles efficaces aux plus grands modèles au monde, démontrant ainsi que des capacités de modèle accrues ne se font plus nécessairement au détriment de la vitesse.

Nom : 4.jpg
Affichages : 678
Taille : 34,3 Ko

1 000 tokens par seconde pour les modèles de 10 T et au-delà

L’exploitation de modèles massifs sur plusieurs accélérateurs nécessite de transférer les informations entre ces processeurs suffisamment rapidement pour préserver une expérience interactive. Le CS-4 réduit la latence d’interconnexion entre puces à seulement 2 microsecondes. Grâce à cette communication à faible latence, le CS-4 peut traiter plus de 1 000 tokens par seconde sur des modèles dépassant les 10 000 milliards de paramètres.

Nom : 5.jpg
Affichages : 672
Taille : 41,6 Ko

Un débit ultra-rapide accru

Les infrastructures d’IA ont souvent contraint les opérateurs à choisir entre deux résultats précieux : une interactivité élevée pour chaque utilisateur ou un débit total élevé. Le CS-4 repousse cette limite. La solution CS-4 génère des tokens jusqu’à 30 fois plus rapidement que les systèmes GPU de production, tout en offrant un débit par watt jusqu’à 10 fois supérieur à celui du CS-3.

Les tokens rapides ayant plus de valeur que les tokens lents, le CS-4 fournit à la fois des tokens à plus forte valeur ajoutée et un nombre total de tokens plus élevé pour un budget énergétique donné, ce qui permet aux centres de données d’être nettement plus rentables. Les utilisateurs bénéficient d’une expérience plus réactive, tandis que les opérateurs gagnent en capacité pour traiter davantage de charges de travail.

La solution CS-4 offre une inférence ultra-rapide là où chaque milliseconde compte et un rendement global élevé là où chaque watt compte.

Nom : 6.jpg
Affichages : 675
Taille : 32,6 Ko

Prise en charge native de l’inférence désagrégée

Le CS-4 est conçu pour s’intégrer à une solution d’infrastructure d’IA hétérogène grâce à la prise en charge native de l’inférence désagrégée – une approche qui attribue les deux phases principales de l’inférence à des plateformes de calcul complémentaires.

Tout d’abord, un moteur de préremplissage spécialement conçu traite la requête entrante et prépare l’état du modèle. Cet état est ensuite transféré vers le CS-4, où le système effectue un décodage à très faible latence et génère la réponse.

Pour les opérateurs, cette architecture allie les performances de décodage de pointe de Cerebras à la flexibilité permettant d’associer le CS-4 à des plateformes de préremplissage complémentaires, notamment AMD Helios et AWS Trainium. Les fournisseurs peuvent utiliser une infrastructure GPU ou ASIC pour un préremplissage efficace tout en recourant au CS-4 pour un décodage ultra-rapide, créant ainsi un système d’inférence hétérogène conçu pour fournir des services différenciés et à haut débit.

Nom : 7.jpg
Affichages : 65
Taille : 37,7 Ko

La plateforme Nexus à l’échelle du rack : une conception modulaire des racks pour des déploiements plus rapides

Le CS-4 est le premier système construit sur la nouvelle architecture de plateforme Cerebras Nexus. Nexus repense le rack autour de trois éléments fondamentaux : le calcul, l’alimentation et les E/S – en apportant des innovations significatives à chacun d’entre eux.

La modularité transforme la manière dont un système d’IA à l’échelle d’un rack passe de l’usine au centre de données. Avec 50 % de composants en moins et des ensembles autonomes pour le calcul, l’alimentation et les E/S, le CS-4 permet une fabrication plus rapide et un déploiement accéléré. Au lieu de considérer le rack comme un ensemble de pièces étroitement couplées, Nexus le transforme en une plateforme composée de modules spécialement conçus.

Cette approche par plateforme simplifie également les mises à niveau, permettant ainsi aux innovations apportées à une partie du système d’être mises à la disposition des clients sans avoir à attendre que toutes les autres parties soient repensées. Nexus est conçu non seulement pour le CS-4, mais aussi pour l’avenir, afin d’accélérer le rythme des progrès au niveau du système.

Nom : 8.jpg
Affichages : 60
Taille : 62,8 Ko

Conception d’un « backpack » de calcul enfichable

Au cœur de Nexus se trouve un sous-système de calcul fondamentalement repensé. Le CS-4 utilise un « Wafer-Scale Backpack » monté à l’arrière qui se fixe verticalement au bloc d’alimentation.

Chaque « Wafer-Scale Backpack » est un ensemble autonome qui intègre la conversion de puissance, le refroidissement liquide direct, les E/S haut débit et l’électronique de contrôle dans un boîtier compact et tridimensionnel construit directement autour de la plaquette.

En dissociant la partie calcul des alimentations électriques, le « Wafer-Scale Backpack » simplifie la fabrication et réduit le temps de déploiement de plusieurs jours à quelques heures. Par rapport au système de la génération précédente, le « Wafer-Scale Backpack » comporte 50 % de composants en moins et recourt à une fabrication automatisée à 60 % de plus.

Nom : 9.jpg
Affichages : 60
Taille : 62,4 Ko

Alimentation haute densité

L’architecture de la plateforme Nexus apporte des améliorations significatives en matière d’alimentation électrique. En rapprochant la conversion de puissance 100 fois plus près des processeurs par rapport aux cartes GPU conventionnelles, le CS-4 élimine pratiquement toute perte de puissance au niveau de la carte. Cela permet de fournir deux fois plus de puissance au WSE-3 Turbo, ce qui se traduit par des fréquences de fonctionnement plus élevées et une génération de jetons plus rapide.
Référence actuelle pour l’ensemble d’alimentation intégré autour de la plaquette.

Nom : 10.jpg
Affichages : 57
Taille : 85,1 Ko

Un nouveau sous-système d’E/S modulaire

Le CS-4 introduit un nouveau sous-système d’E/S programmable qui double la bande passante d’E/S tout en réduisant considérablement la latence. Le module d’E/S de plaquette étend la structure à partir des bords de la plaquette et est conçu pour prendre en charge à la fois la connectivité à un écosystème ouvert et les connexions directes les plus rapides entre les systèmes Cerebras.

Le protocole RoCE v2 RDMA sur Ethernet, basé sur des normes, offre un moyen familier de connecter le CS-4 à l’infrastructure existante et à un écosystème de systèmes hétérogènes. Les liaisons directes entre plaquettes (Direct Wafer Links) permettent des connexions sans commutateur au sein d’un même rack et entre plusieurs racks. Ensemble, ces deux modes offrent aux opérateurs la flexibilité nécessaire pour construire une infrastructure hétérogène et faire évoluer des clusters CS-4 massifs afin de prendre en charge des modèles d’IA de pointe à plus de 1 000 jetons par seconde.

Nom : 11.jpg
Affichages : 57
Taille : 60,7 Ko

Prochaines étapes

Les premières livraisons de CS-4 débuteront ce trimestre. L’IA la plus rapide vient de gagner encore en vitesse, grâce à une tokenomique inégalée et à une architecture système conçue pour l’hyperscale.

Nom : 12.jpg
Affichages : 61
Taille : 64,5 Ko

Source : Présentation Cerebras CS-4

Et vous ?

Pensez-vous que cette annonce est crédible ou pertinente ?
Quel est votre avis sur le sujet ?

Voir aussi :

Le fabricant de puces pour l'IA Cerebras dépose une demande d'introduction en bourse pour affronter Nvidia, qui domine largement le marché des puces pour l'IA avec plus de 80 % des parts

OpenAI lance GPT-5.3-Codex-Spark, optimisé par la puce Wafer Scale Engine 3 de Cerebras, pour un codage en temps réel ultra-rapide, 15 fois plus rapide que son prédécesseur

Les factures de l'IA laissent les dirigeants perplexes après le passage à une tarification basée sur la consommation, seuls 26 % des organisations parviennent à suivre leurs coûts en temps réel