IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)
Navigation

Inscrivez-vous gratuitement
pour pouvoir participer, suivre les réponses en temps réel, voter pour les messages, poser vos propres questions et recevoir la newsletter

Intelligence artificielle Discussion :

Alibaba lance Qwen 3.8-Max, son plus grand modèle d'IA à ce jour


Sujet :

Intelligence artificielle

  1. #1
    Communiqués de presse

    Femme Profil pro
    Traductrice Technique
    Inscrit en
    Juin 2023
    Messages
    3 065
    Détails du profil
    Informations personnelles :
    Sexe : Femme
    Localisation : France

    Informations professionnelles :
    Activité : Traductrice Technique

    Informations forums :
    Inscription : Juin 2023
    Messages : 3 065
    Par défaut Alibaba lance Qwen 3.8-Max, son plus grand modèle d'IA à ce jour
    Alibaba lance Qwen 3.8-Max, son plus grand modèle d'IA à ce jour, capable de traiter du texte, des images et des vidéos, une nouvelle référence pour le codage, la recherche et les tâches à long terme

    Alibaba a dévoilé Qwen 3.8-Max, le modèle le plus puissant de sa famille Qwen. Ce modèle, qui compte 2 400 milliards de paramètres mais n’en active que 95 milliards à la fois, sera disponible via Model Studio d’Alibaba Cloud, et ses poids seront rendus publics la semaine prochaine. Qwen 3.8-Max se situe à un niveau proche de celui de Kimi K3, le modèle de son concurrent national Moonshot AI. Alibaba a déclaré que Qwen 3.8-Max est capable de mener à bien de bout en bout des projets complexes s'étalant sur plusieurs jours. Sur la plateforme de comparaison participative Arena.AI, Qwen 3.8-Max s’est immédiatement hissé au premier rang des modèles chinois pour les tâches textuelles, même s’il reste derrière plusieurs produits d’Anthropic, notamment Claude Fable 5.

    Alibaba Cloud est une entreprise de cloud computing, filiale du groupe Alibaba. Alibaba Cloud fournit des services de cloud computing aux entreprises en ligne et à l'écosystème de commerce électronique d'Alibaba. Alibaba Cloud propose des services cloud disponibles selon un modèle de paiement à l'utilisation, notamment des ressources de calcul élastiques, le stockage de données, des bases de données relationnelles, le traitement du big data, la protection contre les attaques DDoS et des réseaux de diffusion de contenu (CDN). Qwen est une famille de grands modèles de langage développés par Alibaba Cloud. De nombreux modèles Qwen sont distribués sous la licence Apache, libre et open source, sous la licence Qwen (code source disponible) ou sous la licence Qwen Research à usage non commercial ; d’autres modèles Qwen propriétaires sont proposés via Alibaba Cloud.

    Récemment, Alibaba a dévoilé Qwen 3.8-Max, le modèle le plus puissant de sa famille Qwen. Ce modèle, qui compte 2 400 milliards de paramètres mais n’en active que 95 milliards à la fois, sera disponible via Model Studio d’Alibaba Cloud, et ses poids seront rendus publics la semaine prochaine. Qwen 3.8-Max se situe à un niveau proche de celui de Kimi K3, le modèle de son concurrent national Moonshot AI, lancé le mois dernier avec 2 800 milliards de paramètres. Les deux modèles peuvent traiter du texte, des images et des vidéos, et traiter jusqu’à un million de tokens à la fois.

    Sur la plateforme de comparaison participative Arena.AI, Qwen 3.8-Max s’est immédiatement hissé au premier rang des modèles chinois pour les tâches textuelles, même s’il reste derrière plusieurs produits d’Anthropic, notamment Claude Fable 5. Pour les tâches de vision, il s’est classé deuxième au niveau mondial, juste derrière une variante de Fable 5. Le modèle utilise une architecture de type « mixture-of-experts », qui répartit le travail entre des segments spécialisés plutôt que d’activer l’ensemble du système pour chaque requête. Selon Alibaba, cela permet de réduire les coûts et les temps de réponse. En revanche, OpenAI, Anthropic et Google ne divulguent pas le nombre de paramètres de leurs modèles à code source fermé.


    Alibaba a déclaré que Qwen 3.8-Max est capable de mener à bien de bout en bout des projets complexes s'étalant sur plusieurs jours. Lors d'un test, le modèle a passé plus de dix jours à coder de manière autonome, à partir de zéro, un ensemble de logiciels auto-évolutifs, en intégrant les retours des utilisateurs, en effectuant ses propres tests et en itérant sur le code, les aperçus et les journaux sans aucune aide humaine.

    Lors d’un autre test, il a reproduit de toutes pièces un article de recherche sur l’apprentissage automatique, en effectuant 33 cycles d’entraînement sur GPU pendant environ 125 heures, en écrivant 7 600 lignes de code, puis en proposant 18 idées d’amélioration qui ont finalement surpassé la méthode décrite dans l’article original. Participant à un véritable concours en ligne réunissant 526 équipes humaines, il a battu 87 % des concurrents.

    L’entreprise a également démontré l’étendue des capacités du modèle dans diverses tâches professionnelles, notamment un examen complet de conformité juridique réalisé en moins d’une heure, un prototype d’application bancaire interactive livré sans aucune révision, et un menu de restaurant comprenant 26 plats, accompagné d’une analyse des calories et des coûts, généré en une seule fois.

    Cette annonce intervient alors que les modèles d'intelligence artificielle (IA) open source chinois ont considérablement étendu leur présence à l'échelle mondiale, leur taux d'adoption passant de 13 % à près de 30 % de l'utilisation totale en 2025, principalement grâce à Qwen et DeepSeek. Cette tendance a été documentée dans le rapport "State of AI" d'OpenRouter, qui a analysé plus de 100 000 milliards de jetons sur plus de 300 modèles, révélant ainsi le passage d'une domination propriétaire à une concurrence pluraliste et open source à l'échelle mondiale.

    Les entreprises technologiques chinoises bouleversent le secteur de l'IA grâce à des modèles comme Kimi K3 et DeepSeek. Ces systèmes gagnent rapidement en popularité, car ils s'avèrent plus abordables et souvent plus performants que leurs concurrents américains pour les tâches quotidiennes. Contrairement aux systèmes d'IA fermés d'OpenAI ou d'Anthropic, la Chine privilégie une approche ouverte, permettant à tout le monde d'intégrer et de personnaliser ces outils plus librement. Cette percée suscite des craintes à Washington concernant la sécurité intellectuelle et la domination technologique, certains accusant Pékin de copier des technologies américaines.

    Voici un extrait de l'annonce d'Alibaba :

    Qwen 3.8-Max : une nouvelle référence en matière de programmation et de coworking

    Aujourd’hui, nous lançons officiellement Qwen 3.8-Max, le modèle le plus performant de la famille Qwen à ce jour. C’est également la première fois que nous rendons open source les poids d’un modèle de la classe Qwen-Max — ces poids seront publiés la semaine prochaine. S'appuyant sur l'architecture de Qwen 3.5, Qwen 3.8-Max atteint 2 400 milliards de paramètres, apportant des améliorations globales dans les domaines du codage, du travail, de la recherche et des tâches à long terme. Il est non seulement capable de répondre à des questions plus complexes, mais aussi d'accomplir des tâches complexes de bout en bout avec une plus grande fiabilité, en produisant des résultats fiables.

    Nom : 1.jpg
Affichages : 1010
Taille : 128,7 Ko

    Codage

    Pour un modèle de pointe, le codage signifie aujourd’hui bien plus que d’écrire une fonction à la demande : il s’agit de mener à bien, de manière autonome, un véritable projet s’étalant sur plusieurs jours, depuis un dossier vide jusqu’au résultat final. Nous avons testé Qwen3.8-Max sur trois défis de ce type, où chaque résultat devait être obtenu en écrivant et en exécutant réellement du code, sans aucune aide humaine. Un fil conducteur relie ces trois défis : Qwen3.8-Max ne se contente pas de suivre un plan fixe — il évolue de manière autonome grâce à des boucles de rétroaction, qu’il s’agisse de créer un harnais capable de s’améliorer de lui-même, d’affiner une méthode de recherche au fil des expériences ou de gravir les échelons du classement d’un concours, soumission après soumission.

    Nom : 4.jpg
Affichages : 1001
Taille : 82,2 Ko

    Plus de 10 jours de codage autonome : création d’un harnais auto-évolutif

    Dans ce cas précis, Qwen3.8-Max a été chargé de créer le projet oh-my-cli à partir de zéro et, au cours d’une session de codage autonome s’étalant sur plus de 10 jours, de construire un harnais auto-évolutif. Celui-ci intègre les retours des utilisateurs, les bonnes pratiques de la communauté et les résultats des autotests du modèle au sein d’une boucle d’ingénierie unique : les exigences sont normalisées en tickets, automatiquement pris en charge et exécutés par des agents, puis itérés en continu à travers le code, les tests, les aperçus et les journaux. La trace complète du projet est accessible au public dans le dépôt GitHub qwen-code-dev-bot/oh-my-cli.

    Principaux détails de mise en œuvre du harnais de codage autonome :

    - Configuration de la boucle d’ingénierie : état des tâches, répartition et récupération. Qwen3.8-Max combine une machine à états de tickets, un répartiteur, un moniteur et un chien de garde au sein d’une seule boucle d’exécution : lorsqu’une nouvelle exigence est créée dans GitHub Issues, un agent la revendique via la machine à états et la fait passer par les états ready → leased → active ; une fois la mise en œuvre terminée, les tests E2E et les vérifications CI sont déclenchés, et la pull request est fusionnée après validation.

    - Auto-test : auto-test et maintenance du produit. Après chaque mise à jour, le modèle déclenche la validation des phases de compilation, de tests unitaires, de tests de bout en bout et du cycle de vie du bureau ; les états anormaux sont renvoyés vers le ticket ou la pull request concerné(e) pour correction et nouvelle vérification.

    - Évolution multi-sources : mises à niveau du produit à partir de multiples signaux de demande. En convertissant l’expérience de la communauté et les retours des utilisateurs et développeurs en tâches exécutables, le harnais fait évoluer en continu les fonctionnalités /goal, /resume, Dynamic Workflow, Session Replay, Desktop et autres.

    Au 30 juillet 2026, après environ 16 jours de fonctionnement entièrement autonome de l’IA, le référentiel avait accumulé 265 commits, 127 PR et 151 tickets, démontrant ainsi une capacité de codage autonome en constante évolution.

    Reproduire un article de recherche, puis l'améliorer

    Nous avons soumis à Qwen3.8-Max un article de recherche récent intitulé « Unified Data Selection for LLM Reasoning » et lui avons demandé de reproduire l'expérience décrite dans cet article sous forme de code, puis d'essayer de faire mieux. Cet article aborde une question très concrète liée à l'entraînement des IA : lorsque l'on dispose de bien plus de données qu'il n'est possible d'en utiliser pour l'entraînement, quels exemples vaut-il réellement la peine de conserver ? La réponse apportée par l’article est de privilégier les exemples regorgeant de « points de décision difficiles » — ces moments, dans une solution validée, où le modèle était véritablement indécis quant à la marche à suivre.

    Le défi : Qwen3.8-Max est parti de rien d’autre que de l’article et d’un ensemble de GPU — pas de code de départ, pas de pipeline tout prêt. Les scripts de traitement des données, le code d’entraînement, la configuration d’évaluation : il a dû tout concevoir et tout écrire à partir de zéro, exactement le genre de travail qui prend des jours à des ingénieurs expérimentés.

    Travaillant de manière entièrement autonome pendant environ cinq jours (soit environ 125 heures d’effort continu), Qwen3.8-Max a écrit environ 7 600 lignes de code, effectué plus de 1 100 actions et exécuté 33 cycles d’entraînement sur GPU. Il a d’abord passé environ 37 heures à reconstruire de zéro l’intégralité du pipeline présenté dans l’article et a reproduit ses six principaux résultats — en affinant à plusieurs reprises un modèle Qwen3-8B sur les données qu’il avait sélectionnées et en confirmant les gains obtenus sur des benchmarks mathématiques complexes (par exemple, la méthode de sélection de l’article surpasse le choix aléatoire de données de +7,7 % sur AIME24).

    Il est ensuite allé plus loin, transformant la reproduction en auto-évolution. Au cours des quelque 88 heures suivantes, il a exécuté une boucle de recherche auto-améliorative — formuler une hypothèse → écrire le code → l’exécuter sur des GPU → analyser → réessayer — inventant et testant 18 idées d’amélioration de son propre chef au cours de quatre cycles. Les résultats de chaque cycle ont alimenté les hypothèses du cycle suivant, et en diagnostiquant ce qui n’avait pas fonctionné à chaque tentative, il a finalement mis au point une nouvelle méthode qui surpasse l’approche proposée dans l’article, avec un gain de +2,7 points sur le benchmark mathématique de niveau compétition AIME24.

    Nom : 2.jpg
Affichages : 976
Taille : 58,3 Ko

    Battre des centaines d’équipes humaines en 24 heures

    Nous avons ensuite inscrit Qwen3.8-Max à un véritable concours en ligne : le WWW2025 Multimodal Dialogue Intent Recognition Challenge, organisé sur la plateforme Tianchi d’Alibaba Cloud, où 526 équipes humaines s’affrontaient. La tâche consistait à lire des conversations de service client — à la fois le texte et les captures d’écran — et à déterminer correctement ce que le client souhaitait.

    Travaillant de manière entièrement autonome et dans le respect d’un délai strict de 24 heures, Qwen3.8-Max a lu le règlement du concours et a développé une solution complète en code. Pour la partie texte, il a affiné et combiné plusieurs modèles de langage chinois — BERT, MacBERT et RoBERTa ; pour les captures d’écran des produits, il a affiné un modèle de vision-langage, Qwen2.5-VL-7B, soutenu par un modèle Chinese-CLIP pour les images sur lesquelles son modèle principal avait des doutes. Il a ensuite fusionné tous ces modèles en un seul système de vote pondéré, en calibrant le poids attribué au vote de chaque modèle par validation croisée et en ajoutant des « votants » supplémentaires pour les images afin de départager les ex aequo. Au fil des 45 soumissions — les retours de chaque tour orientant le tour suivant d’affinage et de rééquilibrage des pondérations —, sa précision a progressé régulièrement, passant de 0,60 à 0,853 au final, devançant ainsi 458 des 526 équipes humaines (soit 87 % des participants).

    Nom : 3.jpg
Affichages : 988
Taille : 63,0 Ko

    Ensemble, ces trois cas illustrent ce qui distingue Qwen3.8-Max : il est capable de rester concentré pendant plusieurs jours sur un objectif difficile et ouvert, de proposer ses propres idées et de les transformer en résultats concrets, le tout sans intervention humaine.

    Agents multimodaux

    De ce qu’il voit à ce qu’il fait, Qwen3.8-Max ne se contente pas de comprendre les images, les documents et les vidéos. Il offre une intelligence visuelle qui couvre l’ensemble du cycle de vie d’une tâche.

    Lorsqu’il traite des rapports financiers et des fichiers PDF complexes de plus de 200 pages, Qwen3.8-Max est capable de comprendre le texte, les graphiques et la mise en page des documents sur l’ensemble des pages, d’extraire des informations clés à partir de volumes importants de données et de les transformer en rapports structurés ou en expériences web prêtes à être mises en production. Lors du traitement de vidéos de plus de 100 heures, il ne se contente pas de localiser des moments spécifiques et de répondre à des questions détaillées. Il peut organiser les personnes, les événements, les horodatages et les scènes dans un graphe de mémoire vidéo, en établissant en continu des liens sur de longues périodes afin de reconstituer la progression des événements, les relations entre les personnages et les moments critiques.

    Que l’entrée soit un document de plusieurs centaines de pages, une série télévisée complète ou un livestream de 100 heures, des informations qui seraient autrement difficiles à assimiler peuvent être transformées en une structure de connaissances consultable, traçable et interactive.

    Nom : 5.jpg
Affichages : 131
Taille : 95,9 Ko

    Au-delà de la compréhension, Qwen3.8-Max est capable d’effectuer de véritables tâches de production visuelle. Il peut monter des séquences personnelles pour en faire un vlog, transformer une question en animation pédagogique immersive, reconstituer un projet front-end complet à partir d’une simple capture d’écran d’interface, transformer un plan d’étage en visualisation 3D d’intérieur sous Blender, et développer des jeux et des applications interactifs à partir d’une requête en langage naturel.

    Plus important encore, la vision ne se limite pas à l’étape de l’entrée. Pendant l’exécution, Qwen3.8-Max observe et évalue en continu ses propres résultats intermédiaires. Il peut inspecter la mise en page, l’orientation des objets, les relations spatiales, la qualité des animations et les résultats des interactions. Lorsqu’il détecte des problèmes — tels qu’un téléviseur mal orienté, une interface mal alignée ou un résultat visuel qui ne correspond pas à la conception prévue —, il est capable d’identifier l’écart, de réviser son plan et de corriger le résultat de manière autonome.

    Cela signifie que la vision n’est plus simplement une modalité supplémentaire qu’un agent utilise pour comprendre les données d’entrée. Elle devient une boucle de rétroaction native qui s’étend à la planification, à l’exécution, à la vérification et à l’itération. Le modèle génère tout en observant, agit tout en examinant, et passe en revue le résultat à plusieurs reprises pour identifier les problèmes et améliorer son travail. Cette boucle de rétroaction visuelle permet à un agent d’aller au-delà de la simple réalisation d’une tâche pour parvenir à la mener à bien.

    Qwen3.8-Max aide les agents multimodaux à évoluer : ils ne se contentent plus de comprendre le monde, mais agissent et créent en permanence au sein de celui-ci grâce à la vision.

    Dans le monde numérique, mener à bien une tâche complexe de manière autonome nécessite souvent deux actions simultanées : écrire du code pour mettre en œuvre la logique sous-jacente, et manipuler l’interface manuellement pour piloter la tâche et observer le résultat. Cette capacité de l’agent hybride — l’association du codage et de l’utilisation de l’interface graphique — rend ces deux canaux complémentaires : le codage effectue le gros du travail efficacement et à grande échelle, tandis que l’utilisation de l’interface graphique permet d’accéder à tout ce qu’un humain peut voir et toucher et, tout aussi important, renvoie ce qui se passe réellement dans un système en production — étendant ainsi la boucle de rétroaction visuelle décrite ci-dessus, qui passe de l’inspection de sa propre sortie à la vérification par rapport à une application réelle en cours d’exécution.

    Pour mesurer cela, nous présentons RecreationBench, un benchmark de recréation d’applications à long terme couvrant cinq plateformes : ordinateurs de bureau (Ubuntu, macOS, Windows), mobiles (Android) et web. Le modèle ne peut observer une application réelle en exécution que comme une « boîte noire » — sans code source, sans accès à Internet —, en la comprenant uniquement par l’interaction et le retour d’information, puis en reconstruisant l’application entière à partir de zéro. Ici, Qwen3.8-Max démontre déjà des capacités d’agent hybride à la pointe de la technologie, convergeant pas à pas vers l’original grâce à des cycles répétés de codage itératif et de retours interactifs.

    Nom : 6.jpg
Affichages : 117
Taille : 97,9 Ko

    Afin de faciliter l’intégration de ces capacités dans les systèmes d’agents existants, nous lançons également Qwen-MM-Plugins. Il s’agit d’une bibliothèque d’extension de harnais conçue pour les agents multimodaux, qui fournit aux frameworks d’agents des fonctionnalités de traitement d’images et de vidéos, une mémoire multimodale, la prise en charge de la résolution dynamique, l’utilisation d’outils visuels, ainsi que des capacités spécialisées pour des tâches telles que le montage vidéo, Blender et la CAO. Grâce à Qwen-MM-Plugins, tout harnais d’agent existant peut être étendu pour devenir un système multimodal natif plus naturel.

    Source : Annonce de Qwen 3.8-Max

    Et vous ?

    Pensez-vous que cette annonce est crédible ou pertinente ?
    Quel est votre avis sur le sujet ?

    Voir aussi :

    Près de 200 fondateurs de startups américaines exhortent Trump à ne pas interdire les modèles d'IA open source chinois, avertissant que cela laisserait les petits clients à la merci d'OpenAI et d'Anthropic

    Le nouveau modèle DeepSeek-V4-Flash-0731 surpasse sa propre version « Pro ». Il rivalise avec GPT-5.6 Luna, pour un coût inférieur d'environ 60 %, même après la baisse de prix de 80 % pratiquée par OpenAI

    Anthropic estime qu'Alibaba doit être sanctionné pour la plus grande attaque de clonage de Claude, Alibaba aurait utilisé 25 000 comptes pour exploiter Claude à travers plus de 28,8 millions d'échanges
    Publication de communiqués de presse en informatique. Contribuez au club : corrections, suggestions, critiques, ... Contactez le service news et Rédigez des actualités

  2. #2
    Chroniqueur Actualités
    Avatar de Anthony
    Homme Profil pro
    Rédacteur technique
    Inscrit en
    Novembre 2022
    Messages
    2 360
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France, Gironde (Aquitaine)

    Informations professionnelles :
    Activité : Rédacteur technique

    Informations forums :
    Inscription : Novembre 2022
    Messages : 2 360
    Par défaut Alibaba Cloud lance Qwen3.8-Flash-Next, un modèle d'IA multimodal doté d'une nouvelle architecture
    Alibaba Cloud lance Qwen3.8-Flash-Next, un modèle d'IA multimodal doté d'une nouvelle architecture et offrant un meilleur rapport coût-efficacité

    Alibaba Cloud a lancé Qwen3.8-Flash-Next, un modèle d'intelligence artificielle (IA) multimodal de type « mixture-of-experts », offrant un premier aperçu de l'architecture de la future famille Qwen4. Cette refonte architecturale porte à la fois sur le mécanisme d'attention, les connexions résiduelles, l’intégration et l’optimisation. Qwen3.8-Flash-Next dispose d'un modèle principal de 125 milliards de paramètres, complété par 51 milliards de paramètres supplémentaires, dont seuls 6 milliards sont activés par token. Alibaba revendique de meilleurs résultats en matière de codage et dans les tâches bureautiques par rapport à Qwen3.7-Plus, pour un coût d'entraînement environ neuf fois moindre, avec un contexte s'étendant jusqu'à 1 million de tokens via YaRN.

    Alibaba Cloud est une entreprise de cloud computing, filiale du groupe Alibaba. Alibaba Cloud fournit des services de cloud computing aux entreprises en ligne et à l'écosystème de commerce électronique d'Alibaba. Elle propose des services cloud disponibles selon un modèle de paiement à l'utilisation, notamment des ressources de calcul élastiques, le stockage de données, des bases de données relationnelles, le traitement du Big Data, la protection contre les attaques DDoS et des réseaux de diffusion de contenu (CDN).

    Qwen (également connu sous le nom de Tongyi Qianwen) est une famille de grands et petits modèles de langage (LLM et SLM), pour la plupart open source, développée par Alibaba Cloud. La première version de Qwen, basée sur Llama 1 de Meta AI, a été lancée en version bêta en avril 2023, et les poids de son modèle 72B ont été rendus publics en décembre de la même année. Début août 2026, Alibaba a lancé Qwen 3.8-Max, un modèle d'IA à poids ouverts de 2 400 milliards de paramètres capable de traiter du texte, des images et des vidéos. Il s'agit du modèle le plus puissant de la famille Qwen, se situant à un niveau proche de Kimi K3 de Moonshot AI.

    Le 26 août dernier, Alibaba Cloud a publié les poids ouverts de Qwen3.8-Flash-Next, un modèle multimodal de type « mixture-of-experts » qui offre également un premier aperçu de l'architecture de sa future série Qwen4. Selon l'entreprise, ce modèle bénéficie d'une mise à niveau systématique dans quatre domaines clés : la conception, l'attention, les connexions résiduelles, l'intégration et l'optimisation. Cette mise à niveau vise à renforcer ses capacités tout en réduisant le coût de calcul, les exigences en matière de capacité du modèle et l'instabilité lors de l'entraînement.


    Les modifications techniques s’articulent en plusieurs niveaux. Du côté de l’attention, le modèle associe le Gated DeltaNet (GDN), qui compresse l’historique du contexte antérieur, au Qwen Sparse Attention (QSA), un indexeur léger et compressé qui sélectionne le contexte le plus important à l’échelle des micro-blocs, réduisant ainsi considérablement le coût de l’attention sur les longues séquences. Le flux résiduel est divisé en quatre branches selon un schéma Gated Residual (GR), avec une porte dynamique contrôlant les lectures et les écritures afin de renforcer le flux d’informations entre les couches et la stabilité de l’entraînement. Pour l'intégration, un nouveau composant N-gram Embedding adapte la capacité du modèle avec un surcroît de calcul minimal en effectuant des recherches dans une table à partir du contexte local ; de plus, comme la table d'intégration peut être transférée vers la mémoire de l'hôte et préchargée de manière asynchrone, ce processus se déroule en parallèle du calcul du modèle. Enfin, la pile d’entraînement adopte l’optimiseur Muon, perfectionné en termes de précision d’orthogonalisation, de répartition des tâches entre Muon et AdamW, et de fractionnement des paramètres fusionnés, la loi d’évolutivité ayant été réajustée pour s’adapter à la nouvelle architecture.

    En termes d’échelle et d’efficacité, Qwen3.8-Flash-Next dispose d’un modèle principal de 125 milliards de paramètres, complété par 51 milliards de paramètres supplémentaires dans N-gram embeddings, avec seulement 6 milliards de paramètres activés par token. Par rapport à la version précédente, Qwen3.7-Plus, l’entreprise affirme que ce nouveau modèle offre des capacités supérieures en matière de codage et de tâches bureautiques, tout en réduisant le coût de l’entraînement à environ un neuvième de celui de son prédécesseur. Le modèle prend en charge nativement 262 144 tokens de contexte, et cette fenêtre peut être étendue à un million de tokens grâce à YaRN.

    Les poids du modèle Qwen3.8-Flash-Next sont désormais disponibles sur Hugging Face et ModelScope, ce qui rend cette architecture immédiatement accessible aux chercheurs et aux développeurs, tandis qu'Alibaba Cloud pose les bases de la génération Qwen4.

    La publication de Qwen3.8-Flash-Next intervient alors que l'adoption mondiale des modèles d'IA open source chinois a presque triplé, passant de 13 % à environ 30 % de l'utilisation totale en 2025. Cette tendance, qui résulte de l'essor de DeepSeek et de Qwen d'Alibaba, a été documentée dans le rapport « State of AI » d'OpenRouter. Ce rapport a analysé plus de 100 000 milliards de jetons sur plus de 300 modèles, révélant ainsi le passage d'une domination propriétaire à une concurrence pluraliste et open source à l'échelle mondiale.

    Voici un extrait de l'annonce du modèle Qwen3.8-Flash-Next par Alibaba :

    Dans cette version, nous rendons publics les poids de Qwen3.8-Flash-Next, un modèle MoE multimodal qui offre également un premier aperçu de l'architecture utilisée dans Qwen4. Il joue le même rôle que Qwen3-Next pour Qwen3.5 : la conception hybride Gated DeltaNet + Gated Attention introduite à l’époque a depuis été utilisée dans les séries Qwen3.5, Qwen3.6, Qwen3.7 et Qwen3.8. Nous publions à nouveau les modifications architecturales en avant-première, afin que la communauté puisse les examiner avant que la famille complète de modèles Qwen4 ne soit construite sur cette base.

    Qwen3.8-Flash-Next améliore le modèle de manière systématique selon quatre axes — attention, résidu, intégration et optimisation —, ce qui renforce ses capacités tout en optimisant davantage l'efficacité de calcul, la capacité du modèle et la stabilité de l'entraînement :

    • Attention : une architecture hybride GDN + QSA. Le Gated DeltaNet (GDN) compresse efficacement l’historique ; le Qwen Sparse Attention (QSA) utilise un indexeur léger et compressé pour sélectionner le contexte important à l’échelle des micro-blocs, réduisant ainsi considérablement le coût de l’attention sur les longues séquences.
    • Résidu : Gated Residual (GR) divise le flux résiduel en 4 branches et contrôle les lectures et les écritures à l’aide d’une porte dynamique, renforçant ainsi le flux d’informations entre les couches et la stabilité de l’entraînement.
    • Intégration : N-gram Embedding effectue des recherches dans une table en utilisant le contexte local pour adapter la capacité du modèle avec un surcoût de calcul très faible ; la table d'intégration peut être déchargée vers la mémoire de l’hôte et superposée au calcul du modèle grâce à une prélecture asynchrone.
    • Optimisation : l’optimiseur Muon est utilisé ; il a été affiné en termes de précision d’orthogonalisation, de répartition des tâches entre Muon et AdamW, et de fractionnement des paramètres fusionnés, la loi d’échelle ayant été réajustée pour la nouvelle architecture.

    Qwen3.8-Flash-Next intègre un modèle principal de 125 milliards de paramètres, complété par 51 milliards N-gram Embeddings supplémentaires, avec 6 milliards de paramètres activés par token. Par rapport à Qwen3.7-Plus, Qwen3.8-Flash-Next réduit considérablement les coûts d’entraînement et d’inférence : l’entraînement ne prend qu’environ 1/9 du temps, tout en offrant des capacités supérieures en matière de codage et de tâches bureautiques.

    Il prend en charge nativement 262 144 tokens de contexte et est extensible à 1 000 000 de tokens avec YaRN. Les poids de Qwen3.8-Flash-Next sont désormais disponibles sur Hugging Face et ModelScope. La version de production, avec 1 million de tokens de contexte par défaut et des outils officiels intégrés, est proposée sous le nom de Qwen3.8-Flash sur QwenCloud, au prix de 0,15 dollar par million de tokens d’entrée et de 0,47 dollar par million de tokens de sortie.

    Architecture du modèle

    Nom : qwen3.8 flash next arch.png
Affichages : 1132
Taille : 129,3 Ko

    Attention : GDN + QSA pour une gestion efficace de la mémoire et une récupération précise

    Le « Full-Attention » traditionnel offre un accès direct à tous les tokens précédents, mais à mesure que le contexte s'allonge, les coûts de calcul et d'accès à la mémoire du cache KV augmentent considérablement.

    S'inspirant de l'architecture présentée dans Qwen3.5, Qwen3.8-Flash-Next adopte une architecture hybride GDN + Attention : trois couches sur quatre utilisent le Gated DeltaNet (GDN) pour compresser en continu les informations historiques en un état de taille fixe, tandis que la couche restante utilise l'Attention globale pour une récupération précise des informations sur l'ensemble du contexte.

    En ce qui concerne l'attention globale, nous présentons également le « Qwen Sparse Attention » (QSA). L'attention dispersée réduit la charge de calcul liée aux longues séquences en ne prenant en compte que le contexte pertinent. Cependant, les approches existantes, telles que le DSA, s'appuient toujours sur un indexeur au niveau des tokens pour identifier les positions importantes ; à mesure que le contexte s'étend, l'indexeur lui-même devient une source de calcul non négligeable.

    QSA simplifie encore davantage ce processus : un indexeur léger regroupe d’abord la séquence en micro-blocs, évalue l’importance du contexte au niveau de chaque bloc, puis sélectionne les régions les plus pertinentes pour l’Attention. Cela réduit non seulement le coût de l’Attention elle-même, mais aussi la charge d’indexation nécessaire pour identifier le contexte important. Par rapport aux approches qui partagent des indices entre les couches, QSA effectue la compression des séquences de manière indépendante au sein de chaque couche, ce qui réduit sa dépendance à l'égard de la similarité d'attention intercouches et le rend particulièrement bien adapté aux architectures hybrides dans lesquelles les couches GDN et Attention sont entrelacées.

    Nom : qwen3.8 flash next arch 2.png
Affichages : 723
Taille : 89,9 Ko

    En termes simples : GDN « mémorise » efficacement, tandis que QSA « récupère » avec précision.

    Avec 1 million de tokens, le noyau d’Attention du QSA permet d’atteindre des gains de vitesse allant jusqu’à 7,6x et 4,9x respectivement pour les phases de préremplissage et de décodage. Dans un cadre expérimental représentatif des scénarios de service en ligne avec une réutilisation élevée du cache (un taux de réussite de 90 % dans le cache de préfixes), Qwen3.8-Flash-Next atteint un débit de préremplissage 8,6 fois supérieur à celui de Qwen3.7-Plus pour une longueur de contexte de 1 million de tokens.

    Nom : qwen3.8 flash next arch 3.png
Affichages : 716
Taille : 134,2 Ko

    Gated Residual : davantage de voies pour la circulation de l'information

    Dans un transformeur classique, toutes les couches lisent et écrivent en continu dans le même flux résiduel. À mesure que le réseau gagne en profondeur, les caractéristiques initiales sont mélangées à plusieurs reprises avec les informations ultérieures, ce qui augmente le risque de voir les signaux importants se diluer progressivement.

    Gated Residual (GR) peut être considéré comme la combinaison de deux concepts : il s'inspire de l'approche « Hyper-Connection » pour élargir le flux résiduel en plusieurs branches, tout en intégrant le filtrage dynamique élément par élément de GatedNorm dans la lecture du flux résiduel. Le flux résiduel unique d'origine est divisé en quatre branches parallèles, ce qui permet au modèle de déterminer de manière dynamique la quantité d'informations à lire dans chaque branche et celle à réécrire dans chacune d'elles en fonction du contenu actuel.

    On peut conceptualiser ce phénomène comme l'extension d'un canal d'information unique en plusieurs voies parallèles : certaines branches gèrent le flux d'informations local, tandis que d'autres transmettent les informations initiales directement vers les couches profondes du réseau. L'analyse empirique révèle également que l'une de ces branches émerge naturellement comme une voie à longue portée reliant la première couche d'attention à la plupart des couches intermédiaires et suivantes.

    GR simplifie encore davantage l’Hyper-Connection. Une fois que les opérations de lecture et d’écriture sont suffisamment expressives, le mélange supplémentaire des branches n’apporte aucun avantage significatif et peut donc être directement supprimé, ce qui réduit la surcharge liée aux accès mémoire et les sources d’instabilité. Le Gate supprime également efficacement les valeurs aberrantes d’activation et améliore la stabilité de l’apprentissage. De plus, l’état résiduel prend en charge le stockage en FP8, ce qui réduit encore davantage la surcharge liée aux accès mémoire.

    N-gram Embedding : augmenter la capacité du modèle à moindre coût

    En nous inspirant du Per-Layer Embedding de Gemma 3n et de travaux tels que DeepSeek Engram, nous introduisons également l’Embedding N-gram afin d’étendre la capacité du modèle au-delà des paramètres de l’architecture Transformer.

    Un intégration standard effectue une recherche sur la base d’un seul token. N-gram Embedding, quant à lui, effectue des recherches en utilisant le contexte local formé par le token actuel et plusieurs tokens précédents, fournissant ainsi des représentations supplémentaires pour les expressions courantes et les motifs locaux.

    Son principal avantage réside dans sa capacité à intégrer un grand nombre de paramètres sans entraîner pratiquement aucun surcoût de calcul par token.

    Qwen3.8-Flash-Next introduit 51 milliards de paramètres supplémentaires N-gram Embedding. Les emplacements de recherche pouvant être déterminés à l’avance, ces paramètres peuvent être stockés dans la mémoire hôte et préchargés de manière asynchrone, en parallèle du calcul du modèle, sans occuper en permanence la mémoire du GPU.

    Le modèle final n'utilise qu'une seule couche N-gram Embedding située près du début du réseau, ce qui permet d'ajouter efficacement une « mémoire de motifs locaux » à grande échelle pour un coût supplémentaire relativement faible.

    Optimisation : conception conjointe de l'architecture et de l'optimisation

    Qwen3.8-Flash-Next a été entraîné à l'aide de l'optimiseur Muon, avec des améliorations supplémentaires portant sur trois aspects clés de l'application de Muon à l'entraînement de grands modèles : la précision de l'orthogonalisation, l'attribution des paramètres entre Muon et AdamW, et le fractionnement des matrices de paramètres fusionnées.

    Pour les paramètres qui agissent véritablement comme des applications linéaires bidimensionnelles, tels que les poids principaux dans Attention, GDN et MoE Experts, nous utilisons Muon. Les intégrations, le MoE Router et les paramètres de rang faible dans GR continuent d'utiliser AdamW. Pour les projections QKV, SwiGLU et GDN qui sont fusionnées dans l'implémentation, nous les séparons d'abord en fonction des transformations linéaires indépendantes qu'elles représentent, puis nous effectuons l'orthogonalisation séparément.

    Pour la nouvelle architecture et l’optimiseur, nous avons réajusté la loi d’échelle. Les résultats montrent que le modèle peut utiliser de manière stable des taux d’apprentissage et des tailles de lots plus importants, ce qui améliore encore l’efficacité de la convergence et le débit de l’entraînement parallèle à grande échelle.

    Nous constatons également que le « Batch Size Warmup », une pratique courante dans l’entraînement de grands modèles, n’est plus nécessaire : passer progressivement d’un petit lot au lot cible n’améliore pas le résultat final, mais nécessite au contraire 18,8 % d’étapes d’optimisation supplémentaires. Dans la recette d’entraînement finale, nous commençons donc directement avec la taille de lot cible.

    Autres optimisations d'architecture

    Les autres composants reprennent l'architecture définie dans Qwen3-Next et affinée au fil des versions Qwen3.5 à Qwen3.8.

    • MoE ultra-sparse : grâce à l'équilibrage global de la charge, l'augmentation du nombre total de paramètres d'experts tout en maintenant fixe le nombre d'experts activés réduit progressivement la perte d'apprentissage. Qwen3.8-Flash-Next utilise donc un vaste pool d'experts avec un petit nombre d'experts acheminés par token, ainsi qu'un expert partagé.
    • Prédiction multi-tokens (MTP) : le module MTP est entraîné en plusieurs étapes, ce qui permet de maintenir la cohérence entre l’entraînement et l’inférence et d’améliorer ainsi le taux d’acceptation du décodage spéculatif dans des scénarios réels, tout en renforçant les performances de l’architecture principale. Ses couches « full-attention » sont également remplacées par le QSA.
    • Stabilité de l’entraînement : la norme RMSNorm centrée sur zéro avec décroissance des poids appliquée aux poids de norme, le mécanisme de gating de la sortie d’attention et l’initialisation normalisée du routeur MoE sont conservés. Ces conceptions rendent les ablations à petite échelle plus fiables et contribuent au bon déroulement de l’entraînement à grande échelle.

    Performance

    Performances du modèle de base

    Nous comparons Qwen3.8-Flash-Next-Base aux modèles de base Qwen3.8-27B et Qwen3.7-Plus.

    Nom : qwen3.8 flash next tab 3.png
Affichages : 50
Taille : 67,3 Ko

    Avec 6 milliards de paramètres activés, Qwen3.8-Flash-Next-Base obtient les meilleurs résultats sur 8 des 14 benchmarks, notamment MMLU-Pro, SuperGPQA, BBH, GSM8K, EvalPlus, SWEBench-Pretrain, MGSM et MMMLU, et reste proche de Qwen3.7-Plus-Base sur MMLU, MMLU-Redux, GPQA, MATH et MultiPL-E. Les 51 milliards de paramètres N-gram embedding sont gérés de manière déterministe et n’entrent pas dans le budget de multiplication matricielle par token.

    Langage

    Nom : qwen3.8 flash next tab 1.png
Affichages : 49
Taille : 63,6 Ko

    Vision-langage

    Nom : qwen3.8 flash next tab 2.png
Affichages : 50
Taille : 59,1 Ko

    Résumé

    Qwen3.8-Flash-Next étend l'architecture hybride introduite dans Qwen3-Next selon quatre axes : l'attention, le résidu, l'intégration et l'optimisation. QSA compresse la séquence en micro-blocs au sein de chaque couche, réduisant ainsi à la fois le coût de l’attention et celui de l’indexation dans les contextes longs, tout en conservant une récupération précise. Gated Residual élargit le flux résiduel en plusieurs branches parallèles et contrôle les lectures et les écritures à l’aide d’une porte élément par élément dépendante des données, améliorant ainsi le flux d’informations entre les couches et la stabilité de l’entraînement à un coût arithmétique négligeable ; l’état résiduel peut en outre être conservé en FP8, ce qui réduit encore davantage le trafic mémoire. N-gram Embedding fait évoluer la capacité grâce à une mémoire de consultation à adressage déterministe, qui peut être mise à l’échelle avec un calcul par token négligeable et déchargée vers la mémoire hôte. Du côté de l'optimisation, Muon est utilisé comme optimiseur principal, avec, parmi les choix d'implémentation déterminants, la précision de l'orthogonalisation, l'attribution des paramètres et la division des matrices fusionnées, ainsi qu'une loi d'échelle réajustée pour la nouvelle architecture.

    Nous publions ces poids dès maintenant afin que la communauté puisse évaluer l'architecture de manière indépendante, comme nous l'avons fait avec Qwen3-Next, et nous continuerons à l'affiner en vue de Qwen4.

    Source : Annonce de Qwen3.8-Flash-Next

    Et vous ?

    Quel est votre avis sur le sujet ?
    Trouvez-vous cette initiative d'Alibaba Cloud crédible ou pertinente ?

    Voir aussi :

    Alibaba dévoile Qwen 3.6-Max-Preview, la version préliminaire de son prochain modèle d'IA avancé, qui est plus intelligent, plus performant et toujours en pleine évolution

    Alibaba présente Qwen 3.6 Plus, un modèle d'IA 100 % gratuit qui surpasserait Claude Sonnet 4.6 et permettrait de créer des applications en une seule instruction

    Alibaba Cloud lance Qwen-Image-3.0, son dernier modèle IA de génération d'images, avec la prise en charge d'une entrée de 4 500 tokens pour la génération d'images complexes par IA
    Contribuez au club : corrections, suggestions, critiques, ... Contactez le service news et Rédigez des actualités

Discussions similaires

  1. Alibaba lance Qwen 3.8 Max, , la dernière version phare de son grand modèle de langage
    Par Mathis Lucas dans le forum Intelligence artificielle
    Réponses: 0
    Dernier message: 21/07/2026, 13h57
  2. Réponses: 1
    Dernier message: 25/03/2025, 09h15
  3. Réponses: 5
    Dernier message: 31/08/2022, 01h42
  4. Réponses: 0
    Dernier message: 21/08/2020, 21h06
  5. Réponses: 17
    Dernier message: 03/10/2019, 09h23

Partager

Partager
  • Envoyer la discussion sur Viadeo
  • Envoyer la discussion sur Twitter
  • Envoyer la discussion sur Google
  • Envoyer la discussion sur Facebook
  • Envoyer la discussion sur Digg
  • Envoyer la discussion sur Delicious
  • Envoyer la discussion sur MySpace
  • Envoyer la discussion sur Yahoo