IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)
Navigation

Inscrivez-vous gratuitement
pour pouvoir participer, suivre les réponses en temps réel, voter pour les messages, poser vos propres questions et recevoir la newsletter

Intelligence artificielle Discussion :

Alibaba a lancé une nouvelle version de son modèle d'IA Qwen 2.5-Max, affirmant qu'il surpasse DeepSeek


Sujet :

Intelligence artificielle

  1. #1
    Communiqués de presse

    Femme Profil pro
    Traductrice Technique
    Inscrit en
    Juin 2023
    Messages
    3 030
    Détails du profil
    Informations personnelles :
    Sexe : Femme
    Localisation : France

    Informations professionnelles :
    Activité : Traductrice Technique

    Informations forums :
    Inscription : Juin 2023
    Messages : 3 030
    Par défaut Alibaba a lancé une nouvelle version de son modèle d'IA Qwen 2.5-Max, affirmant qu'il surpasse DeepSeek
    L'entreprise technologique chinoise Alibaba a lancé une nouvelle version de son modèle d'IA Qwen 2.5-Max, affirmant qu'il surpasse DeepSeek : "Qwen 2.5-Max surpasse GPT-4o, DeepSeek-V3 et Llama-3.1-405B".

    La société technologique chinoise Alibaba a publié une nouvelle version de son modèle d'intelligence artificielle (IA) Qwen 2.5-Max qui, selon elle, surpasse le très acclamé DeepSeek-V3. Le moment inhabituel de la sortie du Qwen 2.5-Max, le premier jour du Nouvel An lunaire, alors que la plupart des Chinois sont en congé et en famille, montre la pression que l'ascension fulgurante de la startup chinoise DeepSeek au cours des trois dernières semaines a exercée non seulement sur ses rivaux étrangers, mais aussi sur ses concurrents nationaux.

    Récemment, la startup chinoise d'IA DeepSeek a publié un nouveau modèle d'IA qui a provoqué une onde de choc dans la communauté de l'IA, faisant chuter les actions de grandes entreprises américaines comme Nvidia. Le modèle R1 de DeepSeek s'est fait remarqué pour ses performances comparables au modèle o1 d'OpenAI pour 95 % moins cher. Aujourd'hui, le modèle Qwen d'Alibaba veut faire sa propre marque, lancé le premier jour du Nouvel An chinois.

    Pour rappel, Qwen est une famille de grands modèles de langage développés par Alibaba. Alibaba a d'abord lancé une version bêta de Qwen en avril 2023 sous le nom de Tongyi Qianwen. En juin 2024, Alibaba a lancé Qwen 2 et, en septembre 2024, a publié certains de ses modèles en open source, tout en conservant la propriété de ses modèles les plus avancés. En juillet 2024, il a été classé comme le meilleur modèle de langue chinoise dans certains benchmarks et troisième au niveau mondial derrière les meilleurs modèles d'Anthropic et d'OpenAI.

    Mais depuis la sortie du modèle R1 de DeepSeek, ce classement a été chamboulé. Pour rester dans la course à l'IA, Alibaba a donc lancé un nouveau modèle de Qwen, Qwen 2.5-Max, affirmant qu'il surpasse le nouveau modèle de DeepSeek. "Qwen 2.5-Max surpasse ... presque tous les modèles GPT-4o, DeepSeek-V3 et Llama-3.1-405B", a déclaré l'unité cloud d'Alibaba. Les autres modèles mentionnés sont OpenAI et les modèles d'IA open-source les plus avancés de Meta.


    Comme il s'agit d'un jour férié en Chine, l'empressement à lancer Qwen pourrait être une réponse à la fureur suscitée par DeepSeek. En effet, d'autres entreprises technologiques s'empressent de montrer ce qu'elles ont à offrir, le PDG d'OpenAI, Sam Altman, s'empressant à la fois de féliciter DeepSeek et d'affirmer que son entreprise peut encore faire mieux. Dans le même temps, ByteDance, propriétaire de TikTok, a publié une mise à jour de son propre modèle d'IA, affirmant qu'il surpassait OpenAI dans un test de référence largement utilisé, l'AIME.

    Ce n'est pas la première fois que DeepSeek déclenche le chaos dans l'industrie technologique, son modèle précédent, DeepSeek-V2, ayant déclenché une guerre des prix en Chine en mai 2024. DeepSeek a l'habitude de proposer des modèles open-source et étonnamment bon marché, le modèle V2 ne coûtant que 1 yuan (0,14 dollar) pour 1 million de jetons et le modèle V3 étant lancé après un investissement de moins de 6 millions de dollars.

    En juillet 2024, le fondateur de DeepSeek, Liang Wenfeng, a affirmé que sa startup "ne se souciait pas" de la guerre des prix. L'objectif de l'entreprise est plutôt de parvenir à l'AGI (intelligence générale artificielle). En soi, cela contraste avec certains fondateurs américains de l'IA, comme Altman, qui vise la superintelligence de l'IA.

    Voici la présentation de Qwen 2.5-Max par Alibaba :

    Il est largement reconnu que la mise à l'échelle continue de la taille des données et de la taille du modèle peut conduire à des améliorations significatives de l'intelligence du modèle. Cependant, la communauté de la recherche et de l'industrie n'a qu'une expérience limitée de la mise à l'échelle efficace de modèles extrêmement volumineux, qu'il s'agisse de modèles denses ou de mélanges d'experts (MoE).

    De nombreux détails critiques concernant ce processus de mise à l'échelle n'ont été révélés qu'avec la récente publication de DeepSeek V3. Parallèlement, nous développons Qwen 2.5-Max, un modèle MoE à grande échelle qui a été pré-entraîné sur plus de 20 millions de milliards de jetons et post-entraîné avec les méthodologies Supervised Fine-Tuning (SFT) et Reinforcement Learning from Human Feedback (RLHF).

    Aujourd'hui, nous sommes ravis de partager les résultats de performance de Qwen 2.5-Max et d'annoncer la disponibilité de son API via Alibaba Cloud. Nous vous invitons également à découvrir Qwen 2.5-Max sur Qwen Chat !
    Nom : 3.jpg
Affichages : 34684
Taille : 57,5 Ko

    Performances de Qwen 2.5-Max

    Qwen 2.5-Max a été évalué aux côtés des principaux modèles, qu'ils soient propriétaires ou à poids ouvert, sur une série de points de référence (benchmark). Il s'agit notamment de MMLU-Pro, qui teste les connaissances à travers des problèmes de niveau universitaire, LiveCodeBench, qui évalue les capacités de codage, LiveBench, qui teste de manière exhaustive les capacités générales, et Arena-Hard, qui se rapproche des préférences humaines. Voici les résultats comprennent les scores de performance pour les modèles de base et les modèles d'instruction.

    D'abord, les performances des modèles d'instruction, qui peuvent servir à des applications en aval telles que le chat et le codage. Les résultats de performance de Qwen 2.5-Max sont présentés avec les principaux modèles de pointe, y compris DeepSeek V3, GPT-4o, et Claude-3.5-Sonnet.

    Nom : 1.jpg
Affichages : 8174
Taille : 56,3 Ko

    D'après ces tests, Qwen2.5-Max surpasse DeepSeek V3 dans des benchmarks tels que Arena-Hard, LiveBench, LiveCodeBench, et GPQA-Diamond, tout en démontrant des résultats compétitifs dans d'autres évaluations, y compris MMLU-Pro.

    Cependant, lors de la comparaison des modèles de base,Alibaba n'a pas été en mesure d'accéder aux modèles propriétaires tels que GPT-4o et Claude-3.5-Sonnet. Ils ont donc évalué Qwen2.5-Max par rapport à DeepSeek V3, un modèle MoE à poids ouvert de premier plan, Llama-3.1-405B, le plus grand modèle dense à poids ouvert, et Qwen2.5-72B, qui figure également parmi les meilleurs modèles denses à poids ouvert. Les résultats de cette comparaison sont présentés ci-dessous.

    Nom : 2.jpg
Affichages : 8121
Taille : 47,9 Ko

    L'éditeur de Qwen commente ces résultats tout en se projetant sur le futur du modèle :

    Nos modèles de base ont démontré des avantages significatifs sur la plupart des points de référence, et nous sommes optimistes quant aux progrès des techniques de post-entraînement qui permettront à la prochaine version de Qwen2.5-Max d'atteindre de nouveaux sommets.

    La mise à l'échelle des données et de la taille des modèles ne met pas seulement en évidence les progrès réalisés dans le domaine de l'intelligence des modèles, mais reflète également notre engagement inébranlable en faveur de la recherche de pointe. Nous sommes déterminés à améliorer les capacités de réflexion et de raisonnement des grands modèles de langage grâce à l'application innovante de l'apprentissage par renforcement à grande échelle. Cet effort promet de permettre à nos modèles de transcender l'intelligence humaine, en libérant le potentiel d'explorer des territoires inexplorés de la connaissance et de la compréhension.
    Utiliser Qwen 2.5-Max

    Qwen 2.5-Max est désormais disponible dans Qwen Chat, et vous pouvez discuter directement avec le modèle.

    L'API de Qwen 2.5-Max (dont le nom de modèle est qwen-max-2025-01-25) est disponible. Vous devrez d'abord enregistrer un compte Alibaba Cloud et activer le service Alibaba Cloud Model Studio, puis naviguer vers la console et créer une clé API. De plus les API de Qwen sont compatibles avec l'OpenAI-API. Voici un exemple d'utilisation de Qwen 2.5-Max en Python :

    Code : Sélectionner tout - Visualiser dans une fenêtre à part
    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    11
    12
    13
    14
    15
    16
    17
    from openai import OpenAI
    import os
     
    client = OpenAI(
        api_key=os.getenv("API_KEY"),
        base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
    )
     
    completion = client.chat.completions.create(
        model="qwen-max-2025-01-25",
        messages=[
          {'role': 'system', 'content': 'You are a helpful assistant.'},
          {'role': 'user', 'content': 'Which number is larger, 9.11 or 9.8?'}
        ]
    )
     
    print(completion.choices[0].message)


    Démo en ligne gratuite sur Huggingface

    Source : Annonce de Qwen 2.5-Max

    Et vous ?

    Quel est votre avis sur ce nouveau modèle de Qwen ?
    Pensez-vous que ces résultats de benchmarks sont crédibles ou pertinents ?

    Voir aussi :

    Qwen2 : le LLM open source d'Alibaba évolue avec des capacités améliorées et des prouesses multilingues, et serait désormais le meilleur LLM Opensource devant Llama-3 , GPT-4O , et Claude

    Le laboratoire d'IA chinois DeepSeek a publié sa nouvelle famille de modèles R1 sous une licence MIT ouverte, affirmant que le modèle présente des performances comparables au raisonnement simulé o1 d'OpenAI

    Les benchmarks suggèrent que les modèles IA open source comblent l'écart avec les modèles propriétaires. Les capacités de Llama 3 8b sont incroyables et se rapprochent de Wizard 2 8x22b, selon un ingénieur
    Publication de communiqués de presse en informatique. Contribuez au club : corrections, suggestions, critiques, ... Contactez le service news et Rédigez des actualités

  2. #2
    Chroniqueur Actualités
    Avatar de Anthony
    Homme Profil pro
    Rédacteur technique
    Inscrit en
    Novembre 2022
    Messages
    2 319
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France, Gironde (Aquitaine)

    Informations professionnelles :
    Activité : Rédacteur technique

    Informations forums :
    Inscription : Novembre 2022
    Messages : 2 319
    Par défaut Alibaba dévoile Qwen2.5-VL-32B, un nouveau modèle d'IA combinant vision, langage et raisonnement mathématique
    Alibaba dévoile Qwen2.5-VL-32B, un nouveau modèle d'IA multimodale combinant vision, langage et raisonnement mathématique

    Le géant technologique chinois Alibaba a réalisé une nouvelle avancée significative dans le domaine de l'intelligence artificielle (IA). Récemment, l'entreprise a mis en libre accès son dernier modèle multimodal, Qwen2.5-VL-32B-Instruct. Ce nouveau modèle fait partie de la série Qwen2.5, qui comprend également les versions 3B, 7B et 72B. La version 32B donne la priorité à l'exécution locale pratique tout en maintenant des performances élevées.

    Qwen, également appelé Tongyi Qianwen, est une famille de grands modèles de langage (LLM) développés par Alibaba Cloud. En juillet 2024, il a été classé comme le meilleur modèle de langage chinois dans certains benchmarks et troisième au niveau mondial derrière les meilleurs modèles d'Anthropic et d'OpenAI.

    La sortie de Qwen2.5-VL-32B-Instruct fait suite au lancement par Alibaba d'une nouvelle version de son modèle d'IA Qwen 2.5-Max, qui selon l'entreprise surpasse GPT-4o, DeepSeek-V3 et Llama-3.1-405B.

    Qwen2.5-VL-32B, optimisé par apprentissage par renforcement, excelle dans plusieurs domaines. Tout d'abord, ses réponses sont plus en phase avec les habitudes cognitives humaines, ce qui se traduit par une expérience de conversation plus naturelle et plus fluide. Deuxièmement, il présente une amélioration significative des capacités de raisonnement mathématique. Qu'il s'agisse de problèmes mathématiques complexes ou d'analyses géométriques, Qwen2.5-VL-32B fournit des analyses et des raisonnements précis et clairs. En outre, sa précision en matière d'analyse d'images, de reconnaissance de contenu et de déduction logique visuelle a été considérablement améliorée, ce qui permet une analyse plus nuancée des données multimodales.


    Caractéristiques du modèle

    Vers fin janvier 2025, Alibaba a lancé la série de modèles Qwen2.5-VL, qui a fait l'objet d'une grande attention et de commentaires positifs de la part de la communauté. S'appuyant sur la série Qwen2.5-VL, la firme a continué à optimiser le modèle en utilisant l'apprentissage par renforcement et a mis en open-source le nouveau modèle VL avec la très appréciée échelle de paramètres 32B sous la licence Apache 2.0 - Qwen2.5-VL-32B-Instruct. Par rapport aux modèles de la série Qwen2.5-VL précédemment publiés, les caractéristiques de ce modèle VL 32B sont les suivantes :

    • Réponses plus conformes aux préférences humaines : Le style de sortie a été ajusté pour fournir des réponses plus détaillées et mieux formatées qui correspondent davantage aux préférences humaines.
    • Raisonnement mathématique : Amélioration significative de la précision de la résolution de problèmes mathématiques complexes.
    • Compréhension et raisonnement précis sur les images : Amélioration de la précision et de l'analyse détaillée dans des tâches telles que l'analyse d'images, la reconnaissance de contenu et la déduction logique visuelle.

    Performance

    Lors d'une analyse comparative approfondie avec des modèles de l'état de l'art (SoTA) d'échelle comparable, Qwen2.5-VL-32B-Instruct a démontré sa supériorité sur les modèles de référence, par exemple Mistral-Small-3.1-24B et Gemma-3-27B-IT, dépassant même Qwen2-VL-72B-Instruct, qui est plus grand.

    Il présente notamment des avantages significatifs dans les tâches multimodales telles que MMMU, MMMU-Pro et MathVista, qui se concentrent sur le raisonnement complexe en plusieurs étapes. Sur MM-MT-Bench, un benchmark qui met l'accent sur l'évaluation subjective de l'expérience utilisateur, Qwen2.5-VL-32B-Instruct surpasse son prédécesseur Qwen2-VL-72B-Instruct d'une marge substantielle.

    Nom : Qwen2.5-VL Fig 3.PNG
Affichages : 4792
Taille : 54,6 Ko

    En plus d'exceller dans les capacités visuelles, Qwen2.5-VL-32B-Instruct a également atteint des performances de premier plan dans les capacités textuelles pures à la même échelle.

    Nom : Qwen2.5-VL Fig 4.PNG
Affichages : 743
Taille : 60,1 Ko

    Cas de démonstration

    Compréhension et raisonnement précis sur les images

    Utilisateur : Je conduis un gros camion sur cette route, et il est 12 heures. Puis-je atteindre un endroit situé à 110 kilomètres avant 13 heures ?

    Nom : Qwen2.5-VL Fig 1.PNG
Affichages : 736
Taille : 270,7 Ko

    Qwen2-VL-72B-Instruct :

    Nom : Qwen2.5-VL Fig 1-1c.PNG
Affichages : 754
Taille : 35,0 Ko

    Raisonnement mathématique

    Utilisateur : Comme le montre la figure, les droites AB et CD se coupent au point O, OD coupe ∠AOE, ∠BOC = 50,0, alors ∠EOB = ()

    Nom : math3.png
Affichages : 738
Taille : 9,0 Ko

    Qwen2-VL-72B-Instruct :

    Nom : Qwen2.5-VL Fig 2c.PNG
Affichages : 727
Taille : 36,5 Ko

    Prochaine étape

    Qwen2.5-VL-32B s'est concentré sur l'optimisation de l'expérience subjective et du raisonnement mathématique grâce à l'apprentissage par renforcement, dans le cadre du paradigme de la « pensée rapide ». Selon Alibaba, sa prochaine orientation de recherche donnera la priorité aux processus de raisonnement longs et efficaces afin de repousser les limites des modèles visuels en s'attaquant à des tâches de raisonnement visuel très complexes et à plusieurs étapes.

    Source : Qwen (Alibaba)

    Et vous ?

    Quel est votre avis sur le sujet ?
    Trouvez-vous cette initiative d'Alibaba crédible ou pertinente ?

    Voir aussi :

    Alibaba publie le modèle open source Qwen-72B LLM avec une longueur de contexte de 32k, ainsi que Qwen-Chat, qui surpassent les modèles de taille similaire sur les ensembles de données de référence

    Qwen2 : le LLM open source d'Alibaba évolue avec des capacités améliorées et des prouesses multilingues, et serait désormais le meilleur LLM Opensource devant Llama-3 , GPT-4O , et Claude
    Contribuez au club : corrections, suggestions, critiques, ... Contactez le service news et Rédigez des actualités

Discussions similaires

  1. Microsoft publie une nouvelle version de son ERP pour PME/PMI
    Par Siguillaume dans le forum Actualités
    Réponses: 0
    Dernier message: 03/06/2015, 18h06
  2. Réponses: 3
    Dernier message: 19/04/2015, 15h34
  3. Réponses: 0
    Dernier message: 29/10/2010, 12h41
  4. Oodrive lance une nouvelle version d’iExtranet !
    Par Mejdi20 dans le forum Communiqués
    Réponses: 0
    Dernier message: 12/10/2010, 22h28
  5. Réponses: 0
    Dernier message: 27/05/2009, 00h45

Partager

Partager
  • Envoyer la discussion sur Viadeo
  • Envoyer la discussion sur Twitter
  • Envoyer la discussion sur Google
  • Envoyer la discussion sur Facebook
  • Envoyer la discussion sur Digg
  • Envoyer la discussion sur Delicious
  • Envoyer la discussion sur MySpace
  • Envoyer la discussion sur Yahoo