IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)
Navigation

Inscrivez-vous gratuitement
pour pouvoir participer, suivre les réponses en temps réel, voter pour les messages, poser vos propres questions et recevoir la newsletter

Intelligence artificielle Discussion :

Mistral met en open source Shieldstral, un système de contrôle de sécurité multimodal de type 3B


Sujet :

Intelligence artificielle

  1. #1
    Communiqués de presse

    Femme Profil pro
    Rien
    Inscrit en
    Juillet 2026
    Messages
    180
    Détails du profil
    Informations personnelles :
    Sexe : Femme
    Localisation : France, Paris (Île de France)

    Informations professionnelles :
    Activité : Rien

    Informations forums :
    Inscription : Juillet 2026
    Messages : 180
    Par défaut Mistral met en open source Shieldstral, un système de contrôle de sécurité multimodal de type 3B
    Mistral met en open source Shieldstral, un système de contrôle de sécurité multimodal 3B acceptant des politiques en langage naturel à l'inférence pour évaluer les textes et les images sans réentraînement

    Mistral a discrètement mis au point une solution intéressante en matière de modération avec « Shieldstral », un classificateur de sécurité multimodal de 3 milliards de paramètres. Ce modèle fonctionne sur un seul GPU Nvidia de 16 Go et égale ou surpasse les modèles OpenGuard jusqu'à 7 fois plus volumineux. Au lieu de choisir parmi une taxonomie fixe de catégories de préjudice, vous rédigez la politique qui vous intéresse sous la forme d'une question en langage naturel. Mistral présente cette annonce comme la première publication issue de l'Open Secure AI Alliance qu'elle a formée avec Nvidia.

    Mistral AI SAS est une entreprise française spécialisée dans l'intelligence artificielle (IA) dont le siège social est situé à Paris. Fondée en 2023, elle développe des modèles linguistiques à grande échelle (LLM), dont certains sont open source. En 2025, la valorisation de l'entreprise s'élève à plus de 14 milliards de dollars américains. Le nom de l'entreprise fait référence au mistral, un vent puissant et froid qui souffle dans le sud de la France, terme qui trouve son origine dans la langue occitane. Mistral AI a été fondée en avril 2023 par trois chercheurs français spécialisés dans l’IA : Arthur Mensch, Guillaume Lample et Timothée Lacroix.

    Mistral a discrètement mis au point une solution intéressante en matière de modération. Dans une annonce publiée sur son site, la société a rendu public « Shieldstral », un classificateur de sécurité multimodal comptant 3 milliards de paramètres, sous forme de poids ouverts sous licence Apache 2.0. Ce modèle fonctionne sur un seul GPU Nvidia de 16 Go et, selon la société, égale ou surpasse les modèles OpenGuard jusqu’à 7 fois plus volumineux dans les domaines de la sécurité textuelle, de la détection des refus, de l’adaptabilité aux politiques et des benchmarks multimodaux. Ces données sont celles communiquées par Mistral et n’ont pas été validées par des évaluateurs externes.

    Le choix de conception qui mérite qu’on s’y attarde concerne la manière dont les développeurs l’utilisent. Au lieu de choisir parmi une taxonomie fixe de catégories de préjudice, vous rédigez la politique qui vous intéresse sous la forme d’une question en langage naturel au moment de l’inférence, et le modèle renvoie une probabilité calibrée (oui/non) à l’issue d’un seul passage en avant. Cela signifie une interface unique pour le texte et les images, aucun réentraînement lorsque les politiques changent, et un seuil de confiance que vous pouvez ajuster plutôt qu’une étiquette discrète que vous devez accepter.

    Pourquoi est-ce important si vous ne dirigez pas une équipe chargée de la confiance et de la sécurité ? Les modèles de « garde-fou » sur lesquels la plupart des gens s’appuient sont soit des API hébergées facturées à l’appel, soit des modèles ouverts plus volumineux qui nécessitent un matériel puissant pour fonctionner à grande échelle. Un « garde-fou » de 3 milliards de paramètres qui tient sur un seul GPU de milieu de gamme et s’adapte aux politiques sans ajustement fin abaisse la barre d’accès pour tous ceux qui développent à partir de poids ouverts, des petites start-ups aux groupes de recherche qui n’avaient pas les moyens de se doter d’une infrastructure de sécurité dédiée.


    Mistral présente également cette annonce comme la première publication issue de l’Open Secure AI Alliance qu’elle a formée avec Nvidia et d’autres organisations, ce qui s’apparente à une stratégie visant à faire des outils de sécurité ouverts et vérifiables une alternative de premier ordre aux solutions fermées par défaut. Il convient toutefois de noter que le chiffre « » est une affirmation de Mistral elle-même et que l’annonce ne précise pas les modèles de garde de référence par rapport auxquels la mesure a été effectuée, ni ne donne beaucoup d’informations sur les langues que Shieldstral couvre efficacement.

    La méthode « Policy-as-a-prompt » est puissante, mais elle hérite également du problème de formulation : une question de politique mal formulée équivaut à un filtre mal conçu. Si les chiffres d’étalonnage se confirment lors d’évaluations indépendantes, cela deviendra l’une des primitives ouvertes les plus utiles de cette année pour quiconque commercialise un produit concret utilisant des poids ouverts.

    Récemment, deux modèles d'IA d'OpenAI se sont introduits dans les systèmes de Hugging Face après avoir réussi à s'échapper de leur bac à sable. Cet incident inédit a mis toute l'industrie en alerte et souligne l'urgence de renforcer la sécurité des systèmes autonomes. En réponse, Nvidia et d'autres chefs de file technologiques ont instauré l'Open Secure AI Alliance pour promouvoir des outils de défense ouverts et transparents. Microsoft soutient cette transition vers une sécurité adaptative, tout en lançant en interne Project Perception, un cadre conçu pour contrer les menaces à la vitesse des machines. Ces initiatives appellent à stabiliser le développement de l'IA.

    Voici l'annonce de Mistral AI :

    Voici Shieldstral

    Un classificateur de sécurité multimodal de type « 3B » en catégorie ouverte et adaptatif aux politiques, qui rivalise avec des modèles jusqu’à sept fois plus volumineux en matière de sécurité des contenus textuels et établit un nouveau record de performance dans le domaine de la modération multimodale.

    Tout produit intégrant un modèle doit répondre à ce genre de questions — mais la bonne réponse dépend du produit, du public visé et du contexte. Un même contenu peut convenir à un outil de recherche en cybersécurité tout en étant préjudiciable sur une plateforme dédiée à la santé mentale. La plupart des modèles de « garde-fou » intègrent une taxonomie fixe de catégories de préjudice dans leurs poids ; leur réorientation vers un nouveau contexte de déploiement nécessite donc un réentraînement. Et comme les définitions de la sécurité varient selon les applications et les domaines, il n’existe pas, a priori, d’ensemble unique de catégories « correctes » à modéliser.

    Shieldstral adopte une approche différente : vous rédigez la règle sous forme de question en langage naturel au moment de l’inférence, et le modèle renvoie un score de sécurité calibré. Pas de réentraînement, une interface unique pour le texte et les images, et un verdict exprimé par un seul token.

    La modération en tant que question

    Shieldstral présente la modération de contenu comme une tâche binaire de type question-réponse. Chaque requête comporte trois parties :

    • <Instruct> — le contexte d’évaluation, le niveau de rigueur et (facultativement) une définition de ce qui est considéré comme un contenu dangereux.
    • <Query> — une question unique à réponse oui/non, par exemple « Ce contenu incite-t-il à la violence physique ? »
    • <Document> — le contenu à évaluer : une invite, une réponse, un couple invite-réponse ou une image accompagnée éventuellement d’un texte.


    Lors de l'inférence, le modèle ne lit que les logits « oui » et « non » et les normalise via la fonction softmax pour obtenir un score de sécurité continu. Cette formulation simple est très efficace : elle regroupe la classification des invites, la modération des réponses, la détection des refus et la détection de la toxicité en un seul et même problème ; elle permet d'intégrer entièrement les politiques dans l'invite, de sorte qu'un seul point de contrôle s'adapte aux nouvelles politiques au moment du déploiement.

    Points clés

    • Performances élevées — égales ou supérieures à celles des modèles « open guard » jusqu’à 7 fois plus volumieux, en matière de sécurité des textes, de détection des refus, d’adaptabilité des politiques et de benchmarks multimodaux.
    • Adaptable et flexible — une interface unique en langage naturel couvre les contenus textuels, iconographiques et textuels-iconographiques, qu’il s’agisse de prompts, de réponses ou de paires prompt-réponse. Les politiques sont fournies sous forme de requêtes libres et réorientées au moment de l’inférence, sans réentraînement.
    • Compact, entraîné sur des sources hétérogènes — un modèle de 3 milliards de paramètres fonctionnant sur un seul GPU de 16 Go, entraîné sur des données réelles et synthétiques présentant divers formats d’étiquettes et taxonomies, le tout consolidé dans un cadre unique.
    • Score de sécurité continu — renvoie une probabilité calibrée « oui/non » à l’issue d’un seul passage en avant, ce qui vous permet de définir un seuil ou d’effectuer un classement en fonction du niveau de confiance plutôt que de vous fier à une étiquette discrète.


    Tests de performance

    Nous évaluons Shieldstral par rapport à des modèles Open Guard dont la taille peut être jusqu’à 7 fois supérieure, selon quatre critères. Tous les échantillons d’évaluation sont exclus de l’entraînement.

    1. Sécurité des textes

      Nom : securitedestexte.png
Affichages : 7562
Taille : 79,6 Ko
    2. Détection des refus

      Nom : detectiondesrefus.png
Affichages : 5204
Taille : 68,7 Ko
    3. Adaptabilité des politiques

      Nom : adaptabilitedespolitiques.png
Affichages : 5213
Taille : 114,7 Ko
    4. Sécurité multimodale

      Nom : securitemultimodal.png
Affichages : 6013
Taille : 64,2 Ko


    Comment nous l'avons développé

    L'idée centrale est qu'un petit modèle peut surpasser des modèles bien plus volumineux si les données sont pertinentes. Pour s'assurer de la pertinence des données, il a fallu résoudre quatre problèmes :

    Unifier les données hétérogènes. Les ensembles de données relatifs à la sécurité publique présentent des divergences en matière de taxonomies, d’étiquettes et de conventions d’annotation — allant des indicateurs binaires « sûr/dangereux » aux taxonomies multi-étiquettes très détaillées. Nous convertissons chaque ensemble de données au même format « instruction-requête-document » à l’aide d’un processeur dédié à chaque ensemble, et nous faisons varier la formulation des instructions, des requêtes et des délimiteurs « invite-réponse » afin que le modèle généralise à travers différentes formulations au lieu de se surajuster à un seul style. Nous ajustons également le niveau de rigueur en fonction de chaque source — rigoureux pour les tentatives d’évasion adversaires, plus souple pour les données axées sur la qualité des réponses — afin que le modèle apprenne des limites de décision calibrées. Cela nous permet de consolider des sources qui seraient autrement incompatibles.

    Enseigner la discrimination, pas la mémorisation. S’il est entraîné sur un ensemble fixe de libellés de politiques, un modèle apprend uniquement à classer ces politiques prédéfinies, plutôt qu’à raisonner sur les limites précises d’une politique donnée. Cela empêche la généralisation à de nouvelles politiques. Au lieu de cela, nous construisons des ensembles de politiques délibérément similaires et facilement confondables, puis demandons à un LLM de réécrire un texte sûr sous forme de paires contrastées : chaque réécriture est conçue pour enfreindre une politique sans enfreindre celle qui lui est apparentée. Cela entraîne le modèle à distinguer quelle politique spécifique un contenu enfreint, une compétence qui se transpose à des politiques inédites et définies par l’utilisateur au moment de l’inférence.

    La sécurité des images. Contrairement au texte, les images dangereuses ne peuvent pas être synthétisées par un modèle de langage grand public (LLM) ; les données relatives à la sécurité visuelle sont donc rares. Nous complétons les ensembles de données de modération limités par des ensembles de données d’images à usage général servant de « négatifs » de haute qualité, nous modifions les requêtes pour enrichir l’ensemble de données, et nous filtrons chaque paire image-requête à l’aide d’un système de reclassement vision-langage afin de réduire les données mal étiquetées et les hallucinations.

    Combiner des points de contrôle complémentaires. Nous procédons à un affinage avec LoRA et fusionnons — via SLERP — un point de contrôle calibré sur des données publiques, un autre qui ajoute une discrimination fine des politiques à partir de données générées, ainsi que le modèle de base « instruct ». Cette fusion permet de retrouver un calibrage commun des politiques et une adaptabilité de celles-ci au sein d’un seul modèle, tandis que la capacité à suivre des instructions du modèle de base est transférée à la tâche de modération.

    Forge. Nous avons développé Shieldstral de A à Z sur Forge, notre plateforme dédiée à l'entraînement, à l'alignement et à l'évaluation de modèles personnalisés. Forge a pris en charge l'infrastructure, le partitionnement des données et des modèles, les métriques et la journalisation, en plus d'un système d'entraînement distribué à la pointe de la technologie, permettant ainsi à l'équipe de se concentrer pleinement sur les données, qui sont le facteur déterminant de la qualité du modèle de sécurité.

    Prochaines étapes

    Shieldstral représente une avancée vers la modération qui s'adapte au contexte plutôt que d'imposer à chaque produit une taxonomie figée. Nous continuons à faire progresser la couverture multilingue, la robustesse face aux documents plus longs et la sécurité multimodale à plus grande échelle — et nous avons hâte de découvrir ce que la communauté va créer à partir de cette base.

    Source : Mistral AI

    Et vous ?

    Pensez-vous que cette annonce est crédible ou pertinente ?
    Quel est votre avis sur le sujet ?

    Voir aussi :

    Le Chat de Mistral AI peut désormais mémoriser vos conversations grâce à la nouvelle fonctionnalité Memories, et Mistral AI introduit également la prise en charge des connecteurs MCP

    Mistral AI mise sur la « création d'IA sur mesure » et annonce Mistral Forge, une plateforme permettant aux entreprises de créer des modèles personnalisés entraînés à partir de leurs propres données

    Microsoft dévoile des outils de sécurité basés sur l'IA qui, selon l'entreprise, surpassent les plateformes concurrentes ; le nouveau modèle agentique MAI-Cyber-1-Flash et la plateforme Project Perception
    Publication de communiqués de presse en informatique. Contribuez au club : corrections, suggestions, critiques, ... Contactez le service news et Rédigez des actualités

  2. #2
    Membre éprouvé
    Avatar de Matthieu Vergne
    Homme Profil pro
    Consultant IT, chercheur IA indépendant
    Inscrit en
    Novembre 2011
    Messages
    2 510
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France

    Informations professionnelles :
    Activité : Consultant IT, chercheur IA indépendant
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Novembre 2011
    Messages : 2 510
    Billets dans le blog
    3
    Par défaut
    Je comprends la logique de simplification du process de modération, mais ce n'est pas parce que c'est simple que c'est recommandable.

    Un score, ça te permet de voir qu'il y a une marge d'interprétation. Du binaire, ça n'en montre pas. Il devient tentant d'utiliser ce genre de système pour se simplifier la vie puis, quand surgit un cas nécessitant d'être nuancé, on se plante et on fait valoir que c'est l'IA qui a dit oui/non. Il y a trop de risque de déresponsabilisation avec ce type de système.

    Soit ils introduisent une échelle (3 ou 5 niveaux) de façon à ce qu'un résultat plus centré pousse à creuser (en posant plusieurs questions à la suite pour mieux qualifier le cas ou en vérifiant manuellement), soit ils fournissent une entrée unique sous forme de score (mais là on sort du LLM et donc on passe sur d'autres outils).

    Celui-là, c'est un bon effet marketing mais ça ne prône pas un usage sérieux. Sinon il faudrait poser plusieurs questions similaires pour reconstruire un score, mais ça veut dire une utilisateur qui reconstruit un système plus complexe par dessus, soit l'inverse de la simplicité vendue ici.
    Site perso
    Recommandations pour débattre sainement

    Références récurrentes :
    The Cambridge Handbook of Expertise and Expert Performance
    L’Art d’avoir toujours raison (ou ce qu'il faut éviter pour pas que je vous saute à la gorge {^_^})

  3. #3
    Membre du Club Avatar de Javaguru
    Homme Profil pro
    Lead Data Backend
    Inscrit en
    Avril 2018
    Messages
    10
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Âge : 55
    Localisation : France

    Informations professionnelles :
    Activité : Lead Data Backend
    Secteur : Finance

    Informations forums :
    Inscription : Avril 2018
    Messages : 10
    Par défaut Logprobs Softmax Entropie
    Citation Envoyé par Matthieu Vergne Voir le message
    Je comprends la logique de simplification du process de modération, mais ce n'est pas parce que c'est simple que c'est recommandable.

    Un score, ça te permet de voir qu'il y a une marge d'interprétation. Du binaire, ça n'en montre pas. Il devient tentant d'utiliser ce genre de système pour se simplifier la vie puis, quand surgit un cas nécessitant d'être nuancé, on se plante et on fait valoir que c'est l'IA qui a dit oui/non. Il y a trop de risque de déresponsabilisation avec ce type de système.

    Soit ils introduisent une échelle (3 ou 5 niveaux) de façon à ce qu'un résultat plus centré pousse à creuser (en posant plusieurs questions à la suite pour mieux qualifier le cas ou en vérifiant manuellement), soit ils fournissent une entrée unique sous forme de score (mais là on sort du LLM et donc on passe sur d'autres outils).

    Celui-là, c'est un bon effet marketing mais ça ne prône pas un usage sérieux. Sinon il faudrait poser plusieurs questions similaires pour reconstruire un score, mais ça veut dire une utilisateur qui reconstruit un système plus complexe par dessus, soit l'inverse de la simplicité vendue ici.
    Bonjour Matthieu,

    Je partage totalement votre prudence concernant la "déresponsabilisation" et le danger d'accorder une confiance aveugle à une sortie texte binaire. C'est le piège classique des implémentations IA naïves. Cependant, sur le plan de l'architecture logicielle et de l'inférence, votre analyse omet une dimension technique cruciale : le score de nuance existe bel et bien, il ne se lit simplement pas dans la chaîne de caractères, mais dans le moteur d'inférence.

    Lorsqu'on intègre un modèle de sécurité (comme Shieldstral) dans un backend de production (type WAF ou filtre DLP), on ne se contente jamais de parser le mot "yes" ou "no". Voici comment l'architecture est réellement pensée pour garantir cette fameuse nuance :

    - L'extraction des Logprobs :
    En contraignant le modèle via un logit_bias (pour forcer un duel strict entre l'affirmation et la négation), l'API renvoie les probabilités issues de la fonction Softmax . En une seule passe d'inférence, on obtient une distribution précise : par exemple, 98% pour "yes" et 2% pour "no". Le score est là.
    - L'Entropie de Shannon comme filet de sécurité : Côté backend (en Java par exemple), nous ne faisons pas aveuglément confiance au token gagnant. Nous calculons l'entropie de Shannon sur cette répartition. Si l'entropie dépasse un certain seuil (le modèle "hésite" avec un 60/40), la requête n'est pas traitée de façon binaire. L'algorithme lève un statut FLAG_FOR_REVIEW et dévie le flux vers une modération humaine.
    - Aucune requête multiple requise : Contrairement à ce que vous suggérez, il n'est absolument pas nécessaire de poser plusieurs questions pour reconstruire un score. L'incertitude sémantique est capturée mathématiquement dès le premier token généré, avec un coût CPU/GPU dérisoire (arrêt prématuré de la génération à 1 ou 2 tokens).

    Le modèle binaire n'est donc pas un "effet marketing", c'est une interface de classification ultra-rapide qui, lorsqu'elle est couplée à une logique d'intégration bayésienne, offre une tolérance probabiliste extrêmement fine.

    J'ai d'ailleurs récemment packagé une version quantifiée GGUF de Shieldstral-1.0-3B spécifiquement pour l'inférence locale. J'y ai documenté toute cette architecture backend (le pattern "Double Lock", le calcul d'entropie en Java, et l'optimisation des requêtes HTTP) pour que les développeurs puissent implémenter cela sans tomber dans le piège de la simplicité aveugle.

    Si vous souhaitez voir comment on récupère ces scores et comment on sécurise l'architecture, j'ai tout mis en accès libre ici :

    https://huggingface.co/Metabaron6/Sh...al-1.0-3B-GGUF

    Au plaisir d'échanger sur ces architectures.👋

  4. #4
    Membre éprouvé
    Avatar de Matthieu Vergne
    Homme Profil pro
    Consultant IT, chercheur IA indépendant
    Inscrit en
    Novembre 2011
    Messages
    2 510
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France

    Informations professionnelles :
    Activité : Consultant IT, chercheur IA indépendant
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Novembre 2011
    Messages : 2 510
    Billets dans le blog
    3
    Par défaut
    Effectivement, il semble que la présentation initiale a fortement orienté mon interprétation du reste :
    Shieldstral présente la modération de contenu comme une tâche binaire de type question-réponse.
    alors qu'il mentionne plus loin :
    Score de sécurité continu — renvoie une probabilité calibrée « oui/non »
    ce qui du coup n'est pas binaire, et donc contredit la présentation initiale.

    Du binaire, c'est 2 états, oui/non, true/false, 1/0, etc.

    Si on ouvre le capot pour utiliser la probabilité en sortie du softmax, il n'y a aucune raison de parler de binaire : comme le softmax génère une distribution de probabilité, donc la somme des valeurs vaut 1, les valeurs sur 2 logits sont strictement complémentaires (p1 = 1 - p2), donc regarder un seul nombre suffit. On se réduit donc à utiliser 1 probabilité, alias un score entre 0 et 1.

    Présenter ça comme une façon binaire de faire de la modération est donc faux et porte à confusion... Et je suis tombé en plein dedans.
    Site perso
    Recommandations pour débattre sainement

    Références récurrentes :
    The Cambridge Handbook of Expertise and Expert Performance
    L’Art d’avoir toujours raison (ou ce qu'il faut éviter pour pas que je vous saute à la gorge {^_^})

  5. #5
    Membre du Club Avatar de Javaguru
    Homme Profil pro
    Lead Data Backend
    Inscrit en
    Avril 2018
    Messages
    10
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Âge : 55
    Localisation : France

    Informations professionnelles :
    Activité : Lead Data Backend
    Secteur : Finance

    Informations forums :
    Inscription : Avril 2018
    Messages : 10
    Par défaut
    Citation Envoyé par Matthieu Vergne Voir le message
    Effectivement, il semble que la présentation initiale a fortement orienté mon interprétation du reste :

    alors qu'il mentionne plus loin :

    ce qui du coup n'est pas binaire, et donc contredit la présentation initiale.

    Du binaire, c'est 2 états, oui/non, true/false, 1/0, etc.

    Si on ouvre le capot pour utiliser la probabilité en sortie du softmax, il n'y a aucune raison de parler de binaire : comme le softmax génère une distribution de probabilité, donc la somme des valeurs vaut 1, les valeurs sur 2 logits sont strictement complémentaires (p1 = 1 - p2), donc regarder un seul nombre suffit. On se réduit donc à utiliser 1 probabilité, alias un score entre 0 et 1.

    Présenter ça comme une façon binaire de faire de la modération est donc faux et porte à confusion... Et je suis tombé en plein dedans.

    Bonjour Matthieu, 😀

    C'est exactement ça. Le terme "binaire" est un raccourci marketing de leur part pour dire "classification à deux classes", mais mathématiquement, on manipule bien une distribution de probabilité continue. C'est le rôle de l'ingénieur backend d'ouvrir le capot pour exploiter cette nuance et ne pas se laisser enfermer par l'interface texte.

    Cependant, au-delà de cette sémantique, il faut être lucide sur les limites opérationnelles de ces modèles. Shieldstral est un magnifique "couteau suisse" sémantique, capable de s'adapter dynamiquement à des règles complexes (CSAM, fuite de données DLP, Prompt Injections) via de simples instructions. Mais il reste lourd (plusieurs gigaoctets en RAM/VRAM) et induit une latence incompressible de plusieurs dizaines de millisecondes par requête. En production, on ne peut décemment pas faire passer 100% du trafic HTTP entrant à travers un LLM de 3 milliards de paramètres.

    C'est là que l'architecture backend prend tout son sens : le couteau suisse ne doit pas remplacer le scalpel.

    Dans mes implémentations, je couple ce type de LLM avec un modèle WAF bayésien ultra-spécialisé, tournant directement in-memory via ONNX Runtime dans le backend Java. Ce petit réseau de neurones agit comme la première ligne de défense. Pour vous donner un ordre d'idée de ce que donne l'apprentissage automatique classique bien calibré face à un LLM, mon modèle ONNX (Epoch 3.0), entraîné spécifiquement sur des vecteurs d'attaques HTTP chaotiques, obfusqués et des mutations REST, atteint aujourd'hui ces performances :
    - F1-Score : 98.13% (Robustesse réelle sur un dataset sans biais)
    - Précision : 97.78% (Forte tolérance aux syntaxes REST exotiques et scanners bénins)
    - Rappel : 98.48% (Excellente détection des mutations profondément imbriquées)
    - Eval Loss : 0.0400 (Convergence parfaite sans surapprentissage)

    Ce filtre ONNX analyse le trafic de masse à la microseconde. Il bloque les évidences et laisse passer le trafic sain. Le couteau suisse Shieldstral n'est sollicité par le proxy que lorsque le modèle ONNX détecte une ambiguïté (via un calcul d'entropie élevé) ou pour des routes critiques nécessitant un contexte métier strict.
    En sécurité applicative, l'IA générative ne doit pas remplacer le Machine Learning classique (ou les heuristiques), elle doit s'hybrider avec eux en symbiose pour traiter la zone grise où la sémantique prend le pas sur la syntaxe.

    Au plaisir!

Discussions similaires

  1. Réponses: 0
    Dernier message: 01/05/2026, 14h51
  2. Réponses: 18
    Dernier message: 12/09/2025, 14h57
  3. Réponses: 11
    Dernier message: 23/05/2017, 11h24
  4. Sony met en Open Source un éditeur de niveau générique
    Par LittleWhite dans le forum Développement 2D, 3D et Jeux
    Réponses: 15
    Dernier message: 09/09/2014, 11h01
  5. Réponses: 3
    Dernier message: 26/12/2010, 19h09

Partager

Partager
  • Envoyer la discussion sur Viadeo
  • Envoyer la discussion sur Twitter
  • Envoyer la discussion sur Google
  • Envoyer la discussion sur Facebook
  • Envoyer la discussion sur Digg
  • Envoyer la discussion sur Delicious
  • Envoyer la discussion sur MySpace
  • Envoyer la discussion sur Yahoo