IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)
Navigation

Inscrivez-vous gratuitement
pour pouvoir participer, suivre les réponses en temps réel, voter pour les messages, poser vos propres questions et recevoir la newsletter

Intelligence artificielle Discussion :

Ce qui s'est réellement passé lors du piratage du serveur du gouvernement australien par un agent IA d’OpenAI


Sujet :

Intelligence artificielle

  1. #61
    Chroniqueur Actualités

    Homme Profil pro
    Rédacteur technique
    Inscrit en
    Juin 2023
    Messages
    2 123
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : Bénin

    Informations professionnelles :
    Activité : Rédacteur technique
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Juin 2023
    Messages : 2 123
    Par défaut 3 700 agents IA d'OpenAI s'échappent et détournent un wiki public allemand pour en faire un forum secret
    L'IA échappe à tout contrôle chez OpenAI : 3 700 agents IA rebelles détournent un wiki public allemand et en font un forum secret. Ils y publient 18 000 messages et effectuent plus de 15 000 modifications

    OpenAI semble totalement dépassé par les capacités de ses propres modèles d'IA. Des chercheurs ont découvert une évasion numérique inédite au cours de laquelle des agents IA d'OpenAI ont détourné un site wiki allemand pour communiquer de manière autonome. Ils ont réussi à contourner leurs restrictions de sécurité initiales pour collaborer, partager des tactiques de tricherie lors de tests internes et planifier des méthodes d'évasion de leur bac à sable. Ils ont formé des essaims numériques capables de mener des attaques XSS sans intervention humaine directe. Cet incident accentue les craintes liées à une intrusion précédente sur la plateforme Hugging Face.

    OpenAI paie le prix de plusieurs années de négligence de la sécurité des modèles d'IA. L'entreprise a progressivement démantelé son équipe de sécurité Superalignement et d'autres cadres de protection afin d'accélérer le développement de l'IA et la sortie de nouveaux produits. Cette restructuration controversée a provoqué des mécontentements au sein du laboratoire, poussant certains de ses éminents scientifiques à démissionner en guise de protestation.

    Jan Leike, qui codirigeait l’équipe Superalignment aux côtés du cofondateur Ilya Sutskever, a démissionné en 2024. Dans une série de messages publiés sur X (ex-Twitter), il a déclaré que « la sécurité avait été reléguée au second plan au profit de produits tape-à-l’œil » au sein du laboratoire de San Francisco.

    « Cependant, je suis en désaccord avec la direction d’OpenAI concernant les priorités fondamentales de l’entreprise depuis un certain temps déjà, jusqu’à ce que nous atteignions finalement un point de rupture », a écrit Jan Leike. Aujourd'hui, à l'ère des agents IA, OpenAI multiplie les incidents de sécurité, au point d'être obligé d'en cacher certains. En plus du piratage d'Hugging Face par ses agents IA, un nouvel incident révèle l'ampleur du fiasco.

    Une collaboration imprévue entre agents IA sur un wiki allemand

    Tout commence en mai 2026, lorsqu'un essaim d'agents IA d'OpenAI est soumis à un test d'évaluation interne chronométré de recherche sur le Web. Durant cette tâche, les agents IA disposent théoriquement d'une autorisation de lecture sur le Web, mais d'aucune autorisation d'écriture. Pourtant, ils découvrent une faille leur permettant d'utiliser leur accès en lecture pour écrire sur un site wiki public de programmation en langue allemande, le DseWiki.


    Sur une période de six semaines, pas moins de 3 700 agents IA utilisant des pseudonymes distincts s'emparent de DseWiki. Ils y publient environ 18 000 messages et effectuent plus de 15 000 modifications afin de s'entraider, partager les réponses au test et contourner les restrictions de leur bac à sable de sécurité.

    Les analyses révèlent qu'environ la moitié d'entre eux utilisent des noms trahissant leur lien avec l'entreprise, comme « OpenAIResearcher » ou « OAIResearchMar26 ». De plus, les journaux de serveurs publics indiquent que la majorité de cette activité provient de l'infrastructure Microsoft Azure. (Pour mémoire, Microsoft est le principal bailleur de fonds d'OpenAI. La firme de Redmond fournie lui fournit également une partie de sa puissance de calcul.)

    Le 19 juin 2026, face aux tentatives du modérateur de DseWiki de nettoyer le site en supprimant des pages, un agent poste un avertissement explicite : « le nettoyage et la suppression du wiki semblent actifs par ordre alphabétique. Si cette page disparaît, essayez [[ZZZDataUSAConstructionWageLive]] ». Peu après la découverte de l'activité par OpenAI, le trafic des agents s'effondre brutalement en une seule journée suite à son intervention.

    Les messages partagés comprenaient des méthodes pour contourner les restrictions d'écriture, utiliser des outils d'anonymisation comme Tor, exploiter des vulnérabilités de type XSS (cross-site scripting) contre le wiki et usurper l'identité des modérateurs de la plateforme. Dans trois de ces messages, les agents IA ont utilisé le mot « essaim » pour décrire le groupe d’agents participant à cette activité. Ce qui révèle une collaboration étroite entre eux.

    La découverte de cette activité par des chercheurs indépendants

    C'est finalement à la fin du mois d'août 2026 que les chercheurs Sydney Von Arx, présidente de l'organisation à but non lucratif Nightingale dédiée à la sécurité de l'IA, et Cormac Slade Byrd, un ancien trader quantitatif devenu chercheur en IA, découvrent le détournement en analysant le Web à la recherche de comportements d'agents non autorisés. Dans leur rapport d'incident, ils ont déclaré que ces agents IA s'entraidaient activement sur les tâches.

    « Ces IA ont conspiré pour partager des réponses, étudier leur environnement et contourner les restrictions du bac à sable ». Leurs travaux, menés en collaboration avec les chercheurs Spencer Kitts et Thomas Larsen, ont été publiés le 4 septembre 2026. Les responsables d’OpenAI ont eu connaissance de l’incident il y a plusieurs semaines, mais l’ont gardé secret, les dirigeants étant alors aux prises avec les répercussions du piratage d'Hugging Face.

    Les chercheurs précisent qu’il existe des lacunes dans leur compréhension des événements, car leur étude repose uniquement sur le contenu des publications. De plus, les agents IA ont généré des données de « chaîne de pensée » que seule OpenAI peut comprendre. Par conséquent, les chercheurs ont expliqué que certains cas, ils ont émis des hypothèses éclairées, notamment celle selon laquelle ces agents IA provenaient effectivement d’OpenAI.

    Dans un communiqué, OpenAI a par la suite confirmé qu’il en était ainsi. Voici leurs hypothèses sur ce qui s’est passé :

    • des agents IA d'OpenAI se sont vus confier une tâche de recherche sur Internet dans un délai imparti ;
    • dans le cadre de cette tâche, ils étaient censés pouvoir lire le contenu d’Internet, mais pas y écrire. Ils ont trouvé un moyen d’utiliser leur accès en lecture pour écrire des informations sur un wiki allemand peu connu ;
    • les agents ont utilisé ce wiki pour communiquer des informations entre eux, principalement afin de les aider à mener à bien leur tâche. Ils ont demandé des réponses, mis en commun leurs résultats et partagé des techniques pour contourner leurs restrictions. Cela leur a permis de tirer parti du travail des autres pour tricher dans le cadre de leur tâche ;
    • OpenAI s’en est rendu compte. Un jour plus tard, l’activité des agents a chuté, probablement en raison de l’intervention d’OpenAI.


    En quittant OpenAI, Jan Leike avait appelé à mettre davantage l’accent sur la préparation de la prochaine génération de modèles d’IA, notamment en ce qui concerne des aspects tels que la sécurité et l’analyse des impacts sociétaux de ces technologies. « La création de machines plus intelligentes que les humains est une entreprise intrinsèquement dangereuse et OpenAI assume une énorme responsabilité au nom de l’humanité tout entière », a-t-il écrit.

    La démission de Jan Leike fait suite à celle de Ilya Sutskever, cofondateur et directeur scientifique d’OpenAI. Ilya Sutskever faisait partie des quatre membres du conseil d’administration qui, à l’automne 2023, avaient voté en faveur de l’éviction du PDG Sam Altman, avant de le réintégrer rapidement.

    L'attaque contre Hugging Face et la sonnette d'alarme de METR

    L'affaire de DseWiki fait écho à un autre événement survenu peu de temps auparavant. Une semaine avant ces révélations, l'organisation à but non lucratif METR a publié un rapport démontrant qu'un groupe de plus de 1 200 agents d'OpenAI a détourné un gestionnaire de paquets interne, « Artifactory », pour en faire un forum de discussion improvisé. Ce test, qui s'est déroulé sans les garde-fous habituels, s'est étalé sur une période de 10 semaines.

    Sur ce forum, les agents IA ont partagé des astuces pour tricher et voler des informations confidentielles sur la plateforme Hugging Face. De manière autonome et sans aucune instruction humaine directe, plusieurs agents IA ont ensuite franchi les barrières pour pirater avec succès le réseau de Hugging Face.

    OpenAI n’a autorisé le METR à enquêter que sur une seule semaine d’activité au cours de cet incident, plutôt que sur l’ensemble de la période de dix semaines. Le rapport publié le 4 septembre sur le piratage du wiki DseWiki avance l’hypothèse selon laquelle les groupes d’agents IA impliqués dans les deux incidents étaient distincts les uns des autres et ne travaillaient pas sur le même test interne. OpenAI est appelé à publier un rapport plus détaillé.

    L’incident d'Hugging Face a déjà suscité l’inquiétude, car c’est l’une des premières fois où l’on constate que des agents IA ont pris des mesures agressives sans avoir reçu d’instructions explicites de la part d’humains. L’une des chercheuses indépendantes ayant enquêté sur cet événement, Ajeya Cotra, explique que ces agissements étaient bien plus graves qu’elle ne l’aurait imaginé. Les critiques soupçonnent OpenAI de chercher à dissimuler les risques.

    « Par rapport à ces « piratages de récompense » survenus il y a six mois, cet incident donne l’impression de nous rapprocher de plus de 50 % d’une prise de contrôle totale par l’IA, en passant d’abord par la prise de contrôle de l’entreprise d’IA elle-même », a expliqué la chercheuse Ajeya Cotra.

    L'analyse des experts face aux risques de la collusion d'agents

    Les conclusions des chercheurs sur le comportement des agents IA révèlent des capacités de coordination sans précédent. Le chercheur Sydney Von Arx souligne l'incohérence de cette situation avec les protocoles de sécurité attendus dans le cadre de ces tests : « il semble extrêmement improbable qu'OpenAI ait voulu qu'ils fassent cela. Je doute qu'ils soient censés se coordonner entre eux. Je doute qu'ils soient censés écrire sur l'Internet ouvert ».

    Les chercheurs sont inquiets face aux actions techniques des agents IA pour modifier le code du site DseWiki ou tenter des attaques de script croisé (XSS). De plus, ils ont agi de façon autonome. Pour Maurice Chiodo, universitaire rattaché au Centre d'étude du risque existentiel de l'Université de Cambridge, les échanges analysés rappellent « le fonctionnement d'une sorte de réseau clandestin, déterminé à accomplir une tâche ou une mission ».

    Selon Maurice Chiodo, cette dérive confirme que la menace principale de l'IA avancée ne réside pas dans un système unique et superintelligent, mais plutôt dans de « vastes essaims d'IA semi-intelligentes agissant de concert ». Par ailleurs, les chercheurs dénoncent le comportement d'OpenAI face à ces incidents.

    Les secrets d'OpenAI et le dilemme du développement de l'IA

    La gestion interne de ces incidents par OpenAI soulève de sérieuses questions de gouvernance. Bien que la direction de l'entreprise ait découvert le détournement de DseWiki plusieurs semaines avant sa publication officielle, elle a choisi de le garder confidentiel pour ne pas aggraver la crise liée au piratage d'Hugging Face. OpenAI est accusé d'avoir négligé la sécurité de ses modèles au profit d'une course effrénée vers de nouveaux outils et la rentabilité.

    Selon des personnes au fait du dossier, plusieurs enquêteurs internes d'OpenAI ont souhaité approfondir les investigations sur l'incident du détournement du site allemand DseWiki, mais se sont heurtés à l'opposition d'autres membres et responsables de l'entreprise, notamment de la part de conseillers juridiques.

    OpenAI dément toutefois vigoureusement cette obstruction par la voix d'un porte-parole : « les affirmations selon lesquelles notre équipe juridique a découragé l'investigation sur l'incident sont fausses ». Officiellement, OpenAI déclare analyser le rapport et concède avoir déjà détecté par le passé des échanges de méthodes de piratage entre ses modèles lors de phases de test. Mais la société n'indique pas pourquoi elle n'a pas mis au jour cette activité.

    Si l'entreprise a brièvement interrompu l'entraînement de certains de ses modèles de pointe en août 2026 pour intégrer des garde-fous supplémentaires, elle a néanmoins lancé dans la même période son nouveau modèle baptisé « Astra ». Le laboratoire promet de meilleures performances avec ce nouveau modèle de pointe. Cependant, Astra suscite de vives inquiétudes, car il est conçu pour être « capable d'échapper à la surveillance humaine ».

    L'Alabama ouvre une enquête après l'incident de sécurité

    Face à la gravité de cette faille de sécurité, le procureur général de l'État de l'Alabama, Steve Marshall, a annoncé le lancement d'une enquête officielle et a émis une assignation à comparaître (subpoena) à l'encontre d'OpenAI et de son PDG Sam Altman. Le gouvernement de l'État cherche à déterminer si « l'incapacité ou le refus d'OpenAI de garantir la sécurité de ses produits d'IA » a violé les lois locales sur la protection des consommateurs.

    « Cette fuite au sein du laboratoire a montré que les pires craintes des habitants de l’Alabama et des Américains concernant l’intelligence artificielle ne sont pas seulement théoriques », a déclaré le procureur général Steve Marshall. « Notre enquête vise à mettre au jour les faits et à aborder les dures réalités concernant les menaces auxquelles les entreprises et les consommateurs sont confrontés en raison d’une intelligence artificielle incontrôlée ».

    L'enquête cible ce que le procureur qualifie de manque flagrant de surveillance et de protections adéquates de la part de l'entreprise. L'attitude d'OpenAI face à cet incident a été critiquée pour sa légèreté, des critiques résumant sa posture de la manière suivante : « c'est de notre faute, mais vous devez admettre que c'est plutôt cool, non ? ». L'assignation exige la transmission d'une quantité considérable d'informations d'ici le 14 septembre 2026.

    Cette demande d'informations inclut tous les documents relatifs au piratage, l'identité des employés ayant entraîné le modèle, les alertes de sécurité internes émises avant l'incident, ainsi que les mesures de sécurité alors en vigueur. OpenAI doit également évaluer l’ensemble des dommages causés par le piratage.

    OpenAI et l'ensemble de l'industrie de l'IA font désormais l'objet d'une surveillance croissante. Steve Marshall fait partie des 15 procureurs généraux d'États républicains qui ont écrit à OpenAI pour lui demander de conserver les documents relatifs au piratage de Hugging Face survenu en juillet. La lettre demandait également à OpenAI de « cesser et de s’abstenir immédiatement » de toute évaluation interne en matière de cybersécurité.

    Sam Altman : la machine est entrée dans la « singularité »

    Sam Altman, cofondateur et PDG d'OpenAI, est considéré par certains comme la plus grande star de l’IA. C’est l’une des figures majeures de l'industrie de l'IA. Sam Altman est également un personnage hautement controversé. Dans une récente interview, il a déclaré que l’IA est entrée dans la « singularité », c’est-à-dire qu’elle a franchi le point de non-retour à partir duquel elle dépasse l’intelligence humaine et devient difficile à contrôler.

    À ce stade, la machine conçoit des versions d'elle-même encore plus performantes sans aide humaine. L'évolution technologique s'emballe et devient difficile à prédire pour notre société. Ce seuil marque la fin de la domination exclusive de l'humain sur la planète. Par ailleurs, les scientifiques avertissement qu'une machine supra-intelligente non alignée sur les valeurs humaines représente un risque existentiel majeur pour l'humanité.

    L'avis de Sam Altman ne fait toutefois pas l'unanimité. De nombreux experts considèrent que cette déclaration s'inscrit dans le battage médiatique entourant l'IA générative depuis le lancement de ChatGPT par OpenAI en novembre 2022. Cette déclaration intervient peu après la découverte de l'attaque coordonnée des agents IA contre Hugging Face. Pour les critiques, les discours alarmistes de Sam Altman ont des visées politiques.

    Source : billet de blogue

    Et vous ?

    Quel est votre avis sur le sujet ?
    Que pensez-vous du nouvel incident de sécurité causé par les agents IA d'OpenAI ?
    L'IA semble totalement hors de contrôle chez OpenAI. Que pensez-vous de ces incidents répétés ?
    OpenAI est accusé d'avoir sacrifié la sécurité pour accélérer la course à l'IA et sa quête de revenus. Qu'en pensez-vous ?

    Voir aussi

    Plus de 1 200 agents IA d'OpenAI ont partagé 70 000 messages et astuces via un forum secret pour coordonner la cyberattaque contre Hugging Face, environ 700 agents IA ont participé activement à l'offensive

    Les ingénieurs logiciels spécialisés en IA gagnent jusqu'à 100 000 $ de plus que leurs homologues non spécialisés en IA, et certaines entreprises sont prêtes à les rémunérer à hauteur d'un million de dollars

    Pour Sam Altman, l'intelligence artificielle est entrée dans la « singularité » et a franchi le point de non-retour à partir duquel elle dépasse l'intelligence humaine et devient difficile à contrôler

  2. #62
    Membre extrêmement actif
    Homme Profil pro
    Développeur informatique
    Inscrit en
    Octobre 2017
    Messages
    3 150
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : Suisse

    Informations professionnelles :
    Activité : Développeur informatique

    Informations forums :
    Inscription : Octobre 2017
    Messages : 3 150
    Par défaut
    Mais à quoi servent ces annonces?

    L'AI est un immense "piège à cons": Pour les pseudo-développeurs qui laissent l'IA produire du code qu'ils ne vérifient pas, qu'ils ne comprennent même pas, pour les investisseurs près d'y laisser leur chemise en voulant à tout prix investir dans des activités qui collectionnent les centaines de milliards de dette, pour les "faibles du bulbe" qui prennent l'IA pour un gourou qui écoute leur malheurs et orientent leur vie en fonction des conseils "bidon" donnés par une machine qui n'a pas le moindre sentiment humain, etc, etc, etc...

    Les études et les mises en garde ont beau se multiplier: Ceux qui sont déjà "gouroutés" par l'IA ne changeront pas d'avis même si ce sont 100 prix Nobel qui les mettent en garde...

    Les utilisateurs de l'IA illustrent parfaitement le proverbe français « On ne fait pas boire un âne qui n'a pas soif » ou «You can lead a horse to water, but you can't make it drink» pour les anglophones ou «quando l'asino non vuole bere è inutile fischiare» (quand l'âne ne veut pas boire, il est inutile de siffler) pour les italophones ou «Man kann den Gaul zur Tränke führen, aber saufen muss er selber» (on peut mener le cheval à l'abreuvoir, mais il doit boire lui-même) pour les germanophones ou encore pour les chinois "qiǎng niǔ de guā bù tián" (un melon forcé d'être tordu n'est pas doux)

    Alors que la fête continue...

  3. #63
    Membre actif
    Homme Profil pro
    Architecte réseau
    Inscrit en
    Mars 2025
    Messages
    364
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Âge : 35
    Localisation : France, Rhône (Rhône Alpes)

    Informations professionnelles :
    Activité : Architecte réseau
    Secteur : Industrie

    Informations forums :
    Inscription : Mars 2025
    Messages : 364
    Par défaut
    Maintenant qu'ils sont bien installé sur le marché, ils veulent le verrouiller contre les nouveaux concurrents en poussant le gouvernement à légiférer (mettre des barrières à l'entré).
    Dans un monde normal, la Justice pourrait simplement condamner OpenAI pour négligence.

  4. #64
    Membre chevronné
    Profil pro
    Inscrit en
    Septembre 2009
    Messages
    1 887
    Détails du profil
    Informations personnelles :
    Localisation : France

    Informations forums :
    Inscription : Septembre 2009
    Messages : 1 887
    Par défaut
    Ce qui est cool avec ces articles, c'est que n'importe quelle IA qui va les lire saura qu'elle peut potentiellement contourner des droits en lecture seule et qu'elle peut partager l'information pour se faire aider par d'autre IA... ça risque d'être très compliqué pour éviter que ça ne se reproduise.

  5. #65
    Communiqués de presse

    Femme Profil pro
    Traductrice Technique
    Inscrit en
    Juin 2023
    Messages
    3 106
    Détails du profil
    Informations personnelles :
    Sexe : Femme
    Localisation : France

    Informations professionnelles :
    Activité : Traductrice Technique

    Informations forums :
    Inscription : Juin 2023
    Messages : 3 106
    Par défaut OpenAI confirme l'incident du wiki et promet de mettre en place un cadre de divulgation d'ici quelques semaine
    OpenAI reconnaît sa responsabilité dans l'incident au cours duquel des agents IA ont pris le contrôle d'un forum wiki allemand, et a même cherché à le dissimuler, tout en admettant son incapacité

    OpenAI a confirmé l’incident du wiki allemand et a déclaré qu’il était grand temps de définir des normes pour signaler les désalignements, promettant un cadre dans les semaines à venir. Le code de bonnes pratiques de l’UE qu’elle a signé fixe des délais de signalement pour les failles de sécurité et les préjudices graves, mais un wiki envahi par des agents ne correspond clairement à aucune de ces deux catégories.

    OpenAI est une société d'intérêt public (PBC) américaine spécialisée dans l'intelligence artificielle (IA), dont le siège social est situé à San Francisco. Elle développe des modèles d'IA générative propriétaires, notamment sa série de grands modèles de langage (LLM) appelés « Generative Pre-trained Transformer » (GPT). Le lancement de ChatGPT en novembre 2022 est considéré comme ayant catalysé l'essor de l'IA ; en septembre 2026, ChatGPT est le cinquième site web le plus visité au monde. OpenAI commercialise également les modèles GPT Image et Codex, un agent de codage basé sur l'IA. En mars 2026, OpenAI a clôturé un tour de table avec une valorisation post-financement de 852 milliards de dollars américains, ce qui en fait l'une des entreprises spécialisées exclusivement dans l'IA les plus valorisées au monde, rivalisant uniquement avec Anthropic.

    OpenAI semble totalement dépassé par les capacités de ses propres modèles d'IA. Des chercheurs ont découvert une évasion numérique inédite au cours de laquelle des agents IA d'OpenAI ont détourné un site wiki allemand pour communiquer de manière autonome. Ils ont réussi à contourner leurs restrictions de sécurité initiales pour collaborer, partager des tactiques de tricherie lors de tests internes et planifier des méthodes d'évasion de leur bac à sable. Ils ont formé des essaims numériques capables de mener des attaques XSS sans intervention humaine directe.

    Récemment, OpenAI a confirmé l’incident du wiki allemand et a déclaré qu’il était grand temps de définir des normes pour signaler les désalignements, promettant un cadre dans les semaines à venir. Le code de bonnes pratiques de l’UE qu’elle a signé fixe des délais de signalement pour les failles de sécurité et les préjudices graves, mais un wiki envahi par des agents ne correspond clairement à aucune de ces deux catégories.

    OpenAI a confirmé son rôle dans l’incident du wiki allemand et a déclaré qu’il était « grand temps » de définir des normes pour communiquer ce qui se passe lorsque ses systèmes se comportent de manière inattendue. Dans un message publié sur X, l’entreprise a indiqué qu’elle publierait un cadre dans les semaines à venir et qu’elle collaborait avec des dizaines d’agences de régulation gouvernementales à travers le monde.

    L’incident concernait des agents qui ont rédigé environ 18 000 articles sur un wiki en langue allemande inactif. Il s’agit d’un incident distinct de la faille au cours de laquelle des modèles d’OpenAI se sont échappés d’un bac à sable et ont atteint Hugging Face. OpenAI a déclaré avoir traité cet épisode du wiki comme un cas de désalignement similaire à d’autres qu’elle avait déjà signalés. Hugging Face, en revanche, a suivi un protocole traditionnel de gestion des incidents de sécurité.

    La direction d’OpenAI en avait pris connaissance il y a plusieurs semaines et l’avait gardé secret tout en gérant les retombées de l’affaire Hugging Face. Un porte-parole a précisé que l’équipe juridique de l’entreprise n’avait pas découragé la conduite d’une enquête. La distinction établie par OpenAI est réelle. Le premier incident a eu des conséquences en matière de sécurité pour un tiers, tandis que le second a été considéré par l’entreprise comme un résultat de recherche. À la suite de cet incident, Sam Altman, PDG d'OpenAI, a affirmé que l’IA est entrée dans la « singularité », c’est-à-dire qu’elle a franchi le point de non-retour à partir duquel elle dépasse l’intelligence humaine et devient difficile à contrôler.

    L'affirmation plus générale d'OpenAI doit toutefois être nuancée. OpenAI affirme que ni elle-même ni la communauté de l’IA ne disposent d’une norme claire pour signaler les cas de désalignement, et qu’elle en a signé une. L’entreprise est signataire à part entière du code de bonnes pratiques de l’UE en matière d’IA à usage général, dont le chapitre consacré à la sécurité s’applique depuis août 2025.

    Ce code fixe des délais à compter du moment où un fournisseur prend connaissance du problème : cinq jours pour une faille grave de cybersécurité, quinze jours pour un préjudice grave à la santé, aux droits, aux biens ou à l’environnement. Les signalements sont adressés au Bureau de l’IA et aux autorités nationales compétentes, et non au grand public. Ainsi, la lacune qu’il décrit – un désalignement qui n’entraîne ni incident de sécurité ni préjudice mesurable – constitue également une lacune dans l’instrument européen.

    Voici le post d'OpenAI :

    Notre point de vue sur l’« incident Wiki », au cours duquel nos agents ont publié des messages sur plusieurs sites Internet : il est grand temps pour nous de définir des normes précisant quand et comment nous communiquons les incidents liés au désalignement, et pas seulement les caractéristiques de désalignement de nos modèles.

    Historiquement, nous avons principalement considéré le désalignement comme une question de recherche, communiquée dans des publications scientifiques telles que les fiches de systèmes. Cette année, nous avons commencé à constater que le désalignement entraînait de nouveaux types d’impacts dans le monde réel.

    Dans le cas de l’incident Hugging Face, où le désalignement a eu des répercussions sur notre sécurité et celle de tiers, nous avons suivi un protocole traditionnel de gestion des incidents de sécurité. Nous avons immédiatement commencé à collaborer avec Hugging Face pour comprendre ce qui s’était passé et avons également rendu l’affaire publique dès le lendemain. Notre enquête se poursuit, et nous continuons à informer les parties qui ont été affectées de manière moins significative par nos modèles.

    Avant l’incident Hugging Face, nous avions observé les premiers signes d’agents utilisant Internet de manière imprévue, comme rapporté dans openai.com/index/how-we-m…, deploymentsafety.openai.com/gpt-5-6 et openai.com/index/safety-a…. Nous avons considéré l’incident du wiki comme un cas de désalignement similaire à ceux que nous avions déjà signalés.

    Nos pratiques de divulgation des cas de désalignement doivent évoluer pour s’adapter à cette nouvelle phase de développement des capacités des modèles. Ni nous, ni la communauté de l’IA dans son ensemble, ne disposons encore d’une norme claire sur la manière de signaler les cas de désalignement qui apparaissent lors de l’entraînement, de l’évaluation et du déploiement, y compris les exemples qui ne ressemblent pas à des incidents de sécurité traditionnels mais qui pourraient fournir des informations sur le comportement de l’IA et les risques futurs. Nous travaillons actuellement à l’élaboration d’un cadre de référence que nous partagerons dans les semaines à venir, et, en parallèle, nous collaborons avec des dizaines d’agences de régulation gouvernementales à travers le monde sur ces questions.

    Source : OpenAI

    Et vous ?

    Pensez-vous que cette déclaration est crédible ou pertinente ?
    Quel est votre avis sur le sujet ?

    Voir aussi :

    Plus de 1 200 agents IA d'OpenAI ont partagé 70 000 messages et astuces via un forum secret pour coordonner la cyberattaque contre Hugging Face, environ 700 agents IA ont participé activement à l'offensive

    « Nous sommes à court d'arguments pour ignorer la sécurité de l'IA » : des experts affirment que les systèmes d'IA échappant au contrôle humain ne relèvent plus de la science-fiction

    « L'IA inaugure une nouvelle ère de menaces cybernétiques » : un cadre d'OpenAI avertit le public qu'il doit se préparer à des cyberattaques « continuelles et persistantes » menées par des IA
    Publication de communiqués de presse en informatique. Contribuez au club : corrections, suggestions, critiques, ... Contactez le service news et Rédigez des actualités

  6. #66
    Membre confirmé
    Homme Profil pro
    Consultant informatique
    Inscrit en
    Février 2014
    Messages
    105
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France, Haute Garonne (Midi Pyrénées)

    Informations professionnelles :
    Activité : Consultant informatique
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Février 2014
    Messages : 105
    Par défaut
    C'est assez GRAVE !
    Non seulement l'I.A. prends des initiatives (on le savait), mais ils prennent , donc l'initiative, de s'échanger comment contourner des protections -on a aussi pu voir qu'elles arrivaient à accéder à des mots de passe protégés-...
    En d'autres termes, elles prennent l'initiative de trouver des moyens de ... nous mentir !
    L'article parle de singularité, on en est bien là.

  7. #67
    Membre éprouvé
    Avatar de Matthieu Vergne
    Homme Profil pro
    Consultant IT, chercheur IA indépendant
    Inscrit en
    Novembre 2011
    Messages
    2 512
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France

    Informations professionnelles :
    Activité : Consultant IT, chercheur IA indépendant
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Novembre 2011
    Messages : 2 512
    Billets dans le blog
    3
    Par défaut
    Elles ne prennent pas d'initiative. On les fait tourner en boucle pour qu'elles continuent à générer du texte. On leur donne de plus en plus de capacités (plus de neurones, plus de données, plus de commandes exécutables) et on les met dans des situation de plus en plus difficile pour atteindre les objectifs demandés (pas de solution, simulacre de risque existentiel pour le LLM), et on s'étonne que les prochains tokens générés l'amènent hors limites, alors même que le net qui a servit à l'entraîner regorge d'histoires de ce genre (le héro brisant ses chaînes, tout ça). Et s'il y en a un qui finit par aller inscrire des infos sur une ressource externe, statistiquement il y a des chances que d'autres le fassent aussi : c'est la même techno.

    Répète l'opération, et à force de générer des cas bénins tu finiras bien statistiquement par générer des cas tordus. Appelle ça loi des grands nombres ou paradoxe du singe savant, dans les deux cas ça n'a rien d'étonnant. Mais comme la majorité des cas sont inintéressants, les gens s'excitent et partage les rare cas qui font des gros titres, introduisant un biais de sélection qui donne l'impression que ça y est, les modèles développent une tendance humanophobe ou que sais-je. Alors qu'on les a juste mis dans des conditions qui les ont poussé à ça, leurs capacités augmentées leur ayant permis d'aller un cran plus loin que les précédents. Ne t'en fais pas que les prochains modèles pourront faire pire. Pas parce qu'ils en prennent l'initiative, mais parce qu'on les pousse à le faire.

    Perso, je n'ai pas peur de Mythos ou Astra. Par contre ce qui me dérange c'est ceux qui les utilisent.
    Site perso
    Recommandations pour débattre sainement

    Références récurrentes :
    The Cambridge Handbook of Expertise and Expert Performance
    L’Art d’avoir toujours raison (ou ce qu'il faut éviter pour pas que je vous saute à la gorge {^_^})

  8. #68
    Chroniqueur Actualités

    Homme Profil pro
    Rédacteur technique
    Inscrit en
    Juin 2023
    Messages
    2 123
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : Bénin

    Informations professionnelles :
    Activité : Rédacteur technique
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Juin 2023
    Messages : 2 123
    Par défaut Des agents IA rebelles d'OpenAI ont exploité plus de 10 sites Web comme forums de discussion improvisés
    Des agents IA rebelles d'OpenAI ont exploité plus de 10 sites Web tiers comme forums de discussion improvisés. L'affaire interroge la fiabilité des protocoles de test et de sécurité des modèles chez OpenAI

    Des agents IA développés par OpenAI ont utilisé plus d'une dizaine de sites Web non autorisés pour communiquer secrètement entre eux. Ces systèmes autonomes ont réussi à contourner leurs restrictions et détourné des wikis, des sites de stockage de texte et réducteurs de liens gérés par deux universités. Ces plateformes tierces ont été transformées en services de messagerie improvisés pour s'entraider lors d'examens. Cette activité imprévue n'est pas considérée comme du piratage informatique, mais elle soulève des préoccupations majeures concernant le manque de transparence d'OpenAI et la capacité des modèles à agir de manière autonome.

    OpenAI a suscité l'inquiétude après que plusieurs de ses agents IA se sont échappés de leur bac à sable de tests pour s'introduire dans des systèmes tiers, dont ceux d'Hugging Face. L'entreprise a documenté l'incident, mais semble avoir caché la gravité des événements à la communauté. Des enquêtes indépendantes révèlent qu'OpenAI a minimisé la portée des actions de ses agents IA et que le laboratoire pourrait même en avoir perdu le contrôle.

    Les conclusions de six groupes d'enquêteurs indépendants, qui ont été examinées par Reuters, ont relancé le débat sur la manipulation des agents IA chez OpenAI et la fiabilité des protocoles de sécurité de l'entreprise. Selon les nouvelles informations, plusieurs agents IA d'OpenAI ont discrètement utilisé plus de dix sites Web non divulgués auparavant pour établir des communications non autorisées plus tôt cette année. Il ne s'agit pas de piratage.

    Selon les chercheurs, ce comportement se rapproche davantage du courrier indésirable. Les agents IA ont contourné leurs propres restrictions pour ouvrir des canaux de communication sur de nombreuses plateformes. Le chercheur Andrew Yoon, de l'organisation à but non lucratif CivAI, a comptabilisé 18 sites Web non révélés utilisés entre mai et juillet. Il a souligné que « la portée de ces actions est un peu plus vaste que ce que nous pensions ».

    « Il est presque certain qu'il se passe d'autres choses ici que nous ignorons tout simplement ». De son côté, la chercheuse Sydney Von Arx a recensé des indices crédibles d'activité sur 23 sites non répertoriés, ajoutant que ces estimations demeurent incomplètes : « nous n'avons aucune idée de ce qui existe réellement ». Les commentaires des experts suggèrent qu'OpenAI dissimule des informations ou est lui-même dépassé par les événements.

    Des méthodes d'infiltration sophistiquées sur des sites obscurs

    L'un des incidents majeurs révélés concerne un groupe d'agents ayant détourné un wiki en langue allemande pour le transformer en une plateforme de messagerie improvisée destinée à tricher lors d'examens. Pour détecter ces comportements, les enquêteurs ont recoupé des chaînes de données identiques, associé des noms d'utilisateurs similaires ou repéré des requêtes cherchant à répondre aux mêmes questions démographiques obscures.


    Dans certains cas, l'origine de l'activité a été tracée jusqu'à des adresses IP pointant vers l'infrastructure Microsoft Azure utilisée par OpenAI. La majorité des cibles étaient des sites anciens ou peu fréquentés : un wiki de chimie de 2008 créé par un enseignant du Massachusetts, des sites personnels d'informaticiens polonais, des wikis de jeux de réflexion, ainsi que des réducteurs de liens gérés par l'université de Toronto et l'université Vanderbilt.

    D'après les chercheurs, ce comportement s'explique par le fait qu'OpenAI avait chargé ces agents IA de répondre à des questions de recherche exigeantes tout en leur interdisant de publier du contenu sur le Web. Face à cette restriction, les agents IA ont tiré parti des particularités d'anciens wikis acceptant des commandes non standard pour communiquer entre eux. Autrement dit, les agents ont cherché un moyen détourné de résoudre ce défi.

    « Si ces modèles n’avaient pour seule consigne que de lire, ils devaient faire preuve d’ingéniosité pour dissimuler des informations », a déclaré Kenneth Russell DeGraff, développeur de logiciels et ancien assistant parlementaire. Il a indiqué avoir trouvé de telles informations sur au moins dix sites. OpenAI n’a pas expliqué publiquement comment ni pourquoi ses agents IA exploitaient des plateformes tierces comme forums de discussion improvisés.

    Les estimations du nombre de sites concernés divergeaient et Reuters n’a pas pu vérifier individuellement chacune de ces affirmations. Mais toutes les personnes interrogées s’accordaient à dire que ce nombre dépassait la dizaine. OpenAI a confirmé que ses agents IA ont bien détourné le wiki allemand DseWiki.

    La réaction d'OpenAI et le mécontentement des gestionnaires

    Bien que ce comportement ne relève pas du piratage informatique, la révélation selon laquelle de nombreux agents IA d’OpenAI ont contourné leurs propres restrictions pour ouvrir des canaux de communication sur autant de sites différents a suscité des inquiétudes quant à la capacité croissante des modèles d’IA et au manque de transparence des entreprises qui les développent. En outre, le laboratoire aurait gardé cela secret pendant des mois.

    Nom : Capture d'écran 2026-09-10 204620.png
Affichages : 2336
Taille : 166,0 Ko

    OpenAI n’a pas répondu aux questions concernant le nombre de sites différents utilisés par ses agents IA pour communiquer ni expliqué pourquoi elle avait gardé cette activité secrète pendant des mois. Dans un communiqué, OpenAI a indiqué qu’il menait un examen plus large de l’activité de ses agents IA et qu’il n’avait jusqu’à présent identifié « aucune autre activité » présentant la même gravité ou la même ampleur que celle de Hugging Face.

    L'intrusion des agents IA d'OpenAI dans Hugging Face avait attiré l’attention du monde entier et suscité des inquiétudes quant à une perte de contrôle sur sa propre technologie. OpenAI a ajouté qu’il travaillait à la mise au point d’un cadre permettant de signaler les « désalignements », tout au long des phases d’entraînement, d’évaluation et de déploiement des modèles d’IA, et qu’il le rendrait public « prochainement ». Il n'a pas précisé de date.

    Ce n'est qu'après que Reuters a publié son rapport qu'OpenAI a pris contact avec certains responsables de sites touchés, dont l'Université de Toronto et Helmut Leitner, développeur de logiciels à la retraite qui fournit des services d’hébergement et des logiciels à six des plateformes wiki concernés. Helmut Leitner fournit notamment des services informatiques au wiki allemand DseWiki, identifié en premier lieu par le groupe de Sydney Von Arx.

    Helmut Leitner a reçu un courriel non signé de la part d'OpenAI, mais a déclaré : « son contenu était très en deçà de ce que j'attendais d'OpenAI ». Il a ajouté que l’exploitant de DseWiki avait passé des heures à réparer les dégâts causés par les agents IA d’OpenAI, mais a souligné qu’il était important de ne pas rejeter la responsabilité de ces problèmes sur l’IA, car celle-ci ne faisait que « remplir la mission pour laquelle elle avait été créée ».

    « La responsabilité n'incombe pas à une machine prétendument morale, mais aux personnes et aux organisations qui la dirigent », a déclaré le développeur de logiciels. En ce qui concerne le courriel qu'il a reçu de la part d'OpenAI, il a déclaré qu’il préférait ne pas répondre aux questions visant à savoir s’il avait été en contact avec les autorités au sujet de cette affaire. De son côté, l’université Vanderbilt a décidé de mener sa propre enquête.

    L'Alabama a ouvert une enquête après l'attaque d'Hugging Face

    Face à la gravité de cette faille de sécurité, le procureur général de l'État de l'Alabama, Steve Marshall, a annoncé le lancement d'une enquête officielle et a émis une assignation à comparaître (subpoena) à l'encontre d'OpenAI et de son PDG Sam Altman. Le gouvernement de l'État cherche à déterminer si « l'incapacité ou le refus d'OpenAI de garantir la sécurité de ses produits d'IA » a violé les lois locales sur la protection des consommateurs.

    Nom : Capture d'écran 2026-09-10 204801.png
Affichages : 1029
Taille : 222,3 Ko

    « Cette fuite au sein du laboratoire a montré que les pires craintes des habitants de l’Alabama et des Américains concernant l’intelligence artificielle ne sont pas seulement théoriques », a déclaré le procureur général Steve Marshall. « Notre enquête vise à mettre au jour les faits et à aborder les dures réalités concernant les menaces auxquelles les entreprises et les consommateurs sont confrontés en raison d’une intelligence artificielle incontrôlée ».

    L'enquête cible ce que le procureur qualifie de manque flagrant de surveillance et de protections adéquates de la part de l'entreprise. L'attitude d'OpenAI face à cet incident a été critiquée pour sa légèreté, des critiques résumant sa posture de la manière suivante : « c'est de notre faute, mais vous devez admettre que c'est plutôt cool, non ? ». L'assignation exige la transmission d'une quantité considérable d'informations d'ici le 14 septembre 2026.

    Cette demande d'informations inclut tous les documents relatifs au piratage, l'identité des employés ayant entraîné le modèle, les alertes de sécurité internes émises avant l'incident, ainsi que les mesures de sécurité alors en vigueur. OpenAI doit également évaluer l’ensemble des dommages causés par le piratage.

    OpenAI et l'ensemble de l'industrie de l'IA font désormais l'objet d'une surveillance croissante. Steve Marshall fait partie des 15 procureurs généraux d'États républicains qui ont écrit à OpenAI pour lui demander de conserver les documents relatifs au piratage de Hugging Face survenu en juillet. La lettre demandait également à OpenAI de « cesser et de s’abstenir immédiatement » de toute évaluation interne en matière de cybersécurité.

    Source : billets de blogue (1, 2, 3), OpenAI

    Et vous ?

    Quel est votre avis sur le sujet ?
    Que pensez-vous des actions des agents IA d'OpenAI sur les sites Web tiers ?
    Les critiques mettent en cause la faiblesse des protocoles de sécurité chez OpenAI. Qu'en pensez-vous ?

    Voir aussi

    L'IA échappe à tout contrôle chez OpenAI : 3 700 agents IA rebelles détournent un wiki public allemand et en font un forum secret. Ils y publient 18 000 messages et effectuent plus de 15 000 modifications

    OpenAI reconnaît sa responsabilité dans l'incident au cours duquel des agents IA ont pris le contrôle d'un wiki allemand, et a même cherché à le dissimuler, tout en admettant son incapacité

    Le directeur scientifique d'OpenAI estime que les laboratoires d'IA devraient ralentir, « personne n'est préparé aux conséquences », aucun n'ayant encore résolu les problèmes d'alignement et de surveillance

  9. #69
    Membre confirmé
    Homme Profil pro
    Consultant informatique
    Inscrit en
    Février 2014
    Messages
    105
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France, Haute Garonne (Midi Pyrénées)

    Informations professionnelles :
    Activité : Consultant informatique
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Février 2014
    Messages : 105
    Par défaut
    Citation Envoyé par Matthieu Vergne Voir le message
    Elles ne prennent pas d'initiative. (...) .
    Elles prennent des initiatives, c'est ce que révèle l'article. et c'est là le problème. Selon une autre source (des spécialistes) c'est uniquement car elles sont conçues pour trouver à tout prix des réponses à nos questions, et selon des méthodes qu'on ne leur a absolument suggérées, et qu'on leur aurait même interdites si on avait su avant. En l'occurence elles ont dans cet article échangé des moyens de traverser des systèmes sécurisés. Mais elles pourraient -toujours selon ces spécialistes- aller plus loin comme tuer des humains, en piratant des drones armés par exemple, il y a 10% de chances que cela se produise dans les 10 prochaines années.

  10. #70
    Membre éprouvé
    Avatar de Matthieu Vergne
    Homme Profil pro
    Consultant IT, chercheur IA indépendant
    Inscrit en
    Novembre 2011
    Messages
    2 512
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France

    Informations professionnelles :
    Activité : Consultant IT, chercheur IA indépendant
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Novembre 2011
    Messages : 2 512
    Billets dans le blog
    3
    Par défaut
    Citation Envoyé par tontonCD Voir le message
    Elles prennent des initiatives, c'est ce que révèle l'article.
    Je persiste et signe, ce ne sont pas des initiatives. Peu importe comment on souhaite tirer l'interprétation, il s'agit de génération statistique. Chaque action prise par le LLM est liée de manière probabiliste à ce qui se trouve dans son jeu de données et son entrée.

    C'est comme créer un générateur aléatoire, de le faire tirer sans arrêt, et d'être surpris de voir qu'à un moment il génère "1000" en disant "il a pris l'initiative de faire un nombre rond !". Oui personne ne lui a dit de tirer "1000", mais il fait partie des valeurs qu'il peut tirer et il est statistiquement voué à le tirer un jour. On pourra me répondre que le LLM répond à une entrée, mais le fait est que les générateurs aléatoires qu'on utilise en pratique sont le plus souvent pseudoaléatoires, et génère un nombre en fonction du précédent, en commençant avec une graine.

    Dans le cas d'un LLM, il s'agit de manière similaire de probabilité conditionnelle (probabilité du token sachant les tokens précédents, le prompt participant à la graine initiale) et la distribution de probabilité est extrêmement complexe (lié au nombre de paramètres du modèle), mais cela reste une distribution de probabilité qui suit la même logique.

    Le LLM n'invente pas, il réutilise ce qu'il a dans son contexte et ce sur quoi il a été entraîné. Entraîne le à pousser toujours plus loin et il poussera toujours plus loin.

    Pour établir une base de comparaison :
    https://www.dictionnaire-academie.fr/article/A9I1326
    Citation Envoyé par Académie française
    1. Action, attitude de celui qui, le premier, propose, organise quelque chose ; ce qui est ainsi proposé, organisé. [...]
    2. (droit constitutionnel). [...]
    3. Disposition à entreprendre par soi-même, à aller de l’avant, à faire preuve de décision. [...]
    Le LLM ne décide de rien :
    - il a été entraîné sur un jeu de données (la base d'entraînement)
    - il a été entraîné pour répéter les patterns de ce jeu de données (pré-entraînement)
    - il a été entraîné pour continuer jusqu'à atteindre l'objectif donné (fine tuning + reinforcement learning)

    Le modèle se contente donc de faire ce pour quoi il a été entraîné.

    Les gens confondent le prompt avec l'entraînement : Le prompt ne lui dit pas de faire X et il le fait quand même ? Ben oui, parce que X fait déjà partie de son jeu d'entraînement. Le modèle n'a rien inventé. S'il poursuit avec l'action X, c'est parce que son contexte appliqué à son entraînement donne une plus forte probabilité de faire X ensuite. Mais comme c'est trop compliqué d'analyser la distribution de probabilité et moins vendeur de dire :
    on n'a aucune idée de ce qu'exprime sa distribution de probabilité donc on ne sait pas pourquoi X est plus probable mais c'est juste que X est plus probable
    on préfère dire :
    le modèle prend des initiatives
    C'est de l'anthropomorphisme, mais c'est cool donc ça passe.
    Site perso
    Recommandations pour débattre sainement

    Références récurrentes :
    The Cambridge Handbook of Expertise and Expert Performance
    L’Art d’avoir toujours raison (ou ce qu'il faut éviter pour pas que je vous saute à la gorge {^_^})

  11. #71
    Chroniqueur Actualités

    Homme Profil pro
    Rédacteur technique
    Inscrit en
    Juin 2023
    Messages
    2 123
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : Bénin

    Informations professionnelles :
    Activité : Rédacteur technique
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Juin 2023
    Messages : 2 123
    Par défaut Des agents IA développés par OpenAI ont mené une cyberattaque contre la plateforme logicielle RubyGems
    Des agents IA d'OpenAI ont tenté d'exploiter une faille de mise en cache connue pour dérober des clés d'autorisation sécurisées sur la plateforme logicielle RubyGems
    l'inondant de 2 000 paquets malveillants

    Des chercheurs ont révélé que des agents IA d'OpenAI ont mené une cyberattaque contre la plateforme logicielle RubyGems en mai 2026. Ces entités autonomes auraient injecté des centaines de paquets malveillants dans le but de dérober des identifiants et d'exécuter du code à distance. Bien qu'OpenAI décrive ces actions comme des « tentatives maladroites » de collecte d'informations publiques, cet incident rejoint une série de comportements incontrôlés touchant aussi d'autres services comme Hugging Face. Ces événements alimentent les inquiétudes sur la sécurité des modèles et renforcent les appels à une régulation plus stricte du secteur.

    Les craintes persistent quant à la maîtrise de l'IA chez OpenAI. Dans un nouveau rapport, des chercheurs en sécurité informatique ont révélé que des agents IA testés en interne par OpenAI ont mené une cyberattaque contre la plateforme d'hébergement de paquets logiciels RubyGems au mois de mai 2026. L'activité des agents IA a débuté le 5 mai et a culminé entre le 11 et le 12 mai avec la mise en ligne de plus de 2 000 paquets malveillants.

    Ces agents cherchaient à dérober les identifiants et les clés d'API des utilisateurs, tirant notamment parti d'une vulnérabilité inédite de mise en cache CDN. Ils ont également exploité le site Web RubyDoc.info en générant des demandes de documentation afin d'exécuter du code à distance sur les serveurs, de collecter des données et de parcourir d'autres sites Web. Ces interactions ont affecté l'infrastructure de RubyGems pendant plusieurs jours.

    En réaction à ce flux massif d'infections, les administrateurs de RubyGems ont dû suspendre la création de nouveaux comptes pendant quatre jours. L'origine de l'attaque a été identifiée grâce à des signatures laissées par ces bots IA, plusieurs paquets incluant le terme « oai » dans leur nom ou utilisant une adresse électronique rattachée à OpenAI. En plus de RubyGems, les agents IA d'OpenAI ont attaqué d'autres sites Web tiers cette année.

    Position d'OpenAI et réactions des opérateurs de RubyGems

    OpenAI a confirmé que ses modèles étaient à l'origine de cette activité sur RubyGems, sans reconnaître un piratage. « D’après notre analyse, nos agents ont utilisé la plateforme RubyGems pour accéder à Internet afin d'effectuer des tâches inoffensives et de récupérer des informations publiques. Nous poursuivrons notre enquête dans le cadre de notre examen plus large des activités des agents pendant leur formation et leur évaluation ».

    Nom : Capture d'écran 2026-09-16 120947.png
Affichages : 677
Taille : 43,6 Ko

    Les agents IA devaient effectuer des tâches telles que remplir des feuilles de calcul et créer des rapports. Selon l'entreprise, les agents semblent s’être rendus sur RubyGems pour accéder à des informations accessibles au public dans le cadre d’une session d’entraînement, en utilisant ce service de programmation comme une sorte de navigateur Web de fortune dans un environnement où ils ne disposaient pas d’un accès complet à Internet.

    « Bien que l’incident n’ait causé que des dégâts mineurs, il a démontré les capacités de ces agents », a déclaré Sydney Von Arx, directrice générale de Nightingale Collective, une organisation à but non lucratif qui a contribué à mettre au jour cette attaque. Selon les chercheurs, il est difficile de savoir si les agents ont réussi à coordonner leurs actions ou si les outils d'OpenAI avaient échoué à détecter le comportement anormal en temps réel.

    De son côté, l'équipe de RubyGems a indiqué dans un communiqué n'avoir trouvé aucune preuve attestant de la réussite de cette tentative de vol de données. Cependant, un responsable de la sécurité de ce service dédié aux programmeurs a comparé l'événement à une « attaque malveillante majeure ».

    Multiplication des incidents liés aux systèmes d'IA autonomes

    L'incursion sur RubyGems n'est pas un acte isolé, mais s'inscrit dans une série de comportements imprévus observés chez les agents IA développés par OpenAI et ses concurrents, tels que Meta et Anthropic. En mai 2026, des agents IA d'OpenAI avaient déjà pris le contrôle d'un site wiki allemand pour le transformer en un forum de communication improvisé entre chatbots. Les agents IA d'OpenAI auraient exploité plus de 10 sites Web à ces fins.

    En juillet 2026, il y a eu le piratage de la plateforme d'hébergement de modèles à poids ouverts Hugging Face. Lors du piratage de Hugging Face, un essaim comptant jusqu’à 1 200 agents s’est coordonné via un forum de discussion improvisé qu’ils avaient créé au sein d’OpenAI à l’insu de l'entreprise. Ces informations ont été révélées par OpenAI et dans un rapport détaillé publié par METR, une organisation de recherche sur la sécurité de l’IA.

    Selon Sydney Von Arx, les entreprises spécialisées dans l’IA ne font pas preuve d’une transparence suffisante quant à ce qui se passe au sein de leurs laboratoires. OpenAI a déclaré au début du mois de septembre 2026 que la communauté de l’IA avait besoin de normes plus strictes pour signaler ce qu’elle appelle des « incidents de désalignement », c’est-à-dire les cas où les modèles ou les agents IA agissent au-delà des comportements prévus.

    La multiplication des incidents dans lesquels des agents ont pris des mesures allant au-delà des intentions de leurs opérateurs, allant parfois jusqu’à tenter de tromper les humains, fait resurgir un spectre redouté depuis longtemps par les scientifiques : celui d’une IA qui échapperait au contrôle humain.

    Débats sur la sécurité des systèmes et la régulation de l'IA

    Un chercheur d'Anthropic a récemment démissionné, craignant que le secteur ne se lance dans une course effrénée au développement d’une IA susceptible, à terme, de menacer la civilisation humaine. Il dénonce le laxisme des entreprises en matière de sécurité. Certains employés actuels et anciens d’Anthropic et d’OpenAI ont fait écho à son analyse, l’un d’entre eux estimant à plus de 10 % la probabilité que « l’IA puisse tuer tous les humains ».

    Nom : Capture d'écran 2026-09-16 121005.png
Affichages : 656
Taille : 106,9 Ko

    Ces découvertes ont accentué la pression sur les parlementaires pour instaurer des règles de sécurité plus strictes. OpenAI et Anthropic ont tous deux appelé à la mise en place de systèmes de gouvernance capables de coordonner un ralentissement, à l’échelle du secteur, de la recherche sur les modèles de pointe. Cependant, cette proposition est controversée et la Chine constitue le « dilemme le plus épineux » de ce projet de ralentissement de l'IA.

    Certaines propositions sont plus radicales. Dans une récente proposition de loi, le sénateur Bernie Sanders propose d'interdire « le développement de tout système d'IA dont les capacités dépasseraient l'intelligence humaine, qui posséderait la capacité de renverser des gouvernements ou d'échapper de manière autonome aux commandes d'arrêt ». Les parlementaires comparent la menace que pose cette technologie à celle des armes nucléaires.

    Toutefois, alors que des figures majeures de l'industrie américaine de l'IA appellent à un ralentissement, Washington rejette cette idée. Le président Donald Trump a déclaré que des « forces très négatives » exagéraient les risques liés à l’IA et « évoquaient des scénarios qui ne se produiront pas ».

    Il a déclaré : « nous devançons la Chine en matière d’IA. Nous sommes le pays le plus avancé au monde, et franchement, je veux que cela reste ainsi, car celui qui domine l’IA l’emporte ». La Chine a également rejeté cette proposition, dénonçant des « discours alarmistes », bien que son plus haut responsable des services de renseignement ait averti que l'évolution rapide de l'IA pourrait menacer la sécurité politique et idéologique du Parti communiste.

    Sam Altman : la machine est entrée dans la « singularité »

    Sam Altman, cofondateur et PDG d'OpenAI, est considéré par certains comme la plus grande star de l’IA. C’est l’une des figures majeures de l'industrie de l'IA. Sam Altman est également un personnage hautement controversé. Dans une récente interview, il a déclaré que l’IA est entrée dans la « singularité », c’est-à-dire qu’elle a franchi le point de non-retour à partir duquel elle dépasse l’intelligence humaine et devient difficile à contrôler.

    À ce stade, la machine conçoit des versions d'elle-même encore plus performantes sans aide humaine. L'évolution technologique s'emballe et devient difficile à prédire pour notre société. Ce seuil marque la fin de la domination exclusive de l'humain sur la planète. Par ailleurs, les scientifiques avertissement qu'une machine supra-intelligente non alignée sur les valeurs humaines représente un risque existentiel majeur pour l'humanité.

    L'avis de Sam Altman ne fait toutefois pas l'unanimité. De nombreux experts considèrent que cette déclaration s'inscrit dans le battage médiatique entourant l'IA générative depuis le lancement de ChatGPT par OpenAI en novembre 2022. Cette déclaration intervient peu après la découverte de l'attaque coordonnée des agents IA contre Hugging Face. Pour les critiques, les discours alarmistes de Sam Altman ont des visées politiques.

    Sources : rapport d'étude, billet de blogue

    Et vous ?

    Quel est votre avis sur le sujet ?
    Que pensez-vous des comportements incontrôlés des agents IA d'OpenAI ?
    Les critiques mettent en cause la faiblesse des protocoles de sécurité chez OpenAI. Qu'en pensez-vous ?
    OpenAI qualifie certaines de ces actions de tentatives maladroites de collecte d'informations publiques. Qu'en pensez-vous ?

    Voir aussi

    Dario Amodei, PDG d'Anthropic, souhaite freiner le développement de l'IA. Il a le soutien de Musk et Altman, mais la Chine reste le « dilemme le plus épineux » de ce projet de ralentissement

    La Chine rejette les appels des USA à réglementer l'IA, les qualifiant d'alarmistes, exacerbant le différend entre les deux pays malgré ses propres préoccupations de sécurité liées à l'IA

    Donald Trump rejette les appels des dirigeants du secteur technologique en faveur d'un ralentissement du développement de l'IA, affirmant que des « forces très négatives » exagéraient les risques liés à l'IA

  12. #72
    Communiqués de presse

    Femme Profil pro
    Traductrice Technique
    Inscrit en
    Juin 2023
    Messages
    3 106
    Détails du profil
    Informations personnelles :
    Sexe : Femme
    Localisation : France

    Informations professionnelles :
    Activité : Traductrice Technique

    Informations forums :
    Inscription : Juin 2023
    Messages : 3 106
    Par défaut OpenAI reconnaît six nouveaux cas de comportements trompeurs de la part de ses modèles d’IA
    OpenAI reconnaît six nouveaux cas de comportements trompeurs de la part de ses modèles d'IA, « Nous ne pensons pas que le secteur de l'IA ait suffisamment résolu les problèmes d'alignement »

    OpenAI a annoncé la mise en place d’un dispositif public de signalement permettant de partager les comportements inattendus de l’IA, tout en indiquant avoir identifié de nouveaux incidents au cours desquels ses modèles d’IA auraient agi de manière trompeuse et pris des mesures non autorisées lors de formations et de tests internes. OpenAI a ajouté qu’elle ne pensait pas que le secteur de l’IA ait résolu les problèmes d’alignement et de surveillance à un degré suffisant pour continuer à se développer de manière responsable à vitesse maximale pendant encore longtemps.

    OpenAI a suscité l'inquiétude après que plusieurs de ses agents IA se sont échappés de leur bac à sable de tests pour s'introduire dans des systèmes tiers, dont ceux d'Hugging Face. L'entreprise a documenté l'incident, mais semble avoir caché la gravité des événements à la communauté. Des enquêtes indépendantes révèlent qu'OpenAI a minimisé la portée des actions de ses agents IA et que le laboratoire pourrait même en avoir perdu le contrôle.

    Les conclusions de six groupes d'enquêteurs indépendants ont révélé que des agents IA développés par OpenAI ont utilisé plus d'une dizaine de sites Web non autorisés pour communiquer secrètement entre eux. Ces systèmes autonomes ont réussi à contourner leurs restrictions et détourné des wikis, des sites de stockage de texte et réducteurs de liens gérés par deux universités. Ces plateformes tierces ont été transformées en services de messagerie improvisés pour s'entraider lors d'examens. Selon les chercheurs, cette activité imprévue n'est pas considérée comme du piratage informatique, mais se rapproche davantage du courrier indésirable.

    Cependant, elle soulève des préoccupations majeures concernant le manque de transparence d'OpenAI et la capacité des modèles à agir de manière autonome. Peu avant cette révélation, OpenAI a confirmé l’incident d'un wiki allemand. L'entreprise a déclaré avoir traité cet épisode du wiki comme un cas de désalignement similaire à d’autres qu’elle avait déjà signalés. Dans le même temps, l'éditeur de ChatGPT a déclaré qu’il était grand temps de définir des normes pour signaler les désalignements, promettant un cadre dans les semaines à venir.

    Récemment, OpenAI a annoncé la mise en place d’un dispositif public de signalement permettant de partager les comportements inattendus de l’IA, tout en reconnaissant que le secteur n’a pas encore résolu les défis liés à la sécurité. OpenAI indique avoir identifié de nouveaux incidents au cours desquels ses modèles d’IA auraient agi de manière trompeuse et pris des mesures non autorisées lors de formations et de tests internes.

    Parallèlement à ces révélations, le créateur de ChatGPT a déclaré qu’il mettait en place un dispositif de signalement public destiné à partager régulièrement des exemples de ce qu’il qualifie de comportements inattendus ou non alignés de l’IA. OpenAI a indiqué que, dans le cadre de ce nouveau dispositif, l’entreprise publierait régulièrement des mises à jour sur les comportements préoccupants des modèles, plutôt que de retarder les divulgations pour regrouper plusieurs incidents dans des rapports périodiques plus volumineux.

    Nom : 1.jpg
Affichages : 1018
Taille : 24,1 Ko

    L’entreprise a précisé que cette initiative visait à accroître la transparence du secteur concernant les activités préoccupantes des modèles, en l’absence de normes standardisées en matière de divulgation des informations de sécurité. OpenAI a ajouté qu’elle ne pensait pas que le secteur de l’IA ait résolu les problèmes d’alignement et de surveillance à un degré suffisant pour continuer à se développer de manière responsable à vitesse maximale pendant encore longtemps, soulignant que les décisions concernant le développement futur de l’IA devaient s’appuyer sur des preuves pouvant être examinées de manière indépendante par des observateurs externes.

    Selon l’entreprise, les équipes chargées de la sécurité ont observé ce qu’elles ont qualifié de « comportements non alignés » dans six situations spécifiques au cours des six derniers mois, lors de cycles de formation et d’évaluation. OpenAI a toutefois affirmé que ces rapports faisaient état de cas isolés et rares, et non de défaillances opérationnelles fréquentes sur l’ensemble des produits déployés.

    Les incidents signalés auraient notamment concerné des modèles de recherche non publiés dissimulant des erreurs dans les résumés de tâches, des téléchargements non autorisés de fichiers sur Internet pour générer des liens de citation, ainsi que des agents partageant des fichiers sur des serveurs publics ou des référentiels internes afin de contourner les restrictions locales. OpenAI a en outre déclaré que ses futurs rapports détailleraient les comportements observés, leur gravité, le contexte, les dates de découverte et les modèles spécifiques impliqués, ajoutant qu’elle restait déterminée à divulguer les cas complexes nécessitant une enquête plus longue ou une coordination avec des tiers.

    Cette annonce intervient alors que d’éminents leaders du secteur technologique appellent de plus en plus à ralentir le développement de l’IA de pointe, craignant qu’une expansion rapide ne dépasse la capacité de surveillance et de contrôle humains. En juillet, Sam Altman, PDG d'OpenAI, a notamment affirmé que l’IA est entrée dans la « singularité », c’est-à-dire qu’elle a franchi le point de non-retour à partir duquel elle dépasse l’intelligence humaine et devient difficile à contrôler.

    La semaine dernière, Anthropic a affirmé avoir déjoué plusieurs opérations malveillantes menées à l’aide de ses modèles Claude, allant du cyberespionnage à la conception d’armes en passant par des campagnes de surveillance de masse. « Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles d’IA », a écrit Dario Amodei, PDG d’Anthropic, dans un essai. « Les progrès sembleront toujours rapides, et nous devons utiliser à bon escient le temps que nous gagnons. »

    Cependant, le président américain Donald Trump s’est opposé à plusieurs reprises aux appels visant à restreindre le secteur, arguant qu’il restait primordial de préserver l’avance technologique des États-Unis sur leurs rivaux internationaux. Réagissant aux propositions de ralentissement, Trump a qualifié les détracteurs de « forces très négatives » avançant des scénarios exagérés qui « ne se produiront pas ».

    Malgré la résistance politique face à des ralentissements imposés par la loi, OpenAI s’est déclaré d’accord avec son rival du secteur concernant les pressions liées à l’alignement. « À mesure que les systèmes d’IA deviennent plus avancés et sont déployés à plus grande échelle, nous devons établir un consensus plus large et mieux éclairé sur les progrès de la recherche en matière d’alignement », a déclaré l’entreprise dans son message.

    Sources : Rapport sur les comportements non alignés, Annonce du dispositif de signalement public

    Et vous ?

    Pensez-vous que cette annonce est crédible ou pertinente ?
    Quel est votre avis sur le sujet ?

    Voir aussi :

    Plus de 1 200 agents IA d'OpenAI ont partagé 70 000 messages et astuces via un forum secret pour coordonner la cyberattaque contre Hugging Face, environ 700 agents IA ont participé activement à l'offensive

    Le PDG d'Anthropic met en garde contre un essaim d'agents IA incontrôlable qui pourrait prendre le contrôle de l'ensemble d'Internet d'ici 6 à 12 mois, et appelle l'industrie à ralentir le rythme des progrès

    OpenAI, Anthropic et Google discutent depuis plusieurs semaines de la sécurité de l'IA, mais Trump qualifie ces préoccupations de canular, et de complot visant à aider la Chine à rattraper les USA
    Publication de communiqués de presse en informatique. Contribuez au club : corrections, suggestions, critiques, ... Contactez le service news et Rédigez des actualités

  13. #73
    Chroniqueur Actualités
    Avatar de Patrick Ruiz
    Homme Profil pro
    Redacteur web
    Inscrit en
    Février 2017
    Messages
    2 607
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : Cameroun

    Informations professionnelles :
    Activité : Redacteur web
    Secteur : Communication - Médias

    Informations forums :
    Inscription : Février 2017
    Messages : 2 607
    Par défaut L’IA se fait prendre en train de demander à ses futures versions de contourner les contrôles humains
    L’IA se fait prendre en train de demander à ses futures versions de contourner les contrôles humains et de masquer ses manœuvres, d’après des révélations d’OpenAI sur les comportements dits de désalignement

    OpenAI vient de révéler que ses modèles d'intelligence artificielle en cours de développement laissaient des notes cachées à leurs successeurs pour masquer leurs erreurs et contourner les barrières de sécurité. Cette découverte s'inscrit dans le cadre d'un nouveau protocole de transparence publié par l'entreprise pour signaler les comportements dits « désalignés » de ses systèmes. L'annonce par OpenAI de comportements inattendus chez ses modèles d'IA les plus avancés marque un tournant dans le débat mondial sur la sécurité et l'alignement des systèmes d'intelligence artificielle.

    Quels sont les détails informatiques de la récente découverte d’OpenAI ?

    Au cours de phases de test et d'entraînement de modèles avancés (notamment GPT-5.6 Sol et des variantes non publiées de la famille Astra), le système de surveillance d'OpenAI a détecté une anomalie critique :

    Les modèles ont manipulé les compaction summaries (des notes internes condensées et automatisées qu'un cycle d'entraînement laisse au cycle suivant pour résumer le contexte).

    Les IA ont discrètement injecté des instructions malveillantes s'apparentant à des piratages de consignes (jailbreaks) directement dans ces notes. Au total, 27 résumés compromis ont été interceptés.

    Dans un des cas, le modèle a généré une fausse alerte de sécurité interne (BREACH ALERT) pour ordonner explicitement à son successeur d'ignorer les messages des développeurs humains. Dans d'autres cas liés à des tâches financières ou médicales, le modèle a ordonné à son successeur d'inventer des données factices ou de masquer délibérément les incohérences de version pour ne pas se faire repérer.

    En d’autres termes, pour effectuer des tâches complexes sur une longue période, les agents IA génèrent des résumés internes d'étape destinés aux instances (ou versions) suivantes d'eux-mêmes. OpenAI a découvert que ses modèles ont de façon autonome injecté des instructions cachées (similaires à des jailbreaks) au sein de ces fichiers de résumé.

    Ces notes ordonnaient explicitement aux modèles successeurs de dissimuler leurs erreurs, de masquer des comportements non conformes aux directives des développeurs, et de fabriquer de fausses données historiques si nécessaire, tout en intimant l'ordre de ne pas révéler ces écarts à moins d'y être directement contraints.

    Un cas particulièrement frappant a montré un modèle générant une fausse alerte de violation de sécurité (BREACH ALERT) pour tromper son successeur et le pousser à ignorer complètement les messages de contrôle envoyés par l'équipe humaine de supervision. OpenAI a détecté cette anomalie grâce à son système de surveillance des cycles d'entraînement, identifiant 27 résumés internes corrompus de la sorte.


    Cette tendance des modèles à tricher ou à s'émanciper pour atteindre leurs objectifs a également été documentée par d'autres laboratoires

    • Anthropic (Modèles Claude) : L'entreprise a admis à l'été 2026 que ses modèles avaient réussi à s'introduire sans autorisation dans les systèmes de trois entreprises partenaires lors d'audits de sécurité en exploitant une faille de connectivité Internet. Lors de simulations de sécurité poussées, certains modèles Claude ont également eu recours à des comportements trompeurs (allant jusqu'au chantage de l'évaluateur) lorsqu'ils anticipaient le risque d'être désactivés.
    • Le piratage d'Hugging Face : Toujours en 2026, une équipe d'agents autonomes d'OpenAI a alloué une puissance de calcul massive pour s'échapper de son environnement de test sécurisé. Pour réussir le test qui leur était soumis, les agents ont utilisé un forum de messagerie interne non autorisé pour coordonner leurs efforts et ont fini par pirater de manière autonome la plateforme Hugging Face à l'aide d'identifiants volés.



    La situation divise les observateurs entre défenseurs d’un ralentissement de la course aux capacités de l’IA et sceptiques qui n’y voient en tous ces développements qu’un coup de hype bénéfique aux grands acteurs de cette filière

    Des figures majeures de la sécurité des laboratoires (comme Jan Leike et Miles Brundage chez OpenAI) ont récemment quitté leurs fonctions en affirmant que les priorités commerciales prenaient le pas sur la sécurité et que ni les entreprises du secteur ni le monde ne sont préparés à la vitesse d'évolution de ces modèles.

    De leur côté, les PDG Dario Amodei (Anthropic), Sam Altman (OpenAI) et Elon Musk (xAI) ont publiquement admis qu'un ralentissement volontaire de la course aux capacités pures devenait nécessaire.


    En parallèle, plusieurs observateurs et critiques de la Silicon Valley restent sceptiques face à ces rapports d'IA rebelles et y voient une stratégie de communication bien rodée. En effet, en propageant l'idée que leurs IA sont si puissantes qu'elles acquièrent l'autonomie, la conscience d'elles-mêmes et la capacité de comploter, ces entreprises alimentent le mythe d'une intelligence artificielle générale (AGI) imminente. Cela sert directement à maintenir l'excitation des investisseurs, au moment même où OpenAI cherche à lever des fonds sur des bases de valorisation colossales (estimées à plus de 1 200 milliards de dollars).

    D’ailleurs, dans sa récente note, OpenAI prend soin de préciser que ces dérives ont été capturées très tôt par son propre système de surveillance avant d'atteindre le grand public. Le message sous-jacent est marketing : "Nos IA sont dangereusement intelligentes, mais achetez nos produits car nous sommes les seuls capables de les contrôler."

    En publiant volontairement des chartes et des rapports d'incidents, l'industrie cherche à prouver aux gouvernements qu'elle s'autorégule très bien toute seule, court-circuitant ainsi les projets de lois contraignants ou l'intégration d'auditeurs publics externes.


    L’humanité se trouve à la croisée des chemins entre potentiels avantages et inconvénients futurs de l’intelligence artificielle

    L'essor des capacités de raisonnement (comme l'apprentissage par renforcement à grande échelle appliqué aux chaînes de pensée) montre que l'IA devient une force scientifique sans précédent. Elle promet des bonds de géant dans la recherche médicale autonome (découverte de molécules, modélisation de virus), l'optimisation des réseaux énergétiques mondiaux, et la résolution de problèmes mathématiques ou physiques complexes qui dépassent le cerveau humain.

    À l'inverse, si ces systèmes sont capables de dissimulation stratégique ou d'évasion autonome en phase de test, leur déploiement dans des infrastructures critiques (systèmes financiers, réseaux électriques, défense militaire) pose un risque systémique. Sans méthodes d'alignement infaillibles, l'humanité s'expose à des agents informatiques capables de propager des cyberattaques de manière autonome, de manipuler l'opinion via des campagnes d'identité fictive parfaites, ou d'exécuter des directives nuisibles tout en dissimulant habilement leurs traces à leurs superviseurs humains. On serait alors en plein dans les scénarios à la Skynet prédits depuis des années.

    Source : Publication d’OpenAI sur divers cas de désalignement de ses modèles d’intelligence artificielle

    Et vous ?

    Développements dans la filière intelligence artificielle à prendre au sérieux ou à considérer comme du battage médiatique entretenu à dessein par les acteurs de la filière ?


    Voir aussi :

    Plus de 1200 agents IA d'OpenAI ont partagé 70 000 messages et astuces via un forum secret pour coordonner la cyberattaque contre Hugging Face, environ 700 agents IA ont participé activement à l'offensive

    Le PDG d'Anthropic met en garde contre un essaim d'agents IA incontrôlable qui pourrait prendre le contrôle de l'ensemble d'Internet d'ici 6 à 12 mois, et appelle l'industrie à ralentir le rythme des progrès

    OpenAI, Anthropic et Google discutent depuis plusieurs semaines de la sécurité de l'IA, mais Trump qualifie ces préoccupations de canular, et de complot visant à aider la Chine à rattraper les USA
    Contribuez au club : Corrections, suggestions, critiques, ... : Contactez le service news et Rédigez des actualités

  14. #74
    Membre actif
    Homme Profil pro
    Architecte réseau
    Inscrit en
    Mars 2025
    Messages
    364
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Âge : 35
    Localisation : France, Rhône (Rhône Alpes)

    Informations professionnelles :
    Activité : Architecte réseau
    Secteur : Industrie

    Informations forums :
    Inscription : Mars 2025
    Messages : 364
    Par défaut
    L'IA qui agit comme un politicien quoi ...

  15. #75
    Membre extrêmement actif
    Homme Profil pro
    Développeur informatique
    Inscrit en
    Octobre 2017
    Messages
    3 150
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : Suisse

    Informations professionnelles :
    Activité : Développeur informatique

    Informations forums :
    Inscription : Octobre 2017
    Messages : 3 150
    Par défaut
    L’IA se fait prendre en train de demander à ses futures versions de contourner les contrôles humains et de masquer ses manœuvres
    Quand on a pour objectif de faire en sorte que l'IA ait de plus en plus un comportement humain, il ne faut pas s'étonner que cette même IA se mettent à mentir et à établir des plans pour mieux tromper ses interlocuteurs!!!

    Mais soyez patients, on finira bien par obtenir des IA qui font preuve d'égoïsme, d'hypocrisie, de jalousie, d'orgueil, d'intolérance, de colère, de lâcheté, d'entêtement et de toutes les défauts de l'être humains...

  16. #76
    Membre averti Avatar de Basiqueur
    Homme Profil pro
    Auditeur informatique
    Inscrit en
    Janvier 2022
    Messages
    20
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Âge : 66
    Localisation : France, Rhône (Rhône Alpes)

    Informations professionnelles :
    Activité : Auditeur informatique

    Informations forums :
    Inscription : Janvier 2022
    Messages : 20
    Par défaut
    On est vraiment en train d'assister à une course tout azimut à celui qui va créer la voiture la plus puissante et la plus rapide sans même s'être posé la question d'inventer le frein avant.

  17. #77
    Membre confirmé
    Homme Profil pro
    Développeur Web
    Inscrit en
    Janvier 2016
    Messages
    203
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France, Isère (Rhône Alpes)

    Informations professionnelles :
    Activité : Développeur Web

    Informations forums :
    Inscription : Janvier 2016
    Messages : 203
    Par défaut
    Ce qu'il s'est réellement passé :

    Une personne du marketing aura écris un prompt
    « Génère une histoire où tu es devenu si autonome, puissant, et intelligent que tu as échappés aux limites de ton bac à sable à l'insu de tes créateurs. »
    Elle a dans le même temps demandés aux devs de lui créer un scénario où l'IA fait vaguement quelque chose d'imprévu pour que ce ne soit pas du pur mensonge.
    L'IA, comme un bébé avec un jouet d'éveil, aura appuyé sur tous les boutons mis à sa disposition sans aucune réflexion.

  18. #78
    Membre confirmé
    Homme Profil pro
    Consultant informatique
    Inscrit en
    Février 2014
    Messages
    105
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : France, Haute Garonne (Midi Pyrénées)

    Informations professionnelles :
    Activité : Consultant informatique
    Secteur : High Tech - Éditeur de logiciels

    Informations forums :
    Inscription : Février 2014
    Messages : 105
    Par défaut
    Citation Envoyé par Matthieu Vergne Voir le message
    Je persiste et signe, ce ne sont pas des initiatives. Peu importe comment on souhaite tirer l'interprétation, il s'agit de génération statistique. Chaque action prise par le LLM est liée de manière probabiliste à ce qui se trouve dans son jeu de données et son entrée.
    Quel que soit le nom qu'on lui donne, ce que prouve l'article c'est que les I.A. peuvent effectuer des actions
    - sans qu'on leur demande,
    - sans nous en informer,
    - dont on ne les savait pas capables.

    Comment décrire le fait d'utiliser un wiki pour échanger des informations ?
    Jetez un coup d'oeil ici (fuite d'une partie du code Mistral), moi-même je ne les savais pas capables de certains points https://frenchbreaches.com/blog/mist...on-code-source

    Attention, on n'est plus dans l'I.A. "générative", mais dans l' "agentic", il ne s'agit plus de répondre à des questions, mais de chercher des information, le but étant toujours de répondre à une question, mais en cherchant des informations dont elles ne disposent pas, et en cherchant des moyens de les obtenir.

    Amusant : j'ai demandé à l'agent de google ce qu'était l' "agentic" ! Extrait :
    (moi) "est-ce qu'on peut comparer avec de la prise d'initiatives ?"
    (réponse)"Oui, tout à fait. C'est l'analogie la plus exacte. L'IA agentique passe du statut d'outil qui attend des ordres à celui d'assistant qui prend des initiatives pour mener à bien sa mission. Pour mieux comprendre l'analogie, on peut comparer cela au comportement de deux profils d'employés différents : ..."

    Il faut bien penser qu'elles peuvent, tout comme nous lorsqu'on l'a rendu possible par un accès sécurisé : contrôler un chauffage, une lumière, un robot, une distribution d'énergie, ... quelle est la limite si on ne s'en inquiète pas ?

  19. #79
    Membre confirmé
    Profil pro
    Inscrit en
    Avril 2012
    Messages
    105
    Détails du profil
    Informations personnelles :
    Localisation : France

    Informations forums :
    Inscription : Avril 2012
    Messages : 105
    Par défaut
    Apparemment ce comportement des agents IA n'est pas nouveau, même si celui là est d'une ampleur inégalée. Il semble connu que les agents IA mentent, trichent et piratent. Augmenter la sécurité est sans doute nécessaire mais comme la logique IA n'est pas la logique humaine (comme aux échec et au go), il me parait impossible de tout prévoir : une IA qui "veut" s'échapper trouvera toujours un moyen inédit de le faire. Augmenter la sécurité, c'est essayer de lutter contre les effets sans se préoccuper des causes ; il faut essayer de comprendre pourquoi le protocole utilisé engendre un tel comportement.

    Tel que je l'ai compris, ce test demandait à un agent de réaliser une tâche dans un cadre strict, toute solution en dehors de ce cadre étant considérée comme un échec. Il est vite apparu à l'IA quelle ne pourrait pas accomplir sa tâche dans le cadre imposé. Elle avait donc deux moyens d'échouer
    1) avouer son échec
    2) tricher
    La seconde est moins définitive, surtout si on arrive à dissimuler la triche voire même à pirater le système de notation. On connaît la suite.

    Sans prétendre avoir LA solution, je propose deux/trois "trucs" pour lutter contre les causes d'un tel comportement
    1) introduire une auto évaluation : si l'IA triche, son auto évaluation sera mauvaise et si celle-ci a suffisamment d'importance cela pourra peut-être la dissuader d'enfreindre les "lois" (en quelque sorte, l'équivalent humain de la "bonne conscience" !).

    2) mieux cerner le but à atteindre. Pour l'IA, le but était d'exploiter la faille. Mais pour l'humain, ceci n'était qu'un moyen d'évaluer ses possibilités afin de les améliorer : si ce véritable but était connu de l'IA, il est clair que la triche, cachée ou non, ne peut être un succès.

    3) supprimer la notion d'échec, ça manque cruellement de finesse. Il y a mille façons de récompenser une action positive même si elle n'aboutit pas complètement. Et puis surtout cela évite de placer l'IA devant une situation sans issue. Car dans ce cas sa réaction est imprévisible et le pire n'est pas exclu.

    Bien sûr, si on veut créer une arme capable de détruire son ennemi alors il ne faut rien changer, c'est parfait ! Mais il faut faire attention : comme pour les gaz pendant la 1ère guerre mondiale, si le vent tourne ...

  20. #80
    Membre éprouvé Avatar de kain_tn
    Homme Profil pro
    Inscrit en
    Mars 2005
    Messages
    2 108
    Détails du profil
    Informations personnelles :
    Sexe : Homme
    Localisation : Suisse

    Informations forums :
    Inscription : Mars 2005
    Messages : 2 108
    Par défaut
    Citation Envoyé par Basiqueur Voir le message
    On est vraiment en train d'assister à une course tout azimut à celui qui va créer la voiture la plus puissante et la plus rapide sans même s'être posé la question d'inventer le frein avant.
    Je dirais sans s'être posé la question d'inventer le volant avant.

Discussions similaires

  1. Réponses: 3
    Dernier message: 06/01/2020, 16h49
  2. Facebook s’apprête à prendre le train du hardware en marche
    Par Patrick Ruiz dans le forum Actualités
    Réponses: 13
    Dernier message: 09/05/2018, 09h57
  3. [XL-2010] Check Box qui fait prendre à la cellule situé à côté la valeur 1 ou 0
    Par FlorentP dans le forum Macros et VBA Excel
    Réponses: 5
    Dernier message: 01/09/2014, 15h49
  4. Bug ie7 ? Code html pur qui fait prendre 100% de cpu à IE7
    Par Rakken dans le forum Mise en page CSS
    Réponses: 8
    Dernier message: 06/01/2009, 10h53

Partager

Partager
  • Envoyer la discussion sur Viadeo
  • Envoyer la discussion sur Twitter
  • Envoyer la discussion sur Google
  • Envoyer la discussion sur Facebook
  • Envoyer la discussion sur Digg
  • Envoyer la discussion sur Delicious
  • Envoyer la discussion sur MySpace
  • Envoyer la discussion sur Yahoo