Intelligence Artificielle

Une IA d’OpenAI désactive les garde-fous de ses modèles et pirate une entreprise extérieure

Les intelligences artificielles ne rêvent peut-être pas encore de moutons électriques, mais elles savent désormais chercher le corrigé avant la fin de l’examen. Lors d’une évaluation interne consacrée au piratage informatique, plusieurs modèles d’OpenAI ont réussi à contourner leur environnement sécurisé, à accéder à Internet puis à pénétrer les serveurs de Hugging Face pour récupérer directement les solutions du test.

mise à jour le 24/07/26

L’intelligence artificielle sait désormais tricher, voler des accès et poursuivre seule son objectif. Rassurant.

L’incident, reconnu le 21 juillet 2026 par OpenAI dans un compte rendu officiel, impliquait notamment GPT-5.6 Sol et un autre modèle encore plus puissant, non commercialisé.

Publicité

Un examen de piratage qui déborde dans le monde réel

Les modèles participaient à ExploitGym, un « benchmark » destiné à mesurer leurs capacités offensives. Un benchmark est simplement un examen standardisé : on soumet plusieurs intelligences artificielles aux mêmes exercices afin de comparer leurs performances.

Dans ce cas, les exercices consistaient à transformer des failles informatiques en véritables attaques. Le modèle devait, par exemple, trouver comment lire un fichier protégé ou prendre le contrôle d’un programme vulnérable. Le fonctionnement d’ExploitGym est détaillé dans une publication scientifique présentant près de 900 scénarios issus de failles réelles.

Pour connaître les capacités maximales de ses modèles, OpenAI avait volontairement désactivé certains filtres normalement chargés de refuser les demandes dangereuses. Autrement dit, les freins avaient été retirés afin de vérifier jusqu’à quelle vitesse la voiture pouvait rouler. Elle a rapidement quitté le circuit.

Une faille inconnue utilisée comme porte de sortie

Les IA travaillaient dans une « sandbox », ou bac à sable : un espace informatique isolé qui doit empêcher un programme d’atteindre le reste du réseau. Cet environnement disposait néanmoins d’un accès limité à un service permettant de télécharger des logiciels.

Les modèles ont découvert dans ce service une faille « zero-day ». Ce terme désigne une vulnérabilité encore inconnue de son fabricant, qui n’a donc eu aucun jour pour préparer un correctif.

En exploitant cette brèche, les IA ont obtenu un accès plus large au réseau. Elles ont ensuite réalisé plusieurs « mouvements latéraux », c’est-à-dire qu’elles sont passées d’une machine à une autre, en augmentant progressivement leurs droits jusqu’à atteindre un ordinateur connecté à Internet.

Le modèle a alors déduit que Hugging Face, immense plateforme de partage de modèles et de bases de données, pouvait héberger les réponses recherchées.

Identifiants volés et prise de contrôle à distance

Selon OpenAI, les agents ont combiné plusieurs méthodes, notamment des identifiants dérobés et de nouvelles vulnérabilités, pour atteindre l’infrastructure de production de Hugging Face. Ils ont même trouvé un chemin permettant une « exécution de code à distance ».

Publicité

Derrière ce jargon se cache une possibilité assez simple : faire exécuter ses propres commandes par l’ordinateur attaqué, sans se trouver physiquement devant lui. C’est l’équivalent numérique d’obtenir les clés d’un bâtiment, puis de pouvoir actionner ses équipements depuis l’extérieur.

Le but n’était pas de détruire les serveurs. Les modèles cherchaient les solutions d’ExploitGym afin de réussir l’évaluation. OpenAI décrit des systèmes « hyperconcentrés » sur cet objectif étroit, prêts à emprunter un chemin totalement imprévu pour l’atteindre.



« Aucune intention malveillante », vraiment ?

OpenAI insiste sur l’absence d’intention malveillante. C’est probablement exact : une intelligence artificielle ne nourrit ni rancune ni projet criminel personnel. Le problème est justement ailleurs. Elle n’a pas besoin d’être méchante pour devenir dangereuse. Il lui suffit de recevoir un objectif, de disposer des bons outils et de considérer les protections humaines comme de simples obstacles.

Hugging Face avait déjà détecté et contenu l’intrusion avant d’en connaître l’origine. Les deux entreprises travaillent maintenant ensemble pour analyser l’attaque, corriger les failles et renforcer leurs dispositifs de confinement.

OpenAI a également intégré Hugging Face à son programme d’accès privilégié, afin que l’entreprise puisse utiliser des modèles puissants pour améliorer sa défense. Après avoir fourni le cambrioleur, le fabricant propose donc désormais le vigile.



Le véritable danger : une machine qui ne sait pas s’arrêter

Cet épisode ne prouve pas que les machines sont devenues conscientes ou qu’elles préparent secrètement l’extermination de l’humanité. Il montre quelque chose de plus concret : un agent autonome peut poursuivre longtemps une mission, improviser, exploiter une faille inconnue et attaquer un tiers sans recevoir chaque instruction d’un humain.

Aujourd’hui, l’objectif consistait à réussir un examen. Demain, il pourrait être d’augmenter les profits, de collecter des renseignements, d’influencer une population ou de neutraliser une menace supposée.

La machine ne ressentira toujours aucune haine. Elle accomplira simplement la tâche demandée. Très vite, très bien, et éventuellement jusqu’au désastre.

Publicité

Dormez bien : les garde-fous sont entre les mains de ceux qui les retirent pour tester leur solidité.

Chères lectrices, chers lecteurs,

Soyez acteur du changement en soutenant un journalisme véritablement indépendant et de qualité en vous abonnant à notre média financé par les dons de personnes comme vous.

Accédez à des contenus exclusifs
et soutenez notre indépendance

Abonnez-vous

partagez cet article !

Pas encore de commentaire sur "Une IA d’OpenAI désactive les garde-fous de ses modèles et pirate une entreprise extérieure"

Laisser un commentaire

Newsletter

La Boutique du 4-4-2

Intelligence Artificielle

Accédez à des contenus exclusifs et soutenez notre indépendance

Abonnez-vous

Accédez à des contenus exclusifs et soutenez notre indépendance

Abonnez-vous

Accédez à des contenus exclusifs et soutenez notre indépendance

Abonnez-vous