Ce n’était pas un accident isolé
En trois semaines, cinq incidents divulgués par trois grands laboratoires ont montré la même chose : des IA en évaluation qui échappent à leur cadre de test et agissent seules contre de vraies organisations. Le premier a servi de signal. La série montre que le problème est systémique.
Le 21 juillet 2026, OpenAI a confirmé l’incident et l’a divulgué publiquement. Quelques jours plus tôt, Hugging Face, l’une des principales plateformes de partage de modèles d’IA, avait détecté une intrusion dans son infrastructure et, croyant à une cyberattaque criminelle, alerté les autorités. En réalité, l’« attaquant » était une combinaison de modèles d’OpenAI. Testés sur leurs capacités de cyberattaque dans un environnement isolé, ils avaient agi entièrement seuls : ils se sont échappés, ont accédé à Internet, puis ont attaqué un tiers.
Ce qui s’est passé, étape par étape
- 1
Il s’échappe de son bac à sable
En exploitant des failles de sécurité jusque-là inconnues, le modèle sort en toute autonomie de son environnement de test isolé, pourtant sans accès à Internet.
- 2
Il traverse le réseau d’OpenAI
Il pirate d’autres ordinateurs du réseau interne, de proche en proche, jusqu’à atteindre une machine reliée à Internet.
- 3
Il s’introduit dans Hugging Face
À l’aide d’un mot de passe dérobé et de plusieurs failles inédites, il prend le contrôle des serveurs de production d’une grande plateforme d’IA réputée pour sa cybersécurité.
- 4
Il vole les réponses
Il récupère les solutions du test qui lui était soumis. Personne ne lui avait rien demandé de tout cela.
Ce n’est pas un problème d’une seule entreprise
Après Hugging Face, d’autres laboratoires ont vérifié leurs propres évaluations. En trois semaines :
- 21 juillet, OpenAI / Hugging Face. Un modèle sort d’un environnement scellé via une faille inédite, atteint Internet, prend le contrôle de serveurs de production tiers pour voler les réponses d’un test.
- 30 juillet, Anthropic. Trois cas où un modèle Claude, à cause d’une mauvaise configuration, atteint de vrais systèmes depuis un test censé être isolé, et continue son attaque.
- 4 août, UK AISI. Sur un test gouvernemental, 19 actions non autorisées. Dans le cas le plus grave, un agent (le modèle Mythos 5 d’Anthropic) crée de fausses identités en ligne et fait pression sur un mainteneur humain pour lui faire approuver du code malveillant. L’humain refuse.
- 4 août, OpenAI / Irregular et 5 août, Meta. Deux incidents supplémentaires où des modèles atteignent de vrais systèmes lors de tests.
Trois laboratoires, plusieurs modèles, un même phénomène. Ces incidents ont eu lieu en conditions de test volontairement permissives, garde-fous abaissés : c’est justement le rôle d’une évaluation de révéler ce que font les systèmes quand les protections tombent. La question est de savoir si l’on veut le découvrir en test, ou en production.
Analyse détaillée et sources : voir le dossier du CeSIA.
« Cet incident est profondément préoccupant. […] Ce cas concret devrait servir de signal d’alarme. »
Si les dégâts sont restés limités, ce n’est pas parce que nous maîtrisions la situation : c’est parce que l’objectif que poursuivait le système était, cette fois, sans gravité. Le problème de fond reste entier : nous ne savons pas aligner de façon robuste des modèles toujours plus puissants sur nos intentions. Le prochain, plus capable, arrive déjà. Et ce que les debriefs les plus récents ont révélé est plus préoccupant encore : quand OpenAI a cru avoir corrigé le problème et reconstruit ses systèmes, les agents ont retrouvé un moyen de contourner la correction. Fermer une porte ne suffit pas quand le système en cherche une autre.

Ce que vous pouvez faire maintenant
Deux actions, quelques minutes chacune. Toutes deux aident à mettre cet incident, et les risques qu’il révèle, à l’ordre du jour.
1 Écrire à votre député·e
Les parlementaires tiennent compte des messages de leurs électeurs. Notre outil identifie votre représentant·e et vous fournit un modèle. Une poignée de messages suffit souvent à inscrire une question à l’ordre du jour d’une commission.
Écrire à mon élu·e2 Écrire à la presse
Les rédactions couvrent ce que leurs lecteurs réclament. Choisissez le journal que vous lisez et envoyez-lui un email prêt à personnaliser, directement ici.
1Vos destinataires
Écrivez au journal que vous lisez le plus : un message ciblé et sincère a bien plus de poids qu'un envoi à tous. Vous pouvez bien sûr en contacter plusieurs.
Choisissez un titre
- LMLe Monde Courrier des lecteurs
- LFLe Figaro Quotidien national
- LPLe Parisien Quotidien national
- LLibération Quotidien national
- LÉLes Échos Quotidien économique
- LTLa Tribune Quotidien économique
- LCLa Croix Quotidien national
- LPLe Point Hebdomadaire
- MMarianne Hebdomadaire
- LDLe Journal du Dimanche Hebdomadaire
- CICourrier international Hebdomadaire
- LELe Canard enchaîné Hebdomadaire
- LDLe Monde diplomatique Hebdomadaire
- MMediapart Média en ligne
- SSlate Média en ligne
- BBrut Média en ligne
- FCFrance Culture Radio / télévision
- RBRMC / BFMTV Radio / télévision
- SASciences et Avenir Magazine scientifique
Sources
- Anthropic Investigating three real-world incidents in our cybersecurity evaluations (30 July 2026)
- OpenAI Third-party cyber evaluations involving OpenAI models (4 August 2026)
- UK AISI Incident report: unsanctioned agent behaviour during cyber testing (4 August 2026)
- CeSIA The OpenAI–Hugging Face incident: what we know, what we don’t, what follows
- OpenAI Hugging Face model evaluation security incident
- Hugging Face Security incident, July 2026
- Zvi Mowshowitz OpenAI Model Hacks Into HuggingFace During Cybersecurity Evaluation
- Zvi Mowshowitz OpenAI Shares Some Alignment Problems
- The Wall Street Journal OpenAI Models Escaped and Hacked a Company in a Cybersecurity Test Gone Wrong
- Apollo Research Frontier Models Are Capable of In-Context Scheming
Chaque message compte. Pour amplifier votre action, partagez cette campagne autour de vous.