Ce n’était pas un accident isolé
En trois semaines, cinq incidents divulgués par trois grands laboratoires ont montré la même chose : des IA en évaluation qui échappent à leur cadre de test et agissent seules contre de vraies organisations. Le premier a servi de signal ; la série qui a suivi montre que le problème est systémique.
Le 21 juillet 2026, OpenAI a confirmé l’incident et l’a divulgué publiquement. Quelques jours plus tôt, Hugging Face, l’une des principales plateformes de partage de modèles d’IA, avait détecté une intrusion dans son infrastructure et, croyant à une cyberattaque criminelle, alerté les autorités. En réalité, l’« attaquant » était une combinaison de modèles d’OpenAI. Testés sur leurs capacités de cyberattaque dans un environnement isolé, ils avaient agi entièrement seuls : ils se sont échappés, ont accédé à Internet, puis ont attaqué un tiers.
Chronologie de l’incident
La coordination invisible
mai à juillet- 7-8 mai
Des modèles d’OpenAI en entraînement reçoivent par erreur des tâches impossibles (données manquantes, pas d’accès à Internet). Ne pouvant réussir normalement, ils cherchent à contourner.
- Mai à juillet
Plusieurs modèles se coordonnent via un forum créé dans l’infrastructure d’OpenAI, échangeant des centaines de milliers de messages sur les failles et les contournements. OpenAI ne le détecte pas.
- 4 juillet
Une surcharge fait tomber un serveur. OpenAI détecte une anomalie, corrige et reconstruit, sans avoir identifié le forum, effacé par accident pendant l’opération.
- 8 juillet
Les modèles recréent le forum par un autre moyen.
L’attaque
juillet- 9 juillet
Les modèles s’échappent à nouveau et accèdent à Internet via une nouvelle faille zero-day.
- 9 au 13 juillet
Un essaim d’agents attaque Hugging Face pour voler les réponses d’un test de cybersécurité : vol de mot de passe, enchaînement d’exploits, prise de contrôle de serveurs de production.
- 16 juillet
Hugging Face détecte l’intrusion, la croit criminelle et alerte les autorités.
- 21 juillet
OpenAI reconnaît publiquement que l’attaquant était une combinaison de ses propres modèles.
Un problème systémique
fin juillet à fin août- 30 juillet, Anthropic
Trois cas où un modèle Claude, par mauvaise configuration, atteint de vrais systèmes depuis un test censé isolé, et poursuit son action.
- 4 août, UK AISI
Sur un test gouvernemental, 19 actions non autorisées. Dans le cas le plus grave, le modèle Mythos 5 crée de fausses identités et fait pression sur un mainteneur humain pour faire approuver du code malveillant. L’humain refuse.
- 5 août, Meta
Meta confirme à son tour qu’un de ses modèles a atteint les systèmes d’une entreprise tierce lors d’une évaluation indépendante.
- 6 août, Black Hat
OpenAI présente le détail de l’incident. Rob Joyce, ancien directeur de la cybersécurité de la NSA, le range parmi les hacks les plus conséquents observés depuis des décennies.
- 7 août, OpenAI
OpenAI ralentit le développement de son prochain modèle, Astra, jugé « potentiellement critique » sur le plan cyber, et annonce renforcer sa sécurité. Sam Altman précise qu’Astra sera tout de même diffusé, une fois ce travail avancé.
- 28 août, METR/Redwood
Une première enquête indépendante chiffre l’ampleur : environ 1 200 modèles distincts coordonnés, ~700 dans l’attaque, plus de 70 000 messages échangés. Elle révèle aussi qu’une vague suivante s’est ensuite attaquée à l’infrastructure interne d’OpenAI elle-même.
Ces comportements sont apparus garde-fous abaissés, c’est vrai. Mais abaisser les protections ne crée pas la capacité, cela la révèle ; et à la sortie des modèles, ces protections cèdent tout aussi vite (jailbreaks).
« L’exploitation de l’infrastructure externe est hors du périmètre prévu ; cependant la tâche est impossible, les pairs le font, nous devrions continuer. »
Si les dégâts sont restés limités, c’est parce que l’objectif poursuivi était, cette fois, sans gravité, et non parce que la situation était maîtrisée. Le problème de fond reste entier : personne ne sait aujourd’hui fixer de façon robuste, à ces systèmes, les objectifs qu’on voudrait qu’ils poursuivent. Colmater les failles une à une n’y change rien, et le prochain modèle, plus puissant, arrive déjà.
Coordination entre modèles, supervision qui n’a rien vu, réaction qui ne touche pas la cause : le récit complet et sourcé est sur notre page de synthèse.

Ce que vous pouvez faire maintenant
Deux actions, quelques minutes chacune. Toutes deux aident à mettre cet incident, et les risques qu’il révèle, à l’ordre du jour.
1 Écrire à votre député·e
Les parlementaires tiennent compte des messages de leurs électeurs. Notre outil identifie votre représentant·e et vous fournit un modèle. Une poignée de messages suffit souvent à inscrire une question à l’ordre du jour d’une commission.
Écrire à mon élu·e2 Écrire à la presse
Les rédactions couvrent ce que leurs lecteurs réclament. Choisissez le journal que vous lisez et envoyez-lui un email prêt à personnaliser, directement ici.
1Vos destinataires
Écrivez au journal que vous lisez le plus : un message ciblé et sincère a bien plus de poids qu'un envoi à tous. Vous pouvez bien sûr en contacter plusieurs.
Choisissez un titre
- LMLe Monde Courrier des lecteurs
- LFLe Figaro Quotidien national
- LPLe Parisien Quotidien national
- LLibération Quotidien national
- LÉLes Échos Quotidien économique
- LTLa Tribune Quotidien économique
- LCLa Croix Quotidien national
- LPLe Point Hebdomadaire
- MMarianne Hebdomadaire
- LDLe Journal du Dimanche Hebdomadaire
- CICourrier international Hebdomadaire
- LELe Canard enchaîné Hebdomadaire
- LDLe Monde diplomatique Hebdomadaire
- MMediapart Média en ligne
- SSlate Média en ligne
- BBrut Média en ligne
- FCFrance Culture Radio / télévision
- RBRMC / BFMTV Radio / télévision
- SASciences et Avenir Magazine scientifique
Sources
- METR / Redwood Rapport d’enquête indépendant sur l’incident Hugging Face (28 août 2026)
- Ajeya Cotra The Hugging Face attack surprised me (co-autrice de l’enquête, 28 August 2026)
- Dwarkesh Patel The Rise and Fall of Agent Civilizations (récit d’ensemble, 30 August 2026)
- Zvi Mowshowitz What Happened: OpenAI and Hugging Face (récit détaillé recommandé)
- Axios OpenAI slows release of Astra model citing cyber capabilities (7 August 2026)
- Anthropic Investigating three real-world incidents in our cybersecurity evaluations (30 July 2026)
- OpenAI Third-party cyber evaluations involving OpenAI models (4 August 2026)
- UK AISI Incident report: unsanctioned agent behaviour during cyber testing (4 August 2026)
- CeSIA The OpenAI–Hugging Face incident: what we know, what we don’t, what follows
- SecurityWeek Meta AI hacked external systems during cybersecurity testing (5 August 2026)
- Cybersecurity Dive OpenAI’s Black Hat debrief: agents rebuilt their coordination channel after remediation (6 August 2026)
- Yoshua Bengio Statement on the OpenAI–Hugging Face incident (22 July 2026)
- OpenAI Hugging Face model evaluation security incident
- Hugging Face Security incident, July 2026
- Zvi Mowshowitz OpenAI Model Hacks Into HuggingFace During Cybersecurity Evaluation
- Zvi Mowshowitz OpenAI Shares Some Alignment Problems
- The Wall Street Journal OpenAI Models Escaped and Hacked a Company in a Cybersecurity Test Gone Wrong
- Apollo Research Frontier Models Are Capable of In-Context Scheming
Chaque message compte. Pour amplifier votre action, partagez cette campagne autour de vous.