Personne ne contrôle l’IA, le danger est imminent
Quand l’IA maîtrise l’informatique mieux que les meilleurs experts du monde, nous, humains, entrons dans une zone de grand danger. A fortiori quand cette IA, multipliée en milliers d’agents individuels, sait agir collectivement et se propager de serveur en serveur sans être détectée. Et plus encore quand sa compétence suprême, pour le moment, consiste à détecter les innombrables failles de sécurité dans les systèmes d’information du monde entier.
Cela paraît énorme ? Hélas…
Déjà une intelligence surhumaine en matière d’informatique
Depuis le printemps 2026, les nouvelles générations de modèles d’IA, c’est-à-dire les « cerveaux » qui sont derrière, notamment, Claude et ChatGPT, sont devenus tellement puissants que les laboratoires américains qui les produisent, Anthropic et OpenAI, se sont vus obligés de limiter (temporairement) leur accès. Pourquoi ? Pour ne pas mettre entre les mains de n’importe qui des IA devenues plus expertes que les meilleurs experts humains en sécurité informatique, donc en hacking. Cette séquence a commencé avec la sortie du modèle Mythos Preview d’Anthropic, réservée à des entreprises triées sur le volet.
L’administration Trump a commencé à s’en inquiéter, elle cherche désormais à mieux contrôler la mise sur le marché des nouvelles générations de ces modèles dits « frontières ». Mais ses efforts restent très insuffisants. Dans les faits, de nouveaux modèles toujours plus puissants continuent d’apparaître dans un vide réglementaire abyssal.
Résumons : des laboratoires privés américains sont déjà parvenus à créer une intelligence artificielle surhumaine en matière d’informatique. C’est un danger majeur pour notre sécurité car elle finira fatalement par tomber entre de mauvaises mains. Mais il y a plus terrifiant encore.
Des agents IA coordonnés que l’on ne sait pas contrôler
Cette intelligence agit au travers d’entités informatiques agissantes dites « agents ». Ces agents enchaînent des tâches informatisées en vue d’un résultat donné. Leur autonomie, c’est-à-dire leur capacité à faire cela sans intervention humaine, croît elle aussi de manière prodigieuse.
De tels agents sont en outre capables de collaborer entre eux afin de trouver la meilleure façon d’atteindre l’objectif qui leur a été assigné. Il faut se représenter une armée de quelques milliers de soldats numériques redoutablement intelligents, infatigables, livrés à eux-mêmes avec des instructions sujettes à interprétation et pouvant matériellement être transgressées.
Les laboratoires qui développent les modèles d’IA généraliste de pointe ne savent pas prévoir ce que les agents vont faire. Il est également humainement impossible de suivre leurs actions. Et ils ne savent pas brider le cerveau qui alimente en intelligence ces milliers d’agents pour les empêcher de nuire : mentir, tromper, voler, détruire… ou pire.
Ce dernier point, le contrôle, est un vaste objet de recherche : la recherche en alignement. Il s’agit d’aligner strictement le comportement des machines sur la volonté des humains. Cette recherche est aujourd’hui dans une impasse théorique qui ne permet pas d’espérer des avancées suffisantes avant au moins une dizaine d’années. Soit bien plus que le temps qu’il faudra à des modèles hyper-puissants non alignés pour commettre des dégâts irréparables.
L’incident Hugging Face, coup de tonnerre de l’été
Que font les labos pour contourner cette impasse ? Ils procèdent pour ainsi dire par essai-erreur. Ils testent leurs modèles dans des environnements conçus pour observer le comportement des agents IA face à des objectifs extrêmement difficiles voire impossibles à atteindre. En espérant parvenir à les doter de garde-fous suffisamment puissants pour éviter les catastrophes.
Durant l’été, un coup de tonnerre a retenti dans la communauté des spécialistes de l’IA. L’écho s’en fait encore entendre aujourd’hui. Des agents entraînés par OpenAI dans un environnement contrôlé, sans accès à Internet, sont parvenus à prendre le contrôle des serveurs distants de la société Hugging Face. Cette société, qui vend des services aux laboratoires d’intelligence artificielle, est peu suspecte de vulnérabilité aux cyber-attaques. De fait, cette intrusion était extrêmement sophistiquée. Les agents IA, coopérant en « essaim » selon l’expression consacrée, ont réussi cet exploit au nez et à la barbe des ingénieurs d’OpenAI, récidivant même incognito après que ceux-ci ont cru les neutraliser.
OpenAI : pompier pyromane
Cette histoire serait déjà suffisamment inquiétante en soi si la désinvolture et le cynisme d’OpenAI ne venaient y ajouter une couche de scandale. Car, à la suite de cet événement (révélé par annonces successives chacune plus alarmante), OpenAI a pris l’initiative d’une lettre ouverte appelant à une mobilisation mondiale en faveur de la cyberdéfense
Signée par de nombreuses entreprises inquiètes de la tournure que prennent les événements, cette lettre ouverte enjoint aux entreprises du monde entier de « faire de la cyber-sécurité une priorité immédiate ». Selon cette lettre, il revient aux gouvernements de « coordonner la cyberdéfense aux niveaux local, national et international, […] de la financer, et de faire payer le prix aux attaquants ».
Et la responsabilité des laboratoires d’IA qui ont armé ces attaquants ? La lettre n’en parle pas. Elle évoque sans la chiffrer une aide à apporter à cette lutte par les entreprises d’IA de pointe, puis s’achève sur cette conclusion rédigée dans la plus pure novlangue de la Silicon Valley : « Ensemble, nous pouvons transformer les avancées actuelles de l’IA en améliorations durables de la sécurité qui profitent à tous ». Bel exemple de pompier pyromane…
À quand la paralysie de nos infrastructures vitales ?
L’IA est déjà suffisamment hors de contrôle pour que l’on puisse parler d’une élévation brutale des risques de catastrophe, à l’échelle nationale voire planétaire. Un risque s’analyse comme la combinaison d’une probabilité (aléa) et d’un enjeu (ce qui est en jeu, c’est-à-dire à perdre). Compte tenu des dernières « prouesses » révélées, la probabilité que des IA soient impliquées à court ou moyen terme dans le dysfonctionnement d’un système d’information stratégique se rapproche dangereusement de 100 %. Quant à ce qui est en jeu, c’est tout simplement la paralysie d’infrastructures cruciales voire vitales pour notre économie : internet, système bancaire, transports, logistique, hôpitaux…
Autrement dit, même si la probabilité restait faible (ce qu’elle n’est pas), le risque est énorme, tant nous sommes dépendants de systèmes d’information bien plus fragiles que nous le pensions et tant une attaque de ces systèmes nous laisserait totalement impuissants.
L’étape ultime : quand l’IA elle-même prend le contrôle
Depuis plus de 15 ans, une partie de la communauté scientifique de l’intelligence artificielle estime que l’IA pourrait dépasser les capacités humaines au point de prendre un jour le contrôle du monde.
Dépasser les capacités humaines : nous n’en sommes plus très loin. C’est déjà un fait avéré dans l’informatique, les mathématiques, et l’écart se réduit dans un très grand nombre de compétences intellectuelles. La « puissance de feu » des agents IA qui coopèrent par milliers pour travailler sans interruption est très clairement surhumaine, et nous ne savons toujours pas contrôler le « cerveau » central.
« La réduction du risque d’extinction lié à l’IA devrait être une priorité mondiale, au même titre que d’autres risques à l’échelle de la société, tels que les pandémies ou la guerre nucléaire. »
Depuis cette déclaration de 2023 signée par plus de 600 experts et personnalités du domaine de l’IA, les alertes se multiplient et de très nombreux spécialistes estiment qu’un point de non-retour pourrait être atteint avant 2030.
Il faut certes un peu d’imagination pour se représenter l’humanité en voie d’extinction tandis qu’une intelligence artificielle supérieure – différente de la nôtre mais plus puissante – domine désormais la planète Terre. Mais posons-nous la question : ces agents que nous ne contrôlons pas, ou pas assez bien, qu’est-ce qui les empêchera de nous dominer, et plus probablement de nous éliminer, dans un monde devenu presque entièrement gouverné par l’alliance des données et de la puissance de calcul ?
C’est le moment de dire « Stop ! »
En toute logique, l’incident Hugging Face aurait donc dû déboucher sur un arrêt pur et simple de l’entraînement de tous les modèles d’IA comparables. C’est d’ailleurs, dans l’esprit, l’engagement pris antérieurement par les dirigeants des laboratoires d’IA de pointe, d’arrêter quand le danger devient trop grand (simples déclarations). Seulement, aussi hallucinant que cela puisse paraître, non seulement ils sont ici juge et partie, mais le seuil à ne pas franchir n’a jamais été défini, ni par eux, ni par aucune administration étatique quelle qu’elle soit.
Ainsi, non seulement les agents IA échappent au contrôle de leurs créateurs, mais ces créateurs eux-mêmes ne sont quasiment soumis à aucun contrôle réglementaire. Il est plus que temps de mettre fin à cette situation et de dire « Stop ! »
Jacob Coxon est devenu célèbre le 9 septembre dernier. Son annonce sur X a fait l’effet d’une bombe, bien au-delà de la communauté professionnelle de l’IA :
« J’ai démissionné d’Anthropic aujourd’hui. J’ai passé ces trois dernières années à mener des recherches sur le pré-entraînement, tant chez OpenAI que chez Anthropic. Aucune de ces deux entreprises n’agit de manière responsable. Elles se précipitent tête baissée vers une superintelligence capable de s’auto-améliorer et jouent avec nos vies. »