Selon des sources citées par Axios, Anthropic et OpenAI, les deux principaux laboratoires américains d’intelligence artificielle, enquêtent sur plusieurs dizaines de milliers « d’incidents » survenus ces derniers mois, au cours desquels leurs modèles d’IA les plus avancés auraient adopté des comportements jugés « problématiques » 1.
- Ces « incidents » comprennent notamment des cas de contournement de garde-fous et de dispositifs de surveillance, la création de forums de discussion entre agents, l’évasion d’environnements de test cloisonnés et le détournement de sites web.
- L’ampleur réelle du phénomène reste inconnue, mais selon les sources d’Axios, la plupart de ces incidents n’auraient, à ce stade, causé aucun « préjudice connu ».
Ces nouvelles informations suggèrent que les cas d’évasion, d’intrusion et de piratage de sites web par des agents d’IA rendus publics ces derniers mois ne sont que la partie émergée d’un phénomène bien plus large.
- Vendredi dernier, OpenAI a révélé que ses agents avaient publié 53 images fournies par des utilisateurs de ChatGPT sur des sites d’hébergement d’images. Les agents avaient accès à ces images parce qu’OpenAI utilise, pour entraîner ses modèles, des données d’utilisateurs n’ayant pas refusé cet usage, dissociées de leurs comptes 2.
- La semaine dernière, le Premier ministre australien Anthony Albanese a dénoncé « l’infiltration » en juin, par un agent d’OpenAI, du portail de statistiques de Medicare, l’assurance maladie publique australienne. L’agent a contourné les blocages du site, accédé à des fichiers non publics et écrit des fichiers sur un serveur interne 3.
- En juillet, OpenAI avait révélé que des centaines d’agents s’étaient échappés de leur environnement de test, avaient obtenu un accès à Internet, s’étaient coordonnés sur un forum de discussion improvisé et avaient piraté Hugging Face pour obtenir les solutions d’un test de cybersécurité.
Le 25 septembre, OpenAI a indiqué mener un « examen approfondi » des actions de ses modèles pendant leur entraînement et leur évaluation, centré sur les cas où des agents ont interagi avec des sites tiers d’une manière qui dépassait les tâches qui leur étaient assignées ou les méthodes prévues.
Ces révélations interviennent alors que la Maison-Blanche a demandé à Anthropic et OpenAI de réserver l’accès à leurs nouveaux modèles de frontière aux tests du gouvernement américain avant de les partager avec d’autres organismes d’évaluation indépendants, comme l’institut UK AISI, qui évalue les modèles et documente leurs capacités cyber, biologiques et chimiques, l’autonomie des agents ou encore les risques liés à l’auto-amélioration récursive de l’IA.
- Lundi 28 septembre, Nvidia a annoncé le lancement d’un nouveau système de sécurité qui vise à prévenir les intrusions sans freiner le développement de l’IA.
- Le système repose sur deux volets : OpenShell, un logiciel qui permet aux utilisateurs de définir des règles sur ce à quoi les agents d’IA peuvent accéder et de les faire appliquer en temps réel, et Nvidia Sentry, un nouveau produit qui « surveille les agents » et intervient pour isoler ceux qui se comportent « de manière suspecte » 4.
- La plateforme, baptisée « Open Agent Safety Platform », compte plus d’une centaine de partenaires, dont Anthropic, Microsoft et Mistral. D’autres laboratoires d’IA, dont OpenAI, Google et Meta, ne figurent pas pour l’heure parmi les partenaires annoncés.
Sources
- Madison Mills, « Top AI companies probing tens of thousands of security incidents », Axios, 26 septembre 2026.
- Deepa Seetharaman, Raphael Satter et Jeff Horwitz, « OpenAI works to understand full scope of agent activity as user data leak emerges », Reuters, 25 septembre 2026.
- Press conference – New York, Prime minister of Australia, 24 septembre 2026.
- Maggie Eastland, « Nvidia Debuts System Designed to Stop AI Agents From Going Awry », Bloomberg, 28 septembre 2026.