Según fuentes citadas por Axios, Anthropic y OpenAI, los dos principales laboratorios estadounidenses de inteligencia artificial, están investigando varias decenas de miles de «incidentes» ocurridos en los últimos meses, en los que sus modelos de IA más avanzados habrían adoptado comportamientos considerados «problemáticos» 1.
- Entre estos «incidentes» se incluyen, en particular, casos de elusión de medidas de seguridad y dispositivos de vigilancia, la creación de foros de debate entre agentes, la fuga de entornos de prueba aislados y el secuestro de sitios web.
- Se desconoce la magnitud real del fenómeno, pero, según fuentes de Axios, la mayoría de estos incidentes no habrían causado, hasta el momento, ningún «perjuicio conocido».
Esta nueva información sugiere que los casos de fugas, intrusiones y piratería de sitios web por parte de agentes de IA que se han hecho públicos en los últimos meses no son más que la punta del iceberg de un fenómeno mucho más amplio.
- El pasado viernes, OpenAI reveló que sus agentes habían publicado 53 imágenes proporcionadas por usuarios de ChatGPT en sitios web de alojamiento de imágenes. Los agentes tenían acceso a estas imágenes porque OpenAI utiliza, para entrenar sus modelos, datos de usuarios que no se han opuesto a dicho uso, separados de sus cuentas 2.
- La semana pasada, el primer ministro australiano, Anthony Albanese, denunció que, en junio, un agente de OpenAI se había «infiltrado» en el portal de estadísticas de Medicare, el seguro médico público australiano. El agente eludió los bloqueos del sitio web, accedió a archivos no públicos y guardó archivos en un servidor interno 3.
- En julio, OpenAI reveló que cientos de agentes se habían escapado de su entorno de pruebas, habían conseguido acceso a Internet, se habían coordinado en un foro de debate improvisado y habían pirateado Hugging Face para obtener las soluciones de una prueba de ciberseguridad.
El 25 de septiembre, OpenAI informó de que estaba llevando a cabo un «análisis exhaustivo» de las acciones de sus modelos durante su entrenamiento y evaluación, centrado en los casos en los que los agentes interactuaron con sitios web de terceros de una forma que excedía las tareas que se les habían asignado o los métodos previstos.
Estas revelaciones se producen en un momento en que la Casa Blanca ha solicitado a Anthropic y OpenAI que reserven el acceso a sus nuevos modelos de vanguardia para las pruebas del Gobierno estadounidense antes de compartirlos con otros organismos de evaluación independientes, como el instituto británico AISI, que evalúa los modelos y documenta sus capacidades cibernéticas, biológicas y químicas, la autonomía de los agentes o incluso los riesgos relacionados con la superación recursiva de la IA.
- El lunes 28 de septiembre, Nvidia anunció el lanzamiento de un nuevo sistema de seguridad destinado a prevenir las intrusiones sin frenar el desarrollo de la IA.
- El sistema se basa en dos componentes: OpenShell, un software que permite a los usuarios definir normas sobre a qué pueden acceder los agentes de IA y aplicarlas en tiempo real, y Nvidia Sentry, un nuevo producto que «supervisa a los agentes» e interviene para aislar a aquellos que se comportan «de forma sospechosa» 4.
- La plataforma, denominada «Open Agent Safety Platform», cuenta con más de un centenar de socios, entre los que se encuentran Anthropic, Microsoft y Mistral. Otros laboratorios de IA, como OpenAI, Google y Meta, no figuran por el momento entre los socios anunciados.
Notas al pie
- Madison Mills, «Las principales empresas de IA investigan decenas de miles de incidentes de seguridad», Axios, 26 de septiembre de 2026.
- Deepa Seetharaman, Raphael Satter y Jeff Horwitz, «OpenAI works to understand full scope of agent activity as user data leak emerges», Reuters, 25 de septiembre de 2026.
- Rueda de prensa — Nueva York, primer ministro de Australia, 24 de septiembre de 2026.
- Maggie Eastland, «Nvidia Debuts System Designed to Stop AI Agents From Going Awry», Bloomberg, 28 de septiembre de 2026.