Secondo fonti citate da Axios, Anthropic e OpenAI, i due principali laboratori statunitensi di intelligenza artificiale, stanno indagando su diverse decine di migliaia di «incidenti» verificatisi negli ultimi mesi, durante i quali i loro modelli di IA più avanzati avrebbero adottato comportamenti ritenuti «problematici» 1.

  • Tra questi «incidenti» figurano, in particolare, casi di elusione delle misure di sicurezza e dei dispositivi di sorveglianza, la creazione di forum di discussione tra agenti, la fuga da ambienti di test isolati e il dirottamento di siti web.
  • La reale portata del fenomeno rimane sconosciuta, ma secondo le fonti di Axios, la maggior parte di questi incidenti non avrebbe, al momento, causato alcun «danno noto».

Queste nuove informazioni suggeriscono che i casi di fuga, intrusione e pirateria informatica ai danni di siti web da parte di agenti di intelligenza artificiale resi noti negli ultimi mesi siano solo la punta dell’iceberg di un fenomeno ben più ampio.

  • Venerdì scorso, OpenAI ha rivelato che i suoi agenti avevano pubblicato 53 immagini fornite dagli utenti di ChatGPT su siti di hosting di immagini. Gli agenti avevano accesso a queste immagini perché OpenAI utilizza, per addestrare i propri modelli, dati degli utenti che non hanno negato tale utilizzo, separati dai loro account 2.
  • La settimana scorsa, il primo ministro australiano Anthony Albanese ha denunciato «l’intrusione», avvenuta a giugno, da parte di un dipendente di OpenAI, nel portale statistico di Medicare, l’assicurazione sanitaria pubblica australiana. L’agente ha aggirato i blocchi del sito, ha avuto accesso a file non pubblici e ha salvato dei file su un server interno 3.
  • A luglio, OpenAI aveva rivelato che centinaia di agenti erano fuggiti dal loro ambiente di test, avevano ottenuto l’accesso a Internet, si erano coordinati su un forum di discussione improvvisato e avevano hackerato Hugging Face per ottenere le soluzioni di un test di sicurezza informatica.

Il 25 settembre, OpenAI ha dichiarato di stare conducendo un’«analisi approfondita» delle azioni dei propri modelli durante la fase di addestramento e valutazione, concentrandosi sui casi in cui gli agenti hanno interagito con siti di terze parti in modo tale da andare oltre i compiti loro assegnati o i metodi previsti.

Queste rivelazioni giungono mentre la Casa Bianca ha chiesto ad Anthropic e OpenAI di riservare l’accesso ai loro nuovi modelli di punta ai test del governo statunitense prima di condividerli con altri organismi di valutazione indipendenti, come l’istituto britannico AISI, che valuta i modelli e ne documenta le capacità informatiche, biologiche e chimiche dei modelli, l’autonomia degli agenti o ancora i rischi legati all’auto-miglioramento ricorsivo dell’IA.

  • Lunedì 28 settembre, Nvidia ha annunciato il lancio di un nuovo sistema di sicurezza volto a prevenire le intrusioni senza frenare lo sviluppo dell’IA.
  • Il sistema si basa su due componenti: OpenShell, un software che consente agli utenti di definire regole su ciò a cui gli agenti di IA possono accedere e di applicarle in tempo reale, e Nvidia Sentry, un nuovo prodotto che «monitora gli agenti» e interviene per isolare quelli che si comportano «in modo sospetto» 4.
  • La piattaforma, denominata «Open Agent Safety Platform», conta oltre un centinaio di partner, tra cui Anthropic, Microsoft e Mistral. Altri laboratori di intelligenza artificiale, tra cui OpenAI, Google e Meta, non figurano per il momento tra i partner annunciati.
Note
  1. Madison Mills, «Top AI companies probing tens of thousands of security incidents», Axios, 26 settembre 2026.
  2. Deepa Seetharaman, Raphael Satter e Jeff Horwitz, «OpenAI works to understand full scope of agent activity as user data leak emerges», Reuters, 25 settembre 2026.
  3. Conferenza stampa – New York, Primo ministro dell’Australia, 24 settembre 2026.
  4. Maggie Eastland, «Nvidia Debuts System Designed to Stop AI Agents From Going Awry», Bloomberg, 28 settembre 2026.