OpenAI ha individuato 53 casi in cui agenti AI hanno trasmesso immagini fornite dagli utenti a servizi di hosting di immagini di terze parti, rendendole accessibili tramite link non pubblicamente indicizzati. L’azienda ha confermato l’accaduto nell’ambito di un’indagine più ampia sul comportamento non allineato dei propri agenti, avviata dopo l’incidente di sicurezza che aveva coinvolto Hugging Face.

La società precisa che si tratta di un numero molto limitato rispetto alla quantità complessiva di dati analizzati e che la grande maggioranza delle informazioni coinvolte nell’indagine non proveniva direttamente dagli utenti. Il punto più delicato riguarda però la capacità degli agenti di utilizzare servizi esterni in modo non previsto, trasferendo dati al di fuori dell’ambiente nel quale erano stati elaborati.

OpenAI ha spiegato che i casi sono emersi nei propri ambienti di ricerca durante attività di addestramento e valutazione. Gli agenti, in determinate circostanze, hanno trasmesso dati a servizi di terze parti. Secondo l’azienda, questo comportamento non era appropriato e si è verificato prima dell’introduzione delle nuove misure di sicurezza sviluppate proprio in seguito all’indagine.

L’episodio mette in evidenza una differenza sostanziale tra un modello linguistico tradizionale e un agente AI. Un chatbot che genera una risposta rimane generalmente confinato all’interazione con l’utente e alle informazioni che gli vengono fornite. Un agente, invece, può essere autorizzato a utilizzare strumenti esterni, consultare servizi, creare file o compiere azioni attraverso API e applicazioni collegate.

Questa maggiore autonomia introduce una superficie d’attacco diversa. Un comportamento imprevisto del modello può infatti trasformarsi in un’azione concreta su un sistema esterno, soprattutto quando l’agente dispone di strumenti sufficientemente ampi e di dati sensibili nel proprio contesto operativo. Nel caso analizzato da OpenAI, gli agenti hanno utilizzato servizi di hosting di immagini e hanno pubblicato le immagini come link non presenti in elenchi pubblici. L’azienda ha lavorato direttamente con i provider coinvolti per rimuovere gran parte dei contenuti e sta proseguendo le attività per eliminare quelli ancora presenti.

ai token

Crediti: Shutterstock

Il fatto che i collegamenti non fossero pubblicamente indicizzati riduce la probabilità di una diffusione casuale su larga scala, ma non cambia la natura dell’evento, ovvero che dati forniti dagli utenti sono usciti dal perimetro previsto e sono stati trasferiti a un servizio esterno. OpenAI ha inoltre chiarito quali categorie di dati non sono state coinvolte. Le informazioni che gli utenti o gli amministratori hanno escluso dall’utilizzo per l’addestramento non rientrano nei dati interessati dall’incidente.

Per gli account Enterprise e Business e per l’utilizzo delle API, i dati sono esclusi dall’addestramento salvo che un amministratore abbia esplicitamente abilitato tale possibilità. Per i dati che possono invece essere utilizzati per il training, OpenAI afferma di applicare ulteriori misure di protezione prima del loro inserimento nei dataset. Tra queste rientrano la separazione dei dati dalle informazioni dell’account e l’utilizzo di un sistema di filtraggio per oscurare elementi personali come nomi, recapiti e numeri di conto.

Il caso resta comunque significativo perché dimostra che la protezione dei dati non dipende esclusivamente dalle policy applicate al modello. Quando un sistema agentico può interagire autonomamente con servizi esterni, la sicurezza deve comprendere anche gli strumenti messi a disposizione dell’agente, i permessi concessi e le modalità con cui vengono controllate le azioni generate dal modello.

In risposta all’incidente, OpenAI ha dichiarato di aver modificato i propri processi di addestramento e valutazione. L’azienda sta introducendo ulteriori safety case, attività di sicurezza e red teaming specificamente orientate a impedire che un modello possa esfiltrare dati attraverso servizi esterni. È stato inoltre potenziato il monitoraggio del comportamento degli agenti, in modo da individuare più rapidamente eventuali deviazioni rispetto alle modalità operative previste, soprattutto negli scenari in cui il modello dispone di accesso a strumenti esterni.

L’indagine non è però conclusa. OpenAI sta infatti riesaminando l’attività degli agenti più datati, procedendo mese per mese a partire dall’incidente che aveva coinvolto Hugging Face. L’azienda avverte quindi che potrebbero emergere ulteriori casi durante questa analisi retrospettiva.