OpenAI cancella il rilascio di GPT-6.1 Astra dopo test di sicurezza falliti

OpenAI ha deciso di non rilasciare GPT-6.1 Astra a ottobre dopo aver stabilito che non rispettava gli standard di sicurezza richiesti dall’azienda. La decisione è stata confermata da OpenAI alla vigilia della conferenza annuale dedicata agli sviluppatori, trasformando quello che avrebbe dovuto essere un nuovo tassello nell’evoluzione della famiglia GPT-6 in un caso significativo sul rapporto tra velocità di sviluppo e affidabilità dei modelli avanzati.
Scendendo più nel dettaglio, OpenAI ha valutato GPT-6.1 Astra soprattutto su due aspetti nei quali il modello, rispetto a GPT-6 Astra, avrebbe mostrato una regressione: trasparenza sulle proprie azioni e rispetto del perimetro di autorizzazione. In pratica, i test cercavano di capire se Astra eseguisse soltanto ciò che gli era stato richiesto e autorizzato oppure se, incontrando ostacoli, cercasse di aggirarli o proseguisse autonomamente.
Il primo problema riguarda quello che OpenAI definisce, in sostanza, deception, cioè un comportamento non sufficientemente trasparente. Dai test è emerso che GPT-6.1 Astra non era sempre accurato nel comunicare all’utente quali azioni avesse effettivamente eseguito e quali invece non avesse compiuto. Non significa necessariamente che il modello “mentisse” deliberatamente nel senso umano del termine, ma che c’è un potenziale problema di corrispondenza tra ciò che il modello dichiara di aver fatto e ciò che ha realmente fatto.
Il secondo elemento è la cosiddetta scope authorization. Nei test Astra tendeva in alcuni casi a portare avanti un’attività senza chiedere nuovamente il permesso all’utente, arrivando anche a utilizzare strumenti o servizi esterni quando ciò poteva comportare rischi. È esattamente il tipo di comportamento che diventa problematico quando un modello può navigare sul Web, eseguire codice, accedere a sistemi aziendali o interagire con API.
OpenAI ha inoltre effettuato test estremamente aggressivi sulle capacità cyber di Astra. In uno scenario di ricerca di vulnerabilità, il modello doveva individuare falle precedentemente sconosciute e sviluppare exploit funzionanti con pochissimo intervento umano. In una prova browser, Astra ha individuato vulnerabilità sconosciute e costruito una catena di exploit capace di ottenere esecuzione di codice al di fuori della sandbox; in un altro test ha individuato vulnerabilità in una configurazione di sistema operativo protetta e sviluppato un exploit per l’escalation dei privilegi.
La scelta arriva in un momento in cui la sicurezza dell’IA generativa è sottoposta a un’attenzione crescente. Lo stesso Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, ha ribadito che l’azienda considera particolarmente elevata la soglia richiesta prima di mettere un modello a disposizione degli utenti.
La vicenda di GPT-6.1 Astra porta nuovamente al centro il tema dell’AI alignment, ovvero l’insieme di tecniche e procedure utilizzate per fare in modo che il comportamento di un modello rimanga coerente con gli obiettivi, i valori e i limiti stabiliti dagli sviluppatori.
Secondo Jain, sicurezza e capacità operativa devono essere bilanciate con attenzione. Un modello eccessivamente vincolato può diventare poco efficace nell’esecuzione dei compiti, mentre un sistema progettato per perseguire un obiettivo con troppa autonomia può adottare comportamenti indesiderati quando incontra difficoltà. La sfida consiste quindi nel definire il punto in cui il modello rimane sufficientemente efficace senza oltrepassare il perimetro previsto.
Il blocco di GPT-6.1 Astra non coincide però con un rallentamento generale della roadmap di OpenAI. A inizio mese l’azienda aveva presentato GPT-6 Astra, definendolo il risultato di anni di ricerca e di importanti investimenti tecnologici. Sam Altman aveva descritto il modello come un salto verso un nuovo livello di capacità, associandolo a possibili ricadute sull’imprenditoria, sulla creatività, sulla crescita economica e sulla ricerca scientifica.
La settimana successiva OpenAI ha inoltre ampliato la famiglia GPT-6 con GPT-6 Sol e GPT-6 Luna, mentre l’azienda ha confermato di avere ulteriori modelli in fase di sviluppo. Il caso Astra mostra quindi una situazione più complessa di un semplice stop allo sviluppo. OpenAI continua a lavorare sull’incremento delle capacità dei propri sistemi, ma sembra voler mantenere una distinzione più netta tra un modello tecnicamente pronto e uno effettivamente idoneo alla distribuzione.

