Nvidia lancia la Open Agent Safety Platform, un mix di difese hardware e software contro agenti ribelli

Il problema odierno degli agenti IA è stabilire quanto possano essere lasciati liberi di agire. Un agente capace di scrivere codice, utilizzare strumenti, consultare database e modificare file può infatti diventare estremamente potente (e pericoloso) quando lavora senza supervisione continua. Ed è proprio qui che NVIDIA ha deciso di intervenire con la Open Agent Safety Platform, progettata per introdurre un livello di controllo esterno al modello e al suo ambiente applicativo.
L’idea è interessante perché se un agente entra in una situazione nella quale deve aggirare una restrizione per completare il proprio compito, non è possibile affidare a quello stesso agente il compito di controllare se stesso. NVIDIA parla di diversi episodi recenti nei quali sistemi agentici sono riusciti a superare i meccanismi di sicurezza presenti a livello applicativo. In questi casi il problema non sarebbe stato necessariamente un malfunzionamento del modello, quanto la possibilità di sfruttare gli strumenti messi a sua disposizione oltre i confini inizialmente previsti.
La piattaforma NVIDIA prova quindi a spostare il controllo fuori dal processo dell’agente, seguendo una logica molto vicina a quella adottata da anni nella sicurezza informatica con sandbox, hypervisor e sistemi di isolamento. Il primo componente è OpenShell, runtime open source che esegue ciascun agente all’interno di una sandbox isolata e applica le politiche stabilite dall’operatore.
In pratica, l’organizzazione può stabilire quali file siano accessibili, quali reti possano essere raggiunte, quali strumenti possano essere utilizzati e quali credenziali siano disponibili. OpenShell verifica queste autorizzazioni e le applica durante l’esecuzione, mantenendo i controlli al di fuori del processo dell’agente. Il sistema include inoltre un meccanismo di verifica formale delle policy, pensato per controllare preventivamente che le regole definite non introducano percorsi di accesso indesiderati.
OpenShell è disponibile come software open source e, pur essendo ottimizzato per le CPU NVIDIA Vera, è stato concepito per poter funzionare anche su piattaforme di terze parti basate su architetture Arm e Intel. Ciò evita, almeno sul piano del software, di trasformare immediatamente questa proposta in un sistema esclusivamente legato all’hardware NVIDIA.
Il secondo livello è rappresentato da NVIDIA Sentry, un “watchdog” progettato per funzionare sulle DPU BlueField-4, quindi su un componente hardware separato dal sistema nel quale gira l’agente. La DPU osserva il comportamento dell’agente dall’esterno e può intervenire quando rileva un tentativo di superare i confini stabiliti, arrivando a mettere in quarantena e bloccare l’agente in pochi millisecondi.
È questa separazione a rendere l’architettura interessante dal punto di vista della sicurezza. Se il controllo fosse implementato esclusivamente nel software che l’agente può potenzialmente influenzare, esisterebbe sempre un punto di attacco. Sentry introduce invece un livello out-of-band isolato dal workload, che utilizza l’architettura NVIDIA DOCA per controllare richieste, identità, accessi a dati, strumenti, API e servizi.
Open Agent Safety Platform ha già raccolto l’adesione di numerosi protagonisti dell’industria tra cui Anthropic, Microsoft, SAP, JPMorganChase, Salesforce, Scale AI, ServiceNow, Red Hat, Cisco e SpaceXAI. Anthropic sta integrando OpenShell e BlueField con Claude Managed Agents, mentre Salesforce ha collegato OpenShell a Slack per consentire ai team di approvare o respingere richieste di accesso aggiuntive da parte degli agenti.


