Nvidia dimezza la memoria alla workstation DGX Spark per tenere il prezzo sotto i 5.000 dollari

Indice dell'articolo
Nvidia ha presentato una versione della DGX Spark con 64 GB di memoria unificata, condivisa tra processore e GPU: la metà del modello originale.
L’annuncio arriva mentre il costo della memoria spinge verso l’alto i prezzi dell’hardware per l’intelligenza artificiale. La versione originale, annunciata a Gennaio 2025 con un costo attorno ai 3.000 dollari, lanciata ufficialmente a ottobre dell’anno scorso con un prezzo di 4.000, è arrivata ormai a sfiorare i 7.000 dollari oggi. Era quindi necessario fornire una versione di ingresso alla piattaforma con un cartellino del prezzo decisamente più basso, e l’unico modo per farlo oggi è quello di abbassare le specifiche per quanto riguarda la memoria RAM.
Il nuovo modello da 64 GB parte quindi da 4.999 dollari: mille dollari, il 25%, in più rispetto al prezzo di debutto della versione da 128 GB. Sarà in vendita dal 23 ottobre attraverso i produttori partner Acer, ASUS, Dell, Gigabyte, HP e MSI, mentre non sarà rilasciata una Founder Edition a marchio NVIDIA, come invece avviene per la versione da 128 GB.
Per quali usi basta la memoria ridotta
Nvidia dichiara che con 64 GB si possono eseguire in locale modelli fino a 100 miliardi di parametri, contro i 200 miliardi della versione da 128 GB, senza indicare una quantizzazione specifica, ma il conto è semplice: 100 miliardi di parametri a 4 bit occupano circa 50 GB. Il valore regge quindi solo con una quantizzazione spinta – la riduzione della precisione dei pesi del modello per contenerne l’ingombro – e lascia poco spazio a sistema operativo e contesti lunghi.
Le specifiche la rendono più adatta all’inferenza locale che al fine tuning, il training o la ricerca, ma potrebbe trovare uno spazio in un momento in cui la diffusione di agenti AI autonomi sta facendo aumentare i costi di inferenza in modi difficilmente prevedibili e solleva preoccupazioni per la governance dei dati aziendali che gli agenti potrebbero inviare autonomamente ai modelli AI in cloud. Per questi utilizzi, l’utilizzo di un modello su server locale – anche di prestazioni ridotte – può rappresentare una garanzia sulla prevedibilità dei costi e la compliance normativa.
Il cluster come alternativa, con un conto da fare
Per chi ha bisogno di più memoria, Nvidia propone di collegare due unità tramite le porte ConnectX-7 e un cavo QSFP. Secondo l’azienda, sommando la memoria dei due nodi si arriva a poter gestire modelli fino a 200 miliardi di parametri. Il nuovo Sync Cluster Assistant, funzione dell’app Nvidia Sync, rileva i sistemi collegati e configura la rete. Un’operazione che finora richiedeva interventi da riga di comando. L’hardware consente di collegare fino a quattro sistemi GB10, ma l’esempio con assistente descritto da Nvidia riguarda il caso di due unità.
In un test interno con Qwen 3.8 27B, due unità da 64 GB hanno ottenuto prestazioni fino a 1,7 volte superiori a quelle di un singolo sistema. Il vantaggio economico, inoltre, non è scontato: ai prezzi di partenza, due unità da 64 GB costano almeno 9.998 dollari, circa 3.000 in più di un singolo sistema da 128 GB a 6.950 dollari. Il confronto resta indicativo, perché i prezzi finali dipendono dai produttori.