OpenAI risponde ad Anthropic con GPT-6 Sol e Luna: prezzi API tagliati del 50%

OpenAI amplia la famiglia GPT-6 con GPT-6 Sol e GPT-6 Luna, due modelli sviluppati con l’obiettivo piuttosto evidente di ridurre il costo dell’intelligenza artificiale nei workload ad alto volume senza rinunciare alle capacità necessarie per coding, automazione e sistemi agentici. I due modelli derivano dalla stessa impostazione tecnologica alla base di GPT-6 Astra, ma sono stati ottimizzati per occupare fasce differenti per prestazioni, frequenza d’uso e costo.
La differenza tra Sol e Luna è infatti soprattutto nella destinazione d’uso. GPT-6 Sol è pensato per attività ricorrenti di sviluppo software, agenti IA e workflow nei quali il modello deve ragionare, utilizzare strumenti e portare a termine sequenze di operazioni. GPT-6 Luna si colloca invece nella fascia ad altissimo volume, con un prezzo estremamente contenuto e un orientamento verso attività come classificazione, estrazione di informazioni, sintesi e altre elaborazioni ripetitive.
Il nuovo listino rappresenta uno degli elementi più interessanti dell’annuncio. Sol costa 2 dollari per milione di token in ingresso e 10 dollari per milione in uscita, valori dimezzati rispetto ai precedenti GPT-5.6 con lo stesso posizionamento. Luna spinge molto più in basso il costo dell’inferenza: 0,10 dollari per milione di token in input e 0,50 dollari per milione in output.
Luna porta l’inferenza a costi molto più bassi
Il prezzo di GPT-6 Luna è particolarmente significativo se rapportato agli scenari in cui un’azienda deve elaborare grandi quantità di dati. Quando un modello viene utilizzato per milioni di richieste relativamente semplici, il costo per singola interazione può diventare un fattore determinante nella progettazione dell’applicazione.
OpenAI posiziona quindi Luna come modello adatto a operazioni nelle quali non è necessario utilizzare costantemente il modello più potente disponibile. Un sistema aziendale potrebbe, per esempio, impiegare un modello più sofisticato per le attività che richiedono ragionamento complesso e affidare a Luna la pre-elaborazione di documenti, l’estrazione di campi, la sintesi di grandi quantità di testo o la classificazione automatica delle informazioni.
La strategia è coerente con una tendenza sempre più evidente nel mercato dell’IA, che vede l’utilizzo di modelli diversi all’interno dello stesso workflow invece di affidare ogni richiesta alla variante più costosa. Ecco perché in simili scenari il prezzo per milione di token diventa una componente architetturale del sistema.
Sol punta su coding e agenti
GPT-6 Sol è invece orientato verso compiti nei quali il modello deve mantenere il contesto, interagire con strumenti esterni e completare una sequenza di operazioni. OpenAI riporta un risultato del 33,2% su AutomationBench, con un costo medio indicato in 0,27 dollari per attività, mentre nel benchmark DeepSWE v1.1, dedicato alle capacità di software engineering, il modello raggiunge il 68,8%. GPT-6 Luna arriva a sua volta al 66,6% nello stesso test, mostrando come anche il modello più economico possa affrontare attività di programmazione relativamente articolate.
Secondo OpenAI, Sol commette circa la metà degli errori rispetto al proprio predecessore. Per un agente software la riduzione degli errori ha un valore significativo, dal momento che un errore può obbligare il sistema a ripetere una procedura, effettuare nuove chiamate agli strumenti e consumare ulteriori token. Una maggiore precisione può quindi tradursi direttamente in una riduzione del costo operativo.
I benchmark pubblicati da OpenAI devono però essere letti considerando i modelli di riferimento utilizzati nei test. Le comparazioni dell’azienda vengono effettuate con GPT-5.6 e con modelli Claude, ma non costituiscono un test diretto e indipendente tra GPT-6 Sol, GPT-6 Luna e il nuovissimo Claude Opus 5.5.
La cache costa il 90% in meno
Un’altra modifica importante riguarda gli input memorizzati nella cache. OpenAI ha ridotto del 90% il prezzo della lettura dei token cached, una scelta particolarmente interessante per gli agenti che lavorano ripetutamente sullo stesso contesto.
Nei workflow software, per esempio, un agente può dover consultare più volte una grande base di codice, documentazione tecnica o una serie di istruzioni di progetto. Se il sistema può riutilizzare efficacemente una parte del contesto già elaborato, diminuisce la quantità di dati che deve essere trattata nuovamente come input a prezzo pieno.
OpenAI sostiene inoltre di aver migliorato i tassi di cache hit e di aver reso più flessibile la gestione del contesto negli agenti di coding. Questi possono modificare il livello di ragionamento e gli strumenti disponibili senza necessariamente compromettere la cache. La conseguenza è una gestione più efficiente dei workflow nei quali le richieste al modello cambiano progressivamente durante l’esecuzione di un’attività.
Risposte più sintetiche e maggiore efficienza
L’ottimizzazione non riguarda esclusivamente i prezzi. OpenAI afferma che sia Sol sia Luna producono risposte più brevi, con meno gergo tecnico e una riduzione delle informazioni considerate a basso valore. La combinazione tra risposte più compatte, maggiore utilizzo della cache e prezzi inferiori può quindi modificare significativamente l’economia delle applicazioni basate su IA. Per le aziende che gestiscono grandi volumi di richieste, il costo complessivo dipende infatti dall’interazione tra prezzo dei token, numero di chiamate, lunghezza del contesto e quantità di tentativi necessari per completare correttamente un’attività.
I due nuovi modelli sono integrati in ChatGPT Work e Codex per gli abbonamenti Plus, Pro, Business, Enterprise ed Edu. Luna è disponibile anche per gli utenti Free e Go nell’app desktop, mentre al momento del lancio nessuno dei due modelli è stato portato nell’interfaccia principale della chat di ChatGPT.


