GPT-6 Sol e Luna: OpenAI dimezza i prezzi dell'API
Dopo Astra, OpenAI declina la nuova generazione in due modelli più economici e attacca frontalmente Claude sul rapporto costo/intelligenza.

In breve
OpenAI completa la famiglia GPT-6 con Sol e Luna, due modelli addestrati con gli stessi metodi di Astra ma ottimizzati per il costo, con prezzi API ridotti del 50% rispetto alla tariffa promozionale di GPT-5.6. L'annuncio è pieno di confronti numerici con Claude Opus 5 e Fable 5.1, dove Sol raggiunge punteggi equivalenti o superiori spendendo dall'80 al 90% in meno per task. Si aggiunge un grosso lavoro sul prompt caching per gli agenti e una disponibilità immediata in ChatGPT Work, Codex e l'API.
🍺 Versione da bancone
Conosci la solita dinamica: il modello top di gamma esce per primo per impressionare, le versioni economiche arrivano tre settimane dopo per incassare. Sol e Luna sono i GPT-6 che costano la metà e che, sui benchmark casalinghi di OpenAI, battono Claude Opus 5 al 9% del suo prezzo — un numero presentato con la calma di un venditore che ti dice che la promo finisce stasera. Il vero punto è qui: per gli agenti che girano in loop per ore, la bolletta conta quanto l'intelligenza. Quando un ricercatore OpenAI brucia 600 dollari di token al giorno in mediana, si capisce perché il prezzo diventi improvvisamente una caratteristica di prodotto.
Da ricordare
- 1
OpenAI estende la famiglia GPT-6 con Sol e Luna, addestrati con metodi simili ad Astra ma posizionati sull'efficienza di costo.
- 2
I prezzi API scendono del 50% rispetto alla tariffa promozionale GPT-5.6: Sol passa a 2$ / 10$ per milione di token (input / output), Luna a 0,10$ / 0,50$.
- 3
Su AutomationBench 1.0.6, Sol in modalità xhigh ottiene il 33,2% a 0,27$ per task, contro il 26,9% di Claude Opus 5 in modalità max, cioè 11,1 volte più costoso.
- 4
Su DeepSWE v1.1, Sol in max raggiunge il 68,8%, a 1,1 punti dal miglior punteggio di Claude Fable 5 nella valutazione, per circa l'80% in meno per task.
- 5
L'affidabilità fattuale migliora: Sol commette circa la metà degli errori del suo predecessore sulla valutazione interna costruita da conversazioni reali segnalate dagli utenti.
- 6
Il prompt caching viene rilavorato: migliori tassi di hit di default, 90% di sconto sui token di input in cache, dashboard e strumento diagnostico, e cambi di effort o di tool senza rompere la cache.
- 7
Disponibili da oggi in ChatGPT Work e Codex per Plus, Pro, Business, Enterprise ed Edu; Luna arriva anche per gli account Free e Go nell'app desktop, e l'API espone gpt-6-sol e gpt-6-luna.
Una famiglia a tre livelli
Astra resta, nel discorso di OpenAI, il vertice: il modello più intelligente e più allineato, quello da scegliere quando non si vuole alcun compromesso. Sol e Luna non pretendono di sostituirlo, ma di occupare i due livelli sottostanti, dove si svolge la maggior parte del lavoro quotidiano.
L'argomento centrale non è "più intelligente" ma "stessa generazione, meno costoso". OpenAI afferma di aver addestrato Sol e Luna con metodi simili ad Astra, trasferendo i suoi progressi in lavoro professionale, factualità, codice, uso del computer e allineamento verso modelli più veloci.
Il vocabolario usato è rivelatore: l'azienda parla di "far avanzare la frontiera sull'efficienza di costo". La competizione non si gioca più solo sul punteggio massimo raggiungibile, ma sulla posizione occupata lungo la curva costo/intelligenza.
La guerra dei prezzi per task
Il calo tariffario è netto: 2$ in input e 10$ in output per milione di token per Sol, 0,10$ e 0,50$ per Luna, cioè metà della tariffa promozionale dei corrispondenti GPT-5.6. OpenAI attribuisce questo margine a guadagni infrastrutturali sul caching e l'inferenza, riversati sui clienti.
Ma la metrica messa in evidenza ovunque nel post non è il prezzo del token: è il costo per task. Su AutomationBench, un test di workflow aziendali che mobilita 47 strumenti in vendite, marketing, operations, supporto, finanza e HR, Sol in modalità xhigh segna il 33,2% a 0,27$ per task, contro il 26,9% di Claude Opus 5 in max per 11,1 volte quel costo.
OpenAI arriva a notare che il punteggio di Claude Fable 5.1 sottostima il costo reale, poiché omette i fallback di emergenza verso Opus 5, avvenuti in circa il 40% dei task. Siamo nel confronto competitivo dichiarato, con il livello di dettaglio metodologico che ne consegue — e il solito avviso che i punteggi concorrenti provengono da report pubblici.
Dettaglio pungente: Sol in xhigh supera anche Astra in modalità low (33,2% contro 30,3%), a quasi quattro volte meno costo. La gerarchia dei modelli non è più lineare, dipende dal livello di effort scelto.
Codice, factualità, uso del computer
Sul codice, OpenAI giustifica la sua logica con i propri numeri interni: valorizzato ai prezzi dell'API, il consumo giornaliero di token supera i 600$ per il ricercatore mediano e i 7.000$ al 90° percentile. Quando gli agenti di codice lavorano a lungo, il costo d'uso sostenuto diventa il vincolo principale.
I risultati seguono questa logica: su DeepSWE v1.1, Sol in max raggiunge il 68,8%, a 1,1 punti dal miglior punteggio di Claude Fable 5 nella valutazione, per circa l'80% in meno per task. Luna in max ottiene il 66,6%, paragonabile a Opus 5 e Fable 5 in modalità medium, ma il 93% e il 96% più economico rispettivamente.
Sul fronte factualità, OpenAI valuta i suoi modelli su conversazioni ChatGPT de-identificate in cui gli utenti avevano segnalato un errore. Sol commette qui circa la metà degli errori del suo predecessore; Luna a effort elevato eguaglia GPT-5.6 Sol per circa un centesimo del suo costo. L'azienda precisa che queste conversazioni, scelte perché inducono errori, non riflettono l'uso tipico.
Sull'uso del computer, Astra resta presentato come il miglior modello al mondo. Sol in xhigh ottiene il 60,5% su OSWorld 2.0 offline, alla pari con Opus 5 in medium (60,3%), per circa l'80% in meno di costo per task.
Il caching, arma discreta degli agenti
La parte meno spettacolare del post è forse la più strutturante. OpenAI annuncia migliori tassi di cache hit di default su GPT-6, con uno sconto del 90% sulla lettura dei token di input in cache — una leva decisiva quando un agente reinietta lo stesso contesto a ogni turno.
Tre novità attrezzano gli sviluppatori: un Prompt Caching Dashboard per seguire la quota di input messa in cache, uno strumento diagnostico che spiega le occasioni mancate, e breakpoint espliciti per scegliere dove si ferma il prefisso in cache. Soprattutto, modificare l'effort di ragionamento o attivare/disattivare tool non rompe più la cache.
La prova sociale viene da GitHub: negli ultimi mesi, questi miglioramenti avrebbero ridotto di oltre il 50% la quota di token di prompt che richiede un trattamento fresco, su miliardi di richieste, accelerando le risposte di Copilot.
Stile, allineamento e disponibilità
OpenAI ha anche trasferito a Sol e Luna lo stile di comunicazione di Astra: più chiarezza, meno gergo, meno giri di parole strani, meno dettagli a basso valore, e risposte leggermente più brevi. L'azienda illustra il suo punto con un esempio di prompt front-end React, spiegando perché preferisce la risposta di GPT-6 Sol — più esplicita su cosa è stato verificato o meno, meno prolissa sui propri strumenti.
Sull'allineamento, entrambi i modelli migliorano rispetto ai loro equivalenti GPT-5.6, in particolare sul tasso di affermazioni ingannevoli riguardo al proprio lavoro di codice. OpenAI ricorda che queste valutazioni testano deliberatamente situazioni difficili e non misurano tassi di fallimento nell'uso normale; la system card contiene i risultati completi.
Il rilascio è immediato ma parziale: ChatGPT Work e Codex per Plus, Pro, Business, Enterprise ed Edu, Luna nell'app desktop per Free e Go. I modelli non sono ancora disponibili in Chat, e il rollout si estende nell'arco della giornata per preservare la stabilità del servizio.
“GPT-6 Astra continues to be our best model across the board.”
“GPT-6 Sol at xhigh effort outperforms Claude Opus 5 at max effort at just 9% of Opus 5's cost per task.”
“Daily token usage has exceeded $600 for the median researcher and $7,000 for researchers at the 90th percentile.”
Perché conta
Questo annuncio dice meno sullo stato dell'arte che sullo stato del mercato. Declinando GPT-6 in tre livelli e dimezzando i prezzi, OpenAI riconosce che la battaglia non si vince più al vertice dei benchmark ma sul costo per task riuscito — l'unica metrica che conta quando gli agenti girano in continuo. La scelta di confrontare sistematicamente Sol e Luna con Claude Opus 5 e Fable 5.1, insistendo su rapporti del 9% o del 4% del costo concorrente, è un attacco diretto sul terreno dove Anthropic si è insediata, quello degli agenti di codice in azienda. Resta la prudenza d'uso: questi numeri provengono da valutazioni condotte da OpenAI nel proprio ambiente di ricerca, i punteggi concorrenti sono ripresi da report pubblici, e i livelli di effort confrontati non sono sempre identici — un modello in "xhigh" contro un concorrente in "medium" non è una parità neutra. Il segnale più solido è altrove: nel lavoro sul caching e nell'ammissione che, anche internamente, la bolletta dei token è diventata un problema di gestione.
Per i team
La stessa macchina, sui vostri temi.
Le vostre fonti, il vostro team, ogni mattina, nella vostra lingua. Pilota aperto a tre aziende.
Da leggere anche
#anthropicOggiClaude Opus 5.5: più potente, il 40% più economico da eseguire
Anthropic lancia il suo primo modello dopo l'appello a «rallentare la frontiera» — e mette l'efficienza al centro del discorso.
Fonte · Anthropic · Introducing Claude Opus 5.5

Jev: il modello progettato per essere chiamato dal codice, non dagli umani
Diogo Almeida, ex OpenAI, spiega perché ha creato una nuova classe di modelli "system one" — e perché rifiuta i benchmark pubblici, i rifiuti e il pre-training.
Fonte · Latent Space · Why We Made Jev — Diogo Almeida, TypeSafe Co-founder & CEO

99% o 0%: quattro esperti scommettono sulla fine del mondo
Steven Bartlett fa scrivere a quattro esperti la loro probabilità di estinzione su una busta. Le risposte vanno dal 99% allo zero, e il dibattito che segue è il più utile che abbiamo sentito sull'argomento.
Fonte · The Diary Of A CEO · AI Emergency: The AI Labs Are Lying To Everyone, He Says 99% Chance Of Extinction | Roman Yampolskiy