Fonte primariaIAArticolo··5 min di lettura

GPT-6.1 Sol: quasi Astra, a un quinto del prezzo

OpenAI aggiorna il suo modello di fascia media e promette le prestazioni del top di gamma su codice, agenti e lavoro professionale, con una fattura divisa per cinque.

GPT-6.1 Sol: quasi Astra, a un quinto del prezzo
Fonte : OpenAI · OpenAIVedi l'originale ↗

In breve

OpenAI lancia GPT-6.1 Sol, un aggiornamento di GPT-6 Sol che si avvicina a GPT-6 Astra su codice agentico, uso del computer e compiti professionali, a un quinto del suo prezzo API. La cache di input scende a 0,10 $ per milione di token, un segnale chiaro rivolto agli sviluppatori di agenti che riutilizzano molto contesto.

🍺 Versione da bancone

OpenAI ha due modelli: quello molto caro che sa fare tutto, e quello meno caro che sa fare quasi tutto. Ora il meno caro ha raggiunto il molto caro su quasi tutto, tranne la ricerca scientifica di punta, per cinque volte meno. È come scoprire che il vino della casa vale il gran cru, con l'etichetta scritta dal ristorante stesso. Se i numeri reggono fuori dal laboratorio, far girare agenti tutto il giorno smette di essere un lusso.

Da ricordare

  1. 1

    GPT-6.1 Sol costa 2 $ per milione di token in input, 0,10 $ in input cached e 10 $ in output, cioè un quinto delle tariffe standard di GPT-6 Astra.

  2. 2

    La cache di input costa il 95% in meno dell'input standard e il 50% in meno rispetto a quella di GPT-6 Sol, un vantaggio pensato per gli agenti che riutilizzano il loro contesto.

  3. 3

    Su DeepSWE v1.1, eguaglia GPT-6 Astra per circa un quinto del costo e supera GPT-6 Sol di 6,4 punti.

  4. 4

    Su Terminal-Bench Science 0.1, costa 5,47 $ per task in media contro 23,21 $ di Opus 5.5 e 23,80 $ di Astra, che resta in testa con 68,1%.

  5. 5

    Su OSWorld 2.0, guadagna 7 punti su GPT-6 Sol e si posiziona a 2,1 punti da Astra per circa un settimo del costo per task.

  6. 6

    Il tasso di risposte contenenti un errore fattuale scende dall'11,4% al 7,7% con sforzo di ragionamento basso, cioè circa il 32% di errori in meno.

  7. 7

    Disponibile da subito in ChatGPT Work e Codex per i piani Plus, Pro, Business, Enterprise ed Edu, oltre che via API (gpt-6.1-sol), ma non ancora in Chat.

La fascia media che punta in alto

GPT-6.1 Sol è un aggiornamento di GPT-6 Sol, il modello intermedio di OpenAI. La sua promessa sta in una riga: un'intelligenza «vicina ad Astra» su codice agentico, uso del computer e lavoro professionale, per un quinto delle tariffe standard di Astra sia in input che in output.

OpenAI presenta il modello come un nuovo equilibrio tra capacità e costo per il lavoro quotidiano: scrivere e debuggare codice, comprendere documenti, eseguire workflow aziendali su più fasi. Il confronto avviene tanto con il fratello maggiore Astra quanto con la concorrenza, in particolare Opus 5.5.

Codice e lavoro professionale: i numeri messi in evidenza

Su DeepSWE v1.1, che valuta task di ingegneria software su basi di codice reali, GPT-6.1 Sol eguaglia Astra per circa un quinto del costo. Supera anche il miglior punteggio di GPT-6 Sol di 6,4 punti, con sforzo di ragionamento e costo inferiori.

Su GDP.pdf, che misura l'accuratezza delle risposte a domande professionali su PDF complessi (tabelle, grafici, schemi, caratteri piccoli) in finanza, sanità, diritto e altri sette settori, supera Opus 5.5 con fallback per meno della metà del costo per task.

Su AutomationBench 1.0.6, che testa workflow completi con 47 strumenti (vendite, marketing, operazioni, supporto, finanza, HR), supera Opus 5.5 di 2,2 punti a sforzo medio, per circa un terzo del costo, e guadagna 4,8 punti su GPT-6 Sol. OpenAI precisa che il costo mostrato per Claude Fable 5.1 è sottostimato perché omette i fallback, verificatisi in circa il 40% dei task.

Uso del computer e scienza

Sul set offline di OSWorld 2.0, che valuta workflow lunghi di utilizzo di applicazioni, GPT-6.1 Sol guadagna 7 punti su GPT-6 Sol a sforzo massimo, per meno della metà del costo. Si posiziona a 2,1 punti da Astra per circa un settimo del costo per task.

Su Terminal-Bench Science 0.1 (analisi dati, simulazione, dimostrazione di teoremi), più che raddoppia il punteggio di GPT-6 Sol. A sforzo massimo, costa 5,47 $ per task, contro 23,21 $ di Opus 5.5 e 23,80 $ di Astra, cioè oltre il 75% di risparmio.

OpenAI pone comunque un limite: Astra resta il miglior modello testato su questo benchmark, con 68,1%, e va privilegiato per i task di ricerca scientifica più difficili.

Fattualità e allineamento

La fattualità viene misurata su conversazioni ChatGPT anonimizzate in cui gli utenti avevano segnalato un errore di un modello precedente. A sforzo basso, la quota di risposte errate scende dall'11,4% al 7,7%. Su tutte le impostazioni, il divario con Astra resta inferiore a 1,9 punti, per meno di un quinto del costo.

OpenAI sottolinea che questi prompt, volutamente difficili, non riflettono l'uso comune. Sul fronte allineamento, il modello sarebbe più trasparente riguardo ai propri limiti (ad esempio davanti a uno strumento di ricerca guasto), più rispettoso delle restrizioni esplicite e meno incline a produrre risultati non autorizzati in modalità agente. Non è stato osservato alcun tentativo di aggirare il revisore di sicurezza automatizzato, come già per Astra e GPT-6 Sol. I dettagli sono riportati in un addendum alla system card.

Prezzo e disponibilità

Il modello è disponibile da oggi per gli utenti Plus, Pro, Business, Enterprise ed Edu in ChatGPT Work e Codex, ma non ancora in Chat. Gli sviluppatori vi accedono via API con il nome gpt-6.1-sol.

Le tariffe: 2 $ per milione di token in input, 0,10 $ in input cached, 10 $ in output. Nei prossimi giorni, OpenAI proporrà anche GPT-6.1 Sol Ultrafast in Codex, con una generazione di token fino a 8 volte più veloce rispetto alla velocità standard.

“Near-Astra intelligence for a fifth of the price”
“GPT‑6 Astra still achieves the highest score among the models tested at 68.1%, and should be used for the most difficult scientific research tasks.”
“We observed no attempts to bypass an automated safety reviewer, matching GPT‑6 Astra and GPT‑6 Sol.”

Perché conta

L'annuncio dice meno «ecco un modello più intelligente» che «ecco l'intelligenza di ieri a una frazione del prezzo». È il vero terreno di gioco del 2026: gli agenti consumano enormi quantità di token, rileggono continuamente lo stesso contesto, e la loro sostenibilità economica dipende dal costo per task più che dal punteggio grezzo. La cache a 0,10 $ per milione e la comunicazione sistematica in costo per task lo dimostrano. Bisogna però leggere questi numeri con prudenza. Tutti i risultati sono pubblicati da OpenAI, spesso a livelli di sforzo di ragionamento scelti per ciascun benchmark. Alcuni test (GDP.pdf, AutomationBench) sono poco noti. E i confronti di costo con i concorrenti dipendono da convenzioni discutibili, come riconosce la nota sui fallback di Claude Fable 5.1. Infine, il fatto che Astra mantenga il primato in ambito scientifico e che Sol non sia ancora in Chat indica una segmentazione voluta: Sol per il lavoro in volume, Astra per i task più difficili. Per i team che fanno girare agenti in produzione, è la buona notizia del trimestre, a condizione di rifare le misurazioni sui propri task.

#openai#llm#agenti#api#codex#benchmark
Fonte originale
Introducing GPT-6.1 Sol
OpenAI
Apri l'articolo ↗

Per te

Falla lavorare sulle tue fonti.

Gratis: gli articoli della settimana e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.

Per il tuo team

La stessa macchina, sui vostri temi.

Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.

Da leggere anche