Claude Sonnet 5.5: Anthropic avvicina il suo modello di fascia media a Opus
Stesso prezzo di Sonnet 5, 30% più veloce, fino al 30% più economico per task, e punteggi che sfiorano quelli di Opus 5.5 su diversi benchmark.

In breve
Anthropic lancia Claude Sonnet 5.5, secondo modello della famiglia Claude 5.5, pensato come complemento rapido ed economico di Opus 5.5. Il prezzo non cambia (2$ / 10$ per milione di token), ma il modello consuma meno token e fa un balzo spettacolare nell'agentic coding. Le sue capacità cyber sono abbastanza elevate da farne il primo Sonnet dotato di garde-fou degni dei modelli di fascia alta.
🍺 Versione da bancone
Anthropic ha preso il suo modello di fascia media, lo ha fatto correre più veloce, gli ha chiesto di mangiare meno, e ha tenuto lo stesso prezzo sull'etichetta. Risultato: sulla maggior parte dei test, arriva a un soffio dal fratello maggiore Opus, che costa il doppio. Ha persino finito Pokémon Rosso guardando solo screenshot, il che lo rende il primo impiegato d'ufficio con una vera scusa per giocare durante il lavoro. La posta in gioco è che il livello "molto buono" diventa il livello "di default", e la domanda non è più se l'IA può fare il task, ma quanto costa affidarglielo.
Da ricordare
- 1
Sonnet 5.5 passa dal 10,3% al 70,6% su Terminal-Bench 4.0, un benchmark di agentic coding da riga di comando, superando persino Opus 5.5 (66,4%).
- 2
Su GDPval-AA, che misura il lavoro reale in 44 professioni, ottiene 1844 punti contro 1846 per Opus 5.5, 1449 per Sonnet 5 e 1487 per GPT-6 Sol.
- 3
Il prezzo resta di 2$ per milione di token in input e 10$ in output, cioè la metà di Opus 5.5, ma il costo per task scende fino al 30% grazie a una migliore efficienza.
- 4
La generazione è oltre il 30% più veloce rispetto a Sonnet 5, il che ne fa il Sonnet più rapido finora.
- 5
A effort Low o Medium, batte il miglior punteggio di Sonnet 5 su diversi benchmark per circa un decimo del costo per task.
- 6
È il primo Sonnet distribuito con garde-fou cyber (passaggio visibile a Sonnet 5 sulle richieste a rischio) e classificatori anti-distillazione.
- 7
Disponibile immediatamente su tutte le piattaforme, tra cui AWS, Google Cloud e Azure; Haiku 5.5 seguirà nelle prossime settimane.
Un Sonnet che si avvicina quasi al livello di Opus
Sonnet 5.5 viene presentato come il complemento più veloce ed economico di Opus 5.5. Anthropic ripartisce i ruoli chiaramente: Opus per il lavoro complesso che richiede giudizio sostenuto, Sonnet per i task quotidiani ben definiti, la correzione di bug e la produzione di documenti, slide e fogli di calcolo curati.
Sulla carta, il divario si restringe fortemente. In computer use (OSWorld 2.1), Sonnet 5.5 raggiunge l'80,1% contro l'81,8% di Opus 5.5. Su Humanity's Last Exam con strumenti, 64,5% contro 67,7%. Nel riconoscimento di grafici (Chartography), 61,6% contro 64,4%, laddove Sonnet 5 si fermava al 15,6%.
Anthropic stessa ridimensiona: i benchmark catturano solo una sfaccettatura delle capacità, e Opus 5.5 resta "chiaramente più forte" sul lavoro aperto e complesso, secondo i test sia interni che esterni.
Il codice, terreno del balzo più grande
È nella programmazione che il salto è più visibile. Su FrontierCode, a effort High, Sonnet 5.5 guadagna 10 punti rispetto a Sonnet 5 con la stessa impostazione, per circa un quindicesimo del costo per task. Su CursorBench, costruito a partire da vere sessioni Cursor, raggiunge il 55,5%, a due punti da Opus 5.5.
I tester hanno notato la sua rapidità nel comprendere una codebase e un'abitudine nuova: raggruppare maggiormente le chiamate agli strumenti, il che riduce il numero di passaggi e la fattura.
Presso Epic Games, il COO Daniel Vogel afferma che il modello ha raggiunto "la barra di qualità di un modello di fascia superiore" in un audit di design di sistema, gestendo decine di migliaia di righe di codice e task di diverse ore.
Lavoro d'ufficio e senso del design
Su GDPval-AA, che copre 44 professioni e nove grandi settori, Sonnet 5.5 è quasi alla pari con Opus 5.5 e supera Sonnet 5 di circa 400 punti. Viene anche presentato come il primo Sonnet ad aver finito Pokémon Rosso basandosi solo su screenshot, un test di lavoro su lunga durata e comprensione visiva.
Anthropic insiste su qualità meno misurabili: scrittura più chiara, miglior partner di conversazione, occhio per il design di interfaccia. In un test interno, il modello ha ricevuto i documenti trimestrali di un'azienda quotata e un modello di slide; due esperti hanno giudicato la sua revisione operativa di 10 slide pronta da inviare così com'era.
Presso Slack, senza cambiare i prompt, il modello ha fatto meglio di Sonnet 5 su quasi tutte le valutazioni dello Slackbot, con circa il 14% di token in output in meno.
Prezzo invariato, fattura in calo
La griglia resta quella di Sonnet 5: 2$ per milione di token in input, 10$ in output, 0,20$ per le letture della cache e 2,50$ per le scritture. Opus 5.5 costa il doppio su input, output e scritture della cache.
Il risparmio viene quindi dall'efficienza: meno token per lo stesso lavoro, da cui fino al 30% di costo in meno per task. Il livello di effort resta regolabile, di default su Medium in Claude Code e nelle app, su High sulla Claude Platform.
Garde-fou da modello di fascia alta
Sull'audit comportamentale automatizzato di circa 1.850 scenari, Sonnet 5.5 eguaglia o supera Sonnet 5 sulla maggior parte delle misure di allineamento e onestà. È persino il modello Anthropic meno incline a sondare i limiti del proprio container, senza segni di perseguimento di obiettivi contrari a quelli dell'utente.
Poiché le sue capacità cyber sono paragonabili a quelle di Opus 5, riceve protezioni simili a quelle di Opus 5.5: la correzione di bug comune non è toccata, ma i task cyber a rischio passano visibilmente a Sonnet 5. I difensori potranno richiedere un accesso esteso tramite il Cyber Verification Program.
Altra novità: classificatori contro la distillazione, quegli attacchi che usano migliaia di account falsi per estrarre le capacità di un modello, e un'estensione del "preserved thinking" che lega il ragionamento all'account che lo ha prodotto. Sul fronte migrazione, gli utenti senza thinking dovranno passare alla nuova impostazione between_tools.
“Sonnet 5.5 is strongest at well-scoped everyday tasks, fixing bugs, and creating polished documents, slides, and spreadsheets.”
“Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment.”
“It's the first Sonnet model to beat Pokémon Red working only from screenshots.”
Perché conta
Questo annuncio illustra una dinamica ormai classica ma sempre più brutale: il modello intermedio raggiunge la fascia alta della generazione attuale per metà del prezzo. Per le aziende che fanno girare agenti su larga scala, l'argomento decisivo non è il punteggio grezzo ma il costo per task riuscito, ed è proprio lì che Anthropic concentra il proprio discorso, con tanto di grafici costo/prestazioni a supporto. Vanno tuttavia fatte due riserve. Innanzitutto, tutti i numeri sono interni, su benchmark talvolta recenti, e il confronto con OpenAI è parziale (GPT-5.6 Sol sostituito a GPT-6 Sol su Terminal-Bench, in mancanza di dati pubblici). Inoltre, l'arrivo di garde-fou cyber e anti-distillazione su un modello "di tutti i giorni" mostra che il confine tra modello mainstream e modello sensibile si sta assottigliando: i passaggi visibili a Sonnet 5 e i falsi positivi in microbiologia dichiarati apertamente sono il prezzo di questa crescita di capacità, e un segnale che la sicurezza diventa una componente del prodotto, non solo una nota a piè di pagina.
Per te
Falla lavorare sulle tue fonti.
Gratis: gli articoli della settimana e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.
Per il tuo team
La stessa macchina, sui vostri temi.
Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.
Da leggere anche
#eticaOggiLeone XIV sull'IA: «Dormo la notte», ma Nvidia ci va giù pesante
Nell'aereo di ritorno dalla Francia, il papa giudica serie le allerte sui rischi catastrofici dell'IA e punta il dito sulla contraddizione del capo di Nvidia riguardo alla regolamentazione.
Fonte · Vatican News · Pope: Wars are senseless; Russia and Ukraine should sit down to talk
La Florida vuole mettere ChatGPT sotto tutela, citando OpenAI stessa
In una richiesta cautelare urgente, il procuratore generale della Florida ritorce contro OpenAI i suoi stessi allarmi sulla sicurezza ed esige il congelamento dello sviluppo di nuovi modelli senza validazione esterna.
Fonte · Florida Office of the Attorney General (myfloridalegal.com) · Plaintiff's Motion for Temporary Injunction — Office of the Attorney General, State of Florida v. OpenAI Global, LLC et al.

Obama sull'IA: «la tecnologia non è sopravvalutata», la regolamentazione sì
Davanti agli studenti di Colgate, Barack Obama dedica venti minuti all'IA, tra auto-apprendimento dei modelli, IPO di Anthropic e OpenAI e vuoto normativo a Washington.
Fonte · Forbes Breaking News · FULL EVENT: Former President Obama Discusses AI, Democracy At Colgate University