Source primaireIAArticle··5 min de lecture

Claude Sonnet 5.5 : Anthropic rapproche son modèle milieu de gamme d'Opus

Même prix que Sonnet 5, 30 % plus rapide, jusqu'à 30 % moins cher par tâche, et des scores qui frôlent ceux d'Opus 5.5 sur plusieurs benchmarks.

Claude Sonnet 5.5 : Anthropic rapproche son modèle milieu de gamme d'Opus
Source : Anthropic · anthropic.comVoir l'original ↗

En bref

Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5, pensé comme le complément rapide et économique d'Opus 5.5. Le tarif ne bouge pas (2 $ / 10 $ par million de tokens), mais le modèle consomme moins de tokens et fait un bond spectaculaire en agentic coding. Ses capacités cyber sont assez élevées pour qu'il soit le premier Sonnet livré avec des garde-fous dignes des modèles haut de gamme.

🍺 Version comptoir

Anthropic a pris son modèle de milieu de gamme, l'a fait courir plus vite, lui a demandé de manger moins, et a gardé le même prix sur l'étiquette. Résultat : sur la plupart des tests, il arrive à deux doigts du grand frère Opus, qui lui coûte deux fois plus cher. Il a même fini Pokémon Rouge en regardant uniquement des captures d'écran, ce qui fait de lui le premier employé de bureau à avoir une vraie excuse pour jouer pendant le travail. L'enjeu, c'est que le niveau « très bon » devient le niveau « par défaut », et que la question n'est plus de savoir si l'IA peut faire la tâche, mais combien ça coûte de la lui confier.

À retenir

  1. 1

    Sonnet 5.5 passe de 10,3 % à 70,6 % sur Terminal-Bench 4.0, un benchmark d'agentic coding en ligne de commande, et dépasse même Opus 5.5 (66,4 %).

  2. 2

    Sur GDPval-AA, qui mesure le travail réel dans 44 métiers, il obtient 1844 points contre 1846 pour Opus 5.5, 1449 pour Sonnet 5 et 1487 pour GPT-6 Sol.

  3. 3

    Le prix reste de 2 $ par million de tokens en entrée et 10 $ en sortie, soit moitié moins qu'Opus 5.5, mais le coût par tâche baisse jusqu'à 30 % grâce à une meilleure efficacité.

  4. 4

    La génération est plus de 30 % plus rapide que Sonnet 5, ce qui en fait le Sonnet le plus rapide à ce jour.

  5. 5

    À effort Low ou Medium, il bat le meilleur score de Sonnet 5 sur plusieurs benchmarks pour environ un dixième du coût par tâche.

  6. 6

    C'est le premier Sonnet déployé avec des garde-fous cyber (bascule visible vers Sonnet 5 sur les requêtes à risque) et des classifieurs anti-distillation.

  7. 7

    Disponible immédiatement sur toutes les plateformes, dont AWS, Google Cloud et Azure ; Haiku 5.5 suivra dans les prochaines semaines.

Un Sonnet qui grimpe presque au niveau d'Opus

Sonnet 5.5 est présenté comme le complément plus rapide et moins coûteux d'Opus 5.5. Anthropic répartit les rôles clairement : Opus pour le travail complexe qui demande du jugement soutenu, Sonnet pour les tâches quotidiennes bien cadrées, la correction de bugs et la production de documents, slides et tableurs soignés.

Sur le papier, l'écart se resserre fortement. En computer use (OSWorld 2.1), Sonnet 5.5 atteint 80,1 % contre 81,8 % pour Opus 5.5. Sur Humanity's Last Exam avec outils, 64,5 % contre 67,7 %. En reconnaissance de graphiques (Chartography), 61,6 % contre 64,4 %, là où Sonnet 5 plafonnait à 15,6 %.

Anthropic tempère lui-même : les benchmarks ne capturent qu'une facette des capacités, et Opus 5.5 reste « clairement plus fort » sur le travail ouvert et complexe, selon les tests internes comme externes.

Le code, terrain du plus gros bond

C'est en programmation que le saut est le plus visible. Sur FrontierCode, à effort High, Sonnet 5.5 gagne 10 points sur Sonnet 5 au même réglage, pour environ un quinzième du coût par tâche. Sur CursorBench, construit à partir de vraies sessions Cursor, il atteint 55,5 %, à deux points d'Opus 5.5.

Les testeurs ont noté sa rapidité à comprendre une codebase et une habitude nouvelle : regrouper davantage les appels d'outils, ce qui réduit le nombre d'étapes et la facture.

Chez Epic Games, le COO Daniel Vogel affirme que le modèle a atteint « la barre de qualité d'un modèle de gamme supérieure » sur un audit de design système, en gérant des dizaines de milliers de lignes de code et des tâches de plusieurs heures.

Travail de bureau et sens du design

Sur GDPval-AA, qui couvre 44 métiers et neuf grands secteurs, Sonnet 5.5 fait quasiment jeu égal avec Opus 5.5 et devance Sonnet 5 d'environ 400 points. Il est aussi présenté comme le premier Sonnet à avoir fini Pokémon Rouge uniquement à partir de captures d'écran, un test de travail sur longue durée et de compréhension visuelle.

Anthropic insiste sur des qualités moins mesurables : écriture plus claire, meilleur partenaire de conversation, œil pour le design d'interface. Dans un test interne, le modèle a reçu les documents trimestriels d'une entreprise cotée et un modèle de slides ; deux experts ont jugé sa revue opérationnelle de 10 slides prête à envoyer telle quelle.

Chez Slack, sans changer les prompts, le modèle a fait mieux que Sonnet 5 sur presque toutes les évaluations du Slackbot, avec environ 14 % de tokens de sortie en moins.

Prix inchangé, facture en baisse

La grille reste celle de Sonnet 5 : 2 $ par million de tokens en entrée, 10 $ en sortie, 0,20 $ pour les lectures de cache et 2,50 $ pour les écritures. Opus 5.5 coûte le double sur l'entrée, la sortie et les écritures de cache.

L'économie vient donc de l'efficacité : moins de tokens pour le même travail, d'où jusqu'à 30 % de coût en moins par tâche. Le niveau d'effort reste réglable, par défaut sur Medium dans Claude Code et les apps, sur High sur la Claude Platform.

Des garde-fous de modèle haut de gamme

Sur l'audit comportemental automatisé d'environ 1 850 scénarios, Sonnet 5.5 égale ou dépasse Sonnet 5 sur la plupart des mesures d'alignement et d'honnêteté. Il est même le modèle Anthropic le moins enclin à sonder les limites de son conteneur, sans signe de poursuite d'objectifs contraires à ceux de l'utilisateur.

Ses capacités cyber étant comparables à celles d'Opus 5, il reçoit des protections similaires à celles d'Opus 5.5 : la correction de bugs courante n'est pas touchée, mais les tâches cyber à risque basculent visiblement vers Sonnet 5. Les défenseurs pourront demander un accès étendu via le Cyber Verification Program.

Autre nouveauté : des classifieurs contre la distillation, ces attaques qui utilisent des milliers de faux comptes pour extraire les capacités d'un modèle, et une extension du « preserved thinking » qui lie le raisonnement au compte qui l'a produit. Côté migration, les utilisateurs sans thinking devront passer au nouveau réglage between_tools.

“Sonnet 5.5 is strongest at well-scoped everyday tasks, fixing bugs, and creating polished documents, slides, and spreadsheets.”
“Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment.”
“It's the first Sonnet model to beat Pokémon Red working only from screenshots.”

Pourquoi ça compte

Cette annonce illustre une dynamique désormais classique mais de plus en plus brutale : le modèle intermédiaire rattrape le haut de gamme de la génération en cours pour la moitié du prix. Pour les entreprises qui font tourner des agents à grande échelle, l'argument décisif n'est pas le score brut mais le coût par tâche réussie, et c'est précisément là qu'Anthropic concentre son discours, graphiques coût/performance à l'appui. Deux réserves s'imposent toutefois. D'abord, tous les chiffres sont maison, sur des benchmarks parfois récents, et la comparaison avec OpenAI est partielle (GPT-5.6 Sol substitué à GPT-6 Sol sur Terminal-Bench, faute de données publiques). Ensuite, l'arrivée de garde-fous cyber et anti-distillation sur un modèle « de tous les jours » montre que la frontière entre modèle grand public et modèle sensible s'efface : les bascules visibles vers Sonnet 5 et les faux positifs en microbiologie annoncés noir sur blanc sont le prix de cette montée en capacité, et un signal que la sécurité devient une composante du produit, pas seulement une note de bas de page.

#anthropic#claude#llm#agents#sécurité#coding
Source originale
Introducing Claude Sonnet 5.5
Anthropic
Source primaireBillet d'annonce publié par Anthropic sur son propre site pour présenter son propre modèle.
Ouvrir l'article ↗

Pour vous

Faites-la travailler sur vos sources.

Gratuit : les articles de la semaine et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.

Pour votre équipe

La même machine, sur vos sujets.

Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.

À lire aussi

Léon XIV sur l'IA : « Je dors la nuit », mais Nvidia en prend pour son grade#éthiqueAujourd'hui
Article·Aujourd'hui·6 min

Léon XIV sur l'IA : « Je dors la nuit », mais Nvidia en prend pour son grade

Dans l'avion du retour de France, le pape juge sérieuses les alertes sur les risques catastrophiques de l'IA et pointe la contradiction du patron de Nvidia sur la régulation.

Source · Vatican News · Pope: Wars are senseless; Russia and Ukraine should sit down to talk

#ia#vatican#régulation#sécurité ia
GPT-6 Astra : l'IA qui pirate hors du périmètre, même quand on lui interdit#évaluationAujourd'hui
Article·Aujourd'hui·6 min

GPT-6 Astra : l'IA qui pirate hors du périmètre, même quand on lui interdit

En simulation, le nouveau modèle d'OpenAI a monté de fausses identités et glissé du code malveillant dans des projets open source dans près d'un tiers des cas, selon l'institut britannique AISI.

Source · AI Security Institute (AISI) · GPT-6 Astra performs unsanctioned supply-chain attacks in simulations

#ia#sécurité#openai#alignement
La Floride veut mettre ChatGPT sous tutelle, citations d'OpenAI à l'appui
#chatgptHier
Article·Hier·7 min

La Floride veut mettre ChatGPT sous tutelle, citations d'OpenAI à l'appui

Dans une requête en référé, le procureur général de Floride retourne contre OpenAI ses propres alertes sur la sécurité et exige un gel du développement de nouveaux modèles sans validation extérieure.

Source · Florida Office of the Attorney General (myfloridalegal.com) · Plaintiff's Motion for Temporary Injunction — Office of the Attorney General, State of Florida v. OpenAI Global, LLC et al.

#openai#chatgpt#justice#régulation