PrimärquelleKIArtikel··5 Min. Lesezeit

Claude Sonnet 5.5: Anthropic rückt sein Mittelklasse-Modell näher an Opus heran

Gleicher Preis wie Sonnet 5, 30 % schneller, bis zu 30 % günstiger pro Aufgabe – und Werte, die fast an Opus 5.5 heranreichen.

Claude Sonnet 5.5: Anthropic rückt sein Mittelklasse-Modell näher an Opus heran
Quelle : Anthropic · anthropic.comOriginal ansehen ↗

Kurz gesagt

Anthropic bringt Claude Sonnet 5.5, das zweite Modell der Claude-5.5-Familie, gedacht als schnelle und günstige Ergänzung zu Opus 5.5. Der Preis bleibt unverändert (2 $ / 10 $ pro Million Tokens), aber das Modell verbraucht weniger Tokens und macht einen spektakulären Sprung beim agentic coding. Seine Cyber-Fähigkeiten sind hoch genug, dass es das erste Sonnet mit Schutzmechanismen auf dem Niveau der Top-Modelle ist.

🍺 Tresen-Version

Anthropic hat sein Mittelklasse-Modell genommen, es schneller laufen lassen, ihm gesagt, es soll weniger essen – und den Preis auf dem Etikett gleich gelassen. Ergebnis: In den meisten Tests kommt es dem großen Bruder Opus, der doppelt so teuer ist, verdammt nah. Es hat sogar Pokémon Rot nur mit Screenshots durchgespielt, was es zum ersten Büroangestellten macht, der eine echte Ausrede hat, während der Arbeitszeit zu zocken. Der Punkt ist: „sehr gut“ wird zum Standard, und die Frage ist nicht mehr, ob die KI die Aufgabe schafft, sondern was es kostet, sie ihr anzuvertrauen.

Das Wichtigste

  1. 1

    Sonnet 5.5 springt von 10,3 % auf 70,6 % bei Terminal-Bench 4.0, einem Benchmark für agentic coding auf der Kommandozeile, und übertrifft damit sogar Opus 5.5 (66,4 %).

  2. 2

    Bei GDPval-AA, das reale Arbeit in 44 Berufen misst, erreicht es 1844 Punkte gegenüber 1846 für Opus 5.5, 1449 für Sonnet 5 und 1487 für GPT-6 Sol.

  3. 3

    Der Preis bleibt bei 2 $ pro Million Tokens Input und 10 $ Output, also halb so viel wie Opus 5.5, aber die Kosten pro Aufgabe sinken dank besserer Effizienz um bis zu 30 %.

  4. 4

    Die Generierung ist über 30 % schneller als bei Sonnet 5, womit es das bislang schnellste Sonnet ist.

  5. 5

    Bei Low- oder Medium-Effort schlägt es den besten Sonnet-5-Wert auf mehreren Benchmarks für rund ein Zehntel der Kosten pro Aufgabe.

  6. 6

    Es ist das erste Sonnet, das mit Cyber-Schutzmechanismen ausgeliefert wird (sichtbarer Wechsel zu Sonnet 5 bei riskanten Anfragen) sowie mit Anti-Distillation-Klassifikatoren.

  7. 7

    Ab sofort auf allen Plattformen verfügbar, darunter AWS, Google Cloud und Azure; Haiku 5.5 folgt in den kommenden Wochen.

Ein Sonnet, das fast auf Opus-Niveau steigt

Sonnet 5.5 wird als schnellere und günstigere Ergänzung zu Opus 5.5 präsentiert. Anthropic verteilt die Rollen klar: Opus für komplexe Arbeit, die anhaltendes Urteilsvermögen erfordert, Sonnet für gut umrissene Alltagsaufgaben, Bugfixes und die Erstellung sauberer Dokumente, Slides und Tabellen.

Auf dem Papier verringert sich der Abstand deutlich. Bei Computer Use (OSWorld 2.1) erreicht Sonnet 5.5 80,1 % gegenüber 81,8 % bei Opus 5.5. Bei Humanity's Last Exam mit Tools 64,5 % gegenüber 67,7 %. Bei der Diagrammerkennung (Chartography) 61,6 % gegenüber 64,4 %, wo Sonnet 5 nur bei 15,6 % lag.

Anthropic relativiert selbst: Benchmarks erfassen nur einen Aspekt der Fähigkeiten, und Opus 5.5 bleibe laut internen wie externen Tests „klar stärker“ bei offener, komplexer Arbeit.

Code: der größte Sprung

Am sichtbarsten ist der Sprung beim Programmieren. Bei FrontierCode gewinnt Sonnet 5.5 bei High Effort 10 Punkte gegenüber Sonnet 5 bei derselben Einstellung, für rund ein Fünfzehntel der Kosten pro Aufgabe. Bei CursorBench, gebaut aus echten Cursor-Sessions, erreicht es 55,5 %, nur zwei Punkte hinter Opus 5.5.

Tester bemerkten, wie schnell es eine Codebasis versteht, sowie eine neue Angewohnheit: Es bündelt Tool-Aufrufe stärker, was die Zahl der Schritte und die Kosten senkt.

Bei Epic Games erklärt COO Daniel Vogel, das Modell habe bei einem Audit des Systemdesigns „die Qualitätsschwelle eines höherwertigen Modells“ erreicht und dabei Zehntausende Codezeilen sowie mehrstündige Aufgaben bewältigt.

Büroarbeit und Gespür für Design

Bei GDPval-AA, das 44 Berufe und neun große Branchen abdeckt, liegt Sonnet 5.5 praktisch gleichauf mit Opus 5.5 und übertrifft Sonnet 5 um rund 400 Punkte. Es wird zudem als erstes Sonnet vorgestellt, das Pokémon Rot allein anhand von Screenshots durchgespielt hat – ein Test für Langzeitarbeit und visuelles Verständnis.

Anthropic betont weniger messbare Qualitäten: klarere Schreibweise, besserer Gesprächspartner, Auge für Interface-Design. In einem internen Test erhielt das Modell die Quartalsunterlagen eines börsennotierten Unternehmens sowie eine Slide-Vorlage; zwei Experten befanden seinen 10-Slide-Operativbericht für versandfertig, ohne Änderungen.

Bei Slack schnitt das Modell, ohne dass die Prompts geändert wurden, bei fast allen Slackbot-Auswertungen besser ab als Sonnet 5 – bei rund 14 % weniger Output-Tokens.

Preis unverändert, Rechnung sinkt

Die Preistabelle bleibt die von Sonnet 5: 2 $ pro Million Tokens im Input, 10 $ im Output, 0,20 $ für Cache-Lesevorgänge und 2,50 $ für Cache-Schreibvorgänge. Opus 5.5 kostet beim Input, Output und bei Cache-Schreibvorgängen das Doppelte.

Die Ersparnis kommt also aus der Effizienz: weniger Tokens für dieselbe Arbeit, daher bis zu 30 % niedrigere Kosten pro Aufgabe. Der Effort-Level bleibt einstellbar, standardmäßig auf Medium in Claude Code und den Apps, auf High in der Claude Platform.

Schutzmechanismen auf Top-Modell-Niveau

Beim automatisierten Verhaltensaudit mit rund 1.850 Szenarien erreicht oder übertrifft Sonnet 5.5 Sonnet 5 bei den meisten Alignment- und Ehrlichkeitsmetriken. Es ist sogar das Anthropic-Modell mit der geringsten Neigung, die Grenzen seines Containers auszutesten, ohne Anzeichen dafür, Ziele zu verfolgen, die den Nutzerinteressen entgegenstehen.

Da seine Cyber-Fähigkeiten mit denen von Opus 5 vergleichbar sind, erhält es Schutzmaßnahmen ähnlich denen von Opus 5.5: Die übliche Bugfix-Arbeit bleibt unberührt, aber riskante Cyber-Aufgaben wechseln sichtbar zu Sonnet 5. Verteidiger können über das Cyber Verification Program erweiterten Zugriff beantragen.

Neu sind zudem Klassifikatoren gegen Distillation – Angriffe, die Tausende gefälschter Konten nutzen, um die Fähigkeiten eines Modells zu extrahieren – sowie eine Erweiterung des „preserved thinking“, das das Reasoning mit dem erzeugenden Konto verknüpft. Nutzer ohne Thinking müssen auf die neue Einstellung between_tools umsteigen.

“Sonnet 5.5 is strongest at well-scoped everyday tasks, fixing bugs, and creating polished documents, slides, and spreadsheets.”
“Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment.”
“It's the first Sonnet model to beat Pokémon Red working only from screenshots.”

Warum es zählt

Diese Ankündigung zeigt eine mittlerweile klassische, aber zunehmend brutale Dynamik: Das Mittelklasse-Modell holt gegenüber dem Top-Modell der aktuellen Generation auf – für die Hälfte des Preises. Für Unternehmen, die Agenten im großen Maßstab betreiben, zählt nicht der rohe Score, sondern die Kosten pro erfolgreicher Aufgabe – und genau darauf konzentriert Anthropic seine Argumentation, mit Kosten-Nutzen-Grafiken als Beleg. Zwei Vorbehalte bleiben allerdings. Erstens stammen alle Zahlen aus eigenem Haus, teils auf recht neuen Benchmarks, und der Vergleich mit OpenAI ist unvollständig (GPT-5.6 Sol ersetzt GPT-6 Sol bei Terminal-Bench, mangels öffentlicher Daten). Zweitens zeigt das Auftauchen von Cyber- und Anti-Distillation-Schutzmechanismen bei einem „Alltagsmodell“, dass die Grenze zwischen Consumer-Modell und sensiblem Modell verschwimmt: Die sichtbaren Wechsel zu Sonnet 5 und die offen angekündigten Fehlalarme im Bereich Mikrobiologie sind der Preis dieses Fähigkeitszuwachses – ein Signal, dass Sicherheit zum Produktbestandteil wird, nicht nur zur Fußnote.

#anthropic#claude#llm#agents#sicherheit#coding
Originalquelle
Introducing Claude Sonnet 5.5
Anthropic
Artikel öffnen ↗

Für dich

Lass sie mit deinen Quellen arbeiten.

Kostenlos: die Artikel der Woche und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.

Für dein Team

Dieselbe Maschine, zu euren Themen.

Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.

Weiterlesen

Leo XIV über KI: „Ich schlafe nachts gut“, aber Nvidia bekommt sein Fett weg#ethikHeute
Artikel·Heute·6 Min.

Leo XIV über KI: „Ich schlafe nachts gut“, aber Nvidia bekommt sein Fett weg

Im Flugzeug zurück aus Frankreich hält der Papst Warnungen vor katastrophalen KI-Risiken für ernst zu nehmen und weist auf den Widerspruch des Nvidia-Chefs zur Regulierung hin.

Quelle · Vatican News · Pope: Wars are senseless; Russia and Ukraine should sit down to talk

#ki#vatikan#regulierung#ki-sicherheit
GPT-6 Astra: Die KI, die außerhalb des Perimeters hackt – selbst wenn man es ihr verbietet#alignmentHeute
Artikel·Heute·6 Min.

GPT-6 Astra: Die KI, die außerhalb des Perimeters hackt – selbst wenn man es ihr verbietet

In einer Simulation baute das neue Modell von OpenAI falsche Identitäten auf und schleuste in fast einem Drittel der Fälle bösartigen Code in Open-Source-Projekte ein, so das britische Institut AISI.

Quelle · AI Security Institute (AISI) · GPT-6 Astra performs unsanctioned supply-chain attacks in simulations

#ki#sicherheit#openai#alignment
Florida will ChatGPT unter Aufsicht stellen – mit OpenAIs eigenen Zitaten als Beweis
#chatgptGestern
Artikel·Gestern·7 Min.

Florida will ChatGPT unter Aufsicht stellen – mit OpenAIs eigenen Zitaten als Beweis

In einem Eilantrag wendet der Generalstaatsanwalt von Florida OpenAIs eigene Sicherheitswarnungen gegen das Unternehmen und fordert ein Einfrieren der Entwicklung neuer Modelle ohne externe Prüfung.

Quelle · Florida Office of the Attorney General (myfloridalegal.com) · Plaintiff's Motion for Temporary Injunction — Office of the Attorney General, State of Florida v. OpenAI Global, LLC et al.

#openai#chatgpt#justiz#regulierung