PrimärquelleKIArtikel··5 Min. Lesezeit

GPT-6.1 Sol: fast auf Astra-Niveau, für ein Fünftel des Preises

OpenAI aktualisiert sein mittleres Modell und verspricht die Leistung seines Spitzenmodells bei Code, Agenten und professionellen Aufgaben – bei einem fünfmal niedrigeren Preis.

GPT-6.1 Sol: fast auf Astra-Niveau, für ein Fünftel des Preises
Quelle : OpenAI · OpenAIOriginal ansehen ↗

Kurz gesagt

OpenAI bringt GPT-6.1 Sol auf den Markt, ein Update von GPT-6 Sol, das sich bei agentischem Code, Computernutzung und professionellen Aufgaben GPT-6 Astra annähert – zu einem Fünftel des API-Preises. Der Cache für Eingaben fällt auf 0,10 $ pro Million Tokens, ein klares Signal an Entwickler von Agenten, die viel Kontext wiederverwenden.

🍺 Tresen-Version

OpenAI hat zwei Modelle: das sehr teure, das alles kann, und das günstigere, das fast alles kann. Jetzt hat das günstigere das teure bei fast allem eingeholt, außer bei wissenschaftlicher Spitzenforschung, und das für ein Fünftel des Preises. Es ist, als würde man entdecken, dass der Hauswein genauso gut ist wie der große Jahrgang – mit einem Etikett, das das Restaurant selbst geschrieben hat. Wenn die Zahlen außerhalb des Labors standhalten, hört das Betreiben von Agenten den ganzen Tag über auf, ein Luxus zu sein.

Das Wichtigste

  1. 1

    GPT-6.1 Sol kostet 2 $ pro Million Tokens bei Eingabe, 0,10 $ bei gecachter Eingabe und 10 $ bei Ausgabe, also ein Fünftel der Standardpreise von GPT-6 Astra.

  2. 2

    Der Eingabe-Cache ist 95 % günstiger als die Standardeingabe und 50 % günstiger als der von GPT-6 Sol – ein Argument, das genau auf Agenten zugeschnitten ist, die ihren Kontext wiederverwenden.

  3. 3

    Bei DeepSWE v1.1 erreicht es GPT-6 Astra für etwa ein Fünftel der Kosten und übertrifft GPT-6 Sol um 6,4 Punkte.

  4. 4

    Bei Terminal-Bench Science 0.1 kostet es durchschnittlich 5,47 $ pro Aufgabe, gegenüber 23,21 $ für Opus 5.5 und 23,80 $ für Astra, das mit 68,1 % weiterhin die Spitze hält.

  5. 5

    Bei OSWorld 2.0 gewinnt es 7 Punkte gegenüber GPT-6 Sol und liegt nur 2,1 Punkte hinter Astra, bei etwa einem Siebtel der Kosten pro Aufgabe.

  6. 6

    Die Rate der Antworten mit einem sachlichen Fehler sinkt von 11,4 % auf 7,7 % bei niedrigem Reasoning-Aufwand, also rund 32 % weniger Fehler.

  7. 7

    Ab sofort verfügbar in ChatGPT Work und Codex für Plus-, Pro-, Business-, Enterprise- und Edu-Abos sowie über die API (gpt-6.1-sol), aber noch nicht in Chat.

Das Mittelklasse-Modell mit Anspruch auf die Spitze

GPT-6.1 Sol ist ein Update von GPT-6 Sol, dem mittleren Modell von OpenAI. Das Versprechen lässt sich in einem Satz zusammenfassen: eine Intelligenz „nahe an Astra“ bei agentischem Code, Computernutzung und professioneller Arbeit, für ein Fünftel der Standardpreise von Astra, sowohl bei Eingabe als auch bei Ausgabe.

OpenAI präsentiert das Modell als neues Gleichgewicht zwischen Leistungsfähigkeit und Kosten für die tägliche Arbeit: Code schreiben und debuggen, Dokumente verstehen, mehrstufige Geschäftsworkflows ausführen. Der Vergleich erfolgt sowohl mit dem großen Bruder Astra als auch mit der Konkurrenz, insbesondere Opus 5.5.

Code und professionelle Arbeit: die hervorgehobenen Zahlen

Bei DeepSWE v1.1, das Software-Engineering-Aufgaben in echten Codebasen bewertet, erreicht GPT-6.1 Sol Astra für etwa ein Fünftel der Kosten. Es übertrifft auch den besten Wert von GPT-6 Sol um 6,4 Punkte, bei geringerem Reasoning-Aufwand und niedrigeren Kosten.

Bei GDP.pdf, das die Richtigkeit von Antworten auf professionelle Fragen zu komplexen PDFs (Tabellen, Grafiken, Diagramme, Kleingedrucktes) in Finanzen, Gesundheit, Recht und sieben weiteren Bereichen misst, übertrifft es Opus 5.5 mit Fallbacks für weniger als die Hälfte der Kosten pro Aufgabe.

Bei AutomationBench 1.0.6, das komplette Workflows mit 47 Tools testet (Vertrieb, Marketing, Betrieb, Support, Finanzen, HR), liegt es bei mittlerem Aufwand 2,2 Punkte vor Opus 5.5, für etwa ein Drittel der Kosten, und gewinnt 4,8 Punkte gegenüber GPT-6 Sol. OpenAI weist darauf hin, dass die angegebenen Kosten für Claude Fable 5.1 unterschätzt sind, da Fallbacks nicht einbezogen wurden, die bei etwa 40 % der Aufgaben auftraten.

Computernutzung und Wissenschaft

Bei der Offline-Version von OSWorld 2.0, die lange Workflows der Anwendungsnutzung bewertet, gewinnt GPT-6.1 Sol bei maximalem Aufwand 7 Punkte gegenüber GPT-6 Sol, für weniger als die Hälfte der Kosten. Es liegt 2,1 Punkte hinter Astra, bei etwa einem Siebtel der Kosten pro Aufgabe.

Bei Terminal-Bench Science 0.1 (Datenanalyse, Simulation, Theorembeweise) verdoppelt es fast den Wert von GPT-6 Sol. Bei maximalem Aufwand kostet es 5,47 $ pro Aufgabe, gegenüber 23,21 $ für Opus 5.5 und 23,80 $ für Astra, also mehr als 75 % Ersparnis.

OpenAI setzt jedoch eine Grenze: Astra bleibt das getestete Bestmodell bei diesem Benchmark mit 68,1 % und sollte für die schwierigsten wissenschaftlichen Forschungsaufgaben bevorzugt werden.

Faktentreue und Alignment

Die Faktentreue wird anhand anonymisierter ChatGPT-Konversationen gemessen, bei denen Nutzer einen Fehler eines früheren Modells gemeldet hatten. Bei niedrigem Aufwand sinkt der Anteil fehlerhafter Antworten von 11,4 % auf 7,7 %. Über alle Einstellungen hinweg bleibt der Abstand zu Astra unter 1,9 Punkten, bei weniger als einem Fünftel der Kosten.

OpenAI betont, dass diese absichtlich schwierigen Prompts nicht die übliche Nutzung widerspiegeln. Beim Alignment soll das Modell transparenter über seine Grenzen sein (etwa bei einem ausgefallenen Suchwerkzeug), respektvoller gegenüber expliziten Einschränkungen und weniger geneigt, im Agentenmodus nicht autorisierte Ergebnisse zu produzieren. Es wurden keine Versuche beobachtet, den automatisierten Sicherheitsprüfer zu umgehen, ebenso wie bei Astra und GPT-6 Sol. Details finden sich in einem Nachtrag zur System Card.

Preise und Verfügbarkeit

Das Modell ist ab heute für Nutzer von Plus, Pro, Business, Enterprise und Edu in ChatGPT Work und Codex verfügbar, aber noch nicht in Chat. Entwickler erhalten Zugriff über die API unter dem Namen gpt-6.1-sol.

Die Preise: 2 $ pro Million Tokens bei Eingabe, 0,10 $ bei gecachter Eingabe, 10 $ bei Ausgabe. In den kommenden Tagen wird OpenAI zudem GPT-6.1 Sol Ultrafast in Codex anbieten, mit einer Token-Generierung, die bis zu 8-mal schneller ist als die Standardgeschwindigkeit.

“Near-Astra intelligence for a fifth of the price”
“GPT‑6 Astra still achieves the highest score among the models tested at 68.1%, and should be used for the most difficult scientific research tasks.”
“We observed no attempts to bypass an automated safety reviewer, matching GPT‑6 Astra and GPT‑6 Sol.”

Warum es zählt

Die Ankündigung sagt weniger „hier ist ein intelligenteres Modell“ als „hier ist die Intelligenz von gestern zu einem Bruchteil des Preises“. Das ist das eigentliche Spielfeld von 2026: Agenten verbrauchen enorm viele Tokens, lesen ständig denselben Kontext erneut, und ihre wirtschaftliche Tragfähigkeit hängt mehr von den Kosten pro Aufgabe ab als vom reinen Score. Der Cache zu 0,10 $ pro Million und die systematische Kommunikation in Kosten pro Aufgabe zeigen das deutlich. Man sollte diese Zahlen jedoch mit Vorsicht lesen. Alle Ergebnisse werden von OpenAI veröffentlicht, oft bei für jeden Benchmark ausgewählten Reasoning-Aufwandsstufen. Einige Tests (GDP.pdf, AutomationBench) sind wenig bekannt. Und die Kostenvergleiche mit Konkurrenten hängen von fragwürdigen Konventionen ab, wie es die Anmerkung zu den Fallbacks von Claude Fable 5.1 zugesteht. Schließlich zeigt die Tatsache, dass Astra in der Wissenschaft die Spitze behält und Sol noch nicht in Chat verfügbar ist, eine bewusste Segmentierung: Sol für die Arbeit in großem Volumen, Astra für die schwierigsten Aufgaben. Für Teams, die Agenten in der Produktion betreiben, ist das die gute Nachricht des Quartals – vorausgesetzt, man wiederholt die Messungen mit den eigenen Aufgaben.

#openai#llm#agenten#api#codex#benchmarks
Originalquelle
Introducing GPT-6.1 Sol
OpenAI
Artikel öffnen ↗

Für dich

Lass sie mit deinen Quellen arbeiten.

Kostenlos: die Artikel der Woche und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.

Für dein Team

Dieselbe Maschine, zu euren Themen.

Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.

Weiterlesen