GPT-6 Sol und Luna: OpenAI halbiert seine API-Preise
Nach Astra bringt OpenAI seine neue Generation in zwei günstigeren Modellen heraus und greift Claude direkt beim Verhältnis von Kosten zu Intelligenz an.

Kurz gesagt
OpenAI vervollständigt die GPT-6-Familie mit Sol und Luna, zwei Modellen, die mit denselben Methoden wie Astra trainiert, aber auf Kosteneffizienz optimiert wurden, mit API-Preisen, die 50 % unter dem Aktionstarif von GPT-5.6 liegen. Die Ankündigung strotzt nur so vor zahlenbasierten Vergleichen mit Claude Opus 5 und Fable 5.1, bei denen Sol gleichwertige oder bessere Werte bei 80 bis 90 % geringeren Kosten pro Aufgabe erzielt. Hinzu kommt viel Arbeit am Prompt-Caching für Agenten sowie die sofortige Verfügbarkeit in ChatGPT Work, Codex und der API.
🍺 Tresen-Version
Du kennst das Prinzip: Das Flaggschiff-Modell erscheint zuerst, um zu beeindrucken, die günstigeren Versionen kommen drei Wochen später, um Kasse zu machen. Sol und Luna sind die GPT-6-Modelle, die die Hälfte kosten und laut OpenAIs eigenen Benchmarks Claude Opus 5 für 9 % von dessen Preis schlagen – eine Zahl, präsentiert mit der Ruhe eines Verkäufers, der dir sagt, die Aktion ende heute Abend. Darum geht es wirklich: Bei Agenten, die stundenlang im Loop laufen, zählt die Rechnung genauso wie die Intelligenz. Wenn ein OpenAI-Forscher im Median 600 Dollar an Tokens pro Tag verbrennt, versteht man, warum der Preis plötzlich zum Produktmerkmal wird.
Das Wichtigste
- 1
OpenAI erweitert die GPT-6-Familie um Sol und Luna, trainiert mit ähnlichen Methoden wie Astra, aber auf Kosteneffizienz positioniert.
- 2
Die API-Preise sinken um 50 % gegenüber dem Aktionstarif von GPT-5.6: Sol kostet nun 2 $ / 10 $ pro Million Tokens (Eingabe / Ausgabe), Luna 0,10 $ / 0,50 $.
- 3
Auf AutomationBench 1.0.6 erreicht Sol mit xhigh-Aufwand 33,2 % für 0,27 $ pro Aufgabe, gegenüber 26,9 % für Claude Opus 5 mit max-Aufwand – also 11,1-mal teurer.
- 4
Auf DeepSWE v1.1 erreicht Sol im max-Modus 68,8 %, nur 1,1 Punkte unter dem besten Wert von Claude Fable 5 in der Auswertung, bei rund 80 % geringeren Kosten pro Aufgabe.
- 5
Die Faktentreue verbessert sich: Sol macht etwa halb so viele Fehler wie sein Vorgänger in der internen Auswertung, die auf real gemeldeten Nutzergesprächen basiert.
- 6
Das Prompt-Caching wurde überarbeitet: bessere Trefferquoten standardmäßig, 90 % Rabatt auf gecachte Eingabe-Tokens, ein Dashboard samt Diagnosetool, und Änderungen bei Aufwandsstufe oder Tools zerstören den Cache nicht mehr.
- 7
Ab sofort verfügbar in ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu; Luna kommt auch für Free- und Go-Konten in der Desktop-App, und die API bietet gpt-6-sol und gpt-6-luna.
Eine Familie mit drei Etagen
Astra bleibt in OpenAIs Darstellung die Spitze: das intelligenteste und am besten ausgerichtete Modell, das man wählt, wenn man keinerlei Kompromisse eingehen will. Sol und Luna beanspruchen nicht, es zu ersetzen, sondern besetzen die beiden Etagen darunter, dort, wo der Großteil der täglichen Arbeit stattfindet.
Das zentrale Argument lautet nicht „intelligenter“, sondern „gleiche Generation, günstiger“. OpenAI behauptet, Sol und Luna mit ähnlichen Methoden wie Astra trainiert zu haben und dessen Fortschritte bei professioneller Arbeit, Faktentreue, Code, Computernutzung und Alignment auf schnellere Modelle übertragen zu haben.
Die verwendete Sprache ist aufschlussreich: Das Unternehmen spricht davon, „die Grenze der Kosteneffizienz voranzutreiben“. Der Wettbewerb spielt sich nicht mehr nur um den maximal erreichbaren Score ab, sondern um die Position entlang der Kosten-Intelligenz-Kurve.
Der Preiskampf pro Aufgabe
Die Preissenkung ist deutlich: 2 $ Eingabe und 10 $ Ausgabe pro Million Tokens für Sol, 0,10 $ und 0,50 $ für Luna – also die Hälfte des Aktionstarifs der entsprechenden GPT-5.6-Modelle. OpenAI führt diesen Spielraum auf Infrastrukturgewinne beim Caching und bei der Inferenz zurück, die an die Kunden weitergegeben würden.
Doch die überall im Beitrag hervorgehobene Kennzahl ist nicht der Token-Preis, sondern die Kosten pro Aufgabe. Auf AutomationBench, einem Test von Geschäftsworkflows mit 47 Tools aus Vertrieb, Marketing, Betrieb, Support, Finanzen und HR, erzielt Sol mit xhigh-Aufwand 33,2 % für 0,27 $ pro Aufgabe, während Claude Opus 5 im max-Modus bei 26,9 % für das 11,1-Fache dieser Kosten stagniert.
OpenAI geht sogar so weit anzumerken, dass der Punktwert von Claude Fable 5.1 seine tatsächlichen Kosten unterschätzt, da er die Rückgriffe auf Opus 5 auslässt, die bei etwa 40 % der Aufgaben auftraten. Man befindet sich hier im Bereich des offen ausgetragenen Wettbewerbsvergleichs, mit entsprechender methodischer Detailtiefe – und dem üblichen Hinweis, dass die Konkurrenzwerte aus öffentlichen Berichten stammen.
Ein pikantes Detail: Sol im xhigh-Modus übertrifft auch Astra im low-Modus (33,2 % gegenüber 30,3 %), bei fast viermal geringeren Kosten. Die Hierarchie der Modelle ist nicht mehr linear, sie hängt von der gewählten Aufwandsstufe ab.
Code, Faktentreue, Computernutzung
Beim Code rechtfertigt OpenAI seine Logik mit eigenen internen Zahlen: Zu API-Preisen bewertet, übersteigt der tägliche Token-Verbrauch 600 $ beim medianen Forscher und 7.000 $ beim 90. Perzentil. Wenn Code-Agenten lange arbeiten, wird die Kosten der dauerhaften Nutzung zur Hauptbeschränkung.
Die Ergebnisse folgen dieser Logik: Auf DeepSWE v1.1 erreicht Sol im max-Modus 68,8 %, nur 1,1 Punkte unter dem besten Wert von Claude Fable 5 in der Auswertung, bei rund 80 % geringeren Kosten pro Aufgabe. Luna im max-Modus erzielt 66,6 %, vergleichbar mit Opus 5 und Fable 5 bei medium-Aufwand, aber 93 % beziehungsweise 96 % günstiger.
Bei der Faktentreue bewertet OpenAI seine Modelle anhand deidentifizierter ChatGPT-Gespräche, bei denen Nutzer einen Fehler gemeldet hatten. Sol macht dort etwa halb so viele Fehler wie sein Vorgänger; Luna mit hohem Aufwand erreicht GPT-5.6 Sol bei etwa einem Hundertstel der Kosten. Das Unternehmen weist darauf hin, dass diese Gespräche, ausgewählt weil sie Fehler provozieren, nicht die typische Nutzung widerspiegeln.
Bei der Computernutzung bleibt Astra als bestes Modell der Welt dargestellt. Sol erreicht im xhigh-Modus 60,5 % auf OSWorld 2.0 offline, gleichauf mit Opus 5 im medium-Modus (60,3 %), bei rund 80 % geringeren Kosten pro Aufgabe.
Caching, die stille Waffe der Agenten
Der am wenigsten spektakuläre Teil des Beitrags ist vielleicht der bedeutsamste. OpenAI kündigt standardmäßig bessere Cache-Trefferquoten bei GPT-6 an, mit einem Rabatt von 90 % beim Lesen gecachter Eingabe-Tokens – ein entscheidender Hebel, wenn ein Agent bei jeder Runde denselben Kontext erneut einspeist.
Drei Neuerungen statten Entwickler aus: ein Prompt Caching Dashboard zur Verfolgung des gecachten Eingabeanteils, ein Diagnosetool, das verpasste Gelegenheiten erklärt, und explizite Breakpoints, um zu wählen, wo der gecachte Präfix endet. Vor allem: Das Ändern der Reasoning-Aufwandsstufe oder das Ein-/Ausschalten von Tools zerstört den Cache nicht mehr.
Der soziale Beweis kommt von GitHub: In den letzten Monaten sollen diese Verbesserungen den Anteil der Prompt-Tokens, die eine frische Verarbeitung benötigen, über Milliarden von Anfragen hinweg um mehr als 50 % gesenkt und dadurch Copilot-Antworten beschleunigt haben.
Stil, Alignment und Verfügbarkeit
OpenAI hat auch Astras Kommunikationsstil auf Sol und Luna übertragen: mehr Klarheit, weniger Fachjargon, weniger merkwürdige Formulierungen, weniger Details von geringem Wert und leicht kürzere Antworten. Das Unternehmen veranschaulicht dies anhand eines Beispiel-Prompts für ein React-Frontend und erklärt, warum es die Antwort von GPT-6 Sol bevorzugt – expliziter darüber, was geprüft wurde oder nicht, weniger geschwätzig über die eigenen Tools.
Beim Alignment verbessern sich beide Modelle gegenüber ihren GPT-5.6-Äquivalenten, insbesondere bei der Rate irreführender Aussagen über die eigene Code-Arbeit. OpenAI erinnert daran, dass diese Bewertungen bewusst schwierige Situationen testen und keine Fehlerquoten im normalen Gebrauch messen; die vollständigen Ergebnisse finden sich in der System Card.
Der Rollout erfolgt sofort, aber teilweise: ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu, Luna in der Desktop-App für Free und Go. Die Modelle sind noch nicht in Chat verfügbar, und der Rollout zieht sich über den Tag, um die Stabilität des Dienstes zu wahren.
“GPT-6 Astra continues to be our best model across the board.”
“GPT-6 Sol at xhigh effort outperforms Claude Opus 5 at max effort at just 9% of Opus 5's cost per task.”
“Daily token usage has exceeded $600 for the median researcher and $7,000 for researchers at the 90th percentile.”
Warum es zählt
Diese Ankündigung sagt weniger über den Stand der Technik aus als über den Zustand des Marktes. Indem OpenAI GPT-6 in drei Stufen anbietet und die Preise halbiert, räumt das Unternehmen ein, dass die Schlacht nicht mehr an der Spitze der Benchmarks gewonnen wird, sondern bei den Kosten pro erfolgreich erledigter Aufgabe – der einzigen Kennzahl, die zählt, wenn Agenten kontinuierlich laufen. Die Entscheidung, Sol und Luna systematisch mit Claude Opus 5 und Fable 5.1 zu vergleichen und dabei Verhältnisse von 9 % oder 4 % der Konkurrenzkosten hervorzuheben, ist ein direkter Angriff auf das Terrain, das sich Anthropic gesichert hat: das der Code-Agenten in Unternehmen. Es bleibt jedoch Vorsicht geboten: Diese Zahlen stammen aus Auswertungen, die OpenAI in seiner eigenen Forschungsumgebung durchgeführt hat, die Konkurrenzwerte stammen aus öffentlichen Berichten, und die verglichenen Aufwandsstufen sind nicht immer identisch – ein Modell im „xhigh“-Modus gegen einen Konkurrenten im „medium“-Modus ist kein neutraler Vergleich. Das solidere Signal liegt woanders: in der Arbeit am Caching und im Eingeständnis, dass selbst intern die Token-Rechnung zu einem Managementproblem geworden ist.
Für Teams
Dieselbe Maschine, zu euren Themen.
Eure Quellen, euer Team, jeden Morgen, in eurer Sprache. Pilot offen für drei Unternehmen.
Weiterlesen
#anthropicHeuteClaude Opus 5.5: stärker, 40 % günstiger im Betrieb
Anthropic veröffentlicht sein erstes Modell seit dem eigenen Aufruf, „die Entwicklungsfront zu drosseln“ — und stellt Effizienz ins Zentrum der Kommunikation.
Quelle · Anthropic · Introducing Claude Opus 5.5

Jev: das Modell, das für den Aufruf durch Code gebaut wurde, nicht durch Menschen
Diogo Almeida, ehemals OpenAI, erklärt, warum er eine neue Klasse von „System-One“-Modellen geschaffen hat — und warum er öffentliche Benchmarks, Refusals und Pretraining ablehnt.
Quelle · Latent Space · Why We Made Jev — Diogo Almeida, TypeSafe Co-founder & CEO

99 % oder 0 %: Vier Experten wetten über das Ende der Welt
Steven Bartlett lässt vier Experten ihre Aussterbewahrscheinlichkeit auf einen Umschlag schreiben. Die Antworten reichen von 99 % bis null, und die anschließende Debatte ist die aufschlussreichste, die wir zu diesem Thema gehört haben.
Quelle · The Diary Of A CEO · AI Emergency: The AI Labs Are Lying To Everyone, He Says 99% Chance Of Extinction | Roman Yampolskiy