GPT-6: OpenAIs Gebrauchsanweisung für den Weg vom Prototyp zur Produktion
Drei Modelle, fünf Reasoning-Stufen, zwei Geschwindigkeiten und Agenten, die stundenlang arbeiten: OpenAI veröffentlicht die Anleitung für seine neue Modellfamilie.

Kurz gesagt
OpenAI veröffentlicht einen praktischen Leitfaden für Startups, die mit der GPT-6-Familie bauen: GPT-6 Astra, GPT-6.1 Sol und GPT-6 Luna. Das Dokument erklärt, wie man das richtige Modell und die richtige Reasoning-Stufe wählt, Prompts und Skills neu schreibt, lange Aufgaben steuert und die Kosten in der Produktion im Griff behält. Daraus ergibt sich eine klare Vision: Der Entwickler wird zum Projektleiter autonomer Agenten.
🍺 Tresen-Version
OpenAI bringt drei Modelle auf einmal raus und veröffentlicht, wohl wissend, dass du sowieso das teuerste nimmst, um deine Rechnungen zu sortieren, eine Anleitung, die dir erklärt, welches du wählen solltest. Die Kernbotschaft ist einfach: Sprich mit der KI wie mit einem brillanten Praktikanten, sag ihr, was du willst, was sie allein entscheiden darf und wann die Arbeit fertig ist. Nebenbei können diese Agenten jetzt stundenlang, sogar tagelang arbeiten und sogar Buttons an deiner Stelle klicken, was sie zu den einzigen Kollegen macht, die keine Kaffeepause verlangen. Worauf es ankommt: Das eigentliche Know-how besteht nicht mehr darin, Code zu schreiben, sondern ein Lastenheft zu verfassen, das bisher niemand gelesen hat.
Das Wichtigste
- 1
Die GPT-6-Familie gliedert sich in drei Modelle: Astra für das schwierigste Reasoning, GPT-6.1 Sol für komplexen Code, Recherche und Computer Use, Luna für repetitive Aufgaben im großen Maßstab.
- 2
Der Reasoning-Aufwand lässt sich in fünf Stufen einstellen (Low, Medium, High, Extra high / Max), zu betrachten als Abwägung zwischen Intelligenz und Preis.
- 3
Zwei kostenpflichtige Geschwindigkeitsmodi: Fast für schnelle, stabile Antwortzeiten, Ultrafast (nur für Astra) beschleunigt die Token-Generierung unabhängig vom Reasoning.
- 4
Prompt Caching senkt die Kosten für gecachte Input-Tokens um bis zu 95 %, vorausgesetzt man platziert stabile Anweisungen vor den sich ändernden Details.
- 5
OpenAI empfiehlt, Regeln vom Typ 'immer nachfragen' durch explizite Entscheidungsgrenzen zu ersetzen und genau zu definieren, was 'fertig' bedeutet.
- 6
Für lange Aufgaben: Steering während der Ausführung über die Responses WebSocket API, asynchrone Tool-Aufrufe und Multi-Agenten-Workflows (in Beta bei GPT-6.1 Sol).
- 7
Alle drei Modelle können Websites und Desktop-Anwendungen über Computer Use steuern, auch Software ohne API.
Eine Produktpalette als Abwägungsfrage konzipiert
Der Leitfaden steckt von Anfang an den Rahmen ab: Die Wahl eines GPT-6-Modells bedeutet, zwischen Leistungsfähigkeit, Kosten und Latenz abzuwägen. GPT-6 Astra ist den schwierigsten Reasoning-Problemen vorbehalten, bei denen maximale Intelligenz nötig ist.
GPT-6.1 Sol zielt auf komplexen Code, Recherche und Computer Use ab. GPT-6 Luna richtet sich an Massenarbeit mit klarem Ziel: Felder aus Rechnungen extrahieren, Anfragen klassifizieren, strukturierte Zusammenfassungen erstellen.
Die Reasoning-Stufe wird separat eingestellt. Low für Extraktion oder kleine Änderungen, Medium zur Planung einer Funktion, High für schwieriges Debugging. Extra high / Max sollte man nur beibehalten, wenn der Gewinn den zusätzlichen Zeit- und Kostenaufwand rechtfertigt.
Bei der Geschwindigkeit bietet der Fast-Modus schnellere, gleichmäßigere Antworten gegen einen höheren Preis pro Token. Ultrafast, nur für Astra in Codex und der API verfügbar, beschleunigt die Generierung unabhängig vom Reasoning-Aufwand.
Produktion ist vor allem eine Frage von Kontext und Kosten
OpenAI betont die Effizienz: unnötigen Kontext kürzen, aber relevante Elemente behalten, und unabhängige Aufgaben parallel starten, damit ein langsamer Schritt den Rest nicht blockiert.
Prompt Caching wird hervorgehoben: Gecachte Input-Tokens kosten je nach Modell bis zu 95 % weniger. Das Rezept besteht darin, stabile Anweisungen und Referenzdokumente vor den variablen Details zu platzieren und Tool-Definitionen konstant zu halten.
Bei langen Konversationen reduziert die Komprimierung die Kontextgröße, während der nötige Zustand erhalten bleibt. Vor jedem Deployment empfiehlt der Leitfaden, Erfolgsrate, Latenz und Kosten pro erfolgreicher Aufgabe zu messen sowie Monitoring und Datenkontrollen vorzusehen.
Prompts, Skills und AGENTS.md: ein echtes Lastenheft schreiben
Der zentrale Rat, Eric Provencher (Developer Experience bei OpenAI) zugeschrieben, lässt sich in einem Satz zusammenfassen: dem Modell einen klaren Auftrag geben. Das erwartete Ergebnis, seinen Empfänger, den Kontext, die Einschränkungen und was als fertig gilt.
Skills sollten kurze Beschreibungen haben, die genau festlegen, wann sie ausgelöst werden, Details nur bei Bedarf laden und starre Rezepte gegen an die verwendeten Modelle angepasste Orientierungen eintauschen.
Die Datei AGENTS.md soll erklären, wann welches Dokument oder welcher Test relevant ist, und sichere Routinen explizit erlauben, etwa lokale Tests mit Wegwerfdaten ohne Zugriff auf die Produktion auszuführen.
Schließlich fordert der Leitfaden, präzise über Ausdauer zu sein: 'fertig' umfasst Implementieren, Ausführen, Ergebnis prüfen und Fehler korrigieren. Das Modell kann zum Beispiel die Gliederung einer Zusammenfassung selbst wählen, muss aber rückfragen, bevor es den Projektumfang ändert.
Agenten, die stunden-, sogar tagelang arbeiten
OpenAI erklärt, dass man mit GPT-6 Aufgaben übertragen kann, die sich über Stunden oder Tage erstrecken. In der API erlaubt das Steering während eines laufenden Durchgangs, eine Korrektur über die Responses WebSocket API zu senden, während das Modell arbeitet; Updates werden in eine Warteschlange gestellt, ohne laufende Tool-Aufrufe oder bereits ausgeführte Aktionen rückgängig zu machen.
Asynchrone Tool-Aufrufe lassen das Modell an unabhängiger Arbeit weitermachen, während eine langsame Aufgabe, etwa eine Testsuite, auf Anwendungsseite läuft. GPT-6.1 Sol unterstützt zudem Multi-Agenten-Workflows, noch in Beta: Es delegiert an Sub-Agenten und fügt dann deren Ergebnisse zusammen.
In Codex kann Astra unterwegs Klärungsfragen stellen. Der Leitfaden rät, anzugeben, welche Aufgaben weiterlaufen können, während man nachdenkt, und die Arbeit explizit umzulenken, wenn sich Anforderungen ändern.
Computer Use, als letztes Mittel
Alle drei Modelle können direkt mit Websites und Desktop-Anwendungen interagieren, auch solchen ohne API. Gegebenes Beispiel: einen Bug untersuchen, den Code korrigieren und dann das Produkt im Browser öffnen, um den Fix zu überprüfen.
Die vorgeschlagene Regel ist pragmatisch: wenn möglich über eine API oder ein verbundenes Tool gehen und Computer Use den Fällen vorbehalten, in denen man einen Bildschirm lesen, klicken oder ein Formular ausfüllen muss. Für die Integration in eigene Anwendungen nennt OpenAI Playwright für den Browser und PyAutoGUI für den Desktop.
“Give the model a clear assignment.”
“Think of the model choice and reasoning level as an intelligence/ price tradeoff.”
“Cached input tokens cost up to 95% less than uncached input tokens, depending on the model.”
Warum es zählt
Dieser Leitfaden verrät mehr über OpenAIs Strategie als ein simples Produktblatt. Die Vervielfachung der Stellschrauben (Modell, Reasoning-Aufwand, Fast, Ultrafast, Cache) verwandelt die Nutzung eines LLM in eine wirtschaftliche Optimierungsübung, und der Anbieter geht davon aus, dass die Kosten pro erfolgreicher Aufgabe die entscheidende Kennzahl sind. Die zweite Botschaft ist kultureller Natur: Die Arbeit des Entwicklers verschiebt sich hin zur Delegation, mit Entscheidungsgrenzen, Definitionen von 'fertig' und Agenten, die man unterwegs neu ausrichtet. Das ist stimmig, aber man sollte kritisch bleiben. Ein vom Anbieter selbst verfasster Leitfaden drängt naturgemäß zu seinen eigenen Tools (Responses API, Codex, Premium-Modi) und sagt nichts über die tatsächlichen Grenzen dieser Agenten bei mehrtägigen Aufgaben. Multi-Agent ist noch in Beta, und das Versprechen autonomer Langzeitarbeit muss sich in echten Fällen noch beweisen, samt der entsprechenden Rechnung.
Kostenloses Konto
Sie haben gerade einen Artikel von AI Sources gelesen
Erstellen Sie ein kostenloses Konto: ein Monat Archiv in voller Länge, Ihre eigenen Quellen zusammengefasst wie diese, Ihre Notizen und Markierungen.
Für dich
Lass sie mit deinen Quellen arbeiten.
Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.
Für dein Team
Dieselbe Maschine, zu euren Themen.
Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.
Weiterlesen
#forschungGesternHinton, Bengio, OpenAI und Anthropic unterzeichnen Plan gegen die Intelligenzexplosion
Zweiundzwanzig Forscher, darunter Führungskräfte von OpenAI und Anthropic, meinen, dass die Automatisierung der KI-Forschung Jahre des Fortschritts in wenige Monate pressen könnte – und dass die Staaten darauf nicht vorbereitet sind.
Quelle · Cambridge Programme on AI Science & Policy (CASP) · What if automating AI R&D triggers an intelligence explosion?
#agentenGesternFLUX 3 Image: Black Forest Labs setzt auf pixelgenaues Layout
Mit FLUX 3 Image beschreibt man ein Bild nicht mehr nur: man zeichnet es Box für Box und retuschiert es anschließend, ohne dass der Rest sich bewegt.
Quelle · Black Forest Labs · FLUX 3 Image: Maximum control over every pixel
#open source2. Okt.Clef: Cloudflare bringt eigene Decision-Modelle als Open Source
Mit Clef und Clef-flash steigt Cloudflare in den aufstrebenden Markt der „Decision Models“ ein und ergänzt dies um eine Fine-Tuning-Plattform per Reinforcement Learning.
Quelle · Cloudflare Blog · Introducing Clef: our open-source decision models, and new RL fine-tuning platform