GPT-6 : le mode d'emploi d'OpenAI pour passer du prototype à la production
Trois modèles, cinq niveaux de raisonnement, deux vitesses et des agents qui travaillent des heures : OpenAI publie la notice de sa nouvelle famille.

En bref
OpenAI publie un guide pratique destiné aux startups qui construisent avec la famille GPT-6 : GPT-6 Astra, GPT-6.1 Sol et GPT-6 Luna. Le document explique comment choisir le bon modèle et le bon niveau de raisonnement, réécrire ses prompts et ses skills, piloter des tâches longues et maîtriser les coûts en production. Il en ressort une vision claire : le développeur devient le chef de projet d'agents autonomes.
🍺 Version comptoir
OpenAI sort trois modèles d'un coup et, conscient que tu vas forcément prendre le plus cher pour trier tes factures, publie une notice pour t'expliquer lequel choisir. Le message de fond est simple : parle à l'IA comme à un stagiaire brillant, dis-lui ce que tu veux, ce qu'elle a le droit de faire seule et à quel moment le boulot est fini. Au passage, ces agents peuvent maintenant bosser des heures, voire des jours, et même cliquer sur des boutons à ta place, ce qui fait d'eux les seuls collègues qui ne demandent pas de pause café. Ce qui compte, c'est que le vrai savoir-faire ne consiste plus à écrire du code mais à rédiger un cahier des charges que personne ne lisait jusqu'ici.
À retenir
- 1
La famille GPT-6 se décline en trois modèles : Astra pour le raisonnement le plus difficile, GPT-6.1 Sol pour le code complexe, la recherche et le computer use, Luna pour les tâches répétitives à grande échelle.
- 2
L'effort de raisonnement se règle sur cinq niveaux (Low, Medium, High, Extra high / Max), à traiter comme un arbitrage intelligence / prix.
- 3
Deux modes de vitesse payants : Fast pour des temps de réponse rapides et stables, Ultrafast (réservé à Astra) qui accélère la génération de tokens indépendamment du raisonnement.
- 4
Le prompt caching réduit jusqu'à 95 % le coût des tokens d'entrée mis en cache, à condition de placer les instructions stables avant les détails changeants.
- 5
OpenAI recommande de remplacer les règles du type « toujours demander » par des frontières de décision explicites et de définir précisément ce que « terminé » veut dire.
- 6
Pour les tâches longues : steering en cours d'exécution via la Responses WebSocket API, appels d'outils asynchrones et workflows multi-agents (en beta sur GPT-6.1 Sol).
- 7
Les trois modèles savent piloter sites web et applications de bureau via le computer use, y compris des logiciels sans API.
Une gamme pensée comme un arbitrage
Le guide pose d'emblée le cadre : choisir un modèle GPT-6, c'est arbitrer entre capacité, coût et latence. GPT-6 Astra est réservé aux problèmes de raisonnement les plus durs, là où l'intelligence maximale est nécessaire.
GPT-6.1 Sol vise le code complexe, la recherche et le computer use. GPT-6 Luna cible le travail de masse au but clair : extraire des champs de factures, classer des demandes, produire des résumés structurés.
Le niveau de raisonnement se règle séparément. Low pour l'extraction ou les petites modifications, Medium pour planifier une fonctionnalité, High pour le débogage difficile. Extra high / Max n'est à conserver que si le gain justifie le temps et le coût supplémentaires.
Côté vitesse, le mode Fast offre des réponses plus rapides et plus régulières moyennant un tarif par token plus élevé. Ultrafast, disponible seulement pour Astra dans Codex et l'API, accélère la génération quel que soit l'effort de raisonnement.
La production, d'abord une affaire de contexte et de coûts
OpenAI insiste sur l'efficacité : couper le contexte inutile tout en gardant les éléments probants, et lancer en parallèle les tâches indépendantes pour qu'une étape lente ne bloque pas le reste.
Le prompt caching est mis en avant : les tokens d'entrée en cache coûtent jusqu'à 95 % moins cher selon le modèle. La recette consiste à placer instructions stables et documents de référence avant les détails variables, et à garder des définitions d'outils constantes.
Pour les longues conversations, la compaction réduit la taille du contexte en conservant l'état nécessaire. Avant tout déploiement, le guide recommande de mesurer le taux de succès, la latence et le coût par tâche réussie, et de prévoir monitoring et contrôles des données.
Prompts, skills et AGENTS.md : écrire un vrai cahier des charges
Le conseil central, attribué à Eric Provencher (Developer Experience chez OpenAI), tient en une phrase : donner au modèle une mission claire. Le résultat attendu, son destinataire, le contexte, les contraintes et ce qui compte comme terminé.
Les skills doivent avoir des descriptions courtes précisant quand les déclencher, charger les détails seulement si besoin, et troquer les recettes rigides contre des orientations adaptées aux modèles utilisés.
Le fichier AGENTS.md doit expliquer quand tel document ou tel test est pertinent et autoriser explicitement les routines sûres, comme lancer des tests locaux sur des données jetables sans accès à la production.
Enfin, le guide demande d'être prescriptif sur la persévérance : « terminé » inclut implémenter, exécuter, inspecter le résultat et corriger les échecs. Le modèle peut par exemple choisir l'organisation d'un résumé, mais doit consulter avant de modifier le périmètre du projet.
Des agents qui travaillent des heures, voire des jours
OpenAI affirme qu'avec GPT-6, on peut confier des tâches s'étalant sur des heures ou des jours. Dans l'API, le steering en cours de tour permet d'envoyer une correction via la Responses WebSocket API pendant que le modèle travaille ; les mises à jour sont mises en file sans annuler les outils en cours ni les actions déjà faites.
Les appels d'outils asynchrones laissent le modèle avancer sur un travail indépendant pendant qu'une tâche lente, comme une suite de tests, tourne côté application. GPT-6.1 Sol supporte aussi des workflows multi-agents, encore en beta : il délègue à des sous-agents puis fusionne leurs conclusions.
Dans Codex, Astra peut poser des questions de clarification en cours de route. Le guide conseille d'indiquer quelles tâches peuvent continuer pendant qu'on réfléchit, et de rediriger explicitement le travail quand les exigences changent.
Le computer use, en dernier recours
Les trois modèles peuvent interagir directement avec des sites et des applications de bureau, y compris celles qui n'ont pas d'API. Exemple donné : enquêter sur un bug, corriger le code, puis ouvrir le produit dans un navigateur pour vérifier le correctif.
La règle proposée est pragmatique : passer par une API ou un outil connecté quand c'est possible, et réserver le computer use aux cas où il faut lire un écran, cliquer ou remplir un formulaire. Pour l'intégrer à sa propre application, OpenAI cite Playwright pour le navigateur et PyAutoGUI pour le bureau.
“Give the model a clear assignment.”
“Think of the model choice and reasoning level as an intelligence/ price tradeoff.”
“Cached input tokens cost up to 95% less than uncached input tokens, depending on the model.”
Pourquoi ça compte
Ce guide en dit plus sur la stratégie d'OpenAI qu'une simple fiche produit. La multiplication des curseurs (modèle, effort de raisonnement, Fast, Ultrafast, cache) transforme l'usage d'un LLM en exercice d'optimisation économique, et l'éditeur assume que le coût par tâche réussie est la métrique qui compte. Le second message est culturel : le travail du développeur glisse vers la délégation, avec des frontières de décision, des définitions de « terminé » et des agents qu'on réoriente en cours de route. C'est cohérent, mais il faut garder un œil critique. Un guide écrit par le vendeur pousse naturellement vers ses propres outils (Responses API, Codex, modes premium) et ne dit rien des limites réelles de ces agents sur des tâches de plusieurs jours. Le multi-agent est encore en beta, et la promesse d'un travail autonome sur la durée reste à vérifier sur des cas réels, avec la facture correspondante.
Compte gratuit
Vous venez de lire un article d'AI Sources
Créez un compte gratuit : un mois d'archives en entier, vos propres sources résumées comme celle-ci, vos notes et surlignages.
Pour vous
Faites-la travailler sur vos sources.
Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.
Pour votre équipe
La même machine, sur vos sujets.
Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.
À lire aussi
#superintelligenceHierHinton, Bengio, OpenAI et Anthropic signent un plan contre l'explosion d'intelligence
Vingt-deux chercheurs, dont des cadres d'OpenAI et d'Anthropic, estiment que l'automatisation de la recherche en IA pourrait comprimer des années de progrès en quelques mois, et que les États n'y sont pas préparés.
Source · Cambridge Programme on AI Science & Policy (CASP) · What if automating AI R&D triggers an intelligence explosion?
#agentsHierFLUX 3 Image : Black Forest Labs mise sur la mise en page au pixel près
Avec FLUX 3 Image, on ne décrit plus seulement une image : on la dessine boîte par boîte, puis on la retouche sans que le reste ne bouge.
Source · Black Forest Labs · FLUX 3 Image: Maximum control over every pixel
#open source2 oct.Clef : Cloudflare lance ses propres modèles de décision, open source
Avec Clef et Clef-flash, Cloudflare entre sur le marché naissant des « decision models » et y ajoute une plateforme de fine-tuning par reinforcement learning.
Source · Cloudflare Blog · Introducing Clef: our open-source decision models, and new RL fine-tuning platform