AI Sources
De première mainIAArticle··7 min de lecture

GPT-6 Sol et Luna : OpenAI divise ses prix API par deux

Après Astra, OpenAI décline sa nouvelle génération en deux modèles moins chers et attaque frontalement Claude sur le rapport coût/intelligence.

GPT-6 Sol et Luna : OpenAI divise ses prix API par deux
Source : OpenAI · OpenAIVoir l'original

En bref

OpenAI complète la famille GPT-6 avec Sol et Luna, deux modèles entraînés avec les mêmes méthodes qu'Astra mais optimisés pour le coût, avec des prix API réduits de 50 % par rapport au tarif promotionnel de GPT-5.6. L'annonce est truffée de comparaisons chiffrées avec Claude Opus 5 et Fable 5.1, où Sol atteint des scores équivalents ou supérieurs pour 80 à 90 % moins cher par tâche. S'y ajoutent un gros travail sur le prompt caching pour les agents et une disponibilité immédiate dans ChatGPT Work, Codex et l'API.

🍺 Version comptoir

Tu connais le principe : le modèle haut de gamme sort en premier pour impressionner, les versions abordables arrivent trois semaines plus tard pour encaisser. Sol et Luna, ce sont les GPT-6 qui coûtent moitié prix et qui, sur les benchmarks maison d'OpenAI, battent Claude Opus 5 à 9 % de son tarif — un chiffre présenté avec le calme d'un vendeur qui te dit que la promo finit ce soir. Le vrai sujet est là : pour les agents qui tournent en boucle pendant des heures, la facture compte autant que l'intelligence. Quand un chercheur OpenAI brûle 600 dollars de tokens par jour en médiane, on comprend pourquoi le prix devient soudain une caractéristique produit.

À retenir

  1. 1

    OpenAI étend la famille GPT-6 avec Sol et Luna, entraînés avec des méthodes similaires à celles d'Astra mais positionnés sur l'efficacité coût.

  2. 2

    Les prix API baissent de 50 % par rapport au tarif promotionnel GPT-5.6 : Sol passe à 2 $ / 10 $ par million de tokens (entrée / sortie), Luna à 0,10 $ / 0,50 $.

  3. 3

    Sur AutomationBench 1.0.6, Sol en effort xhigh obtient 33,2 % pour 0,27 $ par tâche, contre 26,9 % pour Claude Opus 5 en effort max, soit 11,1 fois plus cher.

  4. 4

    Sur DeepSWE v1.1, Sol en max atteint 68,8 %, à 1,1 point du meilleur score de Claude Fable 5 dans l'évaluation, pour environ 80 % moins cher par tâche.

  5. 5

    La fiabilité factuelle progresse : Sol commet environ deux fois moins d'erreurs que son prédécesseur sur l'évaluation interne construite à partir de conversations réelles signalées par les utilisateurs.

  6. 6

    Le prompt caching est retravaillé : meilleurs taux de hit par défaut, 90 % de remise sur les tokens d'entrée mis en cache, dashboard et outil de diagnostic, et changements d'effort ou d'outils sans casser le cache.

  7. 7

    Disponibles dès aujourd'hui dans ChatGPT Work et Codex pour Plus, Pro, Business, Enterprise et Edu ; Luna arrive aussi pour les comptes Free et Go dans l'app desktop, et l'API expose gpt-6-sol et gpt-6-luna.

Une famille à trois étages

Astra reste, dans le discours d'OpenAI, le sommet : le modèle le plus intelligent et le plus aligné, celui qu'on choisit quand on ne veut aucun compromis. Sol et Luna ne prétendent pas le remplacer, mais occuper les deux étages en dessous, là où se déroule l'essentiel du travail quotidien.

L'argument central n'est pas « plus intelligent » mais « même génération, moins cher ». OpenAI affirme avoir entraîné Sol et Luna avec des méthodes similaires à celles d'Astra, transférant ses avancées en travail professionnel, factualité, code, usage de l'ordinateur et alignement vers des modèles plus rapides.

Le vocabulaire employé est révélateur : l'entreprise parle de « faire avancer la frontière sur l'efficacité coût ». La compétition ne se joue plus seulement sur le score maximal atteignable, mais sur la position occupée le long de la courbe coût/intelligence.

La guerre des prix par tâche

La baisse tarifaire est nette : 2 $ en entrée et 10 $ en sortie par million de tokens pour Sol, 0,10 $ et 0,50 $ pour Luna, soit moitié moins que le tarif promotionnel des GPT-5.6 correspondants. OpenAI attribue cette marge à des gains d'infrastructure sur le caching et l'inférence, répercutés sur les clients.

Mais la métrique mise en avant partout dans le billet n'est pas le prix du token : c'est le coût par tâche. Sur AutomationBench, un test de workflows métier mobilisant 47 outils dans la vente, le marketing, les opérations, le support, la finance et les RH, Sol en effort xhigh score 33,2 % pour 0,27 $ par tâche, là où Claude Opus 5 en max plafonne à 26,9 % pour 11,1 fois ce coût.

OpenAI va jusqu'à noter que le point de Claude Fable 5.1 sous-estime son coût réel, puisqu'il omet les recours de secours vers Opus 5, survenus sur environ 40 % des tâches. On est dans la comparaison compétitive assumée, avec le niveau de détail méthodologique qui va avec — et l'avertissement habituel que les scores concurrents proviennent de rapports publics.

Détail piquant : Sol en xhigh dépasse aussi Astra en effort low (33,2 % contre 30,3 %), pour près de quatre fois moins cher. La hiérarchie des modèles n'est plus linéaire, elle dépend du niveau d'effort choisi.

Code, factualité, usage de l'ordinateur

Sur le code, OpenAI justifie sa logique par ses propres chiffres internes : valorisée aux prix de l'API, la consommation quotidienne de tokens dépasse 600 $ pour le chercheur médian et 7 000 $ au 90e centile. Quand les agents de code travaillent longtemps, le coût d'usage soutenu devient la contrainte principale.

Les résultats suivent cette logique : sur DeepSWE v1.1, Sol en max atteint 68,8 %, à 1,1 point du meilleur score de Claude Fable 5 dans l'évaluation, pour environ 80 % moins cher par tâche. Luna en max obtient 66,6 %, comparable à Opus 5 et Fable 5 en effort medium, mais 93 % et 96 % moins cher respectivement.

Côté factualité, OpenAI évalue ses modèles sur des conversations ChatGPT dés-identifiées où des utilisateurs avaient signalé une erreur. Sol y commet environ deux fois moins d'erreurs que son prédécesseur ; Luna à effort élevé égale GPT-5.6 Sol pour environ un centième de son coût. L'entreprise précise que ces conversations, choisies parce qu'elles induisent des erreurs, ne reflètent pas l'usage typique.

Sur l'usage de l'ordinateur, Astra reste présenté comme le meilleur modèle au monde. Sol en xhigh obtient 60,5 % sur OSWorld 2.0 offline, à égalité avec Opus 5 en medium (60,3 %), pour environ 80 % de coût en moins par tâche.

Le caching, arme discrète des agents

La partie la moins spectaculaire du billet est peut-être la plus structurante. OpenAI annonce de meilleurs taux de cache hit par défaut sur GPT-6, avec une remise de 90 % sur la lecture des tokens d'entrée mis en cache — un levier décisif quand un agent réinjecte le même contexte à chaque tour.

Trois nouveautés outillent les développeurs : un Prompt Caching Dashboard pour suivre la part d'entrée mise en cache, un outil de diagnostic qui explique les occasions manquées, et des breakpoints explicites pour choisir où s'arrête le préfixe caché. Surtout, modifier l'effort de raisonnement ou activer/désactiver des outils ne casse plus le cache.

La preuve sociale vient de GitHub : sur les derniers mois, ces améliorations auraient réduit de plus de 50 % la part de tokens de prompt nécessitant un traitement frais, sur des milliards de requêtes, accélérant les réponses de Copilot.

Style, alignement et disponibilité

OpenAI a également transféré à Sol et Luna le style de communication d'Astra : plus de clarté, moins de jargon, moins de tournures étranges, moins de détails à faible valeur, et des réponses légèrement plus courtes. L'entreprise illustre son propos avec un exemple de prompt front-end React, en expliquant pourquoi elle préfère la réponse de GPT-6 Sol — plus explicite sur ce qui a été vérifié ou non, moins bavarde sur ses propres outils.

Sur l'alignement, les deux modèles s'améliorent par rapport à leurs équivalents GPT-5.6, notamment sur le taux d'affirmations trompeuses concernant leur propre travail de code. OpenAI rappelle que ces évaluations testent délibérément des situations difficiles et ne mesurent pas des taux d'échec en usage normal ; la system card contient les résultats complets.

Le déploiement est immédiat mais partiel : ChatGPT Work et Codex pour Plus, Pro, Business, Enterprise et Edu, Luna dans l'app desktop pour Free et Go. Les modèles ne sont pas encore disponibles dans Chat, et le rollout s'étale sur la journée pour préserver la stabilité du service.

GPT-6 Astra continues to be our best model across the board.
GPT-6 Sol at xhigh effort outperforms Claude Opus 5 at max effort at just 9% of Opus 5's cost per task.
Daily token usage has exceeded $600 for the median researcher and $7,000 for researchers at the 90th percentile.

Pourquoi ça compte

Cette annonce dit moins sur l'état de l'art que sur l'état du marché. En déclinant GPT-6 en trois niveaux et en divisant les prix par deux, OpenAI reconnaît que la bataille ne se gagne plus au sommet des benchmarks mais sur le coût par tâche réussie — la seule métrique qui compte quand des agents tournent en continu. Le choix de comparer systématiquement Sol et Luna à Claude Opus 5 et Fable 5.1, en insistant sur des ratios de 9 % ou 4 % du coût concurrent, est une attaque directe sur le terrain où Anthropic s'est installé, celui des agents de code en entreprise. Reste la prudence d'usage : ces chiffres proviennent d'évaluations menées par OpenAI dans son environnement de recherche, les scores concurrents sont repris de rapports publics, et les niveaux d'effort comparés ne sont pas toujours identiques — un modèle en « xhigh » face à un concurrent en « medium » n'est pas une égalité neutre. Le signal le plus solide est ailleurs : dans le travail sur le caching et dans l'aveu que même en interne, la facture de tokens est devenue un problème de gestion.

#openai#gpt-6#llm#api#agents#coût
Source originale
Introducing GPT-6 Sol and Luna
OpenAI
De première mainBillet d'annonce publié par OpenAI sur ses propres modèles, avec ses propres évaluations.
Ouvrir l'article

Pour les équipes

La même machine, sur vos sujets.

Vos sources, votre équipe, chaque matin, dans votre langue. Pilote ouvert à trois entreprises.

Demander un accès pilote

À lire aussi