Source primaireIAArticle··5 min de lecture

GPT-6.1 Sol : presque Astra, pour un cinquième du prix

OpenAI met à jour son modèle intermédiaire et promet les performances de son haut de gamme sur le code, les agents et le travail pro, avec une facture divisée par cinq.

GPT-6.1 Sol : presque Astra, pour un cinquième du prix
Source : OpenAI · OpenAIVoir l'original ↗

En bref

OpenAI lance GPT-6.1 Sol, une mise à jour de GPT-6 Sol qui s'approche de GPT-6 Astra sur le code agentique, l'usage d'ordinateur et les tâches professionnelles, à un cinquième de son prix API. Le cache d'entrée tombe à 0,10 $ par million de tokens, un signal clair envoyé aux développeurs d'agents qui réutilisent beaucoup de contexte.

🍺 Version comptoir

OpenAI a deux modèles : le très cher qui sait tout faire, et le moins cher qui sait presque tout faire. Là, le moins cher vient de rattraper le très cher sur à peu près tout, sauf la recherche scientifique de pointe, pour cinq fois moins. C'est comme découvrir que le vin de la maison vaut le grand cru, avec une étiquette rédigée par le restaurant lui-même. Si les chiffres tiennent hors du labo, faire tourner des agents toute la journée cesse d'être un luxe.

À retenir

  1. 1

    GPT-6.1 Sol coûte 2 $ par million de tokens en entrée, 0,10 $ en entrée cachée et 10 $ en sortie, soit un cinquième des tarifs standard de GPT-6 Astra.

  2. 2

    Le cache d'entrée est 95 % moins cher que l'entrée standard et 50 % moins cher que celui de GPT-6 Sol, un argument taillé pour les agents qui réutilisent leur contexte.

  3. 3

    Sur DeepSWE v1.1, il égale GPT-6 Astra pour environ un cinquième du coût et dépasse GPT-6 Sol de 6,4 points.

  4. 4

    Sur Terminal-Bench Science 0.1, il coûte 5,47 $ par tâche en moyenne contre 23,21 $ pour Opus 5.5 et 23,80 $ pour Astra, qui reste en tête avec 68,1 %.

  5. 5

    Sur OSWorld 2.0, il gagne 7 points sur GPT-6 Sol et se place à 2,1 points d'Astra pour environ un septième du coût par tâche.

  6. 6

    Le taux de réponses contenant une erreur factuelle passe de 11,4 % à 7,7 % en effort de raisonnement faible, soit environ 32 % d'erreurs en moins.

  7. 7

    Disponible dès maintenant dans ChatGPT Work et Codex pour les offres Plus, Pro, Business, Enterprise et Edu, ainsi que dans l'API (gpt-6.1-sol), mais pas encore dans Chat.

Le milieu de gamme qui vise le haut

GPT-6.1 Sol est une mise à jour de GPT-6 Sol, le modèle intermédiaire d'OpenAI. Sa promesse tient en une ligne : une intelligence « proche d'Astra » sur le code agentique, l'usage d'ordinateur et le travail professionnel, pour un cinquième des tarifs standard d'Astra en entrée comme en sortie.

OpenAI présente le modèle comme un nouvel équilibre entre capacité et coût pour le travail quotidien : écrire et déboguer du code, comprendre des documents, exécuter des workflows métier en plusieurs étapes. La comparaison se fait autant avec son grand frère Astra qu'avec la concurrence, notamment Opus 5.5.

Code et travail pro : les chiffres mis en avant

Sur DeepSWE v1.1, qui évalue des tâches d'ingénierie logicielle dans de vraies bases de code, GPT-6.1 Sol égale Astra pour environ un cinquième du coût. Il dépasse aussi le meilleur score de GPT-6 Sol de 6,4 points, avec un effort de raisonnement et un coût plus faibles.

Sur GDP.pdf, qui mesure la justesse des réponses à des questions professionnelles portant sur des PDF complexes (tableaux, graphiques, schémas, petits caractères) dans la finance, la santé, le droit et sept autres domaines, il dépasse Opus 5.5 avec fallbacks pour moins de la moitié du coût par tâche.

Sur AutomationBench 1.0.6, qui teste des workflows complets avec 47 outils (ventes, marketing, opérations, support, finance, RH), il devance Opus 5.5 de 2,2 points en effort moyen, pour environ un tiers du coût, et gagne 4,8 points sur GPT-6 Sol. OpenAI précise que le coût affiché pour Claude Fable 5.1 est sous-estimé car il omet les fallbacks, survenus sur environ 40 % des tâches.

Usage d'ordinateur et science

Sur le jeu hors ligne d'OSWorld 2.0, qui évalue des workflows longs d'utilisation d'applications, GPT-6.1 Sol gagne 7 points sur GPT-6 Sol en effort maximal, pour moins de la moitié du coût. Il se place à 2,1 points d'Astra pour environ un septième du coût par tâche.

Sur Terminal-Bench Science 0.1 (analyse de données, simulation, preuve de théorèmes), il fait plus que doubler le score de GPT-6 Sol. En effort maximal, il coûte 5,47 $ par tâche, contre 23,21 $ pour Opus 5.5 et 23,80 $ pour Astra, soit plus de 75 % d'économie.

OpenAI fixe toutefois une limite : Astra reste le meilleur modèle testé sur ce benchmark, avec 68,1 %, et doit être privilégié pour les tâches de recherche scientifique les plus difficiles.

Factualité et alignement

La factualité est mesurée sur des conversations ChatGPT anonymisées où des utilisateurs avaient signalé une erreur d'un modèle précédent. En effort faible, la part de réponses fautives passe de 11,4 % à 7,7 %. Sur l'ensemble des réglages, l'écart avec Astra reste inférieur à 1,9 point, pour moins d'un cinquième du coût.

OpenAI insiste sur le fait que ces prompts, volontairement difficiles, ne reflètent pas l'usage courant. Côté alignement, le modèle serait plus transparent sur ses limites (par exemple face à un outil de recherche en panne), plus respectueux des restrictions explicites et moins enclin à produire des résultats non autorisés en mode agent. Aucune tentative de contourner le relecteur de sécurité automatisé n'a été observée, comme pour Astra et GPT-6 Sol. Les détails figurent dans un addendum à la system card.

Prix et disponibilité

Le modèle est disponible dès aujourd'hui pour les utilisateurs Plus, Pro, Business, Enterprise et Edu dans ChatGPT Work et Codex, mais pas encore dans Chat. Les développeurs y accèdent via l'API sous le nom gpt-6.1-sol.

Les tarifs : 2 $ par million de tokens en entrée, 0,10 $ en entrée cachée, 10 $ en sortie. Dans les prochains jours, OpenAI proposera aussi GPT-6.1 Sol Ultrafast dans Codex, avec une génération de tokens jusqu'à 8 fois plus rapide que la vitesse standard.

“Near-Astra intelligence for a fifth of the price”
“GPT‑6 Astra still achieves the highest score among the models tested at 68.1%, and should be used for the most difficult scientific research tasks.”
“We observed no attempts to bypass an automated safety reviewer, matching GPT‑6 Astra and GPT‑6 Sol.”

Pourquoi ça compte

L'annonce dit moins « voici un modèle plus intelligent » que « voici l'intelligence d'hier à une fraction du prix ». C'est le vrai terrain de jeu de 2026 : les agents consomment énormément de tokens, relisent sans cesse le même contexte, et leur viabilité économique dépend du coût par tâche plus que du score brut. Le cache à 0,10 $ le million et la communication systématique en coût par tâche le montrent. Il faut cependant lire ces chiffres avec prudence. Tous les résultats sont publiés par OpenAI, souvent à des niveaux d'effort de raisonnement choisis pour chaque benchmark. Certains tests (GDP.pdf, AutomationBench) sont peu connus. Et les comparaisons de coût avec les concurrents dépendent de conventions discutables, comme le reconnaît la note sur les fallbacks de Claude Fable 5.1. Enfin, le fait qu'Astra garde la tête en science et que Sol ne soit pas encore dans Chat indique une segmentation assumée : Sol pour le travail en volume, Astra pour les tâches les plus difficiles. Pour les équipes qui font tourner des agents en production, c'est la bonne nouvelle du trimestre, à condition de refaire les mesures sur leurs propres tâches.

#openai#llm#agents#api#codex#benchmarks
Source originale
Introducing GPT-6.1 Sol
OpenAI
Source primaireIl s'agit du billet d'annonce officiel d'OpenAI qui présente son propre modèle, ses benchmarks et ses tarifs.
Ouvrir l'article ↗

Pour vous

Faites-la travailler sur vos sources.

Gratuit : les articles de la semaine et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.

Pour votre équipe

La même machine, sur vos sujets.

Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.

À lire aussi