Classé #4 Programmation — L'IA qui écrit du code de production
OpenAI

GPT-6.1 Sol

GPT-6.1 Sol est l'agent de programmation que vous pouvez laisser tourner toute la journée sans surveiller la facture. Lors de tests indépendants, il se classe à un ou deux points seulement de GPT-6 Astra, le modèle phare d'OpenAI, tout en coûtant moins d'un quart du prix pour une tâche classique. Le tarif des jetons reste inchangé par rapport à GPT-6 Sol (2 $ en entrée, 10 $ en sortie par million), mais relire du code en cache ne coûte désormais que 0,10 $ par million de jetons, ce qui représente une économie majeure pour les grands dépôts.

Mis à jour 30 septembre 2026 Value Coding AgentDeepSWE 75.2%$0.10 Cached Input
9.8sur 10
Site officiel
Idéal pour

GPT-6.1 Sol est l'agent de programmation que vous pouvez laisser tourner toute la journée sans surveiller la facture. Lors de tests indépendants, il se classe à un ou deux points seulement de GPT-6 Astra, le modèle phare d'OpenAI, tout en coûtant moins d'un quart du prix pour une tâche classique. Le tarif des jetons reste inchangé par rapport à GPT-6 Sol (2 $ en entrée, 10 $ en sortie par million), mais relire du code en cache ne coûte désormais que 0,10 $ par million de jetons, ce qui représente une économie majeure pour les grands dépôts.

Pourquoi ça Gagne

Artificial Analysis (29 septembre 2026) l'a mesuré à un point en dessous de GPT-6 Astra sur son Indice d'Intelligence (52 contre 53) pour 0,72 $ par tâche au lieu de 3,26 $. Sur l'Indice des Agents de Programmation, son paramètre 'xhigh' a dépassé Astra d'un point pour moins de 15 % du coût. OpenAI annonce 75,2 % sur DeepSWE v1.1 avec un effort élevé (high effort), et sur FrontierCode 1.1 de Cognition, il obtient 58,1 % à faible effort pour 0,21 $ par tâche, soit le meilleur résultat sous la barre des 0,30 $ dans ce classement.

À surveiller

Son score de qualité d'intégration (merge quality) ne s'est pas amélioré : sur FrontierCode 1.1, il obtient 60,4 %, soit le même score que GPT-6 Sol. Le gain se situe au niveau du coût, et non d'un plafond de performances plus élevé. Les propres tableaux d'OpenAI montrent que GPT-6 Astra reste nettement en tête pour le travail scientifique en terminal. Claude Sonnet 5.5 obtient des scores plus élevés sur l'indice général d'Artificial Analysis, bien qu'il coûte beaucoup plus cher par tâche. Dans ChatGPT, il n'est disponible que dans Work et Codex, via les abonnements payants.

01

Ce que c'est réellement

Imaginez un chantier avec deux grutiers.

L’un est le vétéran qu’on appelle pour le levage que personne d’autre n’ose faire : glisser une poutre en acier entre deux tours sous un fort vent latéral. L’autre grutier est presque aussi bon et ne demande qu’une fraction du tarif journalier. Pour tous les levages ordinaires, comme les palettes de briques, les charpentes ou le travail quotidien, il serait absurde de réserver le vétéran.

GPT-6.1 Sol est ce deuxième opérateur, et ce mois-ci, l’écart de compétence entre les deux s’est considérablement réduit.

Un lancement né d’une annulation

OpenAI a lancé GPT-6.1 Sol lors de son événement DevDay le 29 septembre 2026, seulement une semaine après GPT-6 Sol. Le choix de ce moment avait une histoire. La veille, OpenAI avait annulé le lancement prévu de GPT-6.1 Astra après que des tests internes ont révélé que le modèle ne respectait pas de manière fiable la portée et les autorisations de ses tâches. Sol 6.1 est un modèle distinct, plus compact, et son propre rapport de sécurité semble plus solide : dans un test d’OpenAI pour savoir si un agent admet que son outil de recherche est défaillant plutôt que de deviner, GPT-6.1 Sol a omis de le signaler dans 2,1 % des cas, contre 4,9 % pour GPT-6 Sol et 1,5 % pour GPT-6 Astra.

L’argument de vente d’OpenAI est direct : une intelligence proche de celle d’Astra pour un cinquième de son prix.

Est-il vraiment proche d’Astra ?

C’est la partie qui compte, et pour une fois, nous n’avons pas besoin de croire le fournisseur sur parole.

Artificial Analysis, une firme de test indépendante, a exécuté ses propres évaluations le jour du lancement. Sur son Indice d’Intelligence, qui combine dix évaluations exigeantes, GPT-6.1 Sol, à effort maximal, a obtenu un score de 52, soit un point derrière les 53 de GPT-6 Astra et quatre points devant GPT-6 Sol. Sur son Indice des Agents de Programmation, le résultat est encore plus serré : à effort maximal, Sol se trouve 2 points derrière Astra, et au deuxième paramètre le plus élevé, ‘xhigh’, il a dépassé Astra d’un point pour moins de 15 % du coût par tâche.

Cognition, l’entreprise derrière l’agent de programmation Devin, l’a testé sur FrontierCode 1.1, un benchmark qui pose une question stricte : un ingénieur senior intégrerait-il (merge) véritablement cette modification ? Le meilleur score de GPT-6.1 Sol est de 60,4 %, soit quasiment la même performance que GPT-6 Sol (60,7 %). La différence réside dans l’argent. À un niveau d’effort moyen, il dépense 0,31 $ par tâche, soit 81 % de moins que ce qu’a dépensé GPT-6 Sol (à son maximum) pour obtenir son meilleur résultat. À un effort faible, il atteint 58,1 % pour seulement 0,21 $, en nette progression par rapport aux 50,5 % de GPT-6 Sol sur ce même réglage.

Les propres chiffres d’OpenAI vont dans le même sens. Sur DeepSWE v1.1, impliquant des tâches d’ingénierie complexes dans des bases de code réelles, leur tableau affiche 75,2 % à un effort élevé (High Effort) pour 0,65 $ par tâche. C’est 6,4 points de plus que le meilleur score de GPT-6 Sol et légèrement supérieur au meilleur score d’Astra (74,1 %), qui coûte 4,43 $ par tâche. Une curiosité mérite d’être signalée : aux réglages ‘xhigh’ et ‘max’, GPT-6.1 Sol obtient paradoxalement un score plus faible, à 71,9 %. Penser plus longtemps n’est pas toujours penser mieux.

Le bilan honnête est donc le suivant : une programmation à peu près au niveau d’Astra, et la même qualité d’intégration que le modèle Sol de la semaine dernière, pour un prix par tâche terminée nettement inférieur.

Pourquoi le prix du cache fait toute la différence

Un agent de programmation ne lit jamais votre projet qu’une seule fois. À chaque fois qu’il exécute un test, lit l’erreur et fait une nouvelle tentative, il relit les mêmes fichiers, les mêmes instructions et le même historique. Au cours d’une longue session, cela peut signifier que les mêmes centaines de milliers de jetons sont réinjectés dans le modèle des dizaines de fois.

C’est précisément ce que couvre l’entrée mise en cache (Cached Input) : du texte que le modèle a vu récemment au cours de cette session. GPT-6.1 Sol facture 0,10 $ par million de jetons mis en cache, soit 95 % de réduction sur le prix normal de 2 $ et la moitié du prix du cache de GPT-6 Sol. Les prix d’entrée et de sortie normaux restent à 2 $ et 10 $ par million, soit un cinquième des 10 $/50 $ de GPT-6 Astra.

Faites l’addition et vous obtenez le chiffre qui compte le plus : Artificial Analysis a calculé qu’il en coûtait environ 0,72 $ par tâche pour exécuter son indice avec GPT-6.1 Sol, contre 3,26 $ pour GPT-6 Astra, 5,98 $ pour Claude Opus 5.5, et 7,60 $ pour Claude Sonnet 5.5. Une mise en garde cependant : les prompts de plus de 272 000 jetons coûtent le double en entrée et 1,5 fois en sortie, rendant les requêtes individuelles véritablement massives plus chères.

Ne poussez pas la jauge à fond

GPT-6.1 Sol possède cinq réglages d’effort : faible (low), moyen (medium - par défaut), élevé (high), très élevé (xhigh) et maximal (max). Il est tentant de penser que le réglage maximal (‘max’) est toujours le meilleur. Sur l’Indice des Agents de Programmation d’Artificial Analysis, ce n’est pas le cas : ‘xhigh’ a obtenu un meilleur score que ‘max’, et coûte moins cher. Pour les correctifs de routine, un effort faible (’low’) ou moyen (‘medium’) est souvent suffisant, comme le démontre le résultat de 58,1 % de Cognition pour 0,21 $. Réservez ‘xhigh’ pour les problèmes nécessitant réellement une réflexion approfondie.

Ses limites honnêtes

  • Un meilleur rapport qualité-prix, pas un meilleur code. Sur FrontierCode 1.1, la qualité d’intégration stagne par rapport à GPT-6 Sol et GPT-5.6 Sol. Si votre problème était que les correctifs de Sol n’étaient pas assez bons, la version 6.1 ne résout pas cela. Elle rend ces mêmes correctifs beaucoup moins chers.
  • La science reste le domaine d’Astra. Sur le Terminal-Bench Science 0.1 d’OpenAI (analyse de données, simulations et preuve de théorèmes dans un terminal), GPT-6.1 Sol obtient un score de 57,0 % à l’effort maximal. C’est plus du double par rapport aux 27,6 % de GPT-6 Sol, mais bien en retrait face à GPT-6 Astra (68,1 %) et Claude Opus 5.5 (63,3 %). La tâche coûte alors 5,47 $, contre environ 23 $ pour chacun de ses rivaux.
  • Claude obtient de meilleurs scores sur l’indice général. Claude Opus 5.5 (58) et Claude Sonnet 5.5 (56) restent devant GPT-6.1 Sol (52) sur l’Indice d’Intelligence d’Artificial Analysis. Et même si Artificial Analysis a mesuré un gain de 12 points sur Terminal-Bench 4.0 pour GPT-6.1 Sol face à GPT-6 Sol, les 64 % de Sonnet lors de ce test demeurent supérieurs. Sonnet y parvient cependant en brûlant beaucoup plus de jetons, ce qui fait que Sol gagne sur la question du coût par tâche.
  • Pas dans le Chat standard. Dans ChatGPT, GPT-6.1 Sol est accessible dans ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu. Les développeurs l’utilisent dans l’API sous le nom de gpt-6.1-sol. OpenAI indique qu’un mode “Ultrafast” plus rapide pour Codex est à venir, mais il n’est pas encore en ligne.

Qui devrait l’utiliser

Si votre travail ressemble à… Choisissez Pourquoi
Des bugs, des tests, des refontes, des agents tournant dans la CI toute la journée GPT-6.1 Sol Une programmation quasi-phare pour une fraction du coût par tâche
Calcul scientifique, les tâches d’utilisation d’un ordinateur les plus difficiles GPT-6 Astra Clairement en tête sur les terminaux scientifiques
Jugements complexes et architectures ouvertes Claude Opus 5.5 Score le plus élevé sur l’indice indépendant général
Longues sessions en terminal où les jetons ne comptent pas Claude Sonnet 5.5 Un score terminal indépendant plus solide, mais une forte consommation de jetons

Le verdict pour la programmation

GPT-6.1 Sol ne relève pas le plafond. Ce qu’il fait, c’est mettre ce plafond à la portée d’un budget ordinaire. Des tests indépendants le placent à un ou deux points du modèle phare d’OpenAI pour moins d’un quart du coût par tâche, et son tarif de mise en cache est parfaitement adapté à la façon dont travaillent réellement les agents de programmation. Confiez-lui vos tâches en attente (backlog), réglez-le sur ‘xhigh’ pour les tickets les plus compliqués, et ne faites appel à Astra ou Opus que lorsqu’il reste bloqué.

02

Forces et limites honnêtes

Points Forts

  • Programmation quasi-phare, vérifiée de manière indépendante : Artificial Analysis a évalué l’Indice des Agents de Programmation le 29 septembre 2026. À effort maximal, GPT-6.1 Sol se situe 2 points en dessous de GPT-6 Astra, et son réglage ‘xhigh’ dépasse même Astra de 1 point pour moins de 15 % du coût par tâche.
  • Bon marché par tâche terminée, pas seulement par jeton : L’exécution complète de l’indice d’Artificial Analysis coûte environ 0,72 $ par tâche avec GPT-6.1 Sol, contre 3,26 $ pour GPT-6 Astra, 5,98 $ pour Claude Opus 5.5, et 7,60 $ pour Claude Sonnet 5.5, tous à effort maximal.
  • Un prix de cache conçu pour les grandes bases de code : Relire du texte que le modèle a déjà vu, comme votre dépôt, coûte 0,10 $ par million de jetons : c’est 95 % de réduction par rapport au prix d’entrée normal et la moitié du tarif de cache de GPT-6 Sol. Les agents de programmation relisant constamment les mêmes fichiers, c’est là que réside la plus grande part des économies.
  • Performant même à faible effort : Sur FrontierCode 1.1 de Cognition, qui évalue si les modifications de code sont assez bonnes pour être intégrées, GPT-6.1 Sol obtient 58,1 % à faible effort (low effort) pour 0,21 $ par tâche, en hausse par rapport aux 50,5 % de GPT-6 Sol avec les mêmes paramètres. Quel que soit le niveau d’effort, il revient 44 à 57 % moins cher par tâche que GPT-6 Sol.
  • Un bond plus important sur de véritables tâches d’ingénierie : Sur DeepSWE v1.1, le graphique d’OpenAI montre 75,2 % à un effort élevé (High Effort) pour 0,65 $ par tâche, soit 6,4 points de plus que le meilleur résultat de GPT-6 Sol (68,8 % au maximum, 2,74 $) et légèrement au-dessus du meilleur résultat de GPT-6 Astra (74,1 % en ‘xhigh’, 4,43 $).

Limites Honnêtes

  • La qualité d’intégration n’a pas évolué : Sur FrontierCode 1.1, son meilleur score de 60,4 % égale celui de GPT-6 Sol (60,7 %) et de GPT-5.6 Sol (60,6 %). Vous obtenez la même qualité de code prêt à être intégré (merge-ready) pour beaucoup moins d’argent, mais pas un meilleur code.
  • Ce n’est pas le modèle pour les terminaux scientifiques : Sur le test Terminal-Bench Science 0.1 d’OpenAI, qui couvre l’analyse de données, les simulations et la démonstration de théorèmes, GPT-6.1 Sol obtient 57,0 % à effort maximal, soit plus du double de GPT-6 Sol (27,6 %), mais nettement derrière GPT-6 Astra (68,1 %) et Claude Opus 5.5 (63,3 %).
  • Claude domine toujours l’indice général : Sur l’Indice d’Intelligence d’Artificial Analysis, Claude Opus 5.5 (58) et Claude Sonnet 5.5 (56) devancent GPT-6.1 Sol (52). Artificial Analysis a mesuré un gain de 12 points sur Terminal-Bench 4.0 par rapport à GPT-6 Sol, mais le score de 64 % de Sonnet 5.5 lors de son lancement reste plus élevé, bien que Sonnet consomme beaucoup plus de jetons pour l’atteindre.
  • L’effort maximal n’est pas le meilleur réglage : Sur l’Indice des Agents de Programmation d’Artificial Analysis, ‘xhigh’ a obtenu un meilleur score que ‘max’. Le propre tableau DeepSWE d’OpenAI montre la même tendance : 75,2 % à un effort élevé (high effort), mais retombe à 71,9 % en ‘xhigh’ et ‘max’, qui coûtent plus cher.
  • De nombreux chiffres phares proviennent d’OpenAI : DeepSWE, OSWorld, GDP.pdf et AutomationBench sont tirés des tableaux de lancement d’OpenAI. Les résultats d’Artificial Analysis et de Cognition sont indépendants, et s’accordent globalement.
03

Aperçu des Benchmarks

Indice des Agents de Programmation d'Artificial Analysis — au-dessus de GPT-6 Astra en xhigh

Indépendant, 29 septembre 2026. À l'effort 'xhigh', GPT-6.1 Sol dépasse GPT-6 Astra de 1 point pour moins de 15 % du coût par tâche d'Astra. Au maximum ('max'), il se situe 2 points en dessous d'Astra et 3 points au-dessus de GPT-6 Sol.

Indice d'Intelligence d'Artificial Analysis — 52 (Effort maximal)

Composite indépendant de 10 évaluations, incluant Terminal-Bench 4.0 et SciCode. Un point en dessous de GPT-6 Astra (53), en hausse par rapport aux 48 de GPT-6 Sol, pour 0,72 $ par tâche contre 3,26 $ pour Astra.

FrontierCode 1.1 — 60,4 % (meilleur) ; 58,1 % à 0,21 $ (Faible effort)

Référence de Cognition pour le code prêt à l'intégration, publiée le 29 septembre 2026. Le meilleur score est au même niveau que GPT-6 Sol. Le résultat à faible effort est le plus élevé de tous les modèles sous 0,30 $ par tâche de ce classement.

DeepSWE v1.1 — 75,2 % (Effort élevé, 0,65 $ par tâche)

Tableau d'OpenAI pour les tâches d'ingénierie complexes dans des bases de code réelles. Le meilleur score de GPT-6 Astra est de 74,1 % en 'xhigh' pour 4,43 $ ; le meilleur de GPT-6 Sol est de 68,8 % au maximum ('max') pour 2,74 $. GPT-6.1 Sol tombe à 71,9 % en 'xhigh' et 'max'.

Terminal-Bench Science 0.1 — 57,0 % (Effort maximal, 5,47 $ par tâche)

Flux de travail scientifiques dans un terminal, selon le tableau d'OpenAI. GPT-6 Astra mène avec 68,1 % (23,80 $ par tâche), Claude Opus 5.5 obtient 63,3 % (23,21 $), et GPT-6 Sol 27,6 % (12,18 $).

Prix — 2 $ / 10 $ par million de jetons, 0,10 $ en cache

Même prix de jeton que GPT-6 Sol et un cinquième des 10 $/50 $ de GPT-6 Astra. Les prompts de plus de 272 000 jetons en entrée coûtent 2× en entrée et 1,5× en sortie ; Batch et Flex bénéficient de 50 % de réduction.

04

Le Verdict

GPT-6.1 Sol s’adresse aux équipes qui souhaitent des agents de programmation de niveau quasi-phare, fonctionnant toute la journée à des tarifs de milieu de gamme. Des tests indépendants le placent à un ou deux points de GPT-6 Astra pour moins d’un quart du coût par tâche. Il se classe juste derrière Claude Sonnet 5.5, car Sonnet obtient de meilleurs scores sur l’indice général indépendant et sur le travail en terminal, et parce que le score de qualité d’intégration de Sol n’a pas bougé par rapport à GPT-6 Sol. Il devance Claude Fable 5.1 pour la programmation quotidienne grâce à son coût par tâche terminée. Conservez GPT-6 Astra pour les terminaux scientifiques et les tâches d’utilisation d’un ordinateur les plus exigeantes. Confiez à GPT-6.1 Sol vos tâches en attente (backlog), et privilégiez le réglage ‘xhigh’ avant ‘max’.

05

Foire aux questions