Представьте себе стройплощадку, где работают два крановщика.
Один из них — ветеран, которого приглашают для подъема грузов, за которые больше никто не берется: например, продеть стальную балку между двумя башнями при сильном боковом ветре. Другой оператор почти так же хорош, но берет лишь малую долю от дневной ставки первого. При любых обычных работах — подъеме поддонов с кирпичами, кровельных ферм или выполнении повседневных задач — нанимать ветерана было бы просто глупо.
GPT-6.1 Sol — это тот самый второй оператор, и в этом месяце разница в квалификации между ними стала совсем небольшой.
Релиз, родившийся из-за отмены
OpenAI выпустила GPT-6.1 Sol на своем мероприятии DevDay 29 сентября 2026 года, всего через неделю после выхода GPT-6 Sol. За таким графиком скрывалась своя история. За день до этого OpenAI отменила запланированный запуск GPT-6.1 Astra, поскольку внутреннее тестирование показало, что модель не может надежно оставаться в рамках заданных масштабов и разрешений своих задач. Sol 6.1 — это отдельная, более компактная модель, и ее собственный отчет о безопасности выглядит куда чище: в тесте OpenAI на то, признается ли агент в поломке своего поискового инструмента, а не пытается угадать, GPT-6.1 Sol скрыл проблему лишь в 2.1% случаев по сравнению с 4.9% у GPT-6 Sol и 1.5% у GPT-6 Astra.
Коммерческое предложение OpenAI предельно ясно: интеллект, близкий к Astra, за пятую часть цены.
Действительно ли модель близка к Astra?
Именно этот вопрос имеет решающее значение, и на этот раз нам не нужно полагаться только на заявления разработчика.
Artificial Analysis, независимая компания по тестированию, провела свои тесты в день выпуска модели. В ее Индексе интеллекта (Intelligence Index), который объединяет десять сложных тестов, GPT-6.1 Sol на максимальном уровне усилий получил 52 балла — отстав всего на один балл от GPT-6 Astra с ее 53 баллами и опередив GPT-6 Sol на четыре балла. В индексе Coding Agent Index разрыв еще меньше: на максимальном усилии (Max Effort) Sol отстает от Astra на 2 балла, а на втором по величине уровне усилий, xhigh, он действительно обогнал Astra на один балл, затратив на задачу менее 15% стоимости.
Cognition, компания, создавшая агента для программирования Devin, проверила модель с помощью FrontierCode 1.1 — бенчмарка, который ставит жесткий вопрос: стал бы старший разработчик действительно объединять (merge) это изменение? Лучший балл GPT-6.1 Sol составил 60.4%, что фактически повторяет показатель GPT-6 Sol (60.7%). Вся разница заключается в стоимости. При среднем уровне усилий модель тратит $0.31 на задачу — это на 81% меньше, чем потратил GPT-6 Sol на максимальном уровне усилий для достижения своего лучшего показателя. При низком уровне усилий она набирает 58.1% всего за $0.21, что выше результата GPT-6 Sol в 50.5% при аналогичных настройках.
Собственные данные OpenAI указывают на ту же тенденцию. В бенчмарке DeepSWE v1.1, проверяющем выполнение сложных инженерных задач на реальных кодовых базах, в их таблице указан результат 75.2% при высоком уровне усилий (High Effort) и стоимости $0.65 на задачу. Это на 6.4 балла выше максимального результата GPT-6 Sol и чуть выше лучшего результата Astra (74.1%), стоимость которого составляет $4.43 на задачу. Стоит упомянуть одну странность: на настройках xhigh и max GPT-6.1 Sol парадоксальным образом показывает более низкий результат — 71.9%. Больше размышлений не всегда означает лучшее качество мышления.
Следовательно, объективный итог таков: программирование примерно на уровне Astra и такое же качество объединения кода, как у модели Sol недельной давности, но по существенно более низкой цене за каждое завершенное задание.
Почему стоимость кэширования — это главная новость
Агент для программирования никогда не читает ваш проект лишь единожды. Каждый раз, когда он запускает тест, считывает ошибку и пробует снова, он перечитывает одни и те же файлы, инструкции и историю. Во время длинной сессии это может означать, что одни и те же несколько сотен тысяч токенов загружаются в модель десятки раз.
Это именно то, к чему относится кэшированный ввод (Cached Input): текст, который модель недавно уже видела во время данной сессии. GPT-6.1 Sol берет $0.10 за миллион кэшированных токенов — это скидка 95% от стандартных $2 и половина стоимости кэша GPT-6 Sol. Обычные тарифы на ввод и вывод остаются на уровне $2 и $10 за миллион, что в пять раз меньше тарифов GPT-6 Astra ($10/$50).
Сложите все это, и вы получите самую важную цифру: по оценке Artificial Analysis, выполнение их бенчмарка на GPT-6.1 Sol обходится примерно в $0.72 за задачу, по сравнению с $3.26 для GPT-6 Astra, $5.98 для Claude Opus 5.5 и $7.60 для Claude Sonnet 5.5. Есть только одна оговорка: промпты, размер которых превышает 272 000 входных токенов, обойдутся в 2 раза дороже при вводе и в 1.5 раза дороже при выводе, что делает единичные гигантские запросы весьма затратными.
Не выкручивайте уровень усилий на максимум
GPT-6.1 Sol имеет пять уровней настройки усилий (effort): низкий (low), средний (medium — по умолчанию), высокий (high), очень высокий (xhigh) и максимальный (max). Легко предположить, что “max” всегда лучше. В индексе Coding Agent Index (Artificial Analysis) это оказалось не так: настройка xhigh получила более высокий балл, чем max, и обошлась дешевле. Для повседневных исправлений зачастую достаточно уровней low или medium; это подтверждает результат Cognition — 58.1% за $0.21. Приберегите уровень “xhigh” для задач, действительно которым действительно нужно дополнительное обдумывание.
Объективные ограничения модели
- Более выгодная стоимость, а не улучшенный код. Качество готового к объединению кода в FrontierCode 1.1 не изменилось по сравнению с GPT-6 Sol и GPT-5.6 Sol. Если ваша проблема заключалась в том, что исправления от Sol были недостаточно качественными, версия 6.1 ее не решит. Она лишь делает те же самые исправления гораздо дешевле.
- Наука по-прежнему остается уделом Astra. В тесте OpenAI Terminal-Bench Science 0.1 (анализ данных, симуляции и доказательство теорем в терминале) GPT-6.1 Sol на максимальном усилии набирает 57.0%. Это более чем в два раза выше показателя GPT-6 Sol (27.6%), но значительно отстает от GPT-6 Astra (68.1%) и Claude Opus 5.5 (63.3%). При этом задача обходится в $5.47 по сравнению с примерно $23 у конкурентов.
- Claude лидирует в широком индексе. Claude Opus 5.5 (58) и Claude Sonnet 5.5 (56) продолжают опережать GPT-6.1 Sol (52) в Индексе интеллекта от Artificial Analysis. И хотя агентство зафиксировало для GPT-6.1 Sol прирост на 12 баллов по сравнению с GPT-6 Sol в тесте Terminal-Bench 4.0, базовый показатель Sonnet в 64% в этом тесте по-прежнему выше. Однако для достижения такого результата Sonnet сжигает куда больше токенов, так что Sol выигрывает по стоимости на задачу.
- Модель недоступна в стандартном чате. Внутри ChatGPT модель GPT-6.1 Sol доступна в интерфейсах ChatGPT Work и Codex для подписчиков тарифных планов Plus, Pro, Business, Enterprise и Edu. Разработчики используют ее в API под названием
gpt-6.1-sol. В OpenAI заявляют о разработке более быстрого режима “Ultrafast” для Codex, но в настоящий момент он еще не запущен.
Кому следует использовать эту модель
| Если ваша работа похожа на… | Выбирайте | Причина |
|---|---|---|
| Баги, тесты, рефакторинг, ИИ-агенты, круглосуточно работающие в CI | GPT-6.1 Sol | Качество программирования, близкое к флагманскому, за малую долю стоимости на задачу |
| Научные вычисления, самые сложные задачи по управлению компьютером | GPT-6 Astra | Явное лидерство в работе с научными терминалами |
| Принятие архитектурных решений, требующих гибкого подхода | Claude Opus 5.5 | Высший балл в широком независимом индексе |
| Длительные терминальные сессии, в которых расход токенов не имеет значения | Claude Sonnet 5.5 | Более высокий независимый показатель терминала, но больший расход токенов |
Вердикт для разработчиков
GPT-6.1 Sol не поднимает потолок возможностей. Модель просто делает эти максимальные возможности доступными для повседневных бюджетов. Независимые тесты ставят модель в пределах одного-двух баллов от флагманской версии OpenAI за менее чем четверть стоимости на задачу, а цены на кэш специально адаптированы под то, как на самом деле работают агенты для программирования. Загружайте в модель свой бэклог, устанавливайте режим “xhigh” для сложных задач и обращайтесь за помощью к Astra или Opus только тогда, когда модель зайдет в тупик.