Ранжированное руководство

Программирование — ИИ, который пишет код для продакшена

Это агенты для программирования, а не игрушки для автодополнения. GPT-6 Astra лидирует, потому что выполняет работу в терминале с наименьшим числом токенов, а Claude Opus 5.5 идёт с ней вровень в независимых тестах и сильнее всех на больших запутанных кодовых базах. Claude Sonnet 5.5 — быстрый вариант за половину цены токенов для чётко очерченных багов и новых функций. GPT-6.1 Sol и Grok 4.7 дают программирование почти топового уровня за малую долю цены, а GLM-5.3, GLM-5.3-Flash и Qwen3.8-Max дополняют список выгодными вариантами.

Сначала решение

Наш рейтинг

Начните с победителя, затем сравните компромиссы, которые могут изменить ваш выбор.

#1 Программирование

GPT-6 Astra

OpenAI

GPT-6 Astra берёт coding-корону реальным голосованием разработчиков и агентской практикой: новый №1 на Arena.ai Code Arena (1 797 баллов в WebDev), закрытие инцидентов, терминальные сессии и полная настройка рабочего места при расходе примерно трети токенов Sol.

Почему он побеждает

№1 на Arena.ai Code Arena в общем зачёте и в WebDev с 1 797 баллами (+35 баллов отрыва от Claude Fable 5.1 Max и +109 от Opus 5 Max), лидерство в Data & Analytics, Consumer Product и Content Creation Tools; плюс 57,7–57,9% на Terminal-Bench 4.0, рекордные 74,1% на DeepSWE v1.1, 64,6% на Terminal-Bench Science и 88% pass@1 / 99,2% pass@4 на SRE-Bench.

В чем подвох

На синтетическом харнессе Artificial Analysis Fable 5.1 по-прежнему опережает Astra со счётом 70:67, а SWE-Bench Pro остаётся исторической силой Claude Fable. Ценник API — $10/$50 (в 2,5× выше Sol), чтение кэша стоит вчетверо дороже ($1 против $0,25 у Fable 5.1), лаконичные ответы иногда пропускают шаги оформления отчётов, а усиленные кибер-ограничители могут добавлять трения в анализе уязвимостей.

9.9 Оценка редакции
Читать обзор
Лучше всего для

GPT-6 Astra берёт coding-корону реальным голосованием разработчиков и агентской практикой: новый №1 на Arena.ai Code Arena (1 797 баллов в WebDev), закрытие инцидентов, терминальные сессии и полная настройка рабочего места при расходе примерно трети токенов Sol.

Почему он побеждает

№1 на Arena.ai Code Arena в общем зачёте и в WebDev с 1 797 баллами (+35 баллов отрыва от Claude Fable 5.1 Max и +109 от Opus 5 Max), лидерство в Data & Analytics, Consumer Product и Content Creation Tools; плюс 57,7–57,9% на Terminal-Bench 4.0, рекордные 74,1% на DeepSWE v1.1, 64,6% на Terminal-Bench Science и 88% pass@1 / 99,2% pass@4 на SRE-Bench.

Обратите внимание

На синтетическом харнессе Artificial Analysis Fable 5.1 по-прежнему опережает Astra со счётом 70:67, а SWE-Bench Pro остаётся исторической силой Claude Fable. Ценник API — $10/$50 (в 2,5× выше Sol), чтение кэша стоит вчетверо дороже ($1 против $0,25 у Fable 5.1), лаконичные ответы иногда пропускают шаги оформления отчётов, а усиленные кибер-ограничители могут добавлять трения в анализе уязвимостей.

#2

Claude Opus 5.5

Anthropic

Claude Opus 5.5 — модель для программирования, которую зовут, когда работа большая и запутанная: миграция на сотни тысяч строк, ошибка, проходящая через пять сервисов, старая система, которую уже никто толком не понимает. В собственных бенчмарках Anthropic она опережает GPT-6 Astra; в независимых тестах они идут вровень. Второе место вместо первого — только потому, что Astra выполняет ту же работу в терминале с гораздо меньшим числом токенов.

9.9 Оценка редакции
Читать обзор
#3

Claude Sonnet 5.5

Anthropic

Claude Sonnet 5.5 — модель для программирования, которую можно не выключать весь день: быстрая, вдвое дешевле Opus 5.5 за токен и достаточно сильная, чтобы большинство исправлений багов, новых функций и рефакторингов вообще не требовали флагмана. Только не выкручивайте регулятор усилий до упора: на самом высоком уровне она пишет больше любой модели, которую когда-либо измеряла Artificial Analysis, а некоторые результаты даже ухудшаются.

9.8 Оценка редакции
Читать обзор
#4

GPT-6.1 Sol

OpenAI

GPT-6.1 Sol — это агент для программирования, которого можно использовать круглыми сутками, не переживая о счетах. В независимых тестах он отстает от флагманской модели OpenAI GPT-6 Astra всего на балл-два, при этом типичная задача обходится более чем вчетверо дешевле. Цена за токен не изменилась по сравнению с GPT-6 Sol ($2 за ввод, $10 за вывод за миллион токенов), но повторное чтение кэшированного кода теперь стоит всего $0.10 за миллион токенов — именно здесь кроется главная экономия при работе с большими репозиториями.

9.8 Оценка редакции
Читать обзор
#5

Claude Fable 5.1

Anthropic

Механизм рассуждений класса Mythos, усовершенствованный для агентного кодирования. Те же веса, что и у ограниченной Mythos 5.1, но оптимизированные со скидкой 75% на кэш, что меняет экономику долгосрочной инженерии. Лучше всего развертывать в Claude Code, где его оценка 70 в AA Coding Agent доминирует в этой области.

9.8 Оценка редакции
Читать обзор
#6

Grok 4.7

xAI

Grok 4.7 — самая дешёвая серьёзная модель для программирования рядом с вершиной рейтинга. За $2 за ввод и $6 за вывод на миллион токенов она набирает 71,0 % в DeepSWE и 46,3 % в CursorBench 4.0 и работает прямо в Cursor и Grok Build. Это сильный напарник для повседневного программирования, но пока не тот агент, которого можно на несколько часов оставить одного в терминале.

9.7 Оценка редакции
Читать обзор
#7

GLM-5.3

Z.ai (Zhipu AI)

Тяжеловесный coding-агент с открытыми весами, обученный для этапа после первого ответа: планировать, редактировать, тестировать, восстанавливаться после ошибок и не терять нить в долгой работе с репозиторием.

9.2 Оценка редакции
Читать обзор
#8

Qwen3.8-Max

Alibaba / Qwen Team

Ценный конкурент для визуальных задач и программирования с длинным контекстом, который теперь занимает 6-е место после того, как независимые тесты поставили впереди флагманский GLM-5.3. Его загружаемый чекпойнт уровня Max остается выдающимся, но 2.4 триллиона параметров превращают самостоятельный хостинг в проект масштаба дата-центра.

9.2 Оценка редакции
Читать обзор
#9

GLM-5.3-Flash

Z.ai (Zhipu AI)

Программирование и агентная работа почти передового уровня по необычно низкой цене, с нативным зрением и контекстом 1M. Здесь «Flash» означает эффективность и дешевизну, а не малый размер и не особенно высокую скорость.

9.2 Оценка редакции
Читать обзор
Вопросы и ответы

Часто задаваемые вопросы