Есть разница между тем, кто пишет код, и тем, кто понимает систему.
Первый видит ошибку undefined is not a function, оборачивает строку в проверку if и идёт дальше. Сбой исчезает. Через три дня ломается что-то другое, там, где никто не ждал.
Второй спрашивает, почему значение оказалось неопределённым. Он прослеживает его назад через сервисы, выясняет, что запись в базу данных завершалась раньше, чем подтверждалось сообщение, и меняет порядок так, чтобы ошибочное состояние вообще не могло возникнуть.
Claude Opus 5.5 — определённо из вторых. Модель вышла 22 сентября 2026 года и занимает второе место в нашем рейтинге программирования — ближе к первому, чем любая модель до неё.
В чём она сильна: большие и запутанные задачи
Истории первых тестировщиков Anthropic похожи друг на друга: огромные задачи, на которые раньше у целой команды уходили недели.
- Один тестировщик завершил миграцию кода на 680 000 строк меньше чем за день.
- Другой провёл аудит и исправил кодовую базу на 200 000 строк меньше чем за три часа. Opus 5 на ту же работу понадобилось больше 20 часов и в 2,5 раза больше токенов.
- Во внутреннем тесте Opus 5.5 и Fable 5.1 переписали с C на Rust HAProxy — широко используемую программу, которая распределяет веб-трафик между серверами, — и обе версии прошли почти все собственные тесты HAProxy. Opus 5.5 справилась за 9,5 часа вместо 12 и на 51 % дешевле.
Это истории от производителя, а не независимые измерения, так что считайте их указанием на направление, а не гарантией. Но закономерность устойчива: чем больше и хаотичнее задача, тем сильнее отрывается Opus 5.5.
Кроме того, она понятно объясняет свои действия. В анонсе Anthropic показано, как модель диагностирует ошибку в биллинге. Вместо стены технических подробностей она начинает с денег: $1,50 из падения выручки у клиента пришлись на изменение тарифа, а остальные $9,92 — на ошибку в конкретном коммите, из-за которой перестало учитываться использование в последний день каждого месяца. Когда агент меняет ваш код, именно такие отчёты не дают ему лукавить.
Бенчмарки: ничья — смотря кто считает
Здесь стоит притормозить: таблицы производителей и независимые тесты рассказывают немного разные истории.
Данные Anthropic (сентябрь 2026 года):
- Terminal-Bench 4.0 — многошаговая работа в терминале командной строки: у Opus 5.5 66,4 % (±2,6 пункта). У GPT-6 Astra — 57,9 %, эту цифру сообщила OpenAI.
- FrontierCode v1.1 — проверка, достаточно ли хороши изменения кода для слияния: Opus 5.5 — 54,4 %, Astra — 53,3 %.
- CursorBench 4.0 — более длинные задачи программирования в редакторе Cursor: Opus 5.5 — 57,8 %, Fable 5.1 — 51,8 %.
Независимые данные: Artificial Analysis сама прогнала Terminal-Bench 4.0 и получила 59,6 % и у Opus 5.5, и у Astra. Полная ничья.
Наше правило — доверять независимым измерениям больше, чем таблицам производителей. По чистым возможностям это ничья. Значит, рейтинг решает что-то другое.
Почему GPT-6 Astra сохраняет первое место
Когда две модели одинаково хороши, мы расставляем их по тому, сколько вам стоит выполненная задача.
Здесь у Astra явное преимущество. На максимальном усилии Artificial Analysis насчитала у Opus 5.5 около 119 000 выходных токенов на задачу против примерно 27 000 у Astra. Токены Opus дешевле ($20 за миллион выходных против $50 у Astra), но их уходит примерно вчетверо больше. Посчитайте — и на пике производительности средняя задача у Astra обходится примерно вдвое дешевле.
У Anthropic есть резонный контраргумент. По её словам, на стандартном уровне усилия Opus 5.5 догоняет Astra в Terminal-Bench примерно за 40 % стоимости, а во FrontierCode обходит её примерно за 20 %. Если независимые тесты это подтвердят, рейтинг изменится. Пока это заявление производителя, и прежде чем поднять модель, мы ждём независимых данных.
Честно об ограничениях
- Приберегайте максимальное усилие для трудных задач. Если оставить Opus 5.5 на максимуме для рутинных правок, она будет писать длинные рассуждения, за которые платите вы.
- Задачи по безопасности перенаправляются. Opus 5.5 настолько сильна в кибербезопасности, что Anthropic отправляет большинство таких задач Opus 4.8, если вы не участвуете в Cyber Verification Program. Обычное исправление ошибок не затронуто.
- Долгие сессии всё ещё упираются в лимиты. Anthropic увеличила пятичасовые лимиты на платных тарифах, но многочасовая работа агента над большим репозиторием всё равно может в них упереться.
Кого нанять
Берите GPT-6 Astra, если у вас очередь чётко поставленных задач и вы хотите закрыть их как можно дешевле.
Берите Claude Opus 5.5, если работа большая, неоднозначная или рискованная: миграция фреймворка, глубокий аудит или ошибка на стыке сервисов. На таких задачах тщательное рассуждение ценнее лаконичного вывода. Это инженер, которому мы доверили бы систему, к которой больше никто не хочет прикасаться.