Представьте двух плотников. Первый — мастер, которого зовут, когда дому нужна новая лестница, а чертежей ещё никто не нарисовал. Второй — надёжный работник, который за неделю навесит сорок дверей, и каждая встанет ровно по уровню.
Большая часть недели команды разработчиков — это двери, а не лестницы: упавший тест, форма, которой нужно новое поле, API, сменивший название. Claude Sonnet 5.5 создана для дверей.
Anthropic выпустила её 28 сентября 2026 года — второй моделью семейства Claude 5.5, через неделю после Opus 5.5. Цена осталась как у Sonnet 5: 2 доллара за миллион входных токенов и 10 долларов за миллион выходных — вдвое меньше, чем у Opus 5.5. По словам Anthropic, она работает более чем на 30 % быстрее Sonnet 5 и обходится до 30 % дешевле в расчёте на задачу, потому что справляется за меньшее число шагов.
Независимые цифры
Для агентов-программистов мы больше всего доверяем Terminal-Bench 4.0: это длинные многошаговые задания в настоящей командной строке, где модели нужно что-то установить, запустить, прочитать ошибки и попробовать снова.
Artificial Analysis провела этот тест независимо в сентябре 2026 года. Sonnet 5.5 набрала 64 % — чуть больше, чем Opus 5.5 и GPT-6 Astra, у которых около 60 %. Собственный прогон Anthropic даёт больше, 70,6 %, но тестовые среды производителей обычно льстят своим моделям, так что запоминать стоит независимые 64 %. В любом случае это огромный скачок по сравнению с Sonnet 5, у которой в таблице Anthropic было 10,3 %.
Второй независимый источник подтверждает общую картину. Vals AI ставит Sonnet 5.5 на второе место из 66 моделей в своём индексе с результатом 69,22 % — меньше чем в половине пункта от Opus 5.5 — при стоимости теста примерно в две трети от него. На двух рейтингах по программированию она первая: Vibe Code Bench (создание небольших приложений по описанию) — 92,39 %, и Code Migration — 69,83 %.
Что добавляют собственные тесты Anthropic
Стартовая таблица Anthropic дополняет картину:
- FrontierCode v1.1, который проверяет, можно ли принять изменение кода без участия человека: 52,1 % на уровне xhigh. У Opus 5.5 — 54,4 %, у GPT-6 Sol — 49,3 %.
- CursorBench 4.0, собранный из реальных сессий в редакторе Cursor: 55,5 % — примерно на два пункта ниже Opus 5.5 и далеко впереди 34,1 % у Sonnet 5.
Полезнее всего графики стоимости: на них результат каждой модели сопоставлен со стоимостью задачи на каждом уровне усилий. Выделяются два вывода. На уровне High — по умолчанию в API — Sonnet 5.5 достигает лучшего результата GPT-6 Sol в FrontierCode примерно за пятую часть стоимости задачи. А на уровне Medium — по умолчанию в Claude Code — она превосходит лучший результат Sonnet 5 в Terminal-Bench менее чем за десятую часть стоимости.
Первые тестировщики говорят о том же, только проще. Lovable увидела примерно вдвое меньше shell-команд на задачу. Slack намерил около 14 % экономии выходных токенов по сравнению с Sonnet 5. Unity, где задача считается выполненной, только если изменение действительно работает при запуске, сообщает, что большая часть работы Sonnet 5.5 эту проверку прошла.
Регулятор усилий — и почему верхнее положение даёт обратный эффект
Как и у Opus 5.5, у Sonnet 5.5 есть регулятор усилий с пятью уровнями: low, medium, high, xhigh и max. Чем выше уровень, тем дольше модель думает и тщательнее проверяет свою работу. Логично ожидать, что max лучше всех. С Sonnet 5.5 это часто не так.
Artificial Analysis измерила весь диапазон в своём Intelligence Index:
| Усилия | Intelligence Index | Стоимость задачи |
|---|---|---|
| Low | 36 | 0,41 $ |
| Medium | 41 | 0,59 $ |
| High | 47 | 1,08 $ |
| Xhigh | 52 | 2,74 $ |
| Max | 56 | 7,60 $ |
Переход с xhigh на max даёт четыре пункта при почти трёхкратном росте стоимости. На max Sonnet 5.5 писала около 193 000 выходных токенов на задачу. Это рекорд за всю историю замеров Artificial Analysis: примерно на 60 % больше, чем у Opus 5.5 на max, и примерно в семь раз больше, чем у GPT-6 Astra.
Хуже того, больше усилий не всегда означает лучший код. В FrontierCode Sonnet 5.5 набирает 52,1 % на xhigh, но лишь 46,2 % на max. Anthropic объясняет причину в сноске: на max модель чаще запускала процедуру ревью кода в Claude Code, которая распределяет проверку между множеством вспомогательных агентов. В некоторых случаях это заканчивалось тайм-аутом или лишними правками за пределами задачи, а FrontierCode штрафует за изменения, о которых никто не просил.
Вывод простой: считайте xhigh потолком. Если задача не решается и на xhigh, лучшим следующим шагом обычно будет Opus 5.5, а не max.
Честная оговорка
Архитектор по-прежнему Opus. Anthropic говорит об этом прямо: в ряде тестов Sonnet 5.5 на max приближается к Opus 5.5, но и во внутренних тестах Anthropic, и у внешних тестировщиков Opus 5.5 остаётся заметно сильнее в сложной, открытой работе, требующей длительного взвешенного суждения. Opus также сохраняет лидерство в FrontierCode и CursorBench.
Счёт за Claude Code вдвое не уменьшится. Агенты-программисты постоянно перечитывают ваш проект, и это перечитывание оплачивается как чтение из кэша — 0,20 доллара за миллион токенов и у Sonnet 5.5, и у Opus 5.5. Вы экономите на новом вводе и выводе, но длинная сессия, активно использующая кэш, сэкономит меньше, чем обещает заголовок про «половину цены».
Задачи по безопасности перенаправляются. Sonnet 5.5 — первая модель Sonnet, которая выходит с теми же защитными механизмами в области кибербезопасности, что Anthropic применяет к своим самым сильным моделям. Обычное исправление багов это не затрагивает, но рискованные задачи по безопасности заметно для пользователя передаются Sonnet 5, если ваша команда не одобрена через Cyber Verification Program от Anthropic.
Переход потребует немного работы. Anthropic перечисляет пять несовместимых изменений по сравнению с Sonnet 5. Принудительный вызов инструмента теперь возвращает ошибку, нестандартные значения temperature отклоняются, а текст между вызовами инструментов приходит в другом формате. Исправить всё это несложно, но замена в одну строку не получится.
Где она уместна
| Если задача — … | Берите | Почему |
|---|---|---|
| чётко очерченный баг, функция или миграция | Claude Sonnet 5.5 | Быстро и дёшево на medium или high |
| открытая архитектура или проблема, которую никто ещё не очертил | Claude Opus 5.5 | Заметно более сильное суждение, по словам Anthropic и тестировщиков |
| долгая работа в терминале без присмотра по минимальной цене за задачу | GPT-6 Astra | На пиковом уровне тратит лишь малую долю токенов |
| доводка фронтенда, слайды, небольшие визуальные проекты | Claude Sonnet 5.5 | Хорошее чувство дизайна и быстрые итерации |
Вердикт
Claude Sonnet 5.5 — модель, которую большинству разработчиков стоит просто оставить включённой. Она навешивает двери — все сорок — быстро и по половине цены токена флагмана. Держите её на medium или high, включайте xhigh для трудных случаев, а когда заказ окажется лестницей, зовите Opus.