Обновление 25 июля: Opus 5 сдвигает Fable 5 на #3. Fable сохраняет опубликованный SWE-Bench Pro и крошечные преимущества CursorBench/FrontierCode; Opus 5 выигрывает Frontier-Bench и почти равен при половине цены токена. Июньский обзор остается полезным доказательством, но не текущим общим порядком.
Есть цифра, которая делает этот обзор простым в написании: 80.3%. Это Claude Fable 5 на SWE-Bench Pro — бенчмарке, которому нет дела до игрушечных задач, его волнует лишь то, может ли ИИ исправить реальные ошибки в реальных производственных кодовых базах. GPT-5.5 набирает 58.6%. Предыдущий король, Opus 4.8, набрал 69.2%. Fable 5 не просто побеждает — он побеждает с отрывом, который заставляет дважды проверить цифры.
Но SWE-Bench Pro — это только половина истории. FrontierCode Diamond — бенчмарк Cognition для оценки того, могут ли модели писать эффективный по токенам код производственного качества — рассказывает вторую половину. Fable 5: 29.3%. Opus 4.8: 13.4%. GPT-5.5: 5.7%. Это не лидерство; это вообще другой вид спорта. И модель достигает этих оценок при средних усилиях рассуждения, что означает, что она сжигает меньше токенов для получения лучшего кода. Дорогая модель, которая на самом деле дешевле в пересчете на реальную задачу.
Тематическое исследование Stripe — это не фантазия из пресс-релиза. Кодовая база на Ruby из 50 миллионов строк — монолит, от которого инженеров бросает в пот — была мигрирована за один день. Работа, на которую у целой команды ушло бы два месяца. Модель планировала, выполняла, самостоятельно проверяла и предоставляла результат. О CursorBench генеральный директор Cursor сказал, что модель «открыла класс долгосрочных проблем, которые были недоступны для более ранних моделей». В бенчмарке для старших инженеров (Senior Engineer Benchmark) она набрала 91 из 100 баллов, тогда как GPT-5.5 и Opus 4.8 остались на уровне низких 60.
Вот как выглядит архитектура класса Mythos, когда ее оборачивают в защитные ограждения безопасности и передают разработчикам. Защитные барьеры реальны — запросы по кибербезопасности, биологии и химии перенаправляются на Opus 4.8 (все еще отличная модель, но не полная версия движка). Но для более чем 95% задач по программированию, которые не вызывают срабатывания классификаторов безопасности, вы работаете с самой мощной моделью, когда-либо выпущенной для широкой публики. Эра агентного программирования только что обрела своего самого явного чемпиона.