Место #6 Кодинг — ИИ, который пишет код для продакшена
Z.ai (Zhipu AI)

GLM-5.3

Скачок постобучения на той же базе для работы после первого ответа. GLM-5.3 должен долго планировать, редактировать, тестировать и восстанавливаться. Стартовые результаты и кибернавыки сильны, но почти все доказательства относятся к дню запуска.

Обновлено 14 августа 2026 года Coding AgentLong-Horizon1M Context Evals
Лучше всего для

Скачок постобучения на той же базе для работы после первого ответа. GLM-5.3 должен долго планировать, редактировать, тестировать и восстанавливаться. Стартовые результаты и кибернавыки сильны, но почти все доказательства относятся к дню запуска.

Почему он побеждает

Z.ai сообщает 28,3 Terminal-Bench 3.0, 66,9 DeepSWE, 42,5 SWE-Marathon, 48,2 AutomationBench и 28,5 ALE-CLI. В закрытом Code Bench результат выше при меньшем числе токенов, чем у 5.2 и в отдельных точках Opus 4.8.

Обратите внимание

Независимых запусков и общей API пока нет, основной доступ—Coding Plan. Модель текстовая, мышление не отключается, а закрытые системы лидируют в нескольких глубоких тестах.

01

Что это на самом деле

Многие демонстрации заканчиваются до трудной части. Модель рисует чистый интерфейс или пишет правдоподобную функцию, камера выключается, и никто не показывает третий упавший тест зависимости. GLM-5.3 нацелен на продолжение: прочитать ошибку, пересмотреть план, провести новый опыт и сохранить ориентацию до проверенного результата.

Z.ai не увеличивала базу. Она добавила исполняемые среды, разновидности профессиональных задач и постобучение на длинных траекториях. Базу можно сравнить с талантливым выпускником, постобучение—с практикой. Выпускник знает язык инженерии; практика учит, когда исследовать, тестировать и отказываться от плохой идеи.

Цифры складываются в связную, хотя и поставщицкую, картину. Terminal-Bench растёт с 4,6 до 28,3, DeepSWE с 46,2 до 66,9, SWE-Marathon с 19,4 до 42,5, AutomationBench с 26,2 до 48,2. ALE-CLI получает 28,5. Широта важнее заявления, что один показатель решает всё.

Закрытый Code Bench добавляет экономику. На Max модель завершает 34,5% примерно при 75 тысячах токенов против 23,4% при 96 тысячах у 5.2. High достигает 31,4% при 50 тысячах выше указанной точки Opus; Fable 5 сохраняет 39,5%. Воспроизвести закрытые задачи нельзя, но вопрос верен: сколько подтверждённой работы получено за время и токены?

Вторая история—кибербезопасность: 84,5% CyberGym и 54,4% ExploitBench, при отставании в глубокой эксплуатации. Правильное применение защитное: разрешённый код в песочнице, воспроизведение, исправление и регрессионные тесты. Это не разрешение проверять чужие системы.

Модель есть во всех Coding Plan и ZCode от $18 в месяц, но баллы зависят от входа, кэша, выхода и времени. Общая API появится позже, поэтому сравнение по расходу пока мутное.

Мышление обязательно: low, high и max регулируют усилие, но старый отключённый режим вызывает ошибку. Без нативного зрения и независимых запусков #6 уместен—серьёзный соперник для длинных сессий, которого нужно тестировать с теми же инструментами и проверками.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Обучена завершать заказ: среды имитируют дни экспертной работы—диагностику, изменение реального стека, эксперименты, сохранение корректности и измеримый результат.
  • Широкий прирост: растут Terminal-Bench, DeepSWE, SWE-Marathon, AutomationBench и ALE-CLI; разные долгие задачи убедительнее одного удачного теста.
  • Перспективная эффективность: Max даёт 34,5% при ~75K токенов против 23,4% при 96K у 5.2; High даёт 31,4% при 50K выше указанной точки Opus. Fable 5 остаётся качественнее.
  • Кибернавыки полезны защите: поиск, подтверждение и исправление уязвимости помогают безопасному ревью. 84,5% CyberGym и 2 436 проверенных находок значимы при разрешённой изолированной работе.
  • Знакомые агенты: все планы и ZCode поддерживают 5.3; заявлены Claude Code, OpenCode и другие клиенты. Low, high и max регулируют усилие.

Честные ограничения

  • Таблицы не равны консенсусу: настройки описаны, но большинство сравнений выполнено или собрано Z.ai. Нужны публичные тесты при одинаковых репозитории и стоимости.
  • Нет победы везде: Fable 5 и Sol лидируют Terminal-Bench 3.0, Sol—DeepSWE, Kimi K3 и Opus—SWE-Marathon, Fable—закрытый Max.
  • Доступ неполон: Coding Plan начинается с $18, но баллы зависят от токена и времени. Без общей API нет чистого pay-as-you-go сравнения.
  • Мышление обязательно: thinking.type: disabled вызывает ошибку. Это несовместимое изменение, добавляющее задержку и требующее миграции.
  • Нет нативного зрения: скриншоты, схемы и видео интерфейса требуют внешнего vision-инструмента или мультимодальной модели.
03

Результаты тестов

Terminal-Bench 3.0 — 28,3 (Z.ai)

Более чем в шесть раз выше 4,6, но ниже Fable 5 с 33,7 и Sol с 34,6.

DeepSWE v1.1 — 66,9 (Z.ai)

+20,7 пункта, рядом с Kimi K3 с 67,5 и ниже Sol с 72,7.

SWE-Marathon v1.1 — 42,5 (Z.ai)

Более чем вдвое выше 19,4 и равно Sol; Kimi K3 и Opus 4.8 впереди.

AutomationBench v1.0.6 — 48,2 (Z.ai)

Лучшее число таблицы и полезный сигнал, ожидающий воспроизведения.

Z.ai Code Bench — 34,5% Max (закрытый)

Больше завершений при меньшем числе токенов, чем у 5.2; продуктовый сигнал, не публичный рекорд.

04

Вердикт

GLM-5.3 входит на #6 в Coding с 9,2. Место намеренно ниже самого красивого показателя: данные широкие и документированные, но не независимые. Это отличный кандидат для долгих репозиториев, терминала и защитного ревью. Сравните его на том же коде, с теми же инструментами, временем, тестами и проверкой. Больше подтверждённой работы на токен означает реальный прирост.

05

Часто задаваемые вопросы