Хороший кодовый агент больше похож не на автодополнение, а на младшего инженера с тикетом. Ему нужно исследовать репозиторий, сформулировать гипотезу, выполнить команды, понять сообщения об ошибках и помнить исходную цель после двенадцатого обходного пути. Grok 4.6 обучен именно для такого длинного цикла. xAI подчёркивает работу по всей кодовой базе, исследование незнакомых областей, веб-разработку, визуальные приложения, несколько раундов обратной связи и больше самопроверки, чем у Grok 4.5. Цель — не красивый фрагмент кода, а задача, доведённая до проверяемого результата.
Рисунок результатов подтверждает настоящий скачок поколения. CursorBench v3.2 растёт с 66,7% до 69,9%, DeepSWE v1.1 — с 54% до 65,9%, а FrontierCode v1.1 — с 56,6% до 61,3%. Улучшаются также APEX-Agents, APEX-SWE и Terminal-Bench v3. Одна удачная строка могла бы зависеть от подходящего промпта или harness; рост сразу в шести тестах программирования и агентов является намного более убедительным сигналом.
Однако универсальным королём кодинга Grok не стал. В сравнении xAI GPT-5.6 Sol набирает 73% в DeepSWE, а Fable 5 — 70%. В Terminal-Bench v3 результат Grok 26% ниже опубликованных 34,6% и 34,1% у соперников. Fable также сохраняет небольшое преимущество в CursorBench, FrontierCode, APEX-Agents и APEX-SWE. В релизе нет полного результата SWE-bench Verified. Заполнять этот пробел другим тестом нельзя: ремонт репозитория, работа в терминале и создание интерфейса связаны, но измеряют разные навыки.
Цена и доступность всё же меняют практическое решение. Grok 4.6 появился в Cursor и Grok Build в первый день, а также доступен через API xAI, OpenRouter, Vercel и Cloudflare. Стандартный тариф остаётся $2 за миллион входных и $6 за миллион выходных токенов; быстрая версия вдвое дороже. Artificial Analysis измеряет около $0,84 за задачу для общей модели. Когда агенту нужны три расследования, две попытки исправления и финальная проверка, стоимость каждой итерации становится полноценной инженерной характеристикой.
Именно поэтому экономию нельзя обменивать на отсутствие защиты. Первые практические отзывы упоминают опасные изменения безопасности и непродуктивную реакцию на неудачу. Они не показывают частоту проблемы, но описывают реальный класс риска. Начинайте с исследования репозитория только для чтения, держите секреты вне доступа модели, разрешайте запись лишь в отдельную ветку, требуйте небольшие diff и запускайте CI после каждого существенного изменения. Расширять автономность стоит только после успешного прохождения внутренних задач, которых модель заранее не видела.
Честное сравнение должно оценивать всю систему: одинаковый тикет, одинаковые инструменты, одинаковые ограничения времени и повторов, одинаковые тесты. Записывайте не только факт появления рабочего патча, но и число шагов, токенов и минут человеческого ревью до состояния, пригодного для merge. Grok 4.6 лучше всего понимать как передового и экономичного кодового агента: достаточно сильного для серьёзной многошаговой работы, достаточно дешёвого для новой попытки и уже встроенного в привычные инструменты. Его преимущество становится реальным только тогда, когда процесс строго проверяет написанный им код.