Большинство генераторов изображений похожи на талантливого иллюстратора со странной проблемой памяти. Первая картинка может быть прекрасной. Потом вы просите перекрасить синюю кружку в красный цвет, а художник заодно передвигает окно, меняет лицо человека и заменяет дневное солнце офисными лампами. Получается ещё одна привлекательная картинка — только не та, которую вы редактировали.
Grok Imagine Image 2.0 построен вокруг именно этой второй просьбы. Его главное улучшение — не очередное слово вроде «кинематографичный» или «сверхдетализированный», а набор средств вокруг генератора. Magic Wand указывает нужную область. Сегментация отделяет объект от окружения. Multi-ref принимает до пяти исходных изображений. Удаление фона выдаёт прозрачный объект, а Smart Resize достраивает сцену под девять полезных соотношений сторон. Модель остаётся вероятностной — под ней не спрятан Photoshop-файл с аккуратными слоями, — но в разговоре с ней наконец появились подобия ручек управления.
Это важно, потому что настоящая визуальная работа состоит из цепочки мелких решений. Владелице магазина редко нужна просто «красивая кроссовка». Ей нужна та же кроссовка на белом фоне, затем в квадратной рекламе, потом рядом с заголовком и, наконец, в другом цвете, но с неизменной подошвой. Разработчику игры нужен персонаж, чей плащ, шрам и снаряжение сохранятся на портрете, листе спрайтов и в игровом окружении. Шаблоны и работа с референсами в Image 2.0 нацелены как раз на эту негламурную дистанцию между эффектной демонстрацией и материалом, который можно использовать в деле.
Сам генератор тоже силён. В публичных слепых сравнениях новая запись grok-imagine-image-2.0 (low) сразу заняла второе место и в генерации, и в редактировании одной картинки. Модель также оказалась среди лидеров в портретах, искусстве, фотореализме, рисунках и тексте. Слово «low» входит в идентификатор Arena, тогда как потребительский продукт называется Quality Mode. Пока xAI не объяснила конфигурацию, не стоит делать вид, будто эта метка раскрывает архитектуру или уровень качества для обычного пользователя.
Наши тесты подтверждают улучшение, но с большой оговоркой. Image 2.0 лучше в целом, особенно когда в запросе много предметов, надписей и последующих изменений. И всё же человек может получить пластиковую кожу, знакомое лицо из фотобанка или освещение, сглаженное до плоского CGI-блеска. Повторные правки иногда сохраняют комнату, но незаметно меняют находящегося в ней человека. Эти ошибки не отменяют прогресс; они объясняют, почему свежее второе место в бенчмарке превращается у нас в третью рекомендацию, а не в немедленную коронацию.
Пока лучше воспринимать Grok Imagine Image 2.0 как необычайно способного ученика в мастерской. Он внимательно слушает, знает, где лежат инструменты, и на удивление часто выдаёт результат, который можно показать заказчику. Но пальцы, мелкий шрифт, лица и всё, что вы просили не трогать, всё равно следует проверить.