История генерации ИИ-изображений последние два года была простой: Midjourney делает самые красивые картинки, а все остальные пытаются догнать. GPT Image 2 не играет в эту игру. Вместо погони за эстетикой OpenAI задала другой вопрос: что, если бы генератор изображений мог думать?
Результатом стало нечто действительно новое. Напишите «создайте инфографику, показывающую темпы внедрения возобновляемых источников энергии в мире по континентам», и GPT Image 2 не просто сделает красивый график с выдуманными числами — он исследует реальные данные, структурирует последовательную визуальную иерархию, корректно отобразит текстовые метки и выдаст дизайн, который можно вставить в презентацию без редактирования. Вот в чем разница «Thinking Mode» (Режима размышления): модель рассуждает о том, что показать, прежде чем выяснять, как это показать.
Прорыв в рендеринге текста заслуживает отдельного абзаца, потому что он настолько значим. У каждого ИИ-генератора изображений в истории была одна стыдная слабость: правописание. Попросите вывеску магазина с надписью «BAKERY», и вы получите «BAKREY» или «BAKEERY» — достаточно близко, чтобы выбесить. GPT Image 2 набирает точность 99%+ на бенчмарках рендеринга текста, включая сложные CJK-символы. Этикетки продуктов, газетные макеты, макеты пользовательского интерфейса, архитектурные аннотации — все читабельно, все правильно. Для дизайнеров, маркетологов и всех, кому нужен текст в их изображениях, это меняет всё.
В чем подвох? Это классический компромисс OpenAI: лучшие функции стоят денег. Режим размышления скрыт за платными тарифами. Ограждения безопасности заметно жестче, чем laissez-faire подход Midjourney. И хотя фотореализм ошеломляющий — сырой, откровенный, без глянцевого блеска ИИ, который делал вывод GPT Image 1.5 мгновенно узнаваемым, — у Midjourney все еще есть та художественная душа, которую GPT Image 2 не пытается воспроизвести. Разные инструменты для разных задач.