Компания OpenAI анонсировала ChatGPT Images 2.0 на базе обновлённой модели gpt-image-2. В бенчмарке LM Arena инструмент сразу занял лидирующую позицию во всех категориях генерации и редактирования изображений, опередив ближайшего соперника на 242 пункта Elo. Столь высокий результат обусловлен качественной отрисовкой надписей на разных языках и строгим соблюдением инструкций.
Мышление перед отрисовкой
Ключевым изменением стала интеграция алгоритмов рассуждения (reasoning), используемых в семействе моделей O-серии. Перед началом генерации нейросеть анализирует запрос, продумывает структуру кадра, проверяет число объектов и ограничения промпта. Пользователям платных тарифов ChatGPT (Plus, Pro, Business) эта возможность доступна под названием thinking mode. В бесплатной версии генератор работает в стандартном режиме без этапа предварительного планирования.
Для разработчиков через API предложен параметр thinking с тремя уровнями детализации: low, medium и high. Кроме того, во время рассуждений модель способна обращаться к веб-поиску в реальном времени, что актуально для создания инфографики и схем с точными фактическими данными.
Сравнение характеристик gpt-image-1 и gpt-image-2
| Параметр | gpt-image-1 | gpt-image-2 |
|---|---|---|
| Максимальное разрешение | 1024 px | 2000 px по длинной стороне |
| Поддерживаемые форматы | 1:1, 3:2, 2:3 | 1:1, 3:2, 2:3, 16:9, 9:16, 3:1, 1:3 |
| Количество изображений за запрос | 1 | до 10 (в едином стиле) |
| Рендеринг текста | только базовый английский с ошибками | мультиязычный (включая кириллицу, CJK и индийские шрифты) |
| Механизм reasoning | отсутствует | поддерживается (параметр thinking) |
| Поиск в интернете | нет | доступен в режиме thinking |
| Актуальность базы знаний | — | декабрь 2025 года |
Тарифы, доступность и закрытие старых версий
Стоимость вызовов через API формируется из нескольких компонентов: $5 за миллион входящих и $10 за миллион исходящих текстовых токенов, а также $8 за миллион входных и $30 за миллион выходных графических токенов. Стандартное изображение размером 1024×1024 обходится примерно в $0.21, что на 60% выше цены первого поколения из-за затрат на рассуждения и увеличенного рабочего полотна.
Модель интегрирована в среду разработки OpenAI Codex, а сторонние платформы, такие как Figma, Canva и Adobe Firefly, уже объявили о её поддержке. Вместе с этим OpenAI сообщила о планах полностью отключить устаревшие DALL-E 2 и DALL-E 3 уже 12 мая 2026 года.
Текущие ограничения
Несмотря на технологический шаг вперёд, у модели остаются слабые стороны: крупные портретные планы людей всё ещё могут содержать дефекты, геометрически точные логотипы брендов даются нейросети с трудом, а длинные связные тексты объёмом более нескольких сотен знаков начинают терять структуру. Кроме того, стилевое единство удерживается только внутри одной пакетной генерации, но сбрасывается между разными диалогами.
Комментарии
, чтобы оставить комментарий.
Пока нет комментариев.