HAVE AI NEWS HAVE AI NEWS
Модели

OpenAI выпустила ChatGPT Images 2.0 с режимом рассуждений, поддержкой 2K и мультиязычным текстом

OpenAI выпустила ChatGPT Images 2.0 с режимом рассуждений, поддержкой 2K и мультиязычным текстом

OpenAI представила модель gpt-image-2, которая внедряет логику O-серии в процесс создания графики, уверенно рисует кириллицу и возглавила рейтинг LM Arena.

Компания OpenAI анонсировала ChatGPT Images 2.0 на базе обновлённой модели gpt-image-2. В бенчмарке LM Arena инструмент сразу занял лидирующую позицию во всех категориях генерации и редактирования изображений, опередив ближайшего соперника на 242 пункта Elo. Столь высокий результат обусловлен качественной отрисовкой надписей на разных языках и строгим соблюдением инструкций.

Мышление перед отрисовкой

Ключевым изменением стала интеграция алгоритмов рассуждения (reasoning), используемых в семействе моделей O-серии. Перед началом генерации нейросеть анализирует запрос, продумывает структуру кадра, проверяет число объектов и ограничения промпта. Пользователям платных тарифов ChatGPT (Plus, Pro, Business) эта возможность доступна под названием thinking mode. В бесплатной версии генератор работает в стандартном режиме без этапа предварительного планирования.

Для разработчиков через API предложен параметр thinking с тремя уровнями детализации: low, medium и high. Кроме того, во время рассуждений модель способна обращаться к веб-поиску в реальном времени, что актуально для создания инфографики и схем с точными фактическими данными.

Сравнение характеристик gpt-image-1 и gpt-image-2

Параметрgpt-image-1gpt-image-2
Максимальное разрешение1024 px2000 px по длинной стороне
Поддерживаемые форматы1:1, 3:2, 2:31:1, 3:2, 2:3, 16:9, 9:16, 3:1, 1:3
Количество изображений за запрос1до 10 (в едином стиле)
Рендеринг текстатолько базовый английский с ошибкамимультиязычный (включая кириллицу, CJK и индийские шрифты)
Механизм reasoningотсутствуетподдерживается (параметр thinking)
Поиск в интернетенетдоступен в режиме thinking
Актуальность базы знанийдекабрь 2025 года

Тарифы, доступность и закрытие старых версий

Стоимость вызовов через API формируется из нескольких компонентов: $5 за миллион входящих и $10 за миллион исходящих текстовых токенов, а также $8 за миллион входных и $30 за миллион выходных графических токенов. Стандартное изображение размером 1024×1024 обходится примерно в $0.21, что на 60% выше цены первого поколения из-за затрат на рассуждения и увеличенного рабочего полотна.

Модель интегрирована в среду разработки OpenAI Codex, а сторонние платформы, такие как Figma, Canva и Adobe Firefly, уже объявили о её поддержке. Вместе с этим OpenAI сообщила о планах полностью отключить устаревшие DALL-E 2 и DALL-E 3 уже 12 мая 2026 года.

Текущие ограничения

Несмотря на технологический шаг вперёд, у модели остаются слабые стороны: крупные портретные планы людей всё ещё могут содержать дефекты, геометрически точные логотипы брендов даются нейросети с трудом, а длинные связные тексты объёмом более нескольких сотен знаков начинают терять структуру. Кроме того, стилевое единство удерживается только внутри одной пакетной генерации, но сбрасывается между разными диалогами.

Автор: Konstantine Mozgovoy

Источник: neurohive.io

Комментарии

, чтобы оставить комментарий.

Пока нет комментариев.