Мой блог
OpenAI представила генератор изображений ChatGPT Images 2.5 и две новые API-модели
Компания OpenAI анонсировала релиз ChatGPT Images 2.5 — своего нового флагманского генератора изображений. Одновременно с ним разработчики получили доступ к двум новым API-моделям, предназначенным для интеграции генеративного визуала в сторонние сервисы и корпоративные продукты. По заявлению OpenAI, масштаб использования графических инструментов платформы достиг впечатляющих показателей: каждую неделю пользователи создают свыше 3 миллиардов изображений через интерфейс ChatGPT и API-решения GPT-Image.
Улучшенная детализация, скорость и инструмент Sketch
Новая версия ChatGPT Images 2.5 принесла ощутимый прирост качества и производительности. По моим наблюдениям за описанными техническими характеристиками, ключевой акцент был сделан на реалистичности освещения и проработке сложных текстур. Задержка при генерации картинок сократилась почти на 50% по сравнению с предыдущим поколением Images 2.0, что существенно ускоряет интерактивное взаимодействие с нейросетью.
Модель стала гораздо аккуратнее относиться к деталям исходных фотографий, загружаемых пользователями в качестве референсов. Она значительно лучше удерживает общий стиль и персонажей при многоходовом диалоге. Теперь при внесении правок нейросеть изменяет исключительно те элементы, о которых её попросили, сохраняя остальную часть кадра, композицию и задний план неизменными даже в сложных сценариях. Дополнительно разработчики улучшили работу с реальной информацией, сложными макетами, прозрачным фоном и поддержанием единой визуальной стилистики на протяжении всей сессии.

Для разработчиков, использующих API, эти улучшения означают повышение надежности сценариев, основанных на референсах. Появилась возможность изолированно обновлять конкретный объект — например, товар, фоновый элемент или текстовый блок — без риска испортить фирменный стиль брендбука или общую сцену.
Вместе с обновлением модели в интерфейсе ChatGPT появился инструмент под названием Sketch. Его можно вызвать прямо в чате командой @Sketch. Этот инструмент позволяет нарисовать эскиз от руки прямо внутри чата, задав нейросети визуальный вектор или набросок будущей композиции. Чтобы упростить старт, OpenAI добавила готовые шаблоны под популярные задачи, включая форматы «Poster» (постер) и «Merch» (мерч и брендирование продукции).
Кроме того, в интерфейсе появилась возможность оставлять точечные комментарии прямо на сгенерированных изображениях для более точной корректировки конкретных областей. Также пользователи теперь могут делиться промптами, лежащими в основе созданных картинок, чтобы другие могли воссоздавать и адаптировать идею со своими фото и параметрами. Обновление Images 2.5 разворачивается для всех пользователей сервисов ChatGPT, ChatGPT Work и Codex на ПК, мобильных устройствах и в веб-версии.
API-модели Flare и Sunburst: назначение, отзывы и цены
Для интеграции через API компания подготовила два узкоспециализированных решения:
- GPT-Image-2.5 Flare — базовая модель по умолчанию для большинства повседневных приложений. Она сочетает высокое качество, быстрое редактирование и сниженную на 50% задержку генерации по сравнению с GPT-Image-2. Отлично подходит для создания контента в соцсетях, прототипирования, визуального поиска и массовой генерации.
- GPT-Image-2.5 Sunburst — специализированная модель для премиального визуального производства. Она оптимизирована для задач, требующих точнейшего контроля над деталями, таких как финальные рекламные кампании и подготовка коммерческих каталогов товаров. Генерация в ней занимает больше времени, но дает максимальную точность правок.
Представители сторонних компаний уже успели протестировать новые решения. Мэтт Чотин из Adobe отметил, что модели семейства GPT-Image-2.5 интегрированы в креативную студию Adobe Firefly. Лаки Ляо из команды тестирования Manus указал, что Flare генерирует изображения в 2–4 раза быстрее предшественника, демонстрируя превосходные результаты при обработке прозрачных фонов. Аксултан Алимкулов из Higgsfield AI подчеркнул способности модели сохранять идентичность персонажа, композиционный замысел и визуальный стиль при внесении множественных изменений.
Что касается ценообразования на странице тарифов OpenAI, обе API-модели предлагаются по идентичным расценкам:
- Входные изображения: $8.00 за 1 миллион токенов (или $2.00 за 1M токенов при использовании кэшированного ввода).
- Исходящие изображения: $30.00 за 1 миллион токенов.
- Текстовый ввод: $5.00 за 1 миллион токенов ($1.25 за кэшированный ввод).
Оценка безопасности и защита авторства SynthID
В опубликованном документе System Card компания подробно описала архитектуру безопасности новых моделей. Обучение проходило на фильтрованных наборах данных из открытого интернета, партнерских материалах и пользовательском контенте. Для снижения рисков создания достоверных дипфейков и несанкционированного использования образов реальных людей OpenAI применила многоуровневый защитный контур.
Защитная система включает проверки на базе языковых моделей до начала генерации, а также специальную модель рассуждений о безопасности (safety reasoning model). Она анализирует текстовые промпты, входные изображения и итоговый результат перед отображением пользователю, блокируя запрос при обнаружении нарушений правил.
В ходе стресс-тестирования с использованием специальных вредоносных промптов итоговый процент нежелательных сгенерированных изображений составил лишь 1.09% для Sunburst и 1.41% для Flare, что заметно лучше базового показателя Images 2.0 (1.64%). По внутреннему фреймворку оценки глобальных рисков Preparedness Framework ни одна из моделей не превысила критические пороги безопасности в биологической или кибернетической сферах.
Для идентификации сгенерированного контента OpenAI продолжает использовать открытый стандарт метаданных C2PA. Кроме того, во все сервисы — ChatGPT, Codex и OpenAI API — была внедрена технология невидимых водяных знаков SynthID от Google DeepMind, позволяющая точно определять ИИ-происхождение графики без ухудшения её визуального качества.
Источник: www.unite.ai
