OpenAI представила функцию генерации изображений без фона в своей модели GPT-Image-2. Теперь через API можно создавать PNG-файлы с прозрачным фоном, указав параметр background=transparent. Это дополнение ориентировано на практические задачи: подготовка товарных фотографий для интернет-магазинов, создание диаграмм для презентаций, разработка иконок и наклеек, а также подготовка изображений для печати на мерче. В документации OpenAI отмечается, что встраивание альфа-канала непосредственно в процесс генерации дает более качественный результат, чем традиционное удаление фона на готовом изображении, особенно при работе со сложными объектами — прозрачным стеклом или тонкими волокнами.

Для активации функции пользователю достаточно добавить параметр background=transparent в запрос к API. OpenAI также рекомендует не описывать фон в текстовом промпте, поскольку модель может все равно сгенерировать его, даже если это не требуется. Это важный нюанс, который стоит учитывать при составлении запросов. Кроме того, для диаграмм с точными числами OpenAI советует вручную проверять сгенерированные значения: модель создает растровую графику и не гарантирует попиксельную точность. Для работы с функцией потребуется Python, библиотеки OpenAI и Pillow, а также API-ключ.

Эта новость показательна для индустрии: вместо того чтобы полагаться на постобработку, OpenAI встраивает нужные свойства изображения на этапе генерации. Такой подход может сократить время на подготовку визуального контента для бизнеса, особенно в электронной коммерции, где прозрачный фон часто требуется для единообразного отображения товаров на сайте. Однако ограничения модели — растровый формат и возможные неточности в числах — напоминают, что для задач, требующих высокой точности, ручная проверка остается обязательной.

Функция доступна через API и поддерживает четыре сценария: товарные фото, диаграммы, иконки и мерч.

Пока функция доступна только через API, что ограничивает ее использование для обычных пользователей, работающих через интерфейс ChatGPT. Тем не менее, для разработчиков и компаний, интегрирующих генерацию изображений в свои продукты, это еще один инструмент, который можно использовать в автоматизированных пайплайнах. В целом, обновление GPT-Image-2 выглядит как шаг к более практичному применению генеративных моделей в коммерческих сценариях.