OpenAI выпустила подробный гайд по промптам для GPT Image 2.5. Документация разбирает генерацию с нуля, редактирование, работу с несколькими референсами, текст внутри изображения, сохранение персонажей и сложные макеты. Пользователи Reddit за несколько дней провели собственные тесты, включая серию экспериментов с официальными промптами и последовательным редактированием. Один из авторов реконструировал 278 промптов по опубликованным примерам OpenAI.

Одна из главных рекомендаций OpenAI звучит почти скучно: сначала скажите модели, что именно она должна сделать, а уже потом описывайте красоту. Тип изображения — product photo, magazine cover, infographic, UI mockup, poster, presentation slide — сразу задаёт композиционные решения. На Reddit это сократили до правила «name the deliverable first». Вместо «cinematic, premium, stunning, highly detailed» лучше написать «Рекламная фотография кроссовок», а затем добавить ракурс, фон, свет и материал. То же со стилем: «кинематографично» почти не несёт информации, а мягкий боковой свет, малая глубина резкости, зерно плёнки и тёплая приглушённая палитра — несут. Автор разбора 278 промптов заметил ту же закономерность: рабочие примеры описывают наблюдаемые визуальные свойства, а не набор прилагательных.

РекомендацияИсточникСуть
Начинать с типа изображенияOpenAIСначала указать deliverable, потом детали
Не полагаться на JSONRedditGPT Image 2.5 понимает обычный текст не хуже
Назначать роли референсамOpenAI и RedditЯвно указать, что взять с каждого изображения
Разбирать стиль на характеристикиRedditСначала описать свет, палитру, оптику, потом генерировать без референса

JSON сам по себе не делает картинку лучше. Структурировать длинный запрос удобно, но GPT Image 2.5 нормально понимает обычный текст и блоки с подзаголовками. Пользователи, сравнивавшие варианты, не увидели особой магии фигурных скобок. Важнее, чтобы требования были понятными и не противоречили друг другу.

JSON-промпт не улучшает результат сам по себе — GPT Image 2.5 понимает и обычный текст, важнее непротиворечивость требований.

Самая частая ошибка — загрузить четыре-пять изображений и написать «сделай по этим референсам». Модель должна сама догадаться, что лицо берётся с первой картинки, платье со второй, свет с третьей, а четвёртая нужна только ради фона. OpenAI советует явно назначать роли: изображение 1 отвечает только за внешность, изображение 2 — за одежду, изображение 3 — за интерьер, изображение 4 — только за свет и цветовую палитру. Если композицию третьего изображения копировать не нужно, это тоже стоит указать. Логика простая: мы знаем, зачем приложили картинку, а модель — нет, пока мы ей не объяснили.

Когда референс нужен только из-за визуального стиля, пользователи советуют обходной путь. Генераторы вместе со стилем часто прихватывают расположение объектов, позы и детали исходного изображения. Можно сначала попросить модель разобрать референс на конкретные визуальные характеристики — свет, палитру, фактуру, оптику и композиционные приёмы, — а затем использовать это описание для новой генерации уже без самой картинки. Так сохраняется визуальный язык, но ослабляется привязка к исходной композиции.

Для редактирования OpenAI предлагает отдельные приёмы, но пользователи отмечают: запрос «измени только цвет платья» иногда меняет ещё половину картинки. Это не значит, что гайд бесполезен. Скорее, официальная документация показывает правильный путь, а не двадцать способов свернуть с него в первый же вечер. Тесты на Reddit не являются лабораторными исследованиями или официальным benchmark, но повторяющиеся наблюдения, совпадающие с рекомендациями OpenAI, стоит учитывать при работе с GPT Image 2.5.