OpenAI выпустила подробный гайд по промптам для GPT Image 2.5. Документация разбирает генерацию с нуля, редактирование, работу с несколькими референсами, текст внутри изображения, сохранение персонажей и сложные макеты. Пользователи Reddit за несколько дней провели собственные тесты, включая серию экспериментов с официальными промптами и последовательным редактированием. Один из авторов реконструировал 278 промптов по опубликованным примерам OpenAI.
Одна из главных рекомендаций OpenAI звучит почти скучно: сначала скажите модели, что именно она должна сделать, а уже потом описывайте красоту. Тип изображения — product photo, magazine cover, infographic, UI mockup, poster, presentation slide — сразу задаёт композиционные решения. На Reddit это сократили до правила «name the deliverable first». Вместо «cinematic, premium, stunning, highly detailed» лучше написать «Рекламная фотография кроссовок», а затем добавить ракурс, фон, свет и материал. То же со стилем: «кинематографично» почти не несёт информации, а мягкий боковой свет, малая глубина резкости, зерно плёнки и тёплая приглушённая палитра — несут. Автор разбора 278 промптов заметил ту же закономерность: рабочие примеры описывают наблюдаемые визуальные свойства, а не набор прилагательных.
| Рекомендация | Источник | Суть |
|---|---|---|
| Начинать с типа изображения | OpenAI | Сначала указать deliverable, потом детали |
| Не полагаться на JSON | GPT Image 2.5 понимает обычный текст не хуже | |
| Назначать роли референсам | OpenAI и Reddit | Явно указать, что взять с каждого изображения |
| Разбирать стиль на характеристики | Сначала описать свет, палитру, оптику, потом генерировать без референса |
JSON сам по себе не делает картинку лучше. Структурировать длинный запрос удобно, но GPT Image 2.5 нормально понимает обычный текст и блоки с подзаголовками. Пользователи, сравнивавшие варианты, не увидели особой магии фигурных скобок. Важнее, чтобы требования были понятными и не противоречили друг другу.
JSON-промпт не улучшает результат сам по себе — GPT Image 2.5 понимает и обычный текст, важнее непротиворечивость требований.
Самая частая ошибка — загрузить четыре-пять изображений и написать «сделай по этим референсам». Модель должна сама догадаться, что лицо берётся с первой картинки, платье со второй, свет с третьей, а четвёртая нужна только ради фона. OpenAI советует явно назначать роли: изображение 1 отвечает только за внешность, изображение 2 — за одежду, изображение 3 — за интерьер, изображение 4 — только за свет и цветовую палитру. Если композицию третьего изображения копировать не нужно, это тоже стоит указать. Логика простая: мы знаем, зачем приложили картинку, а модель — нет, пока мы ей не объяснили.
Когда референс нужен только из-за визуального стиля, пользователи советуют обходной путь. Генераторы вместе со стилем часто прихватывают расположение объектов, позы и детали исходного изображения. Можно сначала попросить модель разобрать референс на конкретные визуальные характеристики — свет, палитру, фактуру, оптику и композиционные приёмы, — а затем использовать это описание для новой генерации уже без самой картинки. Так сохраняется визуальный язык, но ослабляется привязка к исходной композиции.
Для редактирования OpenAI предлагает отдельные приёмы, но пользователи отмечают: запрос «измени только цвет платья» иногда меняет ещё половину картинки. Это не значит, что гайд бесполезен. Скорее, официальная документация показывает правильный путь, а не двадцать способов свернуть с него в первый же вечер. Тесты на Reddit не являются лабораторными исследованиями или официальным benchmark, но повторяющиеся наблюдения, совпадающие с рекомендациями OpenAI, стоит учитывать при работе с GPT Image 2.5.

