8 сентября OpenAI представила GPT Images 2.5 — обновление генератора изображений, которое компания описывает как доведение версии 2.0 до ума, а не как смену поколения. Формально это не «тройка», хотя по объёму изменений заявка выглядит серьёзной. Предыдущая версия, Images 2.0, вышла в апреле и принесла 2K-разрешение, несколько соотношений сторон и веб-поиск для актуальных данных. Пять месяцев спустя 2.5 не переписывает архитектуру, а закрывает те места, на которые пользователи жаловались чаще всего: редактирование и сохранение субъекта на фото.

Масштаб аудитории, которую затрагивает обновление, OpenAI обозначает сразу: каждую неделю через ChatGPT Images и модели GPT-Image в API проходит более 3 млрд сгенерированных изображений. Это значит, что даже небольшое улучшение здесь касается огромного числа людей — от тех, кому нужна картинка для презентации, до тех, кто делает мемы или стилизованные фотографии. Один из разработчиков, прогнавший через gpt-image-2 около 50 тыс. изображений через API, сообщил, что средняя задержка держалась на уровне 104 секунд, а после обновления упала до 35–40 секунд. Это не «до 50%», как в официальном заявлении, а более чем двукратное ускорение на практике.

НаправлениеЧто было раньшеЧто изменилось в 2.5
Точность образаЛица и предметы на референсах могли «плыть» при переносе в новую сценуСубъект остаётся узнаваемым при смене стиля, фона, композиции
Точечное редактированиеПравка одного элемента задевала картинку целикомМеняется только названное (товар, фон, надпись), остальное остаётся как было
Многоэтапное редактированиеС каждой новой правкой картинка могла ухудшатьсяПредыдущие изменения сохраняются, качество не сползает

Три заявленные оси улучшений выглядят так. Первая — точность образа: лица и предметы на референсах раньше могли «плыть» при переносе в новую сцену, теперь субъект остаётся узнаваемым при смене стиля, фона и композиции. Вторая — точечное редактирование: правка одного элемента задевала картинку целиком, теперь меняется только названное — товар, фон, надпись, — а остальное остаётся как было. Третья — многоэтапное редактирование: раньше после пяти правок подряд изображение превращалось в «мутировавшую» версию задуманного, теперь ранние изменения сохраняются, и качество не сползает со временем.

Точечное редактирование меняет только названный элемент, не затрагивая остальную композицию.

Практическая ценность точечного редактирования хорошо видна на рабочих сценариях. Один и тот же товарный снимок можно перекрашивать под сезон, менять фон под кампанию, править цену на этикетке — и не пересобирать всю сцену с нуля каждый раз. Ключ здесь в формулировке промпта: для этой модели промптинг стал полноценной дисциплиной со своим гайдом. В примерах OpenAI показывает, как одна фраза «убери цветок из руки мужчины, ничего больше не меняй» даёт чистый результат без лишних изменений.

Многоэтапное редактирование проверяется на серийных задачах — например, покадровой анимации вращения куба или стоп-моушен ролике из восьми последовательных кадров. В демонстрациях сохраняется внешность животного, освещение и окружение, и между кадрами нет «мутаций», которых раньше было сложно избежать. По формулировке OpenAI, модель лучше понимает сложные визуальные инструкции, точнее передаёт реальную информацию на изображениях и справляется с макетами, включая прозрачные фоны. Примеры охватывают десяток стилей — от ретрофутуризма 1950-х до мозаики и импрессионистских городских сцен.

Контекст для отрасли: генераторы изображений конкурируют не только по качеству отдельной картинки, но и по удобству итеративной работы. Скорость и предсказуемость правок здесь часто важнее, чем разрешение или художественная выразительность, потому что именно на них строится рабочий процесс дизайнера, маркетолога или контент-мейкера. GPT Images 2.5 выходит на фоне обновлений DeepSeek и других моделей, так что борьба идёт за то, у кого длинная серия правок проходит без потери качества. Что остаётся неясным: как новая версия поведёт себя на сложных многосубъектных сценах и насколько заявленное ускорение воспроизводится на разных нагрузках API. Ответы на эти вопросы появятся по мере независимых тестов.