8 сентября OpenAI представила GPT Images 2.5 — обновление генератора изображений, которое компания описывает как доведение версии 2.0 до ума, а не как смену поколения. Формально это не «тройка», хотя по объёму изменений заявка выглядит серьёзной. Предыдущая версия, Images 2.0, вышла в апреле и принесла 2K-разрешение, несколько соотношений сторон и веб-поиск для актуальных данных. Пять месяцев спустя 2.5 не переписывает архитектуру, а закрывает те места, на которые пользователи жаловались чаще всего: редактирование и сохранение субъекта на фото.
Масштаб аудитории, которую затрагивает обновление, OpenAI обозначает сразу: каждую неделю через ChatGPT Images и модели GPT-Image в API проходит более 3 млрд сгенерированных изображений. Это значит, что даже небольшое улучшение здесь касается огромного числа людей — от тех, кому нужна картинка для презентации, до тех, кто делает мемы или стилизованные фотографии. Один из разработчиков, прогнавший через gpt-image-2 около 50 тыс. изображений через API, сообщил, что средняя задержка держалась на уровне 104 секунд, а после обновления упала до 35–40 секунд. Это не «до 50%», как в официальном заявлении, а более чем двукратное ускорение на практике.
| Направление | Что было раньше | Что изменилось в 2.5 |
|---|---|---|
| Точность образа | Лица и предметы на референсах могли «плыть» при переносе в новую сцену | Субъект остаётся узнаваемым при смене стиля, фона, композиции |
| Точечное редактирование | Правка одного элемента задевала картинку целиком | Меняется только названное (товар, фон, надпись), остальное остаётся как было |
| Многоэтапное редактирование | С каждой новой правкой картинка могла ухудшаться | Предыдущие изменения сохраняются, качество не сползает |
Три заявленные оси улучшений выглядят так. Первая — точность образа: лица и предметы на референсах раньше могли «плыть» при переносе в новую сцену, теперь субъект остаётся узнаваемым при смене стиля, фона и композиции. Вторая — точечное редактирование: правка одного элемента задевала картинку целиком, теперь меняется только названное — товар, фон, надпись, — а остальное остаётся как было. Третья — многоэтапное редактирование: раньше после пяти правок подряд изображение превращалось в «мутировавшую» версию задуманного, теперь ранние изменения сохраняются, и качество не сползает со временем.
Точечное редактирование меняет только названный элемент, не затрагивая остальную композицию.
Практическая ценность точечного редактирования хорошо видна на рабочих сценариях. Один и тот же товарный снимок можно перекрашивать под сезон, менять фон под кампанию, править цену на этикетке — и не пересобирать всю сцену с нуля каждый раз. Ключ здесь в формулировке промпта: для этой модели промптинг стал полноценной дисциплиной со своим гайдом. В примерах OpenAI показывает, как одна фраза «убери цветок из руки мужчины, ничего больше не меняй» даёт чистый результат без лишних изменений.
Многоэтапное редактирование проверяется на серийных задачах — например, покадровой анимации вращения куба или стоп-моушен ролике из восьми последовательных кадров. В демонстрациях сохраняется внешность животного, освещение и окружение, и между кадрами нет «мутаций», которых раньше было сложно избежать. По формулировке OpenAI, модель лучше понимает сложные визуальные инструкции, точнее передаёт реальную информацию на изображениях и справляется с макетами, включая прозрачные фоны. Примеры охватывают десяток стилей — от ретрофутуризма 1950-х до мозаики и импрессионистских городских сцен.
Контекст для отрасли: генераторы изображений конкурируют не только по качеству отдельной картинки, но и по удобству итеративной работы. Скорость и предсказуемость правок здесь часто важнее, чем разрешение или художественная выразительность, потому что именно на них строится рабочий процесс дизайнера, маркетолога или контент-мейкера. GPT Images 2.5 выходит на фоне обновлений DeepSeek и других моделей, так что борьба идёт за то, у кого длинная серия правок проходит без потери качества. Что остаётся неясным: как новая версия поведёт себя на сложных многосубъектных сценах и насколько заявленное ускорение воспроизводится на разных нагрузках API. Ответы на эти вопросы появятся по мере независимых тестов.

