Рестораны и бренды всё чаще используют ИИ для генерации изображений еды в рекламных целях. Результат часто выглядит неаппетитно: «донут-креветки», сэндвичи с червеобразной лапшой, мороженое, напоминающее строительный материал, и бургеры, похожие на камень. Пользователи соцсетей регулярно публикуют такие примеры, и они становятся вирусными.
Почему нейросети так плохо справляются с изображением еды? Ответ кроется в технических особенностях генерации изображений. Большинство современных моделей, таких как Midjourney и DALL-E, используют диффузионный подход. Процесс начинается с изображения, состоящего из чистого шума, и постепенно убирает шум, восстанавливая структуру. Как объясняет Крис Рассел, профессор ИИ в Оксфордском университете, сначала восстанавливаются грубые структуры, а мелкие детали добавляются в конце. Если на раннем этапе модель ошибается в базовой форме объекта, то позже она накладывает на эту ошибку яркие текстуры, что приводит к появлению шести пальцев у людей или «донут-креветок».
Другая проблема — слабость диффузионных моделей в генерации тонких, непрерывных структур. Джованбаттиста Калифано, поведенческий ученый из Университета Неаполя, отмечает: «Диффузионные модели notoriously weak at generating thin, continuous, terminating structures». Лапша, волокна и усики — именно та геометрия, которая вызывает трудности, поэтому появляются спагетти-артефакты, проникающие в места без кулинарной логики. Повторяющиеся текстуры, такие как пузырьки или семена, тоже сложно удержать в границах, что объясняет обилие дыр, вызывающих трипофобию.
Модели слабы в генерации тонких непрерывных структур — спагетти, волокон, усиков, из-за чего появляются «червеобразные» артефакты.

Кроме того, ИИ не имеет представления о том, что такое еда на самом деле. Модель не понимает физический мир, а лишь статистически воспроизводит внешний вид объектов. Роланд Мейер, профессор цифровых культур в Цюрихском университете, подчеркивает: «ИИ воспроизводит внешний вид без понимания мира». Это приводит к тому, что мороженое выглядит как бетон, а бургер — как камень. Майкл Кук из Королевского колледжа Лондона добавляет: текстуры, которые нормальны в архитектурном контексте, становятся отталкивающими, когда мы представляем их как еду.
Обучающие данные усугубляют проблему. Фотографии еды в рекламе часто стилизованы: яркие цвета, глянцевый свет, преувеличенные формы. Иногда «еда» на фото — не настоящая, а муляж. Модели могут улавливать эти искажения и воспроизводить их. Поскольку детали обучения неизвестны, трудно сказать, какие ассоциации возникают у модели.
Психологический аспект тоже важен: люди воспринимают такие изображения как отвратительные, потому что они нарушают ожидания о том, как должна выглядеть еда. Это может отталкивать потребителей, что ставит под вопрос использование ИИ в маркетинге продуктов питания. Пока компании экспериментируют с генеративными моделями, им стоит учитывать эти ограничения и, возможно, комбинировать ИИ с традиционной фотографией.



