Почему еда, сгенерированная ИИ, часто выглядит неестественно — The Verge
Рестораны, кафе и бренды все чаще используют изображения, сгенерированные искусственным интеллектом, для рекламы еды, однако такие визуальные материалы нередко выглядят неестественно и вызывают отвращение. Как сообщает The Verge, среди типичных ошибок встречаются слишком длинная лапша, странные скопления отверстий, неестественные текстуры и элементы, напоминающие несъедобные материалы.
Ошибки возникают на ранних этапах
Многие ведущие генераторы изображений работают на основе диффузионных моделей. Они начинают с изображения случайного шума и постепенно формируют нужную картинку: сначала воспроизводят грубые структуры, а затем добавляют мелкие детали и текстуры.
Профессор Оксфордского университета Крис Расселл объяснил, что модель может ошибиться в базовой форме объекта еще до этапа детализации. После этого она добавляет выразительные текстуры к неправильной структуре. Ученый сравнил это с ошибкой, при которой изображенный человек имеет шесть пальцев вместо пяти.
Поведенческий ученый Университета Неаполя Federico II Джованбаттиста Калифано отметил, что диффузионные модели особенно плохо воспроизводят тонкие, непрерывные структуры с четким окончанием. Поэтому лапша, нити и щупальцеподобные элементы могут выходить за пределы предметов или появляться там, где их быть не должно. Схожие проблемы возникают с повторяющимися текстурами, такими как пузырьки и семена.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
Модели воспроизводят внешний вид, а не свойства предметов
Профессор цифровых культур и искусств Цюрихского университета Роланд Майер подчеркнул, что генеративные системы воспроизводят внешний вид объектов, но не понимают физический мир. Они статистически усваивают, как обычно выглядят сэндвичи, буррито или мороженое, однако не знают, что это за предметы и как они должны вести себя.
Старший преподаватель компьютерных наук Королевского колледжа Лондона Майкл Кук объяснил, что текстуры, уместные в архитектурном контексте, на изображении еды могут казаться несъедобными. На результат также влияют обучающие данные: фуд-фотография часто стилизована, с резкими контрастами, насыщенными цветами, глянцевым освещением и преувеличенными формами. ИИ может воспроизводить эти визуальные приемы без понимания их контекста.
Реакция человека усиливает отвращение
По словам экспертов, модели могут усваивать странные визуальные ассоциации из интернета, где необычные или мемные изображения иногда распространяются шире, чем обычные фотографии продуктов. Дополнительной проблемой является обучение ИИ на контенте, уже созданном другими моделями: исследования связывают это с так называемым коллапсом моделей, визуальной деградацией и ростом однообразия изображений.
Люди особенно чувствительны к еде, которая выглядит опасной. Скопления отверстий могут ассоциироваться с заражением, нитевидные детали — с паразитами, а неестественные цвета и фактуры — с порчей или загрязнением продукта. Калифано отметил, что из-за таких реакций «зловещая долина» для еды может ощущаться острее, чем для изображений, похожих на людей, но не вполне человеческих.