Чому згенерована ШІ їжа часто виглядає неприродно — The Verge
Ресторани, кафе та бренди дедалі частіше використовують згенеровані штучним інтелектом зображення для реклами їжі, однак такі візуали нерідко виглядають неприродно й викликають відразу. Як повідомляє The Verge, серед типових помилок трапляються надто довга локшина, дивні скупчення отворів, неприродні текстури та елементи, що нагадують неїстівні матеріали.
Помилки виникають на ранніх етапах
Багато провідних генераторів зображень працюють на основі дифузійних моделей. Вони починають із зображення випадкового шуму й поступово формують потрібну картинку: спочатку відтворюють грубі структури, а згодом додають дрібні деталі та текстури.
Професор Оксфордського університету Кріс Расселл пояснив, що модель може помилитися в базовій формі об’єкта ще до етапу деталізації. Після цього вона додає виразні текстури до неправильної структури. Науковець порівняв це з помилкою, коли зображена людина має шість пальців замість п’яти.
Поведінковий науковець Університету Неаполя Federico II Джованбаттіста Каліфано зазначив, що дифузійні моделі особливо погано відтворюють тонкі, безперервні структури з чітким завершенням. Тому локшина, нитки й щупальцеподібні елементи можуть виходити за межі предметів або з’являтися там, де не мають бути. Схожі проблеми виникають із повторюваними текстурами на кшталт бульбашок і насіння.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Моделі відтворюють вигляд, а не властивості предметів
Професор цифрових культур і мистецтв Цюрихського університету Роланд Маєр наголосив, що генеративні системи відтворюють зовнішній вигляд об’єктів, але не розуміють фізичного світу. Вони статистично засвоюють, як зазвичай виглядають сендвічі, буріто чи морозиво, проте не знають, що це за предмети та як вони мають поводитися.
Старший викладач комп’ютерних наук Королівського коледжу Лондона Майкл Кук пояснив, що текстури, доречні в архітектурному контексті, у зображенні їжі можуть здаватися неїстівними. На результат також впливають навчальні дані: фуд-фотографія часто є стилізованою, з різкими контрастами, насиченими кольорами, глянцевим освітленням і перебільшеними формами. ШІ може відтворювати ці візуальні прийоми без розуміння їхнього контексту.
Відразу посилює реакція людини
За словами експертів, моделі можуть засвоювати дивні візуальні асоціації з інтернету, де незвичайні або мемні зображення іноді поширюються ширше, ніж звичайні фото продуктів. Додатковою проблемою є навчання ШІ на контенті, уже створеному іншими моделями: дослідження пов’язують це з так званим колапсом моделей, візуальною деградацією та зростанням одноманітності зображень.
Люди особливо чутливі до їжі, яка виглядає небезпечною. Скупчення отворів можуть асоціюватися із зараженням, ниткоподібні деталі — з паразитами, а неприродні кольори й фактури — із псуванням чи забрудненням продукту. Каліфано зазначив, що через такі реакції «зловісна долина» для їжі може відчуватися гостріше, ніж для зображень, схожих на людей, але не цілком людських.