Dlaczego żywność generowana przez AI często wygląda nienaturalnie — The Verge
Restauracje, kawiarnie i marki coraz częściej wykorzystują obrazy generowane przez sztuczną inteligencję do reklamowania żywności, jednak takie wizualizacje często wyglądają nienaturalnie i wywołują odrazę. Jak informuje The Verge, do typowych błędów należą zbyt długie kluski makaronu, dziwne skupiska otworów, nienaturalne tekstury i elementy przypominające niejadalne materiały.
Błędy powstają na wczesnych etapach
Wiele czołowych generatorów obrazów działa w oparciu o modele dyfuzyjne. Zaczynają one od obrazu losowego szumu i stopniowo tworzą pożądany obraz: najpierw odtwarzają zgrubne struktury, a następnie dodają drobne szczegóły i tekstury.
Profesor Uniwersytetu Oksfordzkiego Chris Russell wyjaśnił, że model może popełnić błąd w podstawowym kształcie obiektu jeszcze przed etapem dopracowywania szczegółów. Następnie dodaje wyraziste tekstury do błędnej struktury. Naukowiec porównał to do błędu, w którym przedstawiona osoba ma sześć palców zamiast pięciu.
Giovambattista Califano, naukowiec behawioralny z Uniwersytetu Neapolitańskiego Federico II, zaznaczył, że modele dyfuzyjne szczególnie słabo odtwarzają cienkie, ciągłe struktury z wyraźnym zakończeniem. Dlatego makaron, nitki i elementy przypominające macki mogą wychodzić poza granice przedmiotów lub pojawiać się tam, gdzie nie powinny. Podobne problemy występują w przypadku powtarzalnych tekstur, takich jak bąbelki i nasiona.
Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.
Modele odtwarzają wygląd, a nie właściwości przedmiotów
Profesor kultur i sztuk cyfrowych Uniwersytetu Zuryskiego Roland Meyer podkreślił, że systemy generatywne odtwarzają zewnętrzny wygląd obiektów, ale nie rozumieją świata fizycznego. Statystycznie przyswajają sobie, jak zwykle wyglądają kanapki, burrito czy lody, lecz nie wiedzą, czym są te przedmioty ani jak powinny się zachowywać.
Michael Cook, starszy wykładowca informatyki w King’s College London, wyjaśnił, że tekstury właściwe w kontekście architektonicznym mogą wydawać się niejadalne na obrazie żywności. Na wynik wpływają również dane treningowe: fotografia kulinarna jest często stylizowana, z ostrymi kontrastami, nasyconymi kolorami, błyszczącym oświetleniem i przesadzonymi formami. AI może odtwarzać te techniki wizualne bez rozumienia ich kontekstu.
Reakcja człowieka nasila odrazę
Według ekspertów modele mogą przyswajać dziwne skojarzenia wizualne z internetu, gdzie nietypowe lub memiczne obrazy czasem rozchodzą się szerzej niż zwykłe zdjęcia produktów spożywczych. Dodatkowym problemem jest trenowanie AI na treściach już stworzonych przez inne modele: badania wiążą to z tak zwanym kolapsem modeli, degradacją wizualną i rosnącą jednolitością obrazów.
Ludzie są szczególnie wrażliwi na żywność, która wygląda niebezpiecznie. Skupiska otworów mogą kojarzyć się z zakażeniem, nitkowate detale z pasożytami, a nienaturalne kolory i faktury z psuciem się lub zanieczyszczeniem produktu. Califano zauważył, że z powodu takich reakcji „dolina niesamowitości” w przypadku żywności może być odczuwana silniej niż w odniesieniu do obrazów przypominających ludzi, ale nie w pełni ludzkich.
Czytaj nas na Telegram i Sends