Restoranlar, kafeler ve markalar, yiyeceklerini tanıtmak için giderek daha fazla yapay zekaya başvuruyor ve ortaya iştah açmak yerine mide bulandıran bir görsel seli çıkıyor. Ortaya çıkan bu korku şovunda donut karides, solucan benzeri makarnalar, lif lif ayrılmış tavuklar ve inşaat malzemesi gibi görünen dondurmalar yer alıyor. Bu canavarca burger girişimini nasıl tanımlamaya başlayacağımı bile bilmiyorum; kurtçuklarıyla birlikte cehennemden fırlamış bir buritonun yarattığı tripo fobisinden ise hiç bahsetmemek daha iyi. Ortada yumrular var. Ve delikler. Çok ama çok fazla delik.
Gerçek yemek ortada dururken ve fotoğrafı çekilebilirken, restoranların neden iştah açıcı görünmesi gereken ürünlerini tanıtmak için yapay zeka görsellerine başvurduğunu tam olarak bilmiyoruz. Ancak yapay zekanın bu kadar kusursuz bir şekilde mide bulandırıcı görüntüler üretmesinin nedenlerini az çok çözdük.
Bu yapay zeka yemeklerinin bu kadar yanlış görünmesinin birçok nedeni var. Bu nedenler, yapay zeka sistemlerinin görselleri oluşturma biçimindeki teknik detaylardan, eğitildikleri materyallere ve insanların bu görüntüleri algılarken taşıdıkları psikolojik yüklemelere kadar uzanıyor. Sorun sıklıkla daha en baştan başlıyor. Önde gelen görsel oluşturucuların çoğu, görüntüleri difüzyon modeliyle üretiyor. Basitçe anlatmak gerekirse, difüzyon modelleri saf gürültüden oluşan bir görüntüyle, yani ekran dolusu karıncalı bir televizyon ekranıyla işe başlıyor ve istenen görseli oluşturmak için gürültüyü yavaş yavaş temizliyor. Oxford Üniversitesi'nde yapay zeka, hükümet ve politika profesörü ve bilgisayarlı görme uzmanı Chris Russell, "Bu, başlangıçta kaba yapıların önce oluşturulduğu, ince doku detaylarının ise en son eklendiği anlamına geliyor" diye açıklıyor.
Russell'a göre, bu rahatsız edici yemek görsellerinin çoğunda ince detaylar eklenene kadar işler zaten rayından çıkmış oluyor. Model, nesnenin temel yapısını daha erken bir aşamada yanlış kurgulayabiliyor, ardından bu hatalı yapının üzerine canlı doku detaylarını yığabiliyor. Russell, "Bu, bir insanın beş parmak yerine altı parmakla üretilmesi durumunda karşılaştığınız hata türünün aynısı" diyor. Bu durum, o meşhur donut karidesi görselini de gayet iyi açıklıyor.
Alta yatan yapı sağlam olsa bile, ince detaylar kendi içlerinde yine de ters gidebiliyor. İtalya'daki Napoli Federico II Üniversitesi'nde yapay zeka kaynaklı görsellere verilen tepkileri inceleyen davranış bilimci Giovanbattista Califano, "Difüzyon modelleri, ince, sürekli ve uçları olan yapıları üretmede son derece zayıftır" diyor. "Makarnalar, iplikçikler ve sarmaşıklar tam olarak bu modelleri şaşırtan geometri türüdür; bu yüzden anatomik veya mutfak mantığına uymayan yerlere sızan spagetti benzeri yapay bozukluklar elde edersiniz." Başka bir deyişle, model bunun gibi bir şey üretmeye başladığında, nerede durması gerektiğini veya neye bağlı olması gerektiğini çözmekte zorlanıyor. Kabarcıklar ve tohumlar gibi diğer tekrar eden dokuların da difüzyon modelleri tarafından mantıklı sınırlar içinde tutulması aynı şekilde zor; bu yüzden genellikle olmamaları gereken alanlara taşıyorlar. Califano'ya göre bu durum, birçok yapay zeka yemek görselinin neden bu kadar amansız bir şekilde makarna benzeri, ürkütücü derecede desenli ve tripo fobisini tetikleyebilen kümelenmiş deliklerle dolu olduğunu açıklıyor.
İşin kötü yanı, yapay zekanın bir sandviçin aslında ne olduğu hakkında hiçbir fikri yok. Bir makarnanın veya bir buritonun da... Yarattığı nesneler veya içinde bulundukları fiziksel dünya hakkında hiçbir anlayışa sahip değil. İstatistiksel düzeyde bu şeylerin genellikle neye benzediğini genel hatlarıyla öğrendi, ancak neden o şekilde göründüklerini veya nasıl davranmaları gerektiğini bilmiyor. İsviçre'deki Zürih Üniversitesi'nde dijital kültürler ve sanatlar profesörü Roland Meyer, "Yapay zeka görsel oluşturma, dünya hakkında uygun bir bilgiye sahip olmadan sadece görünüşü kopyalar" diye açıklıyor. Ortaya çıkan sonuç, nesnenin kendisine dair herhangi bir anlayıştan kopuk, sadece yemeğe benzetilmiş bir taklit.
Bu anlayış eksikliği, görselleri inceleyen insanlarda mide bulandırıcı bazı estetik algılara yol açabiliyor. Londra King's College'da bilgisayar bilimleri kıdemli öğretim üyesi Michael Cook, bu yüzden dondurmanın çatlak betonu andırdığını veya burgerlerin sanki kayalardan yapılmış gibi göründüğünü belirtiyor. Yapay zeka modelleri, yiyeceklerin neden yiyecek olmayan nesneler gibi görünmemesi gerektiğini anlamıyor. Cook, "Bu dokular mimari bir bağlamda kullanılsaydı tamamen normal görünebilirdi" diye açıklıyor. "Ancak onları yenilebilir bir yiyecek olarak hayal ettiğimizde tamamen yanlış görünmeye başlıyorlar."
Bu modelleri eğitmek için kullanılan görseller de sorunu daha da kötüleştirebiliyor. Cook, "Bu sistemlerin eğitim süreçleri hakkında çok az şey bildiğimiz için, ne tür bir içerik karışımı aldıklarını veya ne tür ilişkiler kurduklarını gerçekten bilmiyoruz" diyor.
Yemek fotoğrafçılığı genellikle son derece stilize edilir; keskin kontrastlar, yoğun renkler, parlak ışıklandırma ve abartılı şekiller barındırır. Bazen fotoğrafı çekilen "yiyecek" gerçek bir yiyecek bile olmayabilir. Meyer, yapay zeka modellerinin bu yüzey niteliklerini ve görsel kuralları algılayabildiğini, ancak bunların arkasındaki bağlamı anlamadan kopyaladıklarını söylüyor. Meyer, "Başka bir deyişle, yapay zeka görsel oluşturma, fotoğrafçılığın görünüşünü mükemmel bir şekilde taklit ediyor, ancak profesyonel estetik stratejilerini uygulayamıyor" diyor. "Onları bu kadar rahatsız edici yapan da nihayetinde bu."
Stil bir yana, dünyayı interneti tarayarak öğrenmenin başka bir sorunu daha var: işler çok hızlı bir şekilde tuhaflaşabiliyor. Londra Queen Mary Üniversitesi'nde hesaplamalı yaratıcılık, oyunlar ve yapay zeka profesörü Simon Colton, örneğin sıradan kırmızı elmaların görsellerinin internette nispeten az olabileceğini söylüyor. "İnternette sıkıcı bir elmanın fotoğrafını kim paylaşmak ister ki?" Öte yandan, tuhaf görseller Reddit gibi sosyal medya platformlarında büyük kitlelerce izlenebiliyor veya meme olarak geniş çapta yayılabiliyor. Tuhaf internet efsaneleri ve çöp içerikler, yapay zeka modelinin yiyecek ve nasıl görünmesi gerektiği konusunda garip bir ilişki ağına sahip olmasına neden olabiliyor.
Cook, yapay zeka sistemlerinin artık yapay zeka tarafından üretilen materyaller üzerinde de eğitildiğinin iyi bilindiğini belirtiyor. Popüler yapay zeka materyallerinin çoğunun yiyecek içerdiğini, insanların yiyecek yığınlarının içine veya üzerine atladığı yapay zeka kaynaklı videoların bir trend haline geldiğini hatırlatıyor. Materyalin bazen gerçeküstü doğasının ötesinde, araştırmalar yapay zeka modellerini diğer modellerin çıktılarıyla eğitmenin bir tür "model çöküşüne" yol açabileceğini gösteriyor. Bunun bir sonucu olarak da görsel bir yozlaşma ve görseller arasında giderek artan bir benzerlik ortaya çıkabiliyor.
Görsellerin nasıl oluşturulduğu ve kullanıldığı işleri daha da kötüleştirebiliyor. İstemler (promptlar) —hem kullanıcılar tarafından yazılanlar hem de şirketlerin modellerini yönlendirmek için kullandıkları sistem düzeyindeki talimatlar— her zaman en iyi sonuçları vermeyebiliyor. Belirsiz olabiliyorlar; örneğin sadece bir sandviç istemek veya metin için mantıklı olan ancak görsel oluşturmak için pek de mantıklı olmayan "kesin ol" gibi bir dil içerebiliyorlar. Düşük çözünürlüklü görseller de amaçlanandan çok daha büyük boyutlara büyütülebiliyor. Bu durum, fark edilmeyebilecek her türlü rahatsız edici kusuru büyütüyor veya modelin kusurlu bir şekilde doldurmak zorunda kaldığı bir boşluk yaratıyor.
Tüm bunlar, yapay zeka tarafından oluşturulan birçok yemek görselini derin bir "tekinsiz vadi"ye itiyor. Ve bizim için ne yazık ki, insanlar bir yiyeceğin yanlış göründüğünü fark etme konusunda son derece hassas. Bilim insanları, tiksinti duygusunun bizi parazitlerden, patojenlerden, toksinlerden ve diğer potansiyel tehditlerden korumanın bir yolu olarak evrildiğine inanıyor; bu da bir şeyin yenmesinin güvenli olmayabileceği durumlara karşı özellikle tetikte olmamızı sağlıyor. Califano, bunun yemek için tekinsiz vadiyi, insana tam benzemeyen varlıklarla yaşadığımızdan çok daha içgüdüsel hale getirdiğini belirtiyor.
Yapay zeka tarafından üretilen yemek görselleri, bu tetikleyicilerin çoğuna aynı anda vurma konusunda ürkütücü bir yeteneğe sahip. Tuhaf, makarna benzeri sarmaşıklar solucanlara veya parazitlere benziyor, delik kümeleri istilaları çağrıştırıyor ve yanlış renkler ve dokular kirlenmeyi veya bozulmayı işaret ediyor. Yapay zeka tarafından üretilen yemekler yanlış görünüyor çünkü ilkel bir düzeyde yanlış hissettiriyor. Yemeğe benzeyebilir, ancak beyinlerimiz daha iyisini biliyor. Ortaya çıkan şey tam anlamıyla bir çöp ve biz de buna göre tepki veriyoruz.