Yapay zeka destekli görsel üretim araçlarının restoran sektöründeki kullanımı, tuhaf ve iştah açmayan bir görsel kalıbın yaygınlaşmasına neden oluyor. TechCrunch'a konuşan Reality Defender CTO'su Alex Lisle, bu sorunun temelinde yatan teknik sebepleri ve kullanıcı algısındaki bozulmayı açıkladı.

Görsel Tekdüzelik Neden Ortaya Çıkıyor?

Lisle'e göre, büyük dil modelleri ve difüzyon modelleri devasa veri setleri üzerinde eğitiliyor. Bu modeller, eğitim sırasında öğrendikleri kalıpları takip ederek 'bir burger menüsü' gibi isteklere yanıt verirken, geçmişte popüler olan belirli bir estetik anlayışı yeniden üretiyor. Sonuç olarak, her buz gibi topak mükemmel yuvarlak, her deniz mahsülü ise anatomik olarak garip şekillerde canlandırılıyor. Lisle, bu durumun '2015 tarihli bir fast food menüsü' gibi görünmesinin, modellerin fonksiyonlarını dayandırdığı veri kümesinin (korpus) o dönemdeki işlerden oluşmasıyla açıklanabildiğini belirtiyor.

Bazı durumlarda bu görseller aşırı sahte bir etki bırakırken, çoğu zaman ilk bakışta normal görünüyor ancak detaylara inildiğinde bir anormallik hissi veriyor. Bu durum, yabancı bir varlığın pizzanın temel prensiplerini anlamadan yapmaya çalışması gibi bir sonuç doğuruyor. Örneğin, erimiş peynir detayı öyle abartılı ve sanatsal bir hâl alıyor ki, yemekten ziyade bir avangard sanat eseri gibi algılanabiliyor.

Veri Kirliliği ve Tespit Araçlarının Yükselişi

Yapay zeka şirketleri için yeni eğitim verileri son derece değerli. Amazon'un nadir kitapları taramak ve yüklendikten sonra imha etmek gibi yöntemlerle veri setlerini genişlettiği biliniyor. Bu devasa veri havuzlarına, yapay zeka tarafından üretilmiş içeriklerin sızması kaçınılmaz hale geliyor. Bu geri besleme döngüsü, görsellerin giderek daha benzer ve yapay bir tonda kalmasına yol açıyor.

Bu görsel tutarsızlıklar ve sahtecilik algısı, yapay zeka tespit ve içerik doğrulama araçları satan girişimcilerin (startup) iş alanını genişletmesine de zemin hazırlıyor. Reality Defender gibi şirketler, bu tür görsel anormallikleri tespit ederek kullanıcıların ve işletmelerin güvenilir içerik üretmesine yardımcı olmayı hedefliyor.

Ne anlama geliyor?

Görsel üretim yapay zekaları, eğitim verilerindeki kalıpları öğreterek çalışma prensibine dayanır. Kullanıcı bir görsel istediğinde, algoritma geçmişte en çok karşılaştığı ve 'başarılı' saydığı estetik kalıpları kopyalar. Bu durum, özellikle yiyecek gibi doğal ve çeşitlilik içeren konularda, mükemmeliyetçilik adına tekdüzelik yaratır. Modelin 'doğru' gördüğü simetri ve pürüzsüzlük, gerçek yaşamın kaotik ve organik yapısıyla çelişir. Bu yüzden üretilen görseller, insan gözüne ilk bakışta 'fazla temiz' veya 'fazla simetrik' gelir ve beğenilmez.

Teknik olarak bu sorun, 'model çökmesi' (model collapse) veya 'eşik değerine (mode collapse) yakınsama' olarak adlandırılan bir olguya benzer. Eğer sistem kendi ürettiği çıktıları tekrar eğitim verisi olarak kullanırsa veya çok dar bir veri dağılımıyla öğrenir, çeşitlilik kaybedilir ve tüm çıktılar birbirine benzemeye başlar. Tüketici açısından pratik sonuç ise, dijital menülerde ve reklam materyallerinde görsel güvenin azalmasıdır. İşletmeler, müşterilerin ilgisini çekmek için bu yapay ve tekrarlayan görsellerden kaçınarak, daha özgün veya gerçek fotoğraflara yönelmek zorunda kalır. Bu durum, yapay zeka görsel üretim araçlarının pazarlama ve sunum amaçlı kullanımdaki sınırlarını vurgular.