Google, yapay zeka platformu Gemini'nin 3.8 Live güncellemesi kapsamında kullanıcıların animasyonlu bir dijital persona ile gerçek zamanlı sohbet etmesine imkân tanıyan 'Live Avatar' özelliğini duyurdu. Bu yenilik, yapay zeka arayüzlerine ilk kez dinamik lip-sync (dudak senkronizasyonu) ve değişken yüz ifadeleri kazandırarak etkileşim biçimini somut bir görsel boyuta taşıyor. Özellik şu an için yalnızca Gemini Enterprise abonelerine sunulmaktadır.

97 Dilde Sürekli Görsel Bütünlük

Şirketin teknik açıklamasına göre Live Avatar, desteklediği 97 dil arasında geçiş yaparken video kalitesinde bozulmaya veya görsel kaymaya neden olmuyor. Google tarafından paylaşılan tanıtım videosunda, avatarın İngilizce ve Japonca konuşurken ağız animasyonlarının telaffuzla kusursuzca hizalandığı gözlemleniyor. Sistem, konuşma sırasında ekrandan bilgi çekme kapasitesine de sahip olup bu süreçte görsel akıcılığı korumaya devam ediyor.

Gizli Kimlik Etiketi ve Sonuç Suyu

Canlı avatar özelliğinin tanıtımı, şirketin neredeyse gerçek zamanlı görsel işleme yetenekleriyle öne çıkan Gemini 3.8 Live modelini açıklamasından yaklaşık bir hafta sonra gerçekleşti. Google, müşterilere hazır avatar şablonları sunarken işletmelerin kendi dijital yüzlerini oluşturmalarına da izin veriyor. Tüm çıktılar, kimliği koruma önlemleriyle birlikte görünmez SynthID filigranı içeriyor; bu da yapay zeka üretimi videoların doğrulanabilirliğini sağlıyor.

Ne anlama geliyor?

Bu teknoloji, metin tabanlı sohbet arayüzlerinin ötesine geçerek sesli etkileşime görsel bir beden kazandırır. Dudak hareketlerinin ses dalgalarıyla eşleşmesi, kullanıcı algısında iletişimi daha doğal ve insan benzeri hale getirir. Görsel drift olarak adlandırılan, dil değişimlerinde oluşan yapay bozulmaların ortadan kaldırılması, çok dilli ortamlarda kesintisiz bir deneyim sunmak için kritik bir mühendislik başarısıdır.

İşletmeler açısından bu özellik, müşteri desteği veya sanal asistan hizmetlerinde marka kimliğini görselleştirmek için yeni bir kanal açar. Görünmez filigran kullanımı ise dijital içeriklerin sahteciliğine karşı bir güvenlik katmanı oluşturur; böylece oluşturulan videoların yapay zeka kaynaklı olduğu teknik olarak doğrulanabilir. Kullanıcılar için bu, bilgiye erişirken sadece okumak veya dinlemek değil, bir karşılık ile diyalog kurma hissi yaratır ve dijital asistanların günlük işlevselliğini artırır.