OpenAI, ChatGPT'nin ses işlevselliğini önemli ölçüde geliştiren iki yeni model olan GPT-Live-1 ve GPT-Live-1 mini'yi piyasaya sürdü. Geçen yaz tanıtılan Gelişmiş Ses Modu'nun yerini alan yeni modeller, duplex mimarisine dayalı olarak çalışıyor ve bu sayede kullanıcılar ve yapay zeka arasında daha doğal bir diyalog sağlanabiliyor.
Doğal Konuşma ve Gerçek Zamanlı İşlem
Önceki ses sistemi, kullanıcının konuşmasını bitirene kadar cevap veremeyen "sıraya dayalı" bir yapıya sahipti. Bu da konuşmada duraklamalar olduğunda istenmeyen kesmeler ve ağır, durağan bir iletişim deneyimi yaratıyordu. GPT-Live-1 ve mini modelleri ise aynı anda girdi işlerken çıktı üretebiliyor. Bu sayede modeller konuşmaya kesintisiz biçimde müdahale edebiliyor, zaman algısı daha iyi oluyor ve hatta canlı çeviri yapabiliyor.
Yeni modeller, konuştuğunuz sırada "mhmm" ve "got it" gibi sözel onaylarla dinlediklerini aktarıyor ve hatta arzu ederseniz konuşma hızını yavaşlatmasını isteyebiliyorsunuz. Arka plandaki gürültülü ortamlarda daha iyi odaklanabiliyorlar ve görsel kartlar aracılığıyla hava, spor veya hisse senedi gibi konularda bilgi sunabiliyorlar.
Güvenlik Önlemleri ve Erişim Seviyeleri
OpenAI, yeni ses özelliğine kapsamlı güvenlik mekanizmaları ekledi. Sistem potansiyel tehlikeli çıktıları algıladığında modeli daha güvenli bir yanıta yönlendiriyor, ek güvenlik mesajları gösteriyor veya yüksek risk durumlarında konuşmayı sonlandırabiliyor. Ebeveynler, yeni ebeveyn kontrol araçlarını kullanarak çocuklarının ses özelliğine erişimini devre dışı bırakabiliyorlar. Sistem, çocuğun kendine zarar vermeyle ilgili konuşmaya yönelmesini algılarsa ebeveyne bildirim gönderiyor.
GPT-Live modelleri bugün itibariyle Android, iOS ve web platformlarında kullanıma sunuluyor. Go, Plus ve Pro abonelikleri GPT-Live-1 modelini kullanırken, ücretsiz hesaplar daha küçük Live-1 mini sürümüne yönlendirilecek.
Ne anlama geliyor?
Ses asistanları, geleneksel olarak sağlam ve doğal bir konuşma deneyimi sağlamakta zorluk çekmiştir. Bunun temel nedeni, sisten kullanıcının konuşmasını tamamlayıp sessiz kaldığını tespit ettikten sonra yanıt verme mekanizmasıdır. Bu "sıra beklemeli" sistem, gerçek insan sohbetine benzer şekilde birbirini kesmek, eş zamanlı dinlemek ve tepki göstermek imkânını yaratmaz. Duplex mimarisi ise aynı anda çoklu görevler işleyen bir yapı sunuyor: dinlemek, işlemek ve konuşmak aynı anda gerçekleşebiliyor. Bu, konuşma tabanlı arayüzlerin daha akıcı, insana yakın ve intiyaç duyduğu anda yardımcı olabilir kılıyor. Ek olarak, sistem gerekli durumlarda daha karmaşık hesaplamalar veya web araştırması için arka planda diğer araçlara başvurabiliyor, böylece kullanıcı konuşmaya başarıyla devam edebiliyor. Güvenlik açısından ise, sistem gözetime dayalı filtreler ve ebeveyn denetimleri ekleyerek, özellikle gençler için daha güvenli bir ortam oluşturmaya çalışıyor. Bu tür gelişmeler, ses arayüzlerinin yazınsal sohbetlere giderek daha çok benzemesini, daha hızlı ve sezgisel hale gelmesini sağlıyor.





Yorumlar (0)
İlk yorumu sen yaz.