Palo Alto merkezli yapay zeka girişimi Fish Audio, hem içerik üreticileri hem de kurumsal şirketler için geliştirdiği ses modellerini büyütmek amacıyla 52 milyon dolarlık tohum yatırım topladı. Coreline Ventures ve Capital Today liderliğinde gerçekleşen yatırım turuna 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners ve HF0 katıldı.
Fish Audio'nun Büyüme Rakamları ve Teknoloji Kitaplığı
Geçen yıl faaliyete geçen girişim, 15 bini aşkın doğal dil kontrolünden oluşan bir kütüphaneye sahip. Açık kaynaklı ve barındırılan modellerini kullanan kişi sayısı 8 milyonun üzerine çıkarken, şirketin yıllık tekrarlayan geliri 21 milyon dolara ulaştı. Eski Nvidia araştırmacısı Shijia Liao tarafından tek bir GPU üzerinde eğitilen bir modelle başlatılan proje, şu an GitHub üzerinde 31 binden fazla yıldız alan 'Fish Speech' deposuna dönüştü.
Model Çeşitliliği ve Kullanım Alanları
Şirket son bir yıl içinde dört adet konuşma üretme ve bir adet metinden konuşmaya dönüştürme modeli olmak üzere toplam beş model yayınladı. Bu modellerden üçü açık kaynaklıyken, en güncel S2.1 Pro modeline yalnızca ücretli API üzerinden erişim sağlanabiliyor. Şirketin API ve platform hizmetlerini HeyGen ve Sanas gibi kuruluşların kullandığı belirtiliyor.
Telif Hakları ve Hızlı Kaldırma Sistemi
Kullanıcıların seslerini eğitim için sunup karşılığında ödeme aldığı sistem, geçtiğimiz aylarda bazı içerik üreticilerinin rızası dışında seslerinin yüklendiği iddialarıyla gündeme geldi. CEO Rissa Cao, içerik kaldırma sürecini otomatik hale getirdiklerini ve kullanıcıların ses örnekleri veya sözleşmelerle hak sahipliğini kanıtlaması durumunda, seslerin üç dakikadan kısa sürede platformdan kaldırıldığını açıkladı.
Ne anlama geliyor?
Ses sentezleme teknolojileri, dijital ortamda doğal ve duygu yüklü konuşmalar üretilmesini sağlayan sistemlerdir. Bu mekanizma, gerçek insan seslerinin veri setleri üzerinden eğitilmesiyle çalışır ve kullanıcının verdiği komutlarla tonlama veya vurgu gibi nüansların değiştirilmesine olanak tanır. Özellikle otomatik müşteri hizmetleri ve dijital karakterlerin oluşturulmasında kullanılan bu sistemler, gecikme süresini düşürerek gerçek zamanlı etkileşimi mümkün kılar.
Sektörde karşılaşılan temel sorun, ses verilerinin mülkiyeti ve izinsiz kullanımıyla ilgilidir. Ses kopyalama yeteneği arttıkça, biyometrik verinin korunması ve hak sahipliğinin doğrulanması kritik bir süreç haline gelmiştir. Bu durum, dijital kimlik doğrulama sistemlerinin geliştirilmesini ve şeffaf lisanslama modellerinin uygulanmasını zorunlu kılmaktadır.





Yorumlar (0)
İlk yorumu sen yaz.