Çin, yapay zeka geliştirmede yeni bir engelle karşı karşıya: yüksek kaliteli Çince metinler ciddi şekilde tükeniyor. Ülkede web içeriğinin sadece yüzde 1,3'ü Çince iken, İngilizce içerik yüzde 49'a ulaşıyor. Bu veri açığı, ABD'nin çip ambargolarından farklı olarak yazılımsal bir çözümle atlatılamıyor.
Çin'in Eğitim Verisinde Ciddi Açık
Dünya çapında yüksek kaliteli, açık kaynaklı metin verisi altı yıl içinde tükenebilir. Çin'in yapay zeka modelleri, sınırlı Çince kaynaklarla daha yoğun çalışmak zorunda olduğu için batılı muadillerine kıyasla birim başına daha pahalıya mal oluyor. Sorun, WeChat ve Douyin gibi platformların harici geliştiricilerle veri paylaşmaması nedeniyle daha da derinleşiyor; bu durum Çin'li yapay zeka laboratuvarlarını düşük kaliteli kaynakları kullanmaya zorlıyor.
Pekin'in Stratejik Veri Planı
Çin hükümeti veriyi stratejik altyapı olarak görmeye başladı. Milli Veri İdaresi Başkanlığı, 2028 yılına kadar imalat, enerji, sağlık, finans, tarım, otonom araçlar ve robotik alanlarında doğrulanmış yapay zeka eğitim veri tabanları oluşturmayı hedefliyor. Aynı zamanda tarihsel arşivlerin, eski el yazmalarının, bilimsel yayınların ve bölgesel ağızların dijitalleştirilmesi de öneriliyor.
Yayıncılar Kapıyı Kapatıyor
Buna karşın Çin yayın endüstrisi direnmeye başladı. Huaxia Yayınevi, yeni basımlarına yapay zeka eğitimi yasağını içeren uyarılar eklemeye başlamış durumda. Benzer şekilde diğer yayıncılar da içeriklerinin yapay zeka modellerini eğitmek için kullanılmasını yasaklayan hukuki uyarılar ekliyor. Bu tutum, Çin'in yabancı yapay zeka modelleriyle olan farkını daha da açıyor.
Ne anlama geliyor?
Bir dil modeli eğitmek için çeşitli ve geniş hacimde metin verisi gerekir. Dil modelleri bu verilerden öğrenerek, anlam çıkarmayı ve cevap üretmeyi öğrenirler. Bir dilde ne kadar çok ve ne kadar kaliteli eğitim verisi varsa, o dille çalışan bir model o kadar iyi performans gösterir. Türkçe gibi daha az temsil edilen diller de benzer sorunla karşı karşıyadır; dünya genelindeki dijital içeriğin büyük çoğunluğu İngilizce ve birkaç ana dilde olduğu için, diğer dillerdeki yapay zeka modellerinin geliştirilmesi daha zor ve maliyetli hale gelir.
Çin'in karşılaştığı durum, sadece veri kıtlığı değil aynı zamanda bir yapısal sorun da sunuyor. Yerel teknoloji şirketleri sosyal medya ve video platformlarından veri alamadıkça, bu hizmetlerdeki milyarlarca kullanıcının oluşturduğu potansiyel eğitim materyallerinden faydalanamazlar. Batı'da teknoloji şirketleri açık kaynak veri kümelerinden ve web içeriğinden yararlanabiliyorken, Çin'de bu kaynaklar kısıtlı kalmaya devam ediyor.
Devlet tarafından denetlenen veri tabanları oluşturmak, kısa vadede veri eksikliğini giderebilir. Ancak uzun vadede yapay zeka rekabetçiliğinde, çeşitli ve doğal kaynaklardan gelen veriye erişim çok önemlidir. Yayıncıların ve muhteva üreticilerinin antrenman verilerine karşı direnci, bu sorunu ağırlaştıracaktır.





Yorumlar (0)
İlk yorumu sen yaz.