Mistral Large 4 (ML4) adını taşıyan bu model, 1 trilyon parametreye sahip olmasıyla dikkat çekiyor ve hem kapalı kaynaklı ABD rakiplerini hem de açık kaynaklı Çinli rakipleri geride bırakma hedefiyle geliştirildi. Fransız Cumhurbaşkanı Emmanuel Macron tarafından 'yapay zekada üçüncü yol' olarak nitelendirilen bu girişim, Avrupa'nın küresel yapay zeka yarışındaki konumunu güçlendirmeyi amaçlıyor.
1 Trilyon Parametre ve Güvenlik Odaklı Yaklaşım
Le Chonk lakabıyla anılan model, şu an için halka açık bir güvenlik noktası üzerinden erişilebilir durumda ancak ağırlıkları henüz tamamen serbest bırakılmadı. Şirket, güvenlik testlerinin tamamlanmasının ardından modelin ağırlıklarını yalnızca üç hafta içinde kamuoyuyla paylaşmayı planlıyor. Mistral Bilim Başkan Yardımcısı Pierre Stock, bu geçiş sürecinde güvenilir ortaklar ve devletlerle iş birliği içinde olacaklarını, açık kaynak ağırlıklarının savunma amaçlı kullanılmasını sağlarken kötü niyetli saldırılara karşı koruma mekanizmaları oluşturacaklarını açıkladı. Özellikle kurumsal müşteriler ve kurumlar arasında son aylarda artan güvenlik endişeleri, bu dikkatli yaklaşımın ana nedenlerinden biri olarak öne çıkıyor.
Verimli Eğitim Süreci ve Rekabetçi Konum
Modelin arkasındaki teknik altyapı da rekabette farklı bir strateji izlendiğini gösteriyor. ML4, tamamen Mistral'in kendi hesaplama kaynakları kullanılarak eğitildi. Bu süreçte yalnızca 4.000 Nvidia GPU kullanıldığı belirtildi. Stock, sayının Çinli rakiplere kıyasla iki ila üç kat daha az olduğunu ve kapalı kaynaklı rakiplere göre çok daha düşük bir seviyede kaldığını vurguladı. Bağımsız performans testleri henüz yayımlanmamış olsa da şirket, ML4'ün Çin dışındaki açık ağırlıklı modeller arasında en üst düzey performansı sergilemesini hedeflediğini duyurdu.
Ne anlama geliyor?
Bu gelişme, büyük ölçekli dil modellerinin geliştirilmesinde 'açık kaynak' ve 'kapalı sistem' arasındaki geleneksel ayrımın yumuşadığını gösteriyor. Geleneksel olarak kapalı modeller, tedarik zincirine bağımlılık ve şeffaflık eksikliği nedeniyle eleştirilirken; açık modeller ise güvenlik açıkları ve denetim zorlukları taşıyordu. Yeni nesil yaklaşım, model ağırlıklarının paylaşılmadan önce kapsamlı güvenlik testlerinden geçirilmesini ve belirli bir süre kontrollü erişimle sunulmasını öngörüyor. Bu mekanizma, kurumsal kullanıcıların güvenlik endişelerini giderirken, ekosistemin denetlenebilir kalmasını sağlıyor. Kullanıcılar açısından bu durum, yerel veya kurumsal sunucularda çalıştırılan modellerin daha güvenli ve izlenebilir hale geleceği anlamına geliyor. Ayrıca, eğitim sürecinde fewer donanım kaynağı kullanılması, yüksek performanslı model üretiminin enerji ve maliyet açısından daha verimli bir yapıya büründüğünü kanıtlıyor. Bu da gelecekte benzer çapta modellerin daha geniş bir kullanıcı kitlesi tarafından erişilebilir olabileceğine işaret ediyor.






Yorumlar (0)
Henüz yorum yok. İlk yorumu siz yazın.