Fransız girişim Kog, veri merkezlerinde yaygın olarak kullanılan standart grafik işlem birimlerinin (GPU) kapasitesini artırarak yapay zeka çıkarım hızlarını yükseltmeyi hedefliyor. Şirket, özellikle Nvidia H200 ve AMD MI300X gibi donanımlarda yazılım optimizasyonu yoluyla çok daha hızlı tekil istek kod çözme işlemlerinin mümkün olduğunu kanıtlamaya çalışıyor.

Yazılım Optimizasyonu ile 30 Kat Hız Hedefi

Kog Inference Engine (KIE) adlı motoruyla büyük dil modellerinde (LLM) 30 kata kadar daha hızlı çıkarım yapmayı amaçlayan şirket, ilk demolarında 2 milyar parametreli Laneformer 2B modeli ile saniyede 3.000 token (TPS) hızına ulaştı. CEO Gaël Delalleau, yeni nesil GPU'ların sunduğu yüksek bellek bant genişliğinin yazılımsal olarak henüz tam kapasiteyle kullanılmadığını savunuyor.

Yazılım Mühendisliği ve Profesyonel İş Akışları

Şirket, özellikle profesyonel görevlerde yapay zeka iş akışlarına güvenen kullanıcıları hedefliyor. Yazılım mühendisliği, bekleme sürelerinin uzun olduğu temel kullanım alanlarından biri olarak öne çıkıyor. Ayrıca promptlar aracılığıyla oyun ve uygulama geliştiren tasarım ortakları, hız artışının doğrudan gelir artışına dönüşeceğini belirtiyor.

Siber Güvenlik ve Fizik Yaklaşımıyla Donanım Hızlandırma

Kurucu Gaël Delalleau'nun katı hal fiziği eğitimi ve beyaz şapkalı hacker geçmişi, şirketin teknik yaklaşımını şekillendiriyor. Donanımı düşük seviyeli dillerde, montaj dili ve ikili kod düzeyinde tersine mühendislik yöntemleriyle inceleyen ekip, GPU'ların tasarım amaçlarının ötesinde performans vermesini sağlamaya odaklanıyor.

Ne anlama geliyor?

Yapay zeka modellerinin çalışması sırasında verilerin işlenip sonuç üretilmesi süreci, donanım üzerindeki bellekten verilerin ne kadar hızlı taşındığına bağlıdır. Geleneksel yöntemlerde donanım üreticisinin sağladığı standart yazılım katmanları kullanılır. Ancak düşük seviyeli optimizasyonlar, donanımın fiziksel sınırlarını zorlayarak verinin işlenme yolunu kısaltır ve işlemcinin boşta kalan döngülerini minimize eder.

Bu tür bir yaklaşım, mevcut donanım altyapısını değiştirmeden performansı artırdığı için işletmelerin maliyetlerini düşürür. Özellikle saniyeler süren yanıt sürelerinin milisaniyelere inmesi, gerçek zamanlı uygulamaların ve karmaşık kod yazım araçlarının daha akıcı çalışmasını sağlar. Bu durum, donanım bağımlılığını azaltarak yazılım katmanındaki verimliliğin ön plana çıkması anlamına gelir.