Nvidia araştırmacıları, agentic AI sistemlerinde küçük bir modelden büyük bir modele veya tersine görev aktarıldığında ortaya çıkan yüksek maliyetli AI model handoff'larını basit lineer matematik kullanarak değiştirebilecek bir teknik geliştirdiler. Bu teknik, gerçek dünya uygulamalarında büyük bağlamların birçok turda biriktiği durumlarda cross-model KV cache transferi için kullanılır.
Cross-Model KV Cache Transfer Teknikinin Avantajları
Uygun model çiftlerinde, bu lineer eşleme işlemi, hedef modelin tek başına doğruluğunun %98'ine kadar koruyarak, tüm konuşmayı yeniden hesaplamaktan 2,7 ila 25 kat daha hızlı çalışır. Bu teknik, gerçek dünya AI uygulamalarında uzun süren, çoklu LLM iş akışlarında hesaplama maliyetlerini ve gecikmeyi azaltabilir.
LLM'lerin Hafıza İşlemesi ve Performans Duvarı
LLM'lerin hafıza işleme süreci, multi-model iş akışlarının üretim aşamasında performans duvarına çarpmasının nedenini açıklar. Bir LLM bir t aldığında, ilk olarak prefilled KV cache'yi hesaplamak için bir ön geçiş yapar. Ardından, bir dizi tokeni birer birerte etmek için bu KV cache'den okumaya başlar. Uzun süren konuşmalar veya uzun vadeli agentic oturumlar sırasında bağlam dần dần uzar ve prefilled aşamasının hesaplama maliyeti model boyutu ve girdi uzunluğu ile doğrudan orantılı olarak artar. Bu, KV cache'nin geçersiz olduğu durumlarda, özellikle de AI sistemi oturum sırasında model değiştirdiğinde, önemli gecikmelere neden olur.
Ne Anlama Geliyor?
Bu teknik, AI sistemlerinin farklı boyutlardaki modeller arasında geçiş yapmasını kolaylaştırarak, uzun vadeli iş akışlarında hesaplama maliyetlerini ve gecikmeyi azaltabilir. Ayrıca, küçük modellerin büyük modellere aktarılmasını sağlayarak, çıktı kalitesini artırabilir. Büyük modellerin küçük modellere aktarılmasıyla da hesaplama maliyetleri azaltılabilir. Bu, özellikle uzun süren konuşmalar veya komplex sistemlerin işlenmesi gibi durumlar için faydalı olabilir.





Yorumlar (0)
İlk yorumu sen yaz.