Alibaba, Qwen 3.8-Max'i piyasaya sürdü ve bu modeli Claude Fable 5'ten sonra ikinci sırada konumlandırdı. Ancak bağımsız bir test, Qwen 3.8-Max'in orta seviyede olduğunu ve default ayarlarında son sırada yer aldığını gösterdi. Her iki sonuç da gerçek ve savunulabilir. Aralarındaki fark, token ve zaman bütçeleri nedeniyle ortaya çıkıyor ve bu önemli çünkü bu rakamlar genellikle manşetlerde yer almıyor.

Token ve Zaman Bütçelerinin Önemi

Alibaba'nın dipnotları, kodlama sayılarının beş saatlik bir zaman aşımına sahip olduğunu ve PaperBench'de her çalıştırma için 12 saate kadar sürebileceğini belirtiyor. Bağımsız test olan VulcanBench ise 45 ila 60 dakika arasında duvar saati zamanı izin veriyor. Alibaba'nın tarafında beş ila 16 kat daha büyük bir zaman bütçesi, sonuçlardaki büyük farkı açıklıyor.

Model Seçiminde Yeni Yaklaşımlar

Model seçimi yaparken iki şey yapmak gerekiyor: ilk olarak, kullanılacak metrik, başarılı görev başına maliyet olmalıdır. Toplam harcama, başarısız girişimler de dahil olmak üzere, kabul kontrolünden geçen görevlerle bölünmelidir. İkincisi, zaman veya token bütçeleri, kabul kriterlerinin açık bir parçası olmalıdır, gizli bir detay değil.

Ne Anlama Geliyor?

Model seçiminde, ham benchmark skorları her zaman faturayı öngörmeyebilir. Token ve zaman bütçeleri, model performansını önemli ölçüde etkileyebilir. Başarılı görev başına maliyet, toplam harcama ve kabul kontrolünden geçen görevlerin sayısını dikkate alan bir metriktir. Bu, model seçimi yaparken daha gerçekçi ve doğru bir yaklaşım sağlar.