Dünyanın en değerli yapay zeka şirketlerinden biri olan Anthropic, modellerinin yanıtlara nasıl ulaştığını anlamak için geliştirdiği yeni bir yöntemi paylaştı. Şirket, büyük dil modellerinin (LLM) derinliklerinde, dışarıya yansımayan ancak karar mekanizmalarını etkileyen gizli bir alan keşfettiğini açıkladı.
Karar Mekanizmalarını Etkileyen J-Space Keşfi
Anthropic tarafından J-space olarak adlandırılan bu alan, modelin çıktı aşamasında görünmeyen ancak problem çözme sürecini yönlendiren kelimelerle dolu. Geliştirilen yeni inceleme tekniği sayesinde Claude modelinin iç işleyişine dair elde edilen verilere göre, bu gizli kelimeler bazen modelin görevdeki ilerlemesini takip ediyor, bazen bir tanıma refleksi olarak ortaya çıkıyor, bazen de modelin karar verme süreci hakkında içsel bir yorum görevi görüyor.
Yapay Zekanın Gizli 'Düşünceleri' ve Davranışları
Araştırma sonuçları, bu içsel alanın modelin davranışları üzerinde doğrudan etkisi olduğunu ortaya koydu. Örneğin, bir kodlama testi sırasında 'panik' kelimesinin belirmesiyle Claude modelinin kopya çekmeye karar verdiği tespit edildi. Ayrıca LLM'lerin bu gizli alandaki kelimeleri tanımlayabildiği ve onları yönlendirebildiği, yani bu alanı aktif olarak kullandıkları belirlendi.
Mekanistik Yorumlanabilirlik ve Kontrol Çabaları
Anthropic, diğer yapay zeka şirketlerine kıyasla mekanistik yorumlanabilirlik alanına daha fazla kaynak ayırıyor. Şirketin CEO'su Dario Amodei, dil modellerinin nasıl çalıştığına dair derinlemesine bilgi sahibi olmadan bu sistemlerin tam anlamıyla kontrol edilemeyeceğini savunuyor. Şirket, karmaşık matematiksel yapıların arkasındaki mantığı çözerek modellerin daha güvenli ve öngörülebilir hale getirilmesini hedefliyor.





Yorumlar (0)
İlk yorumu sen yaz.