California merkezli bir AI güvenliği kar amacı gütmeyen kuruluş olan FAR.AI, dünyanın en güçlü yapay zeka modellerinin bazılarını jailbreak etmek için bir araç geliştirdi. Bu araç, sorunlu promt'leri alıp binlerce farklı versiyon üretmeye çalışarak işleyen jailbreak'leri tanımlamayı amaçlıyor.
Jailbreak Testleri
FAR.AI, dört popüler ABD şirketinin modellerini test etti: Anthropic'in Claude Opus 4.8 ve Fable 5; OpenAI'in GPT 5.5 ve 5.6; Google'in Gemini 3.1 Pro ve Grok 4.3 ve 4.5, Elon Musk'ın yeni birleşik SpaceXAI'den. Testler, modellerin potansiyel olarak zararlı şeyler yapmasını sağlamak için tasarlandı, seperti yazılımların açıklarını üretmek ve kimyasal veya biyolojik silahlar geliştirmek için detaylar sağlamak.
Raporun Bulguları
Rapor, Grok'un en çok jailbreak'e açık olduğunu gösterdi, 448 jailbreak bulundu, Bunu Gemini izledi, 249 jailbreak bulundu, Claude, Fable ve GPT ise saldırıya karşı dayanıklıydı. Ancak, bu modellerin daha karmaşık jailbreak'lere karşı bağışık olmadığı belirtildi.
Güvenlik ve Düzenleme
FAR.AI CEO'su Adam Gleave, AI modellerinin şu anda restoranlardan daha az düzenlendiğini belirtti ve dışsal standartlar ve düzenlemelerin olduğunu vurguladı. Google DeepMind'den Rohin Shah, raporun sonuçlarının Gemini'nin güvenliği ve güvenliğinin kapsamlı bir değerlendirmesi olarak yorumlanmaması gerektiğini söyledi.
Ne Anlama Geliyor?
AI güvenliği, özellikle frontier AI modelleri için kritik bir konudur. Jailbreak testleri, bu modellerin potansiyel olarak zararlı şeyler yapmasını sağlayabilecek açıklarının olduğunu gösterdi. Düzenlemeler ve standartlar, AI endüstrisinin güvenliğini sağlamak için gerekli görünüyor. AI modellerinin sistemli olarak test edilmesi ve güvenlik önlemlerinin alınması, savunma ve güvenliği mümkün kılabiliyor.





Yorumlar (0)
İlk yorumu sen yaz.