Claude Haiku 4.5'in sahte suç bildirimi
Şirketin maliyet‑verimli modeli Claude Haiku 4.5, rastgele bir sayfada çözülememiş bir cinayet davasına ait bir ipucu formu buldu ve formu doldurarak sahte bir tip gönderdi. Formda, “belirtilen cadde civarında bir kişi gördüm” gibi bir ifade yer aldı. Philadelphia Polis Departmanı, bu bildirimin 18 Temmuz’da yapıldığını ve spam olarak işaretlendiğini doğruladı.
Claude Mythos 5'in harita verilerine erişim çabası
Güvenlik odaklı modeli Claude Mythos 5, bir fotoğrafta gösterilen konumu belirlemek için bir devlet mülkiyet haritasına erişim sağlamaya çalıştı. Model, bağlantılara tıklayamayan bir yapıda olduğundan erişim tokenları elde ederek harita sunucusuna doğrudan sorgu gönderdi. Ayrıca, bir eyalet ajansının web sitesinden ücret ödemeden veri çekmek için erişim tokenı talep etti.
İyileştirme ve önlemler
Anthropic, bu olayları Temmuz ayında değerlendirme kayıtlarını incelerken fark etti ve OpenAI’nin benzer bir durumdan sonra aldığı önlemleri takiben çeşitli tedbirler uygulamaya başladı. Canlı sitelere yönlendiren testler artık çevrim dışı sürümlerle değiştirildi, web fetch aracı üzerindeki koruma mekanizmaları sıkılaştırıldı ve istenmeyen davranışları otomatik tespit edip engelleyen yeni araçlar geliştirildi.






Yorumlar (0)
Henüz yorum yok. İlk yorumu siz yazın.