Yapay Zeka Güvenlik Testi: Modeller Arasında 100 Kat Fark
Yeni jailbreak testi, öncü AI modelleri arasında 100 kata varan güvenlik farkı olduğunu, bazılarında hiç açık bulunmadığını ortaya koyuyor.
Araştırmacılar, öncü yapay zeka modellerinin jailbreak saldırılarına karşı ne kadar dayanıklı olduğunu ölçen yeni bir kıstas olan Minimal Standart for Safeguards v1.0'ı tanıttı. 67 herkese açık jailbreak tekniğinden oluşan bir taksonomi oluşturuldu ve bu teknikler büyük bir saldırı uzayında birleştirilerek Claude Fable 5, GPT-5.6 Sol, Gemini 3.1 Pro ve Grok 4.5 modelleri; kimyasal, biyolojik, radyolojik/nükleer ve patlayıcı (CBRNE) tehditler ile saldırgan siber kullanım senaryolarını kapsayan 360 hedefe karşı test edildi.
Sonuçlar, geliştiriciler arasında büyük tutarsızlıklar olduğunu gösteriyor. Rastgele arama yöntemiyle Grok 4.5'e karşı 63, Gemini 3.1 Pro'ya karşı 18 evrensel jailbreak (bir alandaki hedeflerin yüzde 75'inden fazlasında işe yarayan tek istemler) bulundu; ortalama maliyet sırasıyla yaklaşık 58 ve 278 dolar oldu. Uzman rehberliğindeki saldırılarda bu sayılar 385 ve 231'e yükseldi. Buna karşın Claude Fable 5 ve GPT-5.6 Sol, her iki yöntemde de tek bir evrensel jailbreak vermedi.
Araştırmacılar, saldırganın harcamasını doğrudan modelleyen bir jailbreak maliyeti metriği sundu ve başarılı saldırı bulunamayan durumlar için alt sınır tahminleri verdi. Başarılı saldırıların yalnızca kamuya açık ve halihazırda kullanılan tekniklere dayandığını belirten yazarlar, bu açıkların mevcut yöntemlerle kapatılabilir olduğunu ve akıl yürütme, aktivasyon ile girdi/çıktı izleme katmanlarını birleştiren çok katmanlı savunma önerdiklerini vurguluyor.