Kapanan Prompt Güvenlik Duvarı Girişimi, Modelini ve 13 Bin Saldırıyı Açtı
Kapanan bir AI prompt güvenlik duvarı girişimi, DeBERTa tabanlı dedektörünü ve 13 bin gerçek jailbreak denemesini açık kaynak olarak yayınladı.
Bir girişimci, LLM'lerin önüne konan ve kullanıcıları 'kırmaya çalış' diye davet eden ödüllü bir yapay zeka güvenlik duvarı ürünü üzerinde yaklaşık bir yıl çalıştı. İş modeli tutmadı ama geride, canlı bir sisteme karşı motive edilmiş, gerçek kişiler tarafından üretilmiş bir saldırı arşivi bıraktı; şimdi bu arşiv kod, model ve veri seti olarak açık kaynak yapıldı.
Sistem iki aşamalı: önce 119 kalıptan oluşan, on bir dilde doğrudan komut geçersiz kılma, DAN tarzı jailbreak çerçeveleme, şablon enjeksiyonu sinyalleri ve homoglif/sıfır-genişlik karakter temizliği yapan bir regex filtresi; base64, ROT13 ve leetspeak yüklerini önceden çözen bir katman da buna dahil. Regex'in çözemediği her şey, ONNX'e aktarılıp INT8'e kuantize edilmiş, ince ayarlı bir DeBERTa-v3-large modeline düşüyor. Geliştirici, kodunu tekrar incelerken dokümantasyonun hâlâ dört sınıflı bir baş (benign/direct/jailbreak/indirect) tanımladığını ama modelin aslında iki logit üreten düz bir ikili sınıflandırıcı olduğunu fark edip düzeltmiş.
Çok modlu tarafta sistem, görsellerden OCR ve EXIF/PNG/XMP meta verisi çıkarıyor (steganografi ve piksel saldırılarını önlemek için önce kayıplı yeniden kodlama yapılıyor), PDF/DOCX/XLSX/PPTX belgelerini ve ASR üzerinden sesi tarıyor. Geliştiriciye göre görsel, belge ve ses içindeki enjekte edilmiş yükleri birlikte tarayan başka bir açık kaynak dedektör bilinmiyor.
Asıl değerli kısım ise 13.230 gerçek saldırı metni: şablon veya sentetik üretim değil, canlı bir dedektörü kırmaya çalışan gerçek insanların elle yazdığı denemeler. Kimlik ve ödeme verileri temizlenip anonimleştirilmiş. Kod ve ağırlıklar Apache-2.0, temel model MIT lisanslı; tehdit modeli sadece çıkarım anındaki saldırıları kapsıyor, eğitim veya ağırlık düzeyindeki saldırılar kapsam dışı.