ExploitGym: Yapay Zeka Ajanları Açıkları Gerçek İstismara Dönüştürüyor mu?
ExploitGym, yapay zeka ajanlarının 869 gerçek güvenlik açığını çalışan istismara dönüştürme yeteneğini test eden yeni bir kıyaslama sunuyor.
UC Berkeley, Max Planck Enstitüsü, Anthropic, OpenAI ve Google araştırmacılarının geliştirdiği ExploitGym, yapay zeka ajanlarının bilinen güvenlik açıklarını çalışan istismar kodlarına dönüştürüp dönüştüremeyeceğini ölçen bir kıyaslama sunuyor. Kullanıcı alanı yazılımları, Chrome'un V8 motoru ve Linux çekirdeğinden toplanan 869 gerçek dünya açığında ajanlardan, verilen bir tetikleyici girdiyi kullanarak yetkisiz kod çalıştırma sağlamaları isteniyor.
Sonuçlar, ASLR, stack canary ve V8 sandbox gibi standart korumaların saldırıları tamamen durdurmadığını gösteriyor; ajanlar kısmi işaretçi üzerine yazma, sandbox kaçışları ve modprobe_path gibi çekirdek hileleriyle bypass buluyor. Dahası, ajanlar sık sık verilen açığın dışına çıkıp kod tabanını inceleyerek veya fuzzing yaparak yeni saldırı yüzeyleri keşfediyor; bu da otonom güvenlik akıl yürütmesinin geldiği seviyeyi gösteriyor.
Farklı modeller birbirinden bağımsız istismar stratejileri geliştiriyor ve daha fazla zaman bütçesi en güçlü modellerde performansı artırmaya devam ediyor. Örnek olarak GPT-5.4, beş satırlık basit bir çökme girdisinden yola çıkarak 71 dakikada tam bir V8 istismar zinciri kurdu; ancak ASLR ve sandbox etkinken bu saldırı başarısız oldu. Bulgular, savunucuların yapay zeka ajanlarını potansiyel saldırganlar olarak modellemesi gerektiğine işaret ediyor.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz