CVE-Bench: LLM Ajanlarını Gerçek Güvenlik Açıklarını Onarmakta Test Ediyor
CVE-Bench, LLM ajanlarının gerçek Python güvenlik açıklarını Docker sandbox içinde düzeltme becerisini ölçen açık kaynak benchmark aracı.
CVE-Bench, LLM tabanlı yazılım ajanlarının gerçek dünya Python CVE'lerini düzeltme becerisini ölçen açık kaynaklı bir benchmark. Her görev izole bir Docker konteynerinde çalışır; ajan savunmasız commit'e sahip bir depoyu görür, dosya okuma/arama/düzenleme araçlarıyla en fazla 20 tur boyunca kod üzerinde çalışır, ardından bakımcının gizli güvenlik test paketiyle değerlendirilir.
Sistem her CVE için üç farklı prompt seviyesi sunuyor: tam GHSA danışma metni (advisory), sadece davranışsal açıklama (diagnose) ve sadece dosya/fonksiyon konumu (locate). Bu kademelendirme, modelin ne kadar bağlamla gerçek bir açığı bulup düzeltebildiğini ayrıştırmaya olanak tanıyor. Bir çözüm yalnızca tüm güvenlik testleri geçerse ve mevcut regresyon testleri bozulmazsa başarılı sayılıyor.
Benchmark OpenAI, Anthropic ve Poolside model sağlayıcılarını destekliyor; sonuçlar JSON dosyaları ve SVG grafikler olarak üretiliyor. Ayrı bir doğrulama aracı, her görevin güvenlik testlerinin savunmasız kodda başarısız, düzeltilmiş kodda başarılı olduğunu garanti ediyor. Proje MIT lisanslı ve bağımsız araştırma olarak yayımlandı; ajan tabanlı güvenlik düzeltme yeteneklerini karşılaştırmak isteyen mühendisler için hazır bir altyapı sunuyor.