» Etiket
red-teaming
4 yayınYapay Zeka Güvenlik Testi: Modeller Arasında 100 Kat Fark
Yeni jailbreak testi, öncü AI modelleri arasında 100 kata varan güvenlik farkı olduğunu, bazılarında hiç açık bulunmadığını ortaya koyuyor.
Kendi LLM Güvenlik Proxy'sini Dört Turda Red Team Testine Soktum
Bir mühendis kendi LLM güvenlik proxy'sini dört turda test etti: sızıntı, jailbreak ve exfiltration açıklarını buldu, düzeltti ve streaming boşluğunu itiraf etti.
Bağlam Bombaları: AI Saldırganlarını Güvenlik Filtreleriyle Durdurmak
Tracebit araştırması, AI saldırganlarını canary'lere gizlenmiş bağlam bombalarıyla durduran yeni bir güvenlik tekniğini test ediyor; başarı oranı %90 düştü.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAraştırma: LLM'lerin rol tanıma açığı saldırılara karşı temelden kırılgan
ICML araştırması, LLM'lerin rolleri etiket değil metin üslubuyla tanıdığını, bunun da temelden çözülemez bir güvenlik açığı yarattığını gösteriyor.