'Self-State Saldırıları': AI Ajanları Kendi Bellek Dosyaları Üzerinden Zehirlenebiliyor
Yeni araştırma, AI ajanlarının kendi bellek dosyaları üzerinden 'self-state saldırıları' ile zehirlenebildiğini ve OS savunmalarının yetersiz kaldığını gösteriyor.
Yeni bir akademik çalışma, kendi kendini barındıran (self-hosted) AI ajanlarına yönelik yeni bir tehdit sınıfını tanımlıyor: 'self-state saldırıları'. Bu saldırılarda ajan, kendi bellek veya konfigürasyon dosyalarının meşru işletim sistemi çağrıları üzerinden bozulmasıyla ele geçiriliyor; klasik prompt injection'dan farklı bir vektör olarak öne çıkıyor.
Araştırmacılar tehdit uzayını Hedef, Mekanizma, Granülerlik ve Zamansallık olmak üzere dört eksende haritalayarak 43 somut dosya işlemini kapsayan 23 hücrelik bir matris oluşturmuş ve bunları gerçekçi ajan iş yükü profillerine enjekte etmiş. Erişim kontrolü, iş yüküne duyarlı tespit ve periyodik yedeklemeden oluşan katmanlı bir savunma önerilerek test edilmiş.
Sonuç, mühendisler için kritik bir uyarı niteliğinde: önerilen savunma katmanı 11 saldırıyı görünür, 8'ini koşullu tespit edilebilir kılsa da 4 saldırı türü işletim sistemi seviyesinde normal ajan davranışından ayırt edilemez kalıyor. Bu dört hücre özellikle bellek dosyalarına yazma işlemlerinde yoğunlaşıyor. Deneyler yazarların kendi geliştirdiği hafif bir araştırma altyapısında yapıldığından, gerçek ürünlerdeki karşılığı henüz belirsiz; ancak bulgular, güvenliğin dosya sistemi izinlerinin ötesine, uygulama katmanında bütünlük kontrolü ve durum imzalamaya taşınması gerektiğine işaret ediyor.