« Tüm yayınlar

memlineage v0.1.0: LLM ajanlarında bellek zehirlenmesine iki katmanlı savunma

memlineage v0.1.0: LLM ajanlarında bellek zehirlenmesine karşı Ed25519 imzalı köken doğrulama ve davranışsal tespit sunan açık kaynak Python kütüphanesi.

Kalıcı belleğe sahip LLM ajanları (RAG / agentic memory), yalnızca normal etkileşim kanallarını kullanan bir saldırganın modele veya koda dokunmadan ajanın gelecekteki davranışını manipüle edecek "zehirli" bellek kayıtları enjekte etmesine olanak tanıyan yeni bir saldırı yüzeyi yaratıyor. Güncel akademik çalışmalar (SMSR, TMA-NM, Forensic Trajectory Signatures, MemLineage) bunu tekrar üretilebilir şekilde gösteriyor: içerik tabanlı filtreler akıcı metinle atlatılabiliyor, kaynak güven puanları ise "laundering" yoluyla manipüle edilebiliyor.

memlineage, Python ile yazılmış açık kaynaklı bir kütüphane olarak iki katmanlı bir savunma sunuyor. Katman A yazma anında kriptografik köken doğrulaması yapar: her bellek Ed25519 ile imzalanır, güven seviyesi imzalayan anahtardan türetilir, bir türetme grafiği "max-of-strong-edges" yayılımıyla güvenilmeyen bir atadan türeyen belleğin asla güvenilir hale gelmemesini garanti eder ve SensitiveActionGate geri alınamaz eylemleri kriptografik olarak engeller. Katman B ise çalışma zamanında tool-call yapısından (içerikten değil) davranışsal anormallik tespiti yapar; MVP aşamasında yalnızca uyarı verir, otomatik olarak engellemez.

Bağımsız bir denetçi, sıfırdan klonlanan depoda kendi düşmanca testlerini yazarak sonuçları doğruladı: gerçek dış saldırılarda Katman A için ASR 0.000, Katman B için kamuflajsız AUC 0.988, saldırgan kamuflajı altında AUC 0.978 ve Recall 0.950 ölçüldü. CI'da 30/30 test, %95 kapsama, bandit ve SonarCloud'da sıfır bulgu raporlandı.

Sonuç olarak, ajan belleği güvenliğinde tek başına içerik filtresi veya güven puanı yeterli değil; kriptografik köken doğrulaması ile davranışsal tespitin birleşimi, ajan mimarileri için somut ve denetlenebilir bir referans noktası sunuyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz