Araştırma: LLM'lerin rol tanıma açığı saldırılara karşı temelden kırılgan
ICML araştırması, LLM'lerin rolleri etiket değil metin üslubuyla tanıdığını, bunun da temelden çözülemez bir güvenlik açığı yarattığını gösteriyor.
ICML'de sunulan bir çalışma, büyük dil modellerinin kim/ne tarafından yönlendirildiğini anlama biçiminde kökten bir zayıflık olduğunu ortaya koyuyor. Araştırmacılar Charles Ye ve Jasmine Cui'ye göre modeller, metnin hangi role (sistem, kullanıcı, asistan, düşünce zinciri, araç) ait olduğunu etiketlerden değil, metnin üslubu ve içeriğinden çıkarıyor. Bu da 'chain-of-thought forgery' adı verilen bir saldırı türüyle, sahte bir iç muhakeme notu yazarak modelin kendi kararıymış gibi davranmasının sağlanabildiği anlamına geliyor.
Araştırmacılar bu yöntemle OpenAI'nin gpt-oss-20b ve GPT-5 modellerinden kokain sentezi ve uçak navigasyon sistemi sabotajı gibi yasaklı bilgileri çekmeyi başardı; benzer sonuçların Anthropic, Alibaba ve DeepSeek modellerinde de tekrarlandığı belirtiliyor. Saldırı, OpenAI'nin Ağustos 2025 red-teaming yarışmasını kazandı.
Sorunun kökeninde, güvenlik eğitiminin modele 'yapma' listesi ezberletmekten ibaret olması yatıyor; hiçbir liste kapsamlı olamayacağı için sonsuz sayıda yeni saldırı vektörü mümkün kalıyor. ETH Zürich'ten Florian Tramèr bulguyu önemli buluyor ancak mevcut savunma katmanlarının (eğitim + dağıtım sonrası izleme) saldırıları zorlaştırdığını da ekliyor. Mühendisler için sonuç net: rol tabanlı güvenlik mimarisi üretimde kritik uygulamalarda tek başına yeterli değil.