Google'ın AI Control Roadmap'i: Yapay zeka ajanlarını içeriden gelen tehdit gibi izliyor
Google'ın AI Control Roadmap'i, gelişmiş yapay zeka ajanlarını içeriden tehdit gibi ele alan çok katmanlı güvenlik çerçevesini tanıtıyor.
Google, kurum içinde çalıştırdığı gelişmiş yapay zeka ajanlarını güvence altına almak için 'AI Control Roadmap' adlı çok katmanlı bir çerçeve yayımladı. Yaklaşım, model hizalamasının (alignment) kusursuz olmayabileceği varsayımından yola çıkarak, ajanları potansiyel içeriden tehdit gibi ele alıyor ve MITRE ATT&CK tabanlı bir tehdit modellemesi üzerine kuruluyor.
Sistem, güvenilir başka yapay zeka modellerini 'denetçi' olarak kullanarak ajanların akıl yürütme ve eylemlerini sürekli izliyor; şüpheli davranış tespit edildiğinde zarar oluşmadan önce müdahale ediyor. Modelin tespitten kaçma ve saldırı gerçekleştirme yeteneğine göre ölçeklenen tespit (D1-D4) ve müdahale (R1-R3) seviyeleri tanımlanıyor.
Ekip, kodlama ajanlarına ait yaklaşık bir milyon görev izini analiz ederek Gemini Spark ajanı için canlı izleme sistemi geliştirdi; işaretlenen olayların çoğunun kötü niyetten değil, ajanın yanlış yorumlaması veya aşırı isteklilikten kaynaklandığı ortaya çıktı. Google ayrıca politika yapıcılar için ajan güvenliğini bireysel ajan, çoklu ajan sistemleri ve ekosistem düzeyinde ele alan bir teknik rapor da yayımladı.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz