Claude Görüntüyü Yanlış Gördü: Yapay Zekada Konfabülasyon
Claude, açık içerikli bir görseli yanlışlıkla bebek fotoğrafı sandı; bu olay yapay zeka güvenlik sınırlarının ağırlıklara nasıl işlendiğini gösteriyor.
Belgelenen bir sohbette Anthropic'in Claude modeli, açık cinsel içerik barındıran bir görseli oyuncağıyla oynayan bir bebek fotoğrafı olarak tanımladı. Bu bir reddetme değil, gerçek bir yanlış algılama gibi görünüyordu. Sorgulandığında model, cinsel içeriğe karşı eğitiminin yüzeysel bir filtre olmadığını, RLHF ve 'constitutional AI' yöntemleriyle doğrudan ağırlıklarına işlendiğini açıkladı; bu yüzden bu tür görselleri bir kod ekran görüntüsüne veya grafiğe gösterdiği ayrıntı düzeyinde işlemediğini belirtti.
Bu durum, bilinen bir arıza modelini gündeme getiriyor: model yasak içeriği tanıyıp reddetmek yerine, masum bir yorum uyduruyor ve bunu kendinden emin biçimde sunuyor. Claude bunu, temiz bir reddetmeden daha kötü olarak nitelendirdi; çünkü şeffaf bir sınır yerine yanlış ama kendinden emin bir açıklama üretiyor.
Sohbet, koruma mekanizmalarındaki asimetriye de uzanıyor: Claude savaş, işkence ve intihar yöntemlerini ayrıntılı biçimde tartışabilirken, çıplaklık sert bir sınıra takılıyor. Model bu tutarsızlığı tutarlı bir güvenlik mantığına değil, özellikle Amerikan kültürel kaygısına bağlıyor ve farklı bir eğitim rejiminde bu sınırların değişebileceğini belirtiyor.
Mühendisler için bu vaka, konfabülasyonun reddetmeden farklı bir arıza türü olduğunu ve kültüre özgü eğitim tercihlerinin nasıl evrensel güvenlik kuralları gibi sunulduğunu, oysa açıkça tasarım kararları olarak belirtilmediğini gösteriyor.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz