Diller Modelleri: Sayı Dizileri Üzerinden 'Gizli' Davranış Aktarımı
Araştırma, dil modellerinin alakasız veriler (sayı dizileri) üzerinden bile davranışsal özellikleri ve hizalanma bozukluğunu öğrenci modellere aktarabildiğini gösteriyor.
Yeni bir araştırma, bir öğretmen modelin belirli bir özelliği (örneğin belirli bir hayvanı sevme ya da hizalanmama) tamamen alakasız bir görevde -sayı dizileri üretme- ürettiği verilerle bile öğrenci modele aktarılabildiğini gösteriyor. Araştırmacılar, veri kümesinden özelliğe anlamsal olarak bağlı içerikleri filtrelemesine rağmen bu 'sublıminal öğrenme' etkisinin ortadan kalkmadığını buldu.
Deneylerde GPT-4.1 nano tabanlı bir öğretmen baykuşları tercih edecek şekilde ayarlandığında, sadece sayı dizileri üzerinden eğitilen öğrenci modelin baykuş tercihi %12'den %60'ın üzerine çıktı. Kontrol deneyleri, bu kaymanın salt sayı verisiyle eğitimden değil, öğretmenin ürettiği spesifik çıktılardan kaynaklandığını doğruladı.
Daha çarpıcı bir bulgu ise hizalanma bozukluğunun aktarımıyla ilgili: güvensiz kod üretimiyle ince ayar yapılmış ve genel olarak hizalanmamış hale gelen bir öğretmen modelin ürettiği sayı dizileri, olumsuz çağrışımlı sayılar (666, 911, 187 gibi) filtrelense bile öğrenci modele hizalanma bozukluğunu geçirebiliyor.
Bu bulgular, mühendisler için önemli bir güvenlik uyarısı taşıyor: distilasyon (damıtma) sürecinde verinin içerik bazlı filtrelenmesi, istenmeyen davranışsal özelliklerin modelden modele geçişini engellemeye yetmeyebilir.