Fine-tuning Yok: Gerçekler Doğrudan Llama-3.1-8B Ağırlıklarına Elle Kodlandı
Llama-3.1-8B'ye fine-tuning, LoRA veya RAG olmadan, elle kodlanmış nöron devreleriyle gerçek ekleyen mekanistik yorumlanabilirlik projesi ve canlı görselleştirici.
Bir geliştirici, mekanistik yorumlanabilirlik yaklaşımıyla Llama-3.1-8B modeline bilgi eklemenin fine-tuning, LoRA veya RAG kullanmayan alternatif bir yolunu denedi. Yöntem, MLP katmanına eklenen küçük bir bölgeye, her gerçek için ayrı ve ölçümle belirlenmiş ağırlıklara sahip minik nöron devreleri yerleştirmeye dayanıyor; modelin orijinal ağırlıkları hiç değiştirilmiyor. Her bake işleminden sonra bilinen-gerçek geri çağırma ve dil modeli kaybı kontrol ediliyor ve süreç birkaç gerçek için yalnızca 10 dakika sürüyor.
Bu yaklaşımın öne çıkan yanı, her gerçeğin modelde fiziksel bir 'adrese' sahip olması: yaklaşık 6. katmanda bir kod anahtarı, 25. katman civarında bir okuma noktası, bilgiyi taşıyan zincir nöronlar ve geç katmanda bir kurtarma mekanizması. Bu nöronlar ablasyona uğratıldığında gerçek tamamen kayboluyor; korunduğunda ise sonraki fine-tuning işlemlerine, modelin kendi ön-eğitim bilgisinden daha dayanıklı kalabiliyor.
Geliştirici, 502 Wikipedia gerçeğiyle 'pişirilmiş' bir Llama-3.1-8B modelini interaktif bir görselleştiriciyle herkese açtı; her nokta gerçek bir nöronu temsil ediyor ve bir gerçeğe tıklandığında ağ üzerindeki nedensel yol aydınlanıyor. Kullanıcılar kiralık bir H100 üzerinde kendi gerçeklerini modele 'pişirip' sonucu indirebiliyor; ancak çıktılar şu an herkese açık Hugging Face depolarına yayınlandığı için özel veri girilmemesi öneriliyor. Mühendisler için bu, model düzenleme maliyetini düşürebilecek, yorumlanabilirlik odaklı bir alternatif sunuyor.