« Tüm yayınlar

Araştırma: HuggingFace İnce Ayarlı LLM'ler Genelde Daha Kötü Performans Gösteriyor

HuggingFace ince ayarlı LLM'lerin benchmark skorlarını kontaminasyon kontrollü denetleyen çalışma, ortalamada modellerin daha kötü performans gösterdiğini buldu.

Kontaminasyon kontrollü bir denetim, HuggingFace üzerinde yayınlanan topluluk ince ayarlarının (fine-tune) temel modellere göre gerçekten daha iyi mi olduğunu, yoksa sadece benchmark sorularını ezberleyip 'benchmaxxing' mi yaptığını test etti. Çalışma, 164 farklı modelden 150 eşleşmiş çift (temel model + ince ayarı) üzerinde, matematik (GSM8K), genel bilgi (MMLU) ve talimat takibi (IFEval) görevlerinde, her soruyu iki halde çalıştırdı: standart benchmark sorusu ve hiç yayınlanmamış taze bir eşdeğeri. İki hal arasındaki fark, ezberleme sinyalini ortaya koyuyor.

Sonuçlar rahatsız edici: hiç görülmemiş taze sorularda ince ayarlı modellerin doğruluğu üç görev ailesinde de anlamlı şekilde düştü (GSM8K -6,9 puan, MMLU -6,0 puan, IFEval -6,5 puan). Yani ortalamada topluluk ince ayarları temel beceriyi geliştirmiyor, tam tersine kötüleştiriyor. Kontaminasyon açığının ince ayarla büyüyüp büyümediği sorusu ise MMLU ve IFEval için ön kayıtlı geçerlilik testini geçemedi ve bulgu olarak raporlanmadı; sadece GSM8K testi geçti ama istatistiksel olarak anlamlı çıkmadı.

Çalışma, LLM-hakem kullanmayan deterministik puanlama, eşleştirilmiş bootstrap, McNemar testi, Benjamini-Hochberg düzeltmesi ve etiket-karıştırma kontrolü gibi katı istatistiksel önlemlerle ön kayıtlı bir analiz planına dayanıyor. 128.857 yanıt toplandı, 429 kullanılabilir çift elde edildi ve süreçte on farklı mühendislik hatası tespit edilip düzeltildi. Kod ve analiz planı açık kaynak olarak paylaşıldı; mühendisler için ince ayarlı model seçerken benchmark skorlarına güvenmeden önce dikkatli olmaları gerektiğini gösteriyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz