» Etiket
llm-as-judge
4 yayınLLM Değerlendiricilerde Kırılamayan %75 Yanlış Negatif Duvarı
LLM tabanlı reviewer'ların çözülemeyen %75 yanlış negatif sorununu ve neden oylama, prompt kalibrasyonu gibi standart çözümlerin işe yaramadığını inceliyoruz.
Değerlendirme Borcu: Ajan Testleri Neden Üretimde Çöküyor
Ajan değerlendirme araçlarının üretimde neden yetersiz kaldığını, çok-ajanlı sistemlerde büyüyen eval sorununu ve oturum tabanlı çözümü inceliyoruz.
LLM Hakemlerdeki Önyargı: Aktivasyon Geometrisiyle Açıklanıyor
LLM-as-judge önyargısını aktivasyon geometrisiyle açıklayan çalışma; nedensel steering ve doğrusal problarla hata öngörüsü sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLLM-as-judge testleri neden çalıştırma başına farklı sonuç verir
CI'da faithfulness eşiğini kontrol eden LLM hakem, aynı kodda bir gün 0.79 bir gün 0.82 verebilir. Sıcaklık, model sürümü ve belirsiz rubric jitter'ın kaynağı; k-örnekleme ve gürültü bandı çözüm.