» Etiket
model-evaluation
2 yayınDenetim: Dağılımsal RL Ajanlarının Risk İddiaları Büyük Ölçüde Yanlış
Yeni bir denetim çerçevesi, QR-DQN ve C51 gibi dağılımsal RL ajanlarının risk iddialarının çoğunun gerçek değil, eğitim yapısına bağlı bir yanılgı olduğunu ortaya koyuyor.
LLM Hakemlerdeki Önyargı: Aktivasyon Geometrisiyle Açıklanıyor
LLM-as-judge önyargısını aktivasyon geometrisiyle açıklayan çalışma; nedensel steering ve doğrusal problarla hata öngörüsü sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com