» Etiket
evaluation
20 yayınLLM Değerlendiricilerde Kırılamayan %75 Yanlış Negatif Duvarı
LLM tabanlı reviewer'ların çözülemeyen %75 yanlış negatif sorununu ve neden oylama, prompt kalibrasyonu gibi standart çözümlerin işe yaramadığını inceliyoruz.
AI Ajanı Testinde Hata, Cevapta Değil İzde Görünür
Bir AI ajanı test edilirken sekiz yeşil koşudan sonra gelen kırmızı, hatanın cevapta değil izde gizlendiğini gösterdi.
SDABench: LLM'leri Bilimsel Keşifte Test Eden Yeni Kıstas
SDABench, LLM'leri kod çalıştırma yerine altı bilimsel yetenek üzerinden test eden yeni bir kıstas; sonuçlar ciddi eksiklikleri ortaya koyuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAirbnb LLM Değerlendirmesini Haftalardan Bir Güne Nasıl İndirdi
Airbnb'nin dört katmanlı LLM değerlendirme altyapısı, deterministik önbellekleme ve micro LoRA adaptörleriyle iterasyon süresini haftalardan bir güne indiriyor.
Değerlendirme Odaklı Açık Kaynak Kurs: doerkit ve rubric-bench
doerkit ve rubric-bench: LLM'yi rubrik yargıcı olarak kullanan açık kaynak bir istatistik kursu ve genel amaçlı yargıç test çerçevesi.
NicheIQ mühendisliği: Yapay zekaya gerçeği söyletmek
NicheIQ'nun kendi kendini değerlendiren yapay zekayı dürüstleştirme sürecine dair mühendislik notları: yanlılık, başarısız döngüler ve bir 'Yapma' kararı.
WANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
Few-shot örnekleri eval setinden geldi: 0.94 skoru bir kurguydu
Few-shot seçici ve eval seti aynı JSONL dosyasını paylaşınca 0.94 skoru sahteydi. Prompt-zamanı veri kirlenmesi ve kontrol yöntemi.
Yeni Bir Tahta Oyunu İçin MLP Değerlendirici Nasıl Oluşturdum
Larss oyunu için geliştirilen MLP değerlendirme motoru ve sonuçları hakkında bilgi edinin.
LLM Yargıcı: Puanları Toplamadan İkili Kontrollerle Değerlendirme
LLM değerlendirmelerinde ikili kontroller ve tek yargı kullanmanın avantajları. Mühendisler için güvenilir bir kalite değerlendirme yöntemi.