» Etiket
evaluation
37 yayınYeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.
WANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
Few-shot örnekleri eval setinden geldi: 0.94 skoru bir kurguydu
Few-shot seçici ve eval seti aynı JSONL dosyasını paylaşınca 0.94 skoru sahteydi. Prompt-zamanı veri kirlenmesi ve kontrol yöntemi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comKüçük eval setleri regresyonu yakalayamaz: istatistiksel güç sorunu
40-50 örneklik eval setleri regresyonların çoğunu kaçırır. İstatistiksel güç, Wilson aralığı ve ikili kriterlerle doğru ölçüm nasıl yapılır?
Yeni Bir Tahta Oyunu İçin MLP Değerlendirici Nasıl Oluşturdum
Larss oyunu için geliştirilen MLP değerlendirme motoru ve sonuçları hakkında bilgi edinin.
LLM Yargıcı: Puanları Toplamadan İkili Kontrollerle Değerlendirme
LLM değerlendirmelerinde ikili kontroller ve tek yargı kullanmanın avantajları. Mühendisler için güvenilir bir kalite değerlendirme yöntemi.
RAG Değerlendirmesi: Güvenilirlik, Bağlam Hatırlama ve Cevap Alaka Düzeyi
RAGAs değerlendirmesi, AI sistemlerinin güvenilirliğini artırmak için üç ana metriği kullanır: güvenilirlik, bağlam hatırlama ve cevap alaka düzeyi.
Waymo'da AI Projeleri: Değerlendirmeler Olmadan Hazır Değil
Waymo, AI projelerinin değerlendirmelerini sürekli yaparak güvenliği artırıyor. Bu yöntem, diğer endüstrilere de örnek teşkil ediyor.
LLM-yargıç Rehberi: Yapay Zeka ile Değerlendirme Süreci
LLM-yargıç, yapay zeka ile değerlendirme süreçlerini hızlandıran bir yöntemdir. Detaylı rehberimizi keşfedin.
Kendi LLM değerlendirme çerçevemi sıfırdan inşa ettim
Kendi LLM değerlendirme çerçevemin hikayesini ve mühendisler için önemli dersleri paylaşıyorum.