» Etiket
evaluation
42 yayınTutorMoments: Yapay Zeka Öğretmenler Ne Zaman Yardım Etmeli?
Allen AI'nin TutorMoments benchmark'ı, LLM öğretmenlerin ne zaman destek olup ne zaman öğrenciyi zorlaması gerektiğini bilip bilmediğini test ediyor.
NicheIQ mühendisliği: Yapay zekaya gerçeği söyletmek
NicheIQ'nun kendi kendini değerlendiren yapay zekayı dürüstleştirme sürecine dair mühendislik notları: yanlılık, başarısız döngüler ve bir 'Yapma' kararı.
Yeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comWANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
Few-shot örnekleri eval setinden geldi: 0.94 skoru bir kurguydu
Few-shot seçici ve eval seti aynı JSONL dosyasını paylaşınca 0.94 skoru sahteydi. Prompt-zamanı veri kirlenmesi ve kontrol yöntemi.
Küçük eval setleri regresyonu yakalayamaz: istatistiksel güç sorunu
40-50 örneklik eval setleri regresyonların çoğunu kaçırır. İstatistiksel güç, Wilson aralığı ve ikili kriterlerle doğru ölçüm nasıl yapılır?
Yeni Bir Tahta Oyunu İçin MLP Değerlendirici Nasıl Oluşturdum
Larss oyunu için geliştirilen MLP değerlendirme motoru ve sonuçları hakkında bilgi edinin.
LLM Yargıcı: Puanları Toplamadan İkili Kontrollerle Değerlendirme
LLM değerlendirmelerinde ikili kontroller ve tek yargı kullanmanın avantajları. Mühendisler için güvenilir bir kalite değerlendirme yöntemi.
RAG Değerlendirmesi: Güvenilirlik, Bağlam Hatırlama ve Cevap Alaka Düzeyi
RAGAs değerlendirmesi, AI sistemlerinin güvenilirliğini artırmak için üç ana metriği kullanır: güvenilirlik, bağlam hatırlama ve cevap alaka düzeyi.
Waymo'da AI Projeleri: Değerlendirmeler Olmadan Hazır Değil
Waymo, AI projelerinin değerlendirmelerini sürekli yaparak güvenliği artırıyor. Bu yöntem, diğer endüstrilere de örnek teşkil ediyor.