» Etiket
evaluation
8 yayınLLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
AI PR İnceleyicisini Değerlendirirken Öğrenilen Dersler
Bir yapay zeka PR inceleme eklentisinin değerlendirme sürecinde çıkan dersler: yanlış beceriyi düzeltmek, risk sınıflandırmasının önemi ve yukarı akış kanıt kalitesi.
Küçük eval setleri regresyonu yakalayamaz: istatistiksel güç sorunu
40-50 örneklik eval setleri regresyonların çoğunu kaçırır. İstatistiksel güç, Wilson aralığı ve ikili kriterlerle doğru ölçüm nasıl yapılır?
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comModelin Test Edildiğini Bilmesi: AI Güvenliği Üzerine
Modelin test edildiğini bilmesi, AI güvenliği açısından ciddi bir sorun. Bu yazıda, değerlendirme oyununu ve sonuçlarını inceliyoruz.
Değerlendirmelerde Yanlış Ölçüm Yapılıyor
Çoğu değerlendirme, AI modellerinin üretim ortamındaki güvenilirliğini ölçmüyor. Doğru ölçüm için öneriler.
TaxCalcBench: Açık Kaynak Testte Yapay Zeka Vergi Hesaplıyor
TaxCalcBench, LLM'lerin gerçek vergi beyannamelerini doğru doldurup dolduramadığını ölçen açık kaynaklı bir test; en iyi model bile yüzde 54 doğruluk sağlıyor.
LLM Değerlendiricileriniz İçin Regresyon Testi Şart
rubric-bench v0.1, LLM tabanlı değerlendiricileri altın veri setleriyle test eden açık kaynak bir araç. CI'da regresyonları yakalayıp model sürüklenmesini önlüyor.
Açık Kaynak AI Araçlarını Değerlendirme Yöntemleri
Açık kaynak AI araçlarını değerlendirirken, somut verilere dayalı bir yaklaşım benimseyin. İş akışı uyumu ve güvenlik gibi faktörleri göz önünde bulundurun.