» Etiket
ai-evaluation
3 yayınLLM'leri Yazılım Gibi Test Etmek: QA için Promptfoo Rehberi
QA mühendisleri için Promptfoo ile LLM test etme: versiyonlanmış evaller, deterministik assertion'lar, model-graded rubric'ler ve sağlayıcı karşılaştırması.
Kendi Kendine Ödüllenen LLM'ler: Doğruluk Değil İkna Kazanıyor
Referanssız LLM hakemleriyle kendi çıktısını değerlendiren modeller doğruluğu değil ikna ediciliği ödüllendiriyor; GSM8K deneyinde hakem onayı artarken gerçek doğruluk sabit kalıyor.
LLM Hakem Testleri Neden Çalıştırmalar Arası Kararsız?
Aynı kod, aynı girdi, farklı LLM hakem skoru: CI gate'lerinde flapping sorununun kaynakları; sıcaklık, model pinleme, k-örnekleme ve kuantalama ile çözüm.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com