» Etiket
llm-evaluation
3 yayınSWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
Altı LLM değerlendirme aracını CI'a bağladık, sadece ikisi ayakta kaldı
Sekiz aylık gerçek CI testinde altı LLM eval aracından sadece Promptfoo ve DeepEval merge queue gate'i olarak güvenilir çıktı; nedeni determinizm.
Değerlendirme Borcu: Ajan Testleri Neden Üretimde Çöküyor
Ajan değerlendirme araçlarının üretimde neden yetersiz kaldığını, çok-ajanlı sistemlerde büyüyen eval sorununu ve oturum tabanlı çözümü inceliyoruz.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com