» Etiket
llm-evaluation
9 yayınSWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
Altı LLM değerlendirme aracını CI'a bağladık, sadece ikisi ayakta kaldı
Sekiz aylık gerçek CI testinde altı LLM eval aracından sadece Promptfoo ve DeepEval merge queue gate'i olarak güvenilir çıktı; nedeni determinizm.
Değerlendirme Borcu: Ajan Testleri Neden Üretimde Çöküyor
Ajan değerlendirme araçlarının üretimde neden yetersiz kaldığını, çok-ajanlı sistemlerde büyüyen eval sorununu ve oturum tabanlı çözümü inceliyoruz.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAraştırma: LLM Ajanlarında Adım Bazlı Kredi Sinyalleri Rastgeleden Farksız
ALFWorld'de yapılan nedensel denetim, LLM ajan eğitiminde kullanılan hakem ve güven tabanlı kredi sinyallerinin rastgeleden farksız olduğunu ortaya koyuyor.
SciCode-Verified: LLM'lerin Bilimsel Kodlama Yeteneği Hafife Alınmış
SciCode benchmark'ındaki 263 kusur düzeltilince LLM'lerin bilimsel kodlama doğruluğu %60'tan %98'e sıçradı; sorun modellerde değil testteydi.
data-eng-bench: Snowflake'in dbt ajan benchmark'ı
Snowflake'in data-eng-bench'i, dbt kodlama ajanlarını DuckDB ve Snowflake üzerinde 103 gerçekçi görevle test eden açık kaynak Harbor benchmark'ı.
Text-to-SQL benchmarklarında cevap anahtarı yerine veritabanı üretmek
UIUC'nin denetimi BIRD ve Spider 2.0'daki anotasyonların yarısından fazlasının hatalı olduğunu gösterdi. Bir geliştirici, cevabı önce tanımlayıp veritabanını sonra üreten ters bir yaklaşım denedi.
OpenAI, kendi önerdiği SWE-Bench Pro'yu geçersiz ilan etti
OpenAI'nin yaptığı denetime göre SWE-Bench Pro görevlerinin yaklaşık %30'u kusurlu çıktı. Şirket, ajan tabanlı kodlama benchmark'ı için verdiği önceki tavsiyeyi geri çekti.
LLM-as-judge testleri neden çalıştırma başına farklı sonuç verir
CI'da faithfulness eşiğini kontrol eden LLM hakem, aynı kodda bir gün 0.79 bir gün 0.82 verebilir. Sıcaklık, model sürümü ve belirsiz rubric jitter'ın kaynağı; k-örnekleme ve gürültü bandı çözüm.