» Etiket
llm-evaluation
3 yayınText-to-SQL benchmarklarında cevap anahtarı yerine veritabanı üretmek
UIUC'nin denetimi BIRD ve Spider 2.0'daki anotasyonların yarısından fazlasının hatalı olduğunu gösterdi. Bir geliştirici, cevabı önce tanımlayıp veritabanını sonra üreten ters bir yaklaşım denedi.
OpenAI, kendi önerdiği SWE-Bench Pro'yu geçersiz ilan etti
OpenAI'nin yaptığı denetime göre SWE-Bench Pro görevlerinin yaklaşık %30'u kusurlu çıktı. Şirket, ajan tabanlı kodlama benchmark'ı için verdiği önceki tavsiyeyi geri çekti.
LLM-as-judge testleri neden çalıştırma başına farklı sonuç verir
CI'da faithfulness eşiğini kontrol eden LLM hakem, aynı kodda bir gün 0.79 bir gün 0.82 verebilir. Sıcaklık, model sürümü ve belirsiz rubric jitter'ın kaynağı; k-örnekleme ve gürültü bandı çözüm.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com