» Etiket
llm-evaluation
2 yayınText-to-SQL benchmarklarında cevap anahtarı yerine veritabanı üretmek
UIUC'nin denetimi BIRD ve Spider 2.0'daki anotasyonların yarısından fazlasının hatalı olduğunu gösterdi. Bir geliştirici, cevabı önce tanımlayıp veritabanını sonra üreten ters bir yaklaşım denedi.
OpenAI, kendi önerdiği SWE-Bench Pro'yu geçersiz ilan etti
OpenAI'nin yaptığı denetime göre SWE-Bench Pro görevlerinin yaklaşık %30'u kusurlu çıktı. Şirket, ajan tabanlı kodlama benchmark'ı için verdiği önceki tavsiyeyi geri çekti.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com