» Etiket
benchmarks
2 yayınSWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
SynthDocBench: Uzun Bağlamlı Görsel Belge Anlamada VLM Zaafları
SynthDocBench, uzun bağlamlı belgelerde VLM'lerin konumsal önyargı, uzunlukla performans kaybı ve grafik anlama zaaflarını ortaya koyan yeni bir benchmark.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com