» Etiket
data-quality
5 yayınSWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
LLM'in Eğitim Verisi Bayatlayınca: Nijerya Araç Fiyatlama Motoru Nasıl Düzeltildi
Bir LLM, Nijerya araç fiyatlarını eski dolar kuruyla hatırlayınca fiyatlama motoru bozuldu; canlı veri zorunluluğu ve önbellek kirliliği dersleri.
Text-to-SQL benchmarklarında cevap anahtarı yerine veritabanı üretmek
UIUC'nin denetimi BIRD ve Spider 2.0'daki anotasyonların yarısından fazlasının hatalı olduğunu gösterdi. Bir geliştirici, cevabı önce tanımlayıp veritabanını sonra üreten ters bir yaklaşım denedi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAI Teknik Borcu: Üretilen Kod Neden Metadata ve Denetim İster
Veri mühendisliğinde AI ile üretilen kod hızlı ama riskli olabilir. Metadata, insan denetimi ve governance olmadan 'niyet borcu' birikir.
Graf Kenarında Eşleşme Güvenini Koruma: Splink Skorlarını Atmanın Zararları
Eşleşme olasılıklarını atmak, bilgi grafiğinin doğruluğunu etkiler. Kenar özellikleri olarak saklamak, sistemin güvenilirliğini artırır.