» Etiket
evaluation
42 yayınHandbook.md: Uzun politika belgeleri AI ajanlarını güvenilir şekilde yönetemiyor
Handbook.md benchmarkı, AI ajanlarının uzun şirket politika belgelerine gerçekte ne kadar uyduğunu test ediyor; sonuçlar endişe verici.
LLM Değerlendiricilerde Kırılamayan %75 Yanlış Negatif Duvarı
LLM tabanlı reviewer'ların çözülemeyen %75 yanlış negatif sorununu ve neden oylama, prompt kalibrasyonu gibi standart çözümlerin işe yaramadığını inceliyoruz.
Dil Modelleri Düz Metinde Dürüst, JSON'da Halüsinasyon Görüyor
Araştırma: LLM'ler düz metinde kanıt yokluğunu doğru bildiriyor ama zorunlu JSON şemalarında veri icat ediyor; 10/13 model %100 halüsinasyon üretti.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYapay Zeka Modelleri 'Pelikanlı Bisiklet' Testine Hile mi Yapıyor?
7 yapay zeka modeliyle 1.008 SVG üretilerek 'pelikanlı bisiklet' testinde hile (benchmaxxing) yapılıp yapılmadığı istatistiksel olarak incelendi.
AI Ajanı Testinde Hata, Cevapta Değil İzde Görünür
Bir AI ajanı test edilirken sekiz yeşil koşudan sonra gelen kırmızı, hatanın cevapta değil izde gizlendiğini gösterdi.
SDABench: LLM'leri Bilimsel Keşifte Test Eden Yeni Kıstas
SDABench, LLM'leri kod çalıştırma yerine altı bilimsel yetenek üzerinden test eden yeni bir kıstas; sonuçlar ciddi eksiklikleri ortaya koyuyor.
Airbnb LLM Değerlendirmesini Haftalardan Bir Güne Nasıl İndirdi
Airbnb'nin dört katmanlı LLM değerlendirme altyapısı, deterministik önbellekleme ve micro LoRA adaptörleriyle iterasyon süresini haftalardan bir güne indiriyor.
Değerlendirme Odaklı Açık Kaynak Kurs: doerkit ve rubric-bench
doerkit ve rubric-bench: LLM'yi rubrik yargıcı olarak kullanan açık kaynak bir istatistik kursu ve genel amaçlı yargıç test çerçevesi.
LLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
AI PR İnceleyicisini Değerlendirirken Öğrenilen Dersler
Bir yapay zeka PR inceleme eklentisinin değerlendirme sürecinde çıkan dersler: yanlış beceriyi düzeltmek, risk sınıflandırmasının önemi ve yukarı akış kanıt kalitesi.