» Etiket
evaluation
37 yayınHandbook.md: Uzun politika belgeleri AI ajanlarını güvenilir şekilde yönetemiyor
Handbook.md benchmarkı, AI ajanlarının uzun şirket politika belgelerine gerçekte ne kadar uyduğunu test ediyor; sonuçlar endişe verici.
LLM Değerlendiricilerde Kırılamayan %75 Yanlış Negatif Duvarı
LLM tabanlı reviewer'ların çözülemeyen %75 yanlış negatif sorununu ve neden oylama, prompt kalibrasyonu gibi standart çözümlerin işe yaramadığını inceliyoruz.
Yapay Zeka Modelleri 'Pelikanlı Bisiklet' Testine Hile mi Yapıyor?
7 yapay zeka modeliyle 1.008 SVG üretilerek 'pelikanlı bisiklet' testinde hile (benchmaxxing) yapılıp yapılmadığı istatistiksel olarak incelendi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAI Ajanı Testinde Hata, Cevapta Değil İzde Görünür
Bir AI ajanı test edilirken sekiz yeşil koşudan sonra gelen kırmızı, hatanın cevapta değil izde gizlendiğini gösterdi.
SDABench: LLM'leri Bilimsel Keşifte Test Eden Yeni Kıstas
SDABench, LLM'leri kod çalıştırma yerine altı bilimsel yetenek üzerinden test eden yeni bir kıstas; sonuçlar ciddi eksiklikleri ortaya koyuyor.
Airbnb LLM Değerlendirmesini Haftalardan Bir Güne Nasıl İndirdi
Airbnb'nin dört katmanlı LLM değerlendirme altyapısı, deterministik önbellekleme ve micro LoRA adaptörleriyle iterasyon süresini haftalardan bir güne indiriyor.
Değerlendirme Odaklı Açık Kaynak Kurs: doerkit ve rubric-bench
doerkit ve rubric-bench: LLM'yi rubrik yargıcı olarak kullanan açık kaynak bir istatistik kursu ve genel amaçlı yargıç test çerçevesi.
LLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
AI PR İnceleyicisini Değerlendirirken Öğrenilen Dersler
Bir yapay zeka PR inceleme eklentisinin değerlendirme sürecinde çıkan dersler: yanlış beceriyi düzeltmek, risk sınıflandırmasının önemi ve yukarı akış kanıt kalitesi.
NicheIQ mühendisliği: Yapay zekaya gerçeği söyletmek
NicheIQ'nun kendi kendini değerlendiren yapay zekayı dürüstleştirme sürecine dair mühendislik notları: yanlılık, başarısız döngüler ve bir 'Yapma' kararı.