» Etiket
evaluation
5 yayınDil Modelleri Düz Metinde Dürüst, JSON'da Halüsinasyon Görüyor
Araştırma: LLM'ler düz metinde kanıt yokluğunu doğru bildiriyor ama zorunlu JSON şemalarında veri icat ediyor; 10/13 model %100 halüsinasyon üretti.
TutorMoments: Yapay Zeka Öğretmenler Ne Zaman Yardım Etmeli?
Allen AI'nin TutorMoments benchmark'ı, LLM öğretmenlerin ne zaman destek olup ne zaman öğrenciyi zorlaması gerektiğini bilip bilmediğini test ediyor.
Yapay Zeka Benchmark'ınız Modeli Değil, Kafesi Ölçebilir
Yazılım hatalarının AI model değerlendirmesini nasıl etkilediğini keşfedin. Modelin gerçek performansını anlamak için ölçüm sisteminin rolü önemlidir.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLLM ile Üretilen Testler Uygulama Seçimini Nasıl Değiştirir?
Büyük dil modellerinin test üretimi üzerindeki etkileri ve uygulama seçimindeki rolü hakkında önemli bulgular.
NVIDIA SkillEvaluator ile AI Ajanı Yetkinlik Performans Değerlendirmesi
NVIDIA SkillEvaluator, AI ajanlarının yetkinlik performansını ölçmek için geliştirilmiş bir araçtır.