» Etiket
benchmarking
6 yayınVetoBench: Ajan Belleği Reddedilen Kararları Hatırlıyor mu?
VetoBench, ajan bellek sistemlerinin reddedilen kararları (vetoları) hatırlayıp hatırlamadığını test eden açık kaynaklı bir kıyaslama.
Markdown Bilgi Grafiğini Yapay Zeka Ajan Belleği Olarak Ölçmek
IWE, LOCOMO benchmarkıyla markdown bilgi grafiklerini yapay zeka ajan belleği olarak test etti; ucuz bir küratör modeliyle yüzde 96 performansa ulaştı.
On Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAI Ajan Göçünü Benchmark Etmek: Hız Artışına Güvenmemek
AI ajan göçü için güvenilir bir benchmark oluşturma yöntemleri ve önemi.
Modern Yüklerle 15 "E-Atık" GPU'nun Performans Testi
Eski NVIDIA Tesla GPU'larının modern yüklerle performansını değerlendiren bir çalışma. Düşük maliyetli GPU düğümleri için önemli veriler sunuyor.
Muse Spark 1.1 ve GPT-5.6 Tanıtıldı; Rust 1.97 Yayınlandı
AI Gateway'de Muse Spark 1.1 ve GPT-5.6 tanıtıldı; Rust 1.97, sembol karıştırma sistemini güncelledi.