» Etiket
benchmarking
45 yayınDuckDB, SQLite'ı gözlemlenebilirlikte 100 kat geride bırakıyor
Aynı 16.49 $/ay sunucuda DuckDB, SQLite'a göre 4-15x daha hızlı yazıyor ve 100 kat daha fazla satırda gösterge paneli çalıştırıyor. Traceway benchmark sonuçları.
Bir AI kod tabanınızı gerçekten anlıyor mu? Bunu nasıl test edersiniz
Bir AI ajanının kod tabanı anlayışını nasıl test edersiniz? Teardown denetimi yöntemi, on üç Ruby projesinde sınandı; güçlü ve zayıf yanları.
MCP Güvenliği Yeniden Ele Alınıyor: 64 Bin Sunuculuk Dev Ölçekli Çalışma
MCPZoo, 64.611 MCP sunucusuyla güvenlik tarayıcılarının güvenilirliğini test ediyor; uyarıların yarısından azı gerçek çıkıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comToolgz: LLM araç tanımlarında token kullanımını %80 azaltıyor
Toolgz, LLM ajanlarında araç tanımı token kullanımını %80 azaltıp doğruluğu koruyor; 420 koşuluk çapraz sağlayıcı testiyle doğrulandı.
Yapay Zeka Modelleri 'Pelikanlı Bisiklet' Testine Hile mi Yapıyor?
7 yapay zeka modeliyle 1.008 SVG üretilerek 'pelikanlı bisiklet' testinde hile (benchmaxxing) yapılıp yapılmadığı istatistiksel olarak incelendi.
Fable 5 vs GPT-5.6 Sol: NP-Zor Problemde /goal İşe Yarıyor mu?
Claude Fable 5 ve GPT-5.6 Sol, NP-zor bir fiber ağ optimizasyon probleminde /goal özelliğiyle test edildi; sonuçlar beklenmedik çıktı.
MCP Güvenliğinde Ölçme Devrimi: %9'dan %63'e Çıkan Proxy
Açık kaynak mcp-defense-bench kıyaslaması, MCP güvenlik proxy'si mcp-bastion'ın kapsamını %9'dan %63'e nasıl çıkardığını gösteriyor.
10 AI Kodlama Modeli, 5 Görev: Fiyat Performans Kalitesi Belirlemiyor
10 LLM'in 5 kodlama görevindeki performansı karşılaştırıldı: fiyat-kalite korelasyonu zayıf, ucuz modeller premium'a rakip çıktı.
VetoBench: Ajan Belleği Reddedilen Kararları Hatırlıyor mu?
VetoBench, ajan bellek sistemlerinin reddedilen kararları (vetoları) hatırlayıp hatırlamadığını test eden açık kaynaklı bir kıyaslama.
Markdown Bilgi Grafiğini Yapay Zeka Ajan Belleği Olarak Ölçmek
IWE, LOCOMO benchmarkıyla markdown bilgi grafiklerini yapay zeka ajan belleği olarak test etti; ucuz bir küratör modeliyle yüzde 96 performansa ulaştı.