» Etiket
benchmarking
55 yayınLLM ile Üretilen GPU Çekirdeklerinde Gizli Hatalar Bulundu
12 kapılı yeni bir doğrulayıcı, LLM üretimi GPU çekirdeklerinin %39,5'inin standart testleri geçmesine rağmen bozuk olduğunu ortaya koyuyor.
MCP Protokolünde Oturum Durumu: Sticky, Redis ve Continuation Kıyaslaması
MCP'nin oturum yerine continuation taşıması Rust rmcp v3 üzerinde ölçüldü: sticky, Redis ve sealed continuation kıyaslaması.
DuckDB, SQLite'ı gözlemlenebilirlikte 100 kat geride bırakıyor
Aynı 16.49 $/ay sunucuda DuckDB, SQLite'a göre 4-15x daha hızlı yazıyor ve 100 kat daha fazla satırda gösterge paneli çalıştırıyor. Traceway benchmark sonuçları.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comBir AI kod tabanınızı gerçekten anlıyor mu? Bunu nasıl test edersiniz
Bir AI ajanının kod tabanı anlayışını nasıl test edersiniz? Teardown denetimi yöntemi, on üç Ruby projesinde sınandı; güçlü ve zayıf yanları.
MCP Güvenliği Yeniden Ele Alınıyor: 64 Bin Sunuculuk Dev Ölçekli Çalışma
MCPZoo, 64.611 MCP sunucusuyla güvenlik tarayıcılarının güvenilirliğini test ediyor; uyarıların yarısından azı gerçek çıkıyor.
nibble: Redis Bellek İsrafını Kurulum Gerektirmeden Teşhis Edip Düzeltiyor
nibble, Redis'teki bellek israfını kurulum gerektirmeden teşhis edip düzeltmeleri uygulayan bir araç; 8.6 kat bellek tasarrufu ve şeffaf ölçümler sunuyor.
Toolgz: LLM araç tanımlarında token kullanımını %80 azaltıyor
Toolgz, LLM ajanlarında araç tanımı token kullanımını %80 azaltıp doğruluğu koruyor; 420 koşuluk çapraz sağlayıcı testiyle doğrulandı.
Yapay Zeka Modelleri 'Pelikanlı Bisiklet' Testine Hile mi Yapıyor?
7 yapay zeka modeliyle 1.008 SVG üretilerek 'pelikanlı bisiklet' testinde hile (benchmaxxing) yapılıp yapılmadığı istatistiksel olarak incelendi.
Fable 5 vs GPT-5.6 Sol: NP-Zor Problemde /goal İşe Yarıyor mu?
Claude Fable 5 ve GPT-5.6 Sol, NP-zor bir fiber ağ optimizasyon probleminde /goal özelliğiyle test edildi; sonuçlar beklenmedik çıktı.
MCP Güvenliğinde Ölçme Devrimi: %9'dan %63'e Çıkan Proxy
Açık kaynak mcp-defense-bench kıyaslaması, MCP güvenlik proxy'si mcp-bastion'ın kapsamını %9'dan %63'e nasıl çıkardığını gösteriyor.