» Etiket
benchmarking
18 yayınMCP Güvenliği Yeniden Ele Alınıyor: 64 Bin Sunuculuk Dev Ölçekli Çalışma
MCPZoo, 64.611 MCP sunucusuyla güvenlik tarayıcılarının güvenilirliğini test ediyor; uyarıların yarısından azı gerçek çıkıyor.
Fable 5 vs GPT-5.6 Sol: NP-Zor Problemde /goal İşe Yarıyor mu?
Claude Fable 5 ve GPT-5.6 Sol, NP-zor bir fiber ağ optimizasyon probleminde /goal özelliğiyle test edildi; sonuçlar beklenmedik çıktı.
MCP Güvenliğinde Ölçme Devrimi: %9'dan %63'e Çıkan Proxy
Açık kaynak mcp-defense-bench kıyaslaması, MCP güvenlik proxy'si mcp-bastion'ın kapsamını %9'dan %63'e nasıl çıkardığını gösteriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com10 AI Kodlama Modeli, 5 Görev: Fiyat Performans Kalitesi Belirlemiyor
10 LLM'in 5 kodlama görevindeki performansı karşılaştırıldı: fiyat-kalite korelasyonu zayıf, ucuz modeller premium'a rakip çıktı.
VetoBench: Ajan Belleği Reddedilen Kararları Hatırlıyor mu?
VetoBench, ajan bellek sistemlerinin reddedilen kararları (vetoları) hatırlayıp hatırlamadığını test eden açık kaynaklı bir kıyaslama.
Markdown Bilgi Grafiğini Yapay Zeka Ajan Belleği Olarak Ölçmek
IWE, LOCOMO benchmarkıyla markdown bilgi grafiklerini yapay zeka ajan belleği olarak test etti; ucuz bir küratör modeliyle yüzde 96 performansa ulaştı.
On Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
Yerel Model Showdown 9. Tur: Qwen 3.6, Nemotron ve Qwythos Kod Testinde
RTX 5090'da llama.cpp ile beş LLM'in gerçek kodlama görevinde karşılaştırıldığı Local Model Showdown 9. tur analizi ve bulguları.
apitap: Rust Tabanlı ELT Motoru 10 Milyon Satırı 9.9 Saniyede Taşıyor
Açık kaynaklı Rust motoru apitap, tek komutla 10 milyon satırı 9.9 saniyede taşıyor; dlt ve ingestr ile karşılaştırmalı benchmark sonuçları.
Favur Evals: Hangi yapay zeka modeli daha iyi kod yazıyor?
Favur, farklı yapay zeka modellerinin kodlama performansını karşılaştıran bağımsız ve halka açık bir liderlik tablosu olan Favur Evals'ı duyurdu.