» Etiket
benchmark
31 yayınYapay Zeka Tersine Mühendislik Ölçeği
AgentRE-Bench, AI ajanlarının tersine mühendislik yeteneklerini değerlendiriyor. Kalibrasyon, akıl yürütme derinliğinden daha etkili.
PostgreSQL Benchmark: AWS RDS ve Hetzner Karşılaştırması (2026)
2026'da 2 vCPU/4GB PostgreSQL 16 testinde Hostim yazma performansında öne çıktı, Hetzner okuma testini kazandı, RDS ise gizli maliyetleriyle geride kaldı.
Açık bir ajan güvenlik benchmark'ı: Yakalanamayan saldırılar
Modern LLM ajanlarına yönelik 497 saldırıyı içeren açık bir güvenlik benchmark'ı oluşturuldu.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLlama.cpp PR ile Q2_0, x86 CPU'larda 3.0–3.6 kat hızlandı
Llama.cpp'daki yeni PR, Q2_0'ı x86 CPU'larda 3.0–3.6 kat hızlandırıyor. Detaylar burada.
Benchmark N=22'de neden durdu? Dokuz hata ile hata ayıklama hikayesi
Bir geliştirici, benchmark testinin neden 22'de durduğunu ve karşılaştığı hataları inceliyor.
Elasticsearch ve Qdrant: Diskin Uyanamadığı Hikaye
Elasticsearch ve Qdrant arasındaki vektör arama benchmark sonuçları ve ayarların etkisi.
TaxCalcBench: Açık Kaynak Testte Yapay Zeka Vergi Hesaplıyor
TaxCalcBench, LLM'lerin gerçek vergi beyannamelerini doğru doldurup dolduramadığını ölçen açık kaynaklı bir test; en iyi model bile yüzde 54 doğruluk sağlıyor.
LLM İnferansından Ajanik Yüklemelere: Karakterizasyon ve Etkileri
Ajanik uygulamaların LLM hizmetini nasıl etkilediği ve sistem davranışlarının karakterizasyonu hakkında bilgiler.
MET: Kültürel Farkındalıkla Çok Dilliliği Geliştiren Ahlaki Akıl Yürütme
MET, çok dilli ve kültürel olarak duyarlı ahlaki akıl yürütmeyi geliştiren yenilikçi bir çerçeve sunuyor.
Nvidia'nın Groq 3 LPU Performans Testleri ve Önemi
Nvidia'nın Groq 3 LPU'ları ile ilgili ilk performans testleri, 20 milyar dolarlık yatırımın doğruluğunu gösteriyor.