» Etiket
benchmark
26 yayınYapay Zeka Tersine Mühendislik Ölçeği
AgentRE-Bench, AI ajanlarının tersine mühendislik yeteneklerini değerlendiriyor. Kalibrasyon, akıl yürütme derinliğinden daha etkili.
PostgreSQL Benchmark: AWS RDS ve Hetzner Karşılaştırması (2026)
2026'da 2 vCPU/4GB PostgreSQL 16 testinde Hostim yazma performansında öne çıktı, Hetzner okuma testini kazandı, RDS ise gizli maliyetleriyle geride kaldı.
Açık bir ajan güvenlik benchmark'ı: Yakalanamayan saldırılar
Modern LLM ajanlarına yönelik 497 saldırıyı içeren açık bir güvenlik benchmark'ı oluşturuldu.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLlama.cpp PR ile Q2_0, x86 CPU'larda 3.0–3.6 kat hızlandı
Llama.cpp'daki yeni PR, Q2_0'ı x86 CPU'larda 3.0–3.6 kat hızlandırıyor. Detaylar burada.
Benchmark N=22'de neden durdu? Dokuz hata ile hata ayıklama hikayesi
Bir geliştirici, benchmark testinin neden 22'de durduğunu ve karşılaştığı hataları inceliyor.
Elasticsearch ve Qdrant: Diskin Uyanamadığı Hikaye
Elasticsearch ve Qdrant arasındaki vektör arama benchmark sonuçları ve ayarların etkisi.
TaxCalcBench: Açık Kaynak Testte Yapay Zeka Vergi Hesaplıyor
TaxCalcBench, LLM'lerin gerçek vergi beyannamelerini doğru doldurup dolduramadığını ölçen açık kaynaklı bir test; en iyi model bile yüzde 54 doğruluk sağlıyor.
MET: Kültürel Farkındalıkla Çok Dilliliği Geliştiren Ahlaki Akıl Yürütme
MET, çok dilli ve kültürel olarak duyarlı ahlaki akıl yürütmeyi geliştiren yenilikçi bir çerçeve sunuyor.
PostgreSQL Autovacuum İç Mekanizmaları ve Performans Testi
PostgreSQL'deki autovacuum'un önemi ve performans testleri hakkında bilgi edinin.
Web Scraping Endüstrisinde Benchmark Sorununu Çözme Çabası
Web scraping benchmark sorununu çözmek için açık kaynak bir test seti geliştirildi.