» Etiket
benchmark
4 yayın«Ağustos 2026
Yapay Zeka Güvenlik Testi: Modeller Arasında 100 Kat Fark
Yeni jailbreak testi, öncü AI modelleri arasında 100 kata varan güvenlik farkı olduğunu, bazılarında hiç açık bulunmadığını ortaya koyuyor.
data-eng-bench: Snowflake'in dbt ajan benchmark'ı
Snowflake'in data-eng-bench'i, dbt kodlama ajanlarını DuckDB ve Snowflake üzerinde 103 gerçekçi görevle test eden açık kaynak Harbor benchmark'ı.
Açık bir ajan güvenlik benchmark'ı: Yakalanamayan saldırılar
Modern LLM ajanlarına yönelik 497 saldırıyı içeren açık bir güvenlik benchmark'ı oluşturuldu.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLlama.cpp PR ile Q2_0, x86 CPU'larda 3.0–3.6 kat hızlandı
Llama.cpp'daki yeni PR, Q2_0'ı x86 CPU'larda 3.0–3.6 kat hızlandırıyor. Detaylar burada.