» Etiket
benchmark
7 yayınYapay Zeka Güvenlik Testi: Modeller Arasında 100 Kat Fark
Yeni jailbreak testi, öncü AI modelleri arasında 100 kata varan güvenlik farkı olduğunu, bazılarında hiç açık bulunmadığını ortaya koyuyor.
data-eng-bench: Snowflake'in dbt ajan benchmark'ı
Snowflake'in data-eng-bench'i, dbt kodlama ajanlarını DuckDB ve Snowflake üzerinde 103 gerçekçi görevle test eden açık kaynak Harbor benchmark'ı.
Açık bir ajan güvenlik benchmark'ı: Yakalanamayan saldırılar
Modern LLM ajanlarına yönelik 497 saldırıyı içeren açık bir güvenlik benchmark'ı oluşturuldu.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLlama.cpp PR ile Q2_0, x86 CPU'larda 3.0–3.6 kat hızlandı
Llama.cpp'daki yeni PR, Q2_0'ı x86 CPU'larda 3.0–3.6 kat hızlandırıyor. Detaylar burada.
LLM İnferansından Ajanik Yüklemelere: Karakterizasyon ve Etkileri
Ajanik uygulamaların LLM hizmetini nasıl etkilediği ve sistem davranışlarının karakterizasyonu hakkında bilgiler.
Nvidia'nın Groq 3 LPU Performans Testleri ve Önemi
Nvidia'nın Groq 3 LPU'ları ile ilgili ilk performans testleri, 20 milyar dolarlık yatırımın doğruluğunu gösteriyor.
Luc Julia'nın %64 LLM güvenilirlik iddiasının arka planı
Luc Julia'nın %64 güvenilirlik oranının arka planını inceleyen yeni bir kaynak oluşturuldu.