» Etiket
benchmark
22 yayınLoRA Speedrun: Fine-Tuning Teknikleri İçin Açık Hız Sıralaması
LoRA Speedrun, Qwen2.5-1.5B ve GSM8K üzerinde tek bir L40S GPU'da doğrulanmış, herkese açık bir LoRA fine-tuning hız sıralaması sunuyor.
ExploitGym: Yapay Zekâ Ajanları için Exploit Geliştirme Benchmarkı
ExploitGym, kullanıcı alanı, V8 ve Linux çekirdeği açıklarını kapsayan 869 görevlik açık kaynaklı yapay zekâ exploit benchmarkı.
Apple SpeechAnalyzer, Whisper ve eski API'yi WER testinde geride bıraktı
Apple'ın SpeechAnalyzer API'si LibriSpeech testinde Whisper Small ve eski SFSpeechRecognizer'ı doğruluk ve hızda geride bıraktı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comIntel Arc B70 32GB, Vulkan ile Qwen3.6-35B-A3B'de 130 t/s
Intel Arc Pro B70 32GB'de llama.cpp Vulkan ile Qwen3.6-35B-A3B testi: 4-bit'te 130 t/s (262k bağlam), 8-bit hibrit yüklemede 69 t/s.
CVE-Bench: LLM Ajanlarını Gerçek Güvenlik Açıklarını Onarmakta Test Ediyor
CVE-Bench, LLM ajanlarının gerçek Python güvenlik açıklarını Docker sandbox içinde düzeltme becerisini ölçen açık kaynak benchmark aracı.
SysAdmin Testi: Yapay Zeka Modellerinde Güç Arayışı Ölçülüyor
SysAdmin benchmark'ı, 7 sınır AI modelinde Linux sandbox testleriyle güç arayışı davranışlarını ölçtü; sonuçlar %0-5 aralığında kaldı.
ClickHouse ve Postgres, Mac Mini'de 100 Milyon Satırla Karşı Karşıya
Bir Mac Mini M4'te 100 milyon LLM trace satırıyla ClickHouse ve Postgres karşılaştırıldı: ingest hızı, disk, sorgu gecikmesi tüm verileriyle.
Kyutai Pocket TTS: 5 Saniyede Ses Klonlama, CPU'da, MIT Lisanslı
Kyutai'nin Pocket TTS modeli, 5 saniyelik ses örneğinden CPU üzerinde sıfır-atış ses klonlama yapıyor. Kokoro, Supertonic ve Inflect-Nano ile karşılaştırmalı benchmark sonuçları.
Yapay Zeka Tersine Mühendislik Ölçeği
AgentRE-Bench, AI ajanlarının tersine mühendislik yeteneklerini değerlendiriyor. Kalibrasyon, akıl yürütme derinliğinden daha etkili.
PostgreSQL Benchmark: AWS RDS ve Hetzner Karşılaştırması (2026)
2026'da 2 vCPU/4GB PostgreSQL 16 testinde Hostim yazma performansında öne çıktı, Hetzner okuma testini kazandı, RDS ise gizli maliyetleriyle geride kaldı.