» Etiket
benchmarking
45 yayınOn Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
Quantprobe: 16 GB RAM'lik Eski PC'de 110B Parametreli LLM Çalıştırma
Quantprobe aracı, 2016 model bir PC'de 110B parametreli LLM'i 16GB RAM ve SATA SSD ile çalıştırmanın ölçümle kanıtlanmış yöntemini gösteriyor.
PyTorch tarzı API ile LLM 'harness' eğitimi: model donuk, çevresi öğreniyor
LLM ağırlıkları donuk kalırken promptlar, araçlar ve onarım döngüsünü PyTorch benzeri bir eğitim döngüsüyle geliştiren açık kaynak harness-training çerçevesi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYerel Model Showdown 9. Tur: Qwen 3.6, Nemotron ve Qwythos Kod Testinde
RTX 5090'da llama.cpp ile beş LLM'in gerçek kodlama görevinde karşılaştırıldığı Local Model Showdown 9. tur analizi ve bulguları.
apitap: Rust Tabanlı ELT Motoru 10 Milyon Satırı 9.9 Saniyede Taşıyor
Açık kaynaklı Rust motoru apitap, tek komutla 10 milyon satırı 9.9 saniyede taşıyor; dlt ve ingestr ile karşılaştırmalı benchmark sonuçları.
VetoBench: Yapay Zeka Ajanları Reddedilen Fikirleri Unutuyor mu?
VetoBench, hafıza sistemlerini klasik 'doğru öğe geldi mi' sorusu yerine 'reddedilen yaklaşım tekrar önerildi mi' sorusuyla test eden açık kaynaklı bir benchmark. Sonuçlar çarpıcı.
Awsmux: Çoklu Hesap AWS CLI Aracı, Ajanlarda 5,4 Kata Kadar Hız Sağlıyor
Awsmux, paralel çalışan çoklu hesap AWS CLI aracı: AI ajanlarında 5,4 kata kadar hız, 7,4 kat daha az token ve onay sınırlı güvenlik sağlıyor.
Favur Evals: Hangi yapay zeka modeli daha iyi kod yazıyor?
Favur, farklı yapay zeka modellerinin kodlama performansını karşılaştıran bağımsız ve halka açık bir liderlik tablosu olan Favur Evals'ı duyurdu.
Diferansiyel Testler Native ve Generic XDP Farklarını Gösteriyor
Native ve generic XDP arasındaki davranış farklarını ölçen açık kaynak diferansiyel test harness'ı ve 11 paketlik taban çizgisi sonuçları.
Bun, Deno ve Node.js 2026 karşılaştırması: gerçek benchmark sonuçları
Aynı makinede tekrar ölçülen Bun, Deno ve Node.js testleri, dolaşımdaki eski benchmark rakamlarının çoğunu geçersiz kılıyor. Hangi runtime ne zaman doğru seçim?