» Etiket
benchmarking
55 yayın10 AI Kodlama Modeli, 5 Görev: Fiyat Performans Kalitesi Belirlemiyor
10 LLM'in 5 kodlama görevindeki performansı karşılaştırıldı: fiyat-kalite korelasyonu zayıf, ucuz modeller premium'a rakip çıktı.
VetoBench: Ajan Belleği Reddedilen Kararları Hatırlıyor mu?
VetoBench, ajan bellek sistemlerinin reddedilen kararları (vetoları) hatırlayıp hatırlamadığını test eden açık kaynaklı bir kıyaslama.
Markdown Bilgi Grafiğini Yapay Zeka Ajan Belleği Olarak Ölçmek
IWE, LOCOMO benchmarkıyla markdown bilgi grafiklerini yapay zeka ajan belleği olarak test etti; ucuz bir küratör modeliyle yüzde 96 performansa ulaştı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comOn Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
Quantprobe: 16 GB RAM'lik Eski PC'de 110B Parametreli LLM Çalıştırma
Quantprobe aracı, 2016 model bir PC'de 110B parametreli LLM'i 16GB RAM ve SATA SSD ile çalıştırmanın ölçümle kanıtlanmış yöntemini gösteriyor.
PyTorch tarzı API ile LLM 'harness' eğitimi: model donuk, çevresi öğreniyor
LLM ağırlıkları donuk kalırken promptlar, araçlar ve onarım döngüsünü PyTorch benzeri bir eğitim döngüsüyle geliştiren açık kaynak harness-training çerçevesi.
Yerel Model Showdown 9. Tur: Qwen 3.6, Nemotron ve Qwythos Kod Testinde
RTX 5090'da llama.cpp ile beş LLM'in gerçek kodlama görevinde karşılaştırıldığı Local Model Showdown 9. tur analizi ve bulguları.
apitap: Rust Tabanlı ELT Motoru 10 Milyon Satırı 9.9 Saniyede Taşıyor
Açık kaynaklı Rust motoru apitap, tek komutla 10 milyon satırı 9.9 saniyede taşıyor; dlt ve ingestr ile karşılaştırmalı benchmark sonuçları.
VetoBench: Yapay Zeka Ajanları Reddedilen Fikirleri Unutuyor mu?
VetoBench, hafıza sistemlerini klasik 'doğru öğe geldi mi' sorusu yerine 'reddedilen yaklaşım tekrar önerildi mi' sorusuyla test eden açık kaynaklı bir benchmark. Sonuçlar çarpıcı.
Prefill/Decode Ayrıştırması Kuyruk Ekleyerek Tail Latency'yi Kötüleştirebilir
Prefill/decode ayrıştırması yeni kuyruklar ve KV transfer maliyeti ekleyerek tail latency'yi kötüleştirebilir; kontrol döngüsü yaklaşımı gerekiyor.