» Etiket
kv-cache
6 yayınAndroid'de llama.cpp KV Durumuyla TTFT 9,9x Azaldı
EdgeSync-LLM, llama.cpp KV API'leriyle tekrar prompt işlemeden Android'de TTFT'yi 9,9x düşürdü; sahte 8,8x hızlanmayı da tespit edip eledi.
LLM Çıkarımında Gerçek Maliyet: Bellek Bant Genişliği
LLM sunumunda darboğaz FLOP değil, KV cache'in bellekten taşınma maliyeti. Prefill/decode ayrımı, batch boyutu ve context yönetimi neden asıl maliyet kalemi.
Prefill/Decode Ayrıştırması Kuyruk Ekleyerek Tail Latency'yi Kötüleştirebilir
Prefill/decode ayrıştırması yeni kuyruklar ve KV transfer maliyeti ekleyerek tail latency'yi kötüleştirebilir; kontrol döngüsü yaklaşımı gerekiyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comRastgele KV-Cache Tahliyesinde Doğrulanabilir Hata Sertifikaları
Rastgele Poisson örneklemeli KV-cache tahliyesi, LLM servislerinde %97 kapsamalı hata sertifikaları ve daha iyi hata atıflandırması sağlıyor.
TurboQuant: Google'un 6x VRAM İddiası Üzerine Dört Ay Sonra
Google'un TurboQuant algoritması, 6x bellek azaltma iddiasıyla dikkat çekti. Ancak resmi kod hala yayımlanmadı.
Qwen3.6-27B'de KV Önbellek Kuantizasyonunun KLD Etkisi
Bartowski'nin Qwen3.6-27B GGUF modelinde Q8, Q6 ve Q5 seviyelerinde KV önbellek kuantizasyonunun KL diverjansına etkisi ölçüldü; (q8_0,q8_0) neredeyse bedava kalite koruyor.