» Etiket
llm-inference
17 yayınPrefill/Decode Ayrıştırması Kuyruk Ekleyerek Tail Latency'yi Kötüleştirebilir
Prefill/decode ayrıştırması yeni kuyruklar ve KV transfer maliyeti ekleyerek tail latency'yi kötüleştirebilir; kontrol döngüsü yaklaşımı gerekiyor.
Metin Difüzyonu mu Otoregresif Model mi: GPU Kullanımının Gerçek Hesabı
Difüzyon tabanlı dil modelleri ile otoregresif modellerin GPU kullanım ekonomisi karşılaştırması: gecikme, batching ve gerçek token maliyeti.
Rastgele KV-Cache Tahliyesinde Doğrulanabilir Hata Sertifikaları
Rastgele Poisson örneklemeli KV-cache tahliyesi, LLM servislerinde %97 kapsamalı hata sertifikaları ve daha iyi hata atıflandırması sağlıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comBw24: RTX 50 Serisi Blackwell için Sıfırdan Rust+CUDA Çıkarım Motoru
Bw24, RTX 50 serisi Blackwell GPU'lar için sıfırdan yazılmış Rust+CUDA çıkarım motoru; spekülatif kod çözmede llama.cpp'ye karşı 2,3 kata varan hız sunuyor.
Gemma-4 (2B/4B/12B) AWS Inferentia2'ye Nasıl Taşındı
Gemma-4'ü AWS Inferentia2'ye taşıma raporu: karışık dikkat başlıkları, KV paylaşımı ve vLLM/NxD sınırlamalarının nasıl aşıldığı.
LLM Çıkarım Hızı: Darboğaz FLOPS Değil, Bellek Bant Genişliği
LLM çıkarımında gerçek darboğaz bellek bant genişliği. GPU, kuantizasyon ve batching seçimlerinin tok/s üzerindeki etkisini adım adım inceliyoruz.
Trendyol'un ajanı LLM sunum ayarlarını 4 kat hızlandırdı
Trendyol Tech, autooptimizer adlı bir AI ajanıyla vLLM sunum ayarlarını insan müdahalesi olmadan optimize ederek Gemma 4 26B'de 4 kat performans artışı elde etti.