» Etiket
llm-inference
19 yayınGLM 5.2 Yerel Kurulum Rehberi: Kuantizasyon ve Donanım Seçimi
753B parametreli MoE modeli GLM 5.2'yi yerelde çalıştırmak için Unsloth dinamik kuantizasyonları, RAM gereksinimleri ve donanım seçenekleri karşılaştırıldı.
Prefill/Decode Ayrıştırması Kuyruk Ekleyerek Tail Latency'yi Kötüleştirebilir
Prefill/decode ayrıştırması yeni kuyruklar ve KV transfer maliyeti ekleyerek tail latency'yi kötüleştirebilir; kontrol döngüsü yaklaşımı gerekiyor.
Metin Difüzyonu mu Otoregresif Model mi: GPU Kullanımının Gerçek Hesabı
Difüzyon tabanlı dil modelleri ile otoregresif modellerin GPU kullanım ekonomisi karşılaştırması: gecikme, batching ve gerçek token maliyeti.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comRastgele KV-Cache Tahliyesinde Doğrulanabilir Hata Sertifikaları
Rastgele Poisson örneklemeli KV-cache tahliyesi, LLM servislerinde %97 kapsamalı hata sertifikaları ve daha iyi hata atıflandırması sağlıyor.
Bw24: RTX 50 Serisi Blackwell için Sıfırdan Rust+CUDA Çıkarım Motoru
Bw24, RTX 50 serisi Blackwell GPU'lar için sıfırdan yazılmış Rust+CUDA çıkarım motoru; spekülatif kod çözmede llama.cpp'ye karşı 2,3 kata varan hız sunuyor.
Gemma-4 (2B/4B/12B) AWS Inferentia2'ye Nasıl Taşındı
Gemma-4'ü AWS Inferentia2'ye taşıma raporu: karışık dikkat başlıkları, KV paylaşımı ve vLLM/NxD sınırlamalarının nasıl aşıldığı.
LLM Çıkarım Hızı: Darboğaz FLOPS Değil, Bellek Bant Genişliği
LLM çıkarımında gerçek darboğaz bellek bant genişliği. GPU, kuantizasyon ve batching seçimlerinin tok/s üzerindeki etkisini adım adım inceliyoruz.
Flint: LLM Çıkarımı için Yüksek Bant Genişlikli Flash'ı Verimli Kullanma
FLINT, LLM çıkarımında bellek kapasitesi darboğazını gidermek için yüksek bant genişlikli flash (HBF) bellek katmanını verimli entegre eden donanım mimarisi sunuyor.
Trendyol'un ajanı LLM sunum ayarlarını 4 kat hızlandırdı
Trendyol Tech, autooptimizer adlı bir AI ajanıyla vLLM sunum ayarlarını insan müdahalesi olmadan optimize ederek Gemma 4 26B'de 4 kat performans artışı elde etti.