» Etiket
llm-inference
15 yayınGemma-4 (2B/4B/12B) AWS Inferentia2'ye Nasıl Taşındı
Gemma-4'ün AWS Inferentia2'ye taşınması: karışık dikkat kafaları, KV paylaşımı ve NxD sharding sorunlarının çözümü.
397B Parametreli MoE Modeli Tek RTX PRO 6000 96GB GPU'da Çalıştı
Krasis çalışma zamanı, 397B parametreli MoE modelini tek RTX PRO 6000 96GB GPU'da 2.354 tok/s prefill hızıyla çalıştırdı.
vLLM'de Transformers Arka Ucu Artık Yerli Hıza Ulaştı
Transformers'ın vLLM modelleme arka ucu artık native implementasyonlarla aynı hızda; torch.fx ve ast ile otomatik kernel füzyonu sağlıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com56M parametreli LLM, ESP-NOW ile 3 ESP32-S3 kartına dağıtıldı
56M parametreli LLM, ESP-NOW üzerinden üç ESP32-S3 kartına dağıtılarak çalıştırıldı; Split-PLE ve KV cache ile tutarlılık artırıldı.
DeepSeek V4 Flash, AMD Ryzen AI MAX+ 395'te 32 tok/s'a ulaştı
AMD Ryzen AI MAX+ 395'te 284B parametreli DeepSeek V4 Flash, 128GB birleşik bellekle 32 tok/s decode ve ~250 tok/s seyrek prefill hızına ulaştı.
DeepSeek V4 Flash'ı AWS Spot Instance'larda Kendi Sunucularımızda Barındırıyoruz
DeepSeek V4 Flash'ın AWS spot GPU'larda kendi kendine barındırılması: MXFP4 kuantizasyon, RTX PRO 6000, DSpark ve KV cache optimizasyonu detayları.
LLM Çıkarımında Gerçek Maliyet: Bellek Bant Genişliği
LLM sunumunda darboğaz FLOP değil, KV cache'in bellekten taşınma maliyeti. Prefill/decode ayrımı, batch boyutu ve context yönetimi neden asıl maliyet kalemi.
Headroom: Yerel AI için GPU bant genişliği tavanını tarayıcıda ölç
Headroom, WebGPU ile tarayıcıda GPU bellek bant genişliği tavanını ölçüp yerel AI tok/s performansını ve sürücü hatalarını gösteren açık araç.
GLM 5.2 Yerel Kurulum Rehberi: Kuantizasyon ve Donanım Seçimi
753B parametreli MoE modeli GLM 5.2'yi yerelde çalıştırmak için Unsloth dinamik kuantizasyonları, RAM gereksinimleri ve donanım seçenekleri karşılaştırıldı.
Metin Difüzyonu mu Otoregresif Model mi: GPU Kullanımının Gerçek Hesabı
Difüzyon tabanlı dil modelleri ile otoregresif modellerin GPU kullanım ekonomisi karşılaştırması: gecikme, batching ve gerçek token maliyeti.