» Etiket
llm-inference
5 yayın397B Parametreli MoE Modeli Tek RTX PRO 6000 96GB GPU'da Çalıştı
Krasis çalışma zamanı, 397B parametreli MoE modelini tek RTX PRO 6000 96GB GPU'da 2.354 tok/s prefill hızıyla çalıştırdı.
vLLM'de Transformers Arka Ucu Artık Yerli Hıza Ulaştı
Transformers'ın vLLM modelleme arka ucu artık native implementasyonlarla aynı hızda; torch.fx ve ast ile otomatik kernel füzyonu sağlıyor.
56M parametreli LLM, ESP-NOW ile 3 ESP32-S3 kartına dağıtıldı
56M parametreli LLM, ESP-NOW üzerinden üç ESP32-S3 kartına dağıtılarak çalıştırıldı; Split-PLE ve KV cache ile tutarlılık artırıldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comDeepSeek V4 Flash, AMD Ryzen AI MAX+ 395'te 32 tok/s'a ulaştı
AMD Ryzen AI MAX+ 395'te 284B parametreli DeepSeek V4 Flash, 128GB birleşik bellekle 32 tok/s decode ve ~250 tok/s seyrek prefill hızına ulaştı.
Metin Difüzyonu mu Otoregresif Model mi: GPU Kullanımının Gerçek Hesabı
Difüzyon tabanlı dil modelleri ile otoregresif modellerin GPU kullanım ekonomisi karşılaştırması: gecikme, batching ve gerçek token maliyeti.