» Etiket
llm-inference
3 yayınvLLM'de Transformers Arka Ucu Artık Yerli Hıza Ulaştı
Transformers'ın vLLM modelleme arka ucu artık native implementasyonlarla aynı hızda; torch.fx ve ast ile otomatik kernel füzyonu sağlıyor.
DeepSeek V4 Flash, AMD Ryzen AI MAX+ 395'te 32 tok/s'a ulaştı
AMD Ryzen AI MAX+ 395'te 284B parametreli DeepSeek V4 Flash, 128GB birleşik bellekle 32 tok/s decode ve ~250 tok/s seyrek prefill hızına ulaştı.
Metin Difüzyonu mu Otoregresif Model mi: GPU Kullanımının Gerçek Hesabı
Difüzyon tabanlı dil modelleri ile otoregresif modellerin GPU kullanım ekonomisi karşılaştırması: gecikme, batching ve gerçek token maliyeti.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com