» Etiket
vllm
14 yayınvLLM'de Transformers Arka Ucu Artık Yerli Hıza Ulaştı
Transformers'ın vLLM modelleme arka ucu artık native implementasyonlarla aynı hızda; torch.fx ve ast ile otomatik kernel füzyonu sağlıyor.
Tek MI300X GPU'da DeepSeek V4 Flash: Gerçek Kodlama Ajanı Testi
Tek AMD MI300X GPU'da DeepSeek V4 Flash'ın gerçek kodlama ajanlarıyla ölçülen throughput, cache isabet oranı ve maliyet analizi.
DeepSeek V4 Flash'ı AWS Spot Instance'larda Kendi Sunucularımızda Barındırıyoruz
DeepSeek V4 Flash'ın AWS spot GPU'larda kendi kendine barındırılması: MXFP4 kuantizasyon, RTX PRO 6000, DSpark ve KV cache optimizasyonu detayları.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comNetflix GenRec: Özellik Mühendisliği Yerine LLM Tabanlı Sıralayıcı
Netflix'in GenRec'i, özellik mühendisliği yerine LLM tabanlı sıralama kullanarak daha az veriyle üretim performansına ulaşıyor.
Netflix, LLM Sunumunu vLLM ve Triton ile Tamamen İçeride Kuruyor
Netflix'in vLLM, Triton ve OpenAI uyumlu API ile kendi LLM sunum altyapısını nasıl kurduğuna dair mühendislik kararları ve üretim dersleri.
Moonshot AI, Kimi K3'ü Duyurdu: 2,8 Trilyon Parametreli Açık MoE Model
Moonshot AI'nın 2,8 trilyon parametreli açık MoE modeli Kimi K3, 1M bağlam penceresi ve yeni dikkat mimarileriyle tanıtıldı.
LLM Çıkarım Hızı: Darboğaz FLOPS Değil, Bellek Bant Genişliği
LLM çıkarımında gerçek darboğaz bellek bant genişliği. GPU, kuantizasyon ve batching seçimlerinin tok/s üzerindeki etkisini adım adım inceliyoruz.
Netflix Kendi LLM Sunum Altyapısını Nasıl Kurdu
Netflix'in vLLM, Triton ve OpenAI-uyumlu API ile kurduğu kendi LLM sunum altyapısının mimari kararları ve üretimde çıkan sorunlar.
DiffusionGemma: Google'ın Difüzyon Tabanlı LLM Rehberi
Google'ın DiffusionGemma geliştirici rehberi: çift yönlü dikkatli difüzyon tabanlı LLM, 4 kat hızlı üretim, vLLM desteği ve Sudoku ince ayar sonuçları.
vLLM: Yüksek Verimli LLM Çıktı Sistemi Bileşenleri
vLLM'nin yüksek verimli LLM çıktı sistemi bileşenleri ve özellikleri hakkında bilgi edinin.