» Etiket
vllm
11 yayınvLLM'de Transformers Arka Ucu Artık Yerli Hıza Ulaştı
Transformers'ın vLLM modelleme arka ucu artık native implementasyonlarla aynı hızda; torch.fx ve ast ile otomatik kernel füzyonu sağlıyor.
DeepSeek V4 Flash'ı AWS Spot Instance'larda Kendi Sunucularımızda Barındırıyoruz
DeepSeek V4 Flash'ın AWS spot GPU'larda kendi kendine barındırılması: MXFP4 kuantizasyon, RTX PRO 6000, DSpark ve KV cache optimizasyonu detayları.
Netflix GenRec: Özellik Mühendisliği Yerine LLM Tabanlı Sıralayıcı
Netflix'in GenRec'i, özellik mühendisliği yerine LLM tabanlı sıralama kullanarak daha az veriyle üretim performansına ulaşıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comNetflix, LLM Sunumunu vLLM ve Triton ile Tamamen İçeride Kuruyor
Netflix'in vLLM, Triton ve OpenAI uyumlu API ile kendi LLM sunum altyapısını nasıl kurduğuna dair mühendislik kararları ve üretim dersleri.
Moonshot AI, Kimi K3'ü Duyurdu: 2,8 Trilyon Parametreli Açık MoE Model
Moonshot AI'nın 2,8 trilyon parametreli açık MoE modeli Kimi K3, 1M bağlam penceresi ve yeni dikkat mimarileriyle tanıtıldı.
LLM Çıkarım Hızı: Darboğaz FLOPS Değil, Bellek Bant Genişliği
LLM çıkarımında gerçek darboğaz bellek bant genişliği. GPU, kuantizasyon ve batching seçimlerinin tok/s üzerindeki etkisini adım adım inceliyoruz.
Netflix Kendi LLM Sunum Altyapısını Nasıl Kurdu
Netflix'in vLLM, Triton ve OpenAI-uyumlu API ile kurduğu kendi LLM sunum altyapısının mimari kararları ve üretimde çıkan sorunlar.
DiffusionGemma: Google'ın Difüzyon Tabanlı LLM Rehberi
Google'ın DiffusionGemma geliştirici rehberi: çift yönlü dikkatli difüzyon tabanlı LLM, 4 kat hızlı üretim, vLLM desteği ve Sudoku ince ayar sonuçları.
Llamafile ve vLLM: Yerel Model Servisi için İki Yöntem
Llamafile ve vLLM ile yerel model sunumunu karşılaştırın; her birinin avantajları ve dezavantajları hakkında bilgi edinin.
Trendyol'un ajanı LLM sunum ayarlarını 4 kat hızlandırdı
Trendyol Tech, autooptimizer adlı bir AI ajanıyla vLLM sunum ayarlarını insan müdahalesi olmadan optimize ederek Gemma 4 26B'de 4 kat performans artışı elde etti.