« Tüm yayınlar

vLLM'de Transformers Arka Ucu Artık Yerli Hıza Ulaştı

Transformers'ın vLLM modelleme arka ucu artık native implementasyonlarla aynı hızda; torch.fx ve ast ile otomatik kernel füzyonu sağlıyor.

Hugging Face, transformers kütüphanesinin vLLM içindeki modelleme arka ucunu güncelledi; artık birçok LLM mimarisinde elle yazılmış vLLM implementasyonlarıyla aynı veya daha yüksek çıkış hızına ulaşıyor. Qwen3-4B (tek GPU), Qwen3-32B (tensor paralel) ve Qwen3-235B-A22B-FP8 MoE (8×H100 üzerinde veri+expert paralel) testlerinde, transformers arka ucu native vLLM implementasyonlarını yakaladı ya da geçti.

Bunun arkasındaki teknik: sistem artık torch.fx ile modelin hesaplama grafiğini statik olarak analiz ediyor, bilinen optimize edilebilir örüntüleri (MergedColumnParallelLinear, QKVParallelLinear, MoE'de expert paralelizasyonu için kullanılan kernel'ler gibi) tespit ediyor ve ast (soyut sözdizimi ağacı) kullanarak kaynak kodu çalışma zamanında yeniden yazıyor. Ortaya çıkan model hâlâ torch.compile ve CUDA Graphs ile tam uyumlu.

Model yazarları için bu, tek bir bayrakla (--model-impl transformers) tensor/pipeline/expert paralelliği gibi mevcut dağıtım seçenekleriyle uyumlu, ekstra kod yazmadan ultra hızlı vLLM çıkarımı anlamına geliyor. Aynı model kodu eğitim, değerlendirme ve RL rollout'larında da kullanılabiliyor. Sınırlama: doğrusal dikkat mimarileri şimdilik desteklenmiyor, Hub'da özel kodla tanımlanan modellerin de uyumlu çalışması beklenmiyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz