Bw24: RTX 50 Serisi Blackwell için Sıfırdan Rust+CUDA Çıkarım Motoru
Bw24, RTX 50 serisi Blackwell GPU'lar için sıfırdan yazılmış Rust+CUDA çıkarım motoru; spekülatif kod çözmede llama.cpp'ye karşı 2,3 kata varan hız sunuyor.
Bw24, Rust ve CUDA ile sıfırdan yazılmış bir LLM çıkarım motoru; tek hedefi RTX 50 serisi Blackwell GPU'lar (sm_120a), ilk sürümde 24 GB VRAM'li bir RTX 5090 Laptop. Proje ggml veya llama.cpp gibi mevcut çatıları kullanmıyor; her çekirdek ölçülmüş donanım sınırlarına göre elle ayarlanmış ve aynı makinede doğrudan llama.cpp'ye karşı kıyaslanmış.
Öne çıkan özellik, MTP (çoklu-token tahmini) spekülatif kod çözme: desteklenen Qwen modellerinde llama.cpp'nin en iyi spekülatif yapılandırmasına göre 2,3 kata varan verim artışı sağlıyor, ancak her spekülatif çıktı düz kod çözmeyle token bazında birebir eşleşecek şekilde kilitleniyor — yani hız kazancı modelin ürettiği çıktıyı asla değiştirmiyor. Proje kırpılmış taslak başlıklar, OpenAI uyumlu bir sunucu ve Qwen3.5/3.6 ile çeşitli boyutlardaki Gemma-4 dahil altı model desteği sunuyor; ayrıca ağırlıkları VRAM, RAM ve NVMe arasında dağıtan uzman-offload şemaları (Hy3, MiniMax-M3) için erken destek de mevcut.
Mühendisler için bw24, tek hedefe odaklı ve doğruluk-önceliklikli çekirdek mühendisliğinin belirli bir GPU neslinden neler çıkarabileceğini gösteriyor: FP8 KV önbelleği, doluluk oranına göre ayarlanmış dikkat blokları ve FR-Spec taslak kırpma (150 MB'tan 18 MB'a, kabul oranında neredeyse hiç kayıp olmadan) doğruluk garantilerini bozmadan ölçülebilir kazanımlar sağlıyor. Bu, genel amaçlı motorlara göre dar kapsamlı ama titizlikle kıyaslanmış bir alternatif — RTX 50 serisi donanımda tek kullanıcı/tek model sunumu için uygun, vLLM veya SGLang gibi çoklu-GPU/toplu sunum yığınlarının yerini tutmuyor.