RDNA3'te Tek Model İçin Sıfırdan Vulkan Motoru: llama.cpp'den 1.44x Hızlı
RDNA3 GPU'larda tek model için sıfırdan yazılmış Vulkan motoru, llama.cpp'den 1.44x hızlı ve token bazında birebir aynı çıktı üretiyor.
Bir geliştirici, AMD RDNA3 GPU'ları için Qwen3.6-35B-A3B modeline özel olarak sıfırdan yazılmış bir Vulkan çıkarım motoru geliştirdi. llama.cpp'yi çatallamak yerine, GGUF'taki her ağırlık formatı (Q8_0, Q6_K, IQ4_XS, IQ3_XXS, F16) için elle yazılmış GEMV/GEMM çekirdekleri kullanılıyor ve VRAM bant genişliğinin %90-97'sine ulaşılıyor. Modelin hibrit mimarisi — gated-DeltaNet tekrarlaması, 256 uzmanlı MoE katmanı, GQA dikkat mekanizması ve GPU üzerinde çalışan argmax örnekleme — tek bir komut arabelleği gönderimine kaynaştırılmış.
Aynı donanım ve aynı kuantize GGUF dosyası üzerinde motor, RX 7900 XTX'te saniyede 190.7 token üretirken (llama.cpp: 132.3 tok/s, 1.44x fark), RX 7900 XT'de 147.1 tok/s'ye ulaşıyor (llama.cpp: 109.7 tok/s, 1.34x). Karşılaştırma, yazarın önceki ölçümde üç ay eski bir llama.cpp sürümü kullandığını fark edip aynı günün derlemesiyle yeniden test etmesinin ardından yapıldı. Açgözlü çıktı llama.cpp ile token bazında birebir aynı; toplu işlem yolları da bit-düzeyinde özdeş veya argmax kararlılığı açısından doğrulanmış.
Proje, Anthropic Messages API'sini konuşan güvenli Rust (axum) tabanlı bir sunucu olarak sunuluyor; bu sayede Claude Code gibi araçlar doğrudan bağlanabiliyor. Önek önbelleği geri yükleme süresi 341 ms'den 0.3 ms'ye düşürülmüş. Bedeli ise özelleşme: motor yalnızca RDNA3 GPU'larda ve yalnızca bu tek model mimarisinde çalışıyor — modele özel elle ayarlanmış çekirdek ve zamanlamanın genel amaçlı çalışma zamanlarına kıyasla ne kadar performans bıraktığını gösteriyor.