« Tüm yayınlar

Apple Silicon macOS VM'lerde Llama.cpp ile 11-16x Hızlı LLM Çıkarımı

Cua'nın Metal yetenek katmanı, macOS VM'lerde llama.cpp LLM çıkarımını 11-16x hızlandırıyor; kaynak kod ve benchmark verileri açık.

Cua ekibi, Apple'ın Virtualization.framework üzerine kurulu macOS sanal makinelerinde LLM çıkarım performansını büyük ölçüde artıran küçük bir araştırma bileşeni yayınladı. Sorun, misafir macOS VM'lerin GPU'yu eski bir Apple ailesi ve 32 KB threadgroup belleğiyle raporlamasıydı; bu da Metal uygulamalarının SIMD-group matrix, SIMD-group reduction ve bfloat16 gibi hızlı yolları kullanamamasına, dolayısıyla llama.cpp'nin daha yavaş bir yol seçmesine neden oluyordu — fiziksel GPU bunu destekleyebilse bile.

Çözüm, tek bir misafir sürecine kapsamlanan bir Metal yetenek katmanı (shim): seçilen Metal sorgularını yakalayıp Apple GPU ailesini 9'a (1009), maksimum threadgroup belleğini de 64 KB'a çıkarıyor. Bu, gerçek bir GPU passthrough değil; fiziksel donanım ataması veya çekirdek değişikliği yok, sadece raporlanan yetenek değerleri değişiyor.

M1 Ultra üzerinde TinyLlama 1.1B ile prompt işleme 11.08x, token üretimi 16.36x hızlandı; bare-metal performansının sırasıyla %98.25 ve %72.06'sına ulaşıldı. Gemma 4 12B QAT Q4_0 modelinde ise prompt işleme 7.20x, token üretimi 14.54x hızlandı ve bare-metal'in %99.59 ve %94.82'sine erişildi. MLX-LM zaten stok VM'de hızlı çalıştığı için sonuçlar değişmedi.

Çalışma, kaynak kodu, build betikleri, yetenek probu ve ham benchmark kayıtlarıyla birlikte Lume/Cua'nın izin verici lisansı altında yayınlandı; bu da Apple Silicon çipleri, macOS sürümleri ve Metal iş yükleri arasında sonuçların tekrarlanabilir şekilde doğrulanmasını sağlıyor.