« Tüm yayınlar

Shoehorn: LLM'leri Mac'in VRAM'ına Tam Oturacak Şekilde Kuantalıyor

Shoehorn, BF16 GGUF LLM modellerini Mac'inizin kullanılabilir VRAM'ına tam oturacak şekilde tensor başına kuantalayan açık kaynaklı bir Rust CLI aracıdır.

Shoehorn, BF16 GGUF dil modellerini Q4_K_M veya Q5_K_S gibi hazır kalıplara güvenmek yerine, bir makinenin gerçekte kullanılabilir VRAM miktarına tam oturacak şekilde kuantalayan açık kaynaklı bir Rust CLI aracı. Apple Silicon'da Metal API üzerinden gerçek kullanılabilir GPU belleğini ölçüyor, KV cache ve compute buffer ihtiyaçlarını düşüyor, ardından kalan bütçeyi Lagrangian gevşetme ve açgözlü bir doldurma geçişiyle tensor başına karma hassasiyet ataması olarak çözüyor; bir önem matrisi (imatrix) rehberliğinde bütçenin %99,9'undan fazlasını kullanarak kaliteyi maksimize ediyor.

Araç, llama.cpp koduna hiç bağlanmadan ggml'in K-quant ve IQ formatlarındaki kuantalama hedeflerini sıfırdan yeniden uyguluyor; llama.cpp'yi yalnızca çıkarım motoru ve doğruluk referansı olarak kullanıyor. `fit` komutu indirme, imatrix üretimi, çözüm ve sunmayı tek adımda yaparken; `vram` kapasiteyi ölçüyor, `quantize`/`plan` manuel kontrol sağlıyor, `run` ise llama-server'ı başlatıyor. Çıktı, herhangi bir llama.cpp tabanlı araçla doğrudan yüklenebilen standart GGUF v3 formatında.

Mühendisler için bu araç, genel kuantalama katmanları ile gerçek donanım sınırları arasındaki boşluğu kapatıyor; hangi ön ayarın sığacağını tahmin etmek yerine sabit bir bellek bütçesinden maksimum model kalitesi elde etmeyi mümkün kılıyor.