Speculative Decoding: Yerel LLM'lerde Kullanılmayan Ücretsiz Hız Kazancı
Speculative decoding, yerel LLM çıktısını değiştirmeden 1.5-2.5 kat hızlandırıyor; 2026'da MTP ile modellere doğrudan entegre edildi.
LM Studio ve llama.cpp'de bulunan speculative decoding özelliği, bir modelin çıktısını hiç değiştirmeden üretimi 1.5-2.5 kat hızlandırabiliyor. Küçük bir taslak (draft) model sonraki birkaç tokeni tahmin eder, büyük model bu tahminleri tek bir paralel geçişte doğrular; kabul edilen her tahmin anında, reddedilenler yerine büyük modelin kendi seçimiyle değiştirilir. Reddedilme örneklemesi matematiksel olarak büyük modelin dağılımını birebir koruduğu için sonuç kayıpsızdır, sadece taslak model için ekstra VRAM ve hesaplama gerekir. Bu da tekniği tam olarak GPU'nun boşta beklediği tek kullanıcılı yerel çıkarım senaryolarında güçlü kılar.
2026'da bu teknik niş bir kullanıcı hilesinden çıkıp model üreticilerinin doğrudan sunduğu bir özelliğe dönüştü: çoklu token tahmini (MTP). Qwen 3.6 ve Gemma 4 gibi modeller artık kendi eşleşmiş taslak katmanlarıyla geliyor, llama.cpp ve Ollama bunları doğrudan destekliyor, kullanıcının uyumlu bir taslak model aramasına gerek kalmıyor. Kabul oranı ne kadar yüksekse (yüzde 70-80 civarı ikiye katlama demek), kazanç o kadar büyük; taslak modelin aynı aileden ve ana modelin yaklaşık onda biri boyutunda olması gerekiyor.
Ancak her senaryoda işe yaramıyor: hızlı Mixture-of-Experts modellerinde uzman yönlendirmesi yüzünden speculative decoding modeli yavaşlatabiliyor, yaratıcı yazımda kabul oranları çöküyor, ve taslak modelin VRAM'i ana modeli daha düşük bir kuantizasyona itebiliyor. Mühendisler için asıl mesele: bu ayarı açmadan önce kabul oranını ve bellek bütçesini kontrol etmek, çünkü yanlış eşleştirme kazancı tersine çevirebiliyor.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz