» Etiket
llama.cpp
12 yayınCPU'da LLM: hız kazandıran kuantizasyon değil, metin formatı
Ücretsiz ARM CPU sunucusunda ölçüldü: prompt'u 'etiket: değer' formatına çevirmek LLM prefill süresini 6,5 kat kısalttı, kuantizasyon hileleri doğruluğu düşürdü.
Android'de llama.cpp KV Durumuyla TTFT 9,9x Azaldı
EdgeSync-LLM, llama.cpp KV API'leriyle tekrar prompt işlemeden Android'de TTFT'yi 9,9x düşürdü; sahte 8,8x hızlanmayı da tespit edip eledi.
Tesla P100'ün llama.cpp'deki yıllık FP16 hatası 3 satırla çözüldü
llama.cpp'deki 3 satırlık CUDA yaması, Tesla P100'ün yıllardır süren gizli FP16 hassasiyet hatasını performans kaybı olmadan gideriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comllama.cpp'ye Kayıpsız F32 Sıkıştırma: QFX32/QFX16 ile 2.05x Küçülme
llama.cpp'ye eklenen QFX32/QFX16 GGUF tipleri, F32 modelleri doğruluk kaybı olmadan 2.05x sıkıştırıyor; teknik detaylar ve kullanım.
Quantprobe: 16 GB RAM'lik Eski PC'de 110B Parametreli LLM Çalıştırma
Quantprobe aracı, 2016 model bir PC'de 110B parametreli LLM'i 16GB RAM ve SATA SSD ile çalıştırmanın ölçümle kanıtlanmış yöntemini gösteriyor.
120B parametreli LLM, expert akışıyla Android telefonda çalışıyor
Açık kaynaklı bir Android uygulaması, MoE uzmanlarını flash depodan akıtarak 120B parametreli LLM'i telefon CPU'sunda çalıştırıyor, 30B modeller kullanılabilir hızda.
Yerel Model Showdown 9. Tur: Qwen 3.6, Nemotron ve Qwythos Kod Testinde
RTX 5090'da llama.cpp ile beş LLM'in gerçek kodlama görevinde karşılaştırıldığı Local Model Showdown 9. tur analizi ve bulguları.
Intel Arc B70 32GB, Vulkan ile Qwen3.6-35B-A3B'de 130 t/s
Intel Arc Pro B70 32GB'de llama.cpp Vulkan ile Qwen3.6-35B-A3B testi: 4-bit'te 130 t/s (262k bağlam), 8-bit hibrit yüklemede 69 t/s.
Speculative Decoding: Yerel LLM'lerde Kullanılmayan Ücretsiz Hız Kazancı
Speculative decoding, yerel LLM çıktısını değiştirmeden 1.5-2.5 kat hızlandırıyor; 2026'da MTP ile modellere doğrudan entegre edildi.
NilaMind: Cihaz Üzerinde Çalışan 1.5B Parametreli Ruh Sağlığı LLM'i
NilaMind, Qwen2.5-1.5B modelini llama.cpp ile Android'de tamamen çevrimdışı çalıştırıyor; kriz güvenliği model dışı deterministik bir katmanda.