» Etiket
llm-inference
2 yayın«Ağustos 2026
Apple Silicon macOS VM'lerde Llama.cpp ile 11-16x Hızlı LLM Çıkarımı
Cua'nın Metal yetenek katmanı, macOS VM'lerde llama.cpp LLM çıkarımını 11-16x hızlandırıyor; kaynak kod ve benchmark verileri açık.
Prefill/Decode Ayrıştırması Kuyruk Ekleyerek Tail Latency'yi Kötüleştirebilir
Prefill/decode ayrıştırması yeni kuyruklar ve KV transfer maliyeti ekleyerek tail latency'yi kötüleştirebilir; kontrol döngüsü yaklaşımı gerekiyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com