» Etiket
llm-inference
3 yayınApple Silicon macOS VM'lerde Llama.cpp ile 11-16x Hızlı LLM Çıkarımı
Cua'nın Metal yetenek katmanı, macOS VM'lerde llama.cpp LLM çıkarımını 11-16x hızlandırıyor; kaynak kod ve benchmark verileri açık.
Prefill/Decode Ayrıştırması Kuyruk Ekleyerek Tail Latency'yi Kötüleştirebilir
Prefill/decode ayrıştırması yeni kuyruklar ve KV transfer maliyeti ekleyerek tail latency'yi kötüleştirebilir; kontrol döngüsü yaklaşımı gerekiyor.
Flint: LLM Çıkarımı için Yüksek Bant Genişlikli Flash'ı Verimli Kullanma
FLINT, LLM çıkarımında bellek kapasitesi darboğazını gidermek için yüksek bant genişlikli flash (HBF) bellek katmanını verimli entegre eden donanım mimarisi sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com