» Etiket
quantization
23 yayınQuantprobe: 16 GB RAM'lik Eski PC'de 110B Parametreli LLM Çalıştırma
Quantprobe aracı, 2016 model bir PC'de 110B parametreli LLM'i 16GB RAM ve SATA SSD ile çalıştırmanın ölçümle kanıtlanmış yöntemini gösteriyor.
120B parametreli LLM, expert akışıyla Android telefonda çalışıyor
Açık kaynaklı bir Android uygulaması, MoE uzmanlarını flash depodan akıtarak 120B parametreli LLM'i telefon CPU'sunda çalıştırıyor, 30B modeller kullanılabilir hızda.
Qwisp: MoE uzmanlarını flash'ten akıtan motor, Qwen3.6-35B-A3B'yi 8GB Mac'te çalıştırıyor
Qwisp, Qwen3.6-35B-A3B MoE modelini flash'ten uzman akışıyla 8GB Mac'lerde çalıştıran açık kaynaklı, bit-tam kayıpsız bir yerel çıkarım motoru.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comIntel Arc B70 32GB, Vulkan ile Qwen3.6-35B-A3B'de 130 t/s
Intel Arc Pro B70 32GB'de llama.cpp Vulkan ile Qwen3.6-35B-A3B testi: 4-bit'te 130 t/s (262k bağlam), 8-bit hibrit yüklemede 69 t/s.
GLM 5.2 Yerel Kurulum Rehberi: Kuantizasyon ve Donanım Seçimi
753B parametreli MoE modeli GLM 5.2'yi yerelde çalıştırmak için Unsloth dinamik kuantizasyonları, RAM gereksinimleri ve donanım seçenekleri karşılaştırıldı.
Probelock: LLM araç çağırma için kilit dosyası
Probelock, LLM'in araç çağırma yeteneklerini deterministik testlerle ölçüp model/kuantizasyon değişince regresyonda CI'ı durduran bir kilit dosyasıdır.
LLM Çıkarım Hızı: Darboğaz FLOPS Değil, Bellek Bant Genişliği
LLM çıkarımında gerçek darboğaz bellek bant genişliği. GPU, kuantizasyon ve batching seçimlerinin tok/s üzerindeki etkisini adım adım inceliyoruz.
LLM Quantization Rehberi: GPTQ, AWQ ve GGUF Karşılaştırması
Büyük dil modellerini 4-bit'e sıkıştırarak VRAM ihtiyacını düşüren quantization tekniklerini; GPTQ, AWQ, GGUF ve bitsandbytes yöntemlerini karşılaştırmalı olarak inceliyoruz.
antirez'in DS4 motoru: DeepSeek V4 Flash MacBook Pro'da yerelde zirve
antirez'in DS4 motoruyla çalışan DeepSeek V4 Flash, MacBook Pro'da zor kodlama görevlerini tek seferde çözüyor, diğer yerel modelleri geride bırakıyor.
x86'nın yeni matris hızlandırıcısı ACE, Arm SME'ye rakip oluyor
Intel'in ACE hızlandırıcısı AMX'i dış çarpım mimarisine taşıyor; Arm SME2 ile karşılaştırmalı teknik analiz.