» Etiket
quantization
8 yayınTesla P100'ün llama.cpp'deki yıllık FP16 hatası 3 satırla çözüldü
llama.cpp'deki 3 satırlık CUDA yaması, Tesla P100'ün yıllardır süren gizli FP16 hassasiyet hatasını performans kaybı olmadan gideriyor.
Intel Arc B70 32GB, Vulkan ile Qwen3.6-35B-A3B'de 130 t/s
Intel Arc Pro B70 32GB'de llama.cpp Vulkan ile Qwen3.6-35B-A3B testi: 4-bit'te 130 t/s (262k bağlam), 8-bit hibrit yüklemede 69 t/s.
GLM 5.2 Yerel Kurulum Rehberi: Kuantizasyon ve Donanım Seçimi
753B parametreli MoE modeli GLM 5.2'yi yerelde çalıştırmak için Unsloth dinamik kuantizasyonları, RAM gereksinimleri ve donanım seçenekleri karşılaştırıldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comProbelock: LLM araç çağırma için kilit dosyası
Probelock, LLM'in araç çağırma yeteneklerini deterministik testlerle ölçüp model/kuantizasyon değişince regresyonda CI'ı durduran bir kilit dosyasıdır.
LLM Quantization Rehberi: GPTQ, AWQ ve GGUF Karşılaştırması
Büyük dil modellerini 4-bit'e sıkıştırarak VRAM ihtiyacını düşüren quantization tekniklerini; GPTQ, AWQ, GGUF ve bitsandbytes yöntemlerini karşılaştırmalı olarak inceliyoruz.
antirez'in DS4 motoru: DeepSeek V4 Flash MacBook Pro'da yerelde zirve
antirez'in DS4 motoruyla çalışan DeepSeek V4 Flash, MacBook Pro'da zor kodlama görevlerini tek seferde çözüyor, diğer yerel modelleri geride bırakıyor.
Qwen3.6-27B'de KV Önbellek Kuantizasyonunun KLD Etkisi
Bartowski'nin Qwen3.6-27B GGUF modelinde Q8, Q6 ve Q5 seviyelerinde KV önbellek kuantizasyonunun KL diverjansına etkisi ölçüldü; (q8_0,q8_0) neredeyse bedava kalite koruyor.
MiMo v2.5 ile Hibrid SWA Verimliliği ve İyileştirmeleri
MiMo v2.5, Hibrid SWA ile model verimliliğini artırarak %60 boyut azaltma sağlıyor.