» Etiket
gguf
4 yayınllama.cpp'ye Kayıpsız F32 Sıkıştırma: QFX32/QFX16 ile 2.05x Küçülme
llama.cpp'ye eklenen QFX32/QFX16 GGUF tipleri, F32 modelleri doğruluk kaybı olmadan 2.05x sıkıştırıyor; teknik detaylar ve kullanım.
LLM Quantization Rehberi: GPTQ, AWQ ve GGUF Karşılaştırması
Büyük dil modellerini 4-bit'e sıkıştırarak VRAM ihtiyacını düşüren quantization tekniklerini; GPTQ, AWQ, GGUF ve bitsandbytes yöntemlerini karşılaştırmalı olarak inceliyoruz.
Qwen3.6-27B'de KV Önbellek Kuantizasyonunun KLD Etkisi
Bartowski'nin Qwen3.6-27B GGUF modelinde Q8, Q6 ve Q5 seviyelerinde KV önbellek kuantizasyonunun KL diverjansına etkisi ölçüldü; (q8_0,q8_0) neredeyse bedava kalite koruyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comCamelid: Rust ile Yerel AI Çıkarımı için Çoklu Arayüzler
Camelid, Rust ile yerel AI çıkarımı yapmanızı sağlayan çoklu arayüzler sunar. GGUF modelleri ile çalışır.