« Tüm yayınlar

Quantprobe: 16 GB RAM'lik Eski PC'de 110B Parametreli LLM Çalıştırma

Quantprobe aracı, 2016 model bir PC'de 110B parametreli LLM'i 16GB RAM ve SATA SSD ile çalıştırmanın ölçümle kanıtlanmış yöntemini gösteriyor.

Quantprobe adlı açık kaynak araç, hangi katmanın hangi bellek katmanında (VRAM, RAM, SSD) durduğunun, toplam bellek miktarından daha belirleyici olduğunu ölçümlerle gösteriyor. 2016 model bir masaüstünde (GTX 1060 6GB, 16GB DDR4, SATA SSD) yürütülen testlerde GLM-4.5-Air 110B modeli SATA diskten akıtılarak 0,19 tok/s hızda çalıştırılmış; bu rakam ölçüm öncesi kayıt altına alınan 0,2-0,3 tok/s aralığına tam oturuyor. Aynı yaklaşımla Qwen3-30B-A3B melez yerleşimle 19,3 tok/s'a ulaşmış, tahmin de ölçümden önce 19 olarak belirlenmiş.

Proje dört 'yerleşim yasası' öne sürüyor: rotasyonun rank'e bağlı olması, eğitilmiş ağların her yerde yoğun olması (2-bit sıkıştırmanın pratik taban olduğu), kırılganlığın önceden tahmin edilemeyip yalnızca fonksiyonel bir prob ile ölçülebilmesi ve kademeli çözme hızının tek bir denklemle 7B'den 744B'ye kadar tahmin edilebilmesi. Aynı boyuttaki iki GGUF dosyası arasında sadece katman yerleşimi değiştirilerek 2,25 ppl fark elde edilmesi, iddiayı somut biçimde kanıtlıyor.

Mühendisler için önemi açık: llama.cpp üzerine kurulu quantprobe, donanım otomatik algılama olmasa da makine ön ayarları (16 preset) ile hız tahmini, en uygun sıkıştırma ve yerleşim planını tek komutla veriyor. Tüm iddialar betik ve log seviyesinde tekrarlanabilir şekilde paylaşılmış, başarısız denemeler (dinamik top-k, semantik sayfalama) de dürüstçe belgelenmiş.