» Etiket
inference
33 yayınCPU'da LLM: hız kazandıran kuantizasyon değil, metin formatı
Ücretsiz ARM CPU sunucusunda ölçüldü: prompt'u 'etiket: değer' formatına çevirmek LLM prefill süresini 6,5 kat kısalttı, kuantizasyon hileleri doğruluğu düşürdü.
Mozilla Raporu: Açık Kaynak AI Token'larda Önde, Üretimde Geride
Mozilla'nın 2026 raporu: açık kaynak AI modelleri token hacminde önde ama üretim dağıtımında kapalı modellerin gerisinde kalıyor.
Colibri: 744B parametreli GLM-5.2'yi 25GB RAM ile çalıştırma
Colibri, tek dosyalık C motoruyla GLM-5.2'nin 744B parametreli MoE modelini GPU'suz, 25GB RAM'lik makinede çalıştırıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comNVIDIA ModelExpress: P2P RDMA ile Model Başlatma Saniyelere İniyor
NVIDIA ModelExpress, P2P GPU-to-GPU RDMA transferleriyle LLM ağırlık yüklemesini hızlandırıyor; model başlatma süresi dakikalardan saniyelere iniyor.
2.8 Trilyon Parametreli Kimi K3, GPU'suz Mini PC'de Çalıştırıldı
Moonshot'un 2.8T parametreli açık ağırlıklı Kimi K3 modeli, disk üzerinden uzman akışı ile GPU'suz mini PC'de çalıştırıldı.
llama.cpp'ye Kayıpsız F32 Sıkıştırma: QFX32/QFX16 ile 2.05x Küçülme
llama.cpp'ye eklenen QFX32/QFX16 GGUF tipleri, F32 modelleri doğruluk kaybı olmadan 2.05x sıkıştırıyor; teknik detaylar ve kullanım.
Netflix, LLM Sunumunu vLLM ve Triton ile Tamamen İçeride Kuruyor
Netflix'in vLLM, Triton ve OpenAI uyumlu API ile kendi LLM sunum altyapısını nasıl kurduğuna dair mühendislik kararları ve üretim dersleri.
LLM Quantization Rehberi: GPTQ, AWQ ve GGUF Karşılaştırması
Büyük dil modellerini 4-bit'e sıkıştırarak VRAM ihtiyacını düşüren quantization tekniklerini; GPTQ, AWQ, GGUF ve bitsandbytes yöntemlerini karşılaştırmalı olarak inceliyoruz.
LLM Çıkarımının Enerji Maliyeti: LLaMA Üzerinde Ölçüm
Araştırmacılar, LLaMA modelinin farklı boyutlarını V100 ve A100 GPU'larda test ederek LLM çıkarımının enerji ve hesaplama maliyetini analiz etti.
OpenAI Ajan Döngüsünü Nasıl Hızlandırıyor: Harness, API, Çıkarım
OpenAI'nin harness, API ve çıkarım katmanlarındaki ajan döngüsü optimizasyon tekniklerini ve maliyet-verimlilik yaklaşımını inceliyoruz.