» Etiket
inference
9 yayınColibri: 744B parametreli GLM-5.2'yi 25GB RAM ile çalıştırma
Colibri, tek dosyalık C motoruyla GLM-5.2'nin 744B parametreli MoE modelini GPU'suz, 25GB RAM'lik makinede çalıştırıyor.
LLM Quantization Rehberi: GPTQ, AWQ ve GGUF Karşılaştırması
Büyük dil modellerini 4-bit'e sıkıştırarak VRAM ihtiyacını düşüren quantization tekniklerini; GPTQ, AWQ, GGUF ve bitsandbytes yöntemlerini karşılaştırmalı olarak inceliyoruz.
LLM Çıkarımının Enerji Maliyeti: LLaMA Üzerinde Ölçüm
Araştırmacılar, LLaMA modelinin farklı boyutlarını V100 ve A100 GPU'larda test ederek LLM çıkarımının enerji ve hesaplama maliyetini analiz etti.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comBun'ın Rust Geçişi AI Altyapısında C#'ın Yükselişini Gösteriyor
Bun'ın Zig'den Rust'a geçişi, üretim AI altyapısında derlenmiş dillerin değerini ortaya koyuyor. TensorSharp benchmark sonuçları C#'ın bu katmandaki potansiyelini gösteriyor.
ZML/LLMD Alfa: CUDA'dan Apple Metal'e Tek LLM Sunucusu
ZML/LLMD alfa; LLaMa, Gemma, Qwen ve Mistral modellerini NVIDIA, AMD, TPU, Intel ve Apple Metal'de tek sunucuyla çalıştırıyor, DFlash ile hızlanma sağlıyor.
Birleşik Bellek: Mini PC'ler Dev GPU'ların Yapamadığını Nasıl Yapar
AMD Strix Halo gibi birleşik bellekli mini PC'ler, 70B parametreli modelleri RTX 5090'ın bile sığdıramadığı şekilde çalıştırabiliyor. Kapasite ve bant genişliği dengesini inceliyoruz.
OpenAI ve Broadcom'dan LLM'e özel çıkarım çipi Jalapeño
OpenAI ve Broadcom, dokuz ayda geliştirilen ilk özel LLM çıkarım çipi Jalapeño'yu tanıttı; gigawatt ölçekli veri merkezlerinde 2026'da devreye girecek.
FTPO ile Akıl Yürütme Modellerinde Sonsuz Döngü Sorunu Çözülüyor
Antidoom yöntemi, FTPO tekniğiyle akıl yürütme modellerindeki tekrarlayan döngü hatasını hedefli biçimde düzeltiyor; LFM2.5 ve Qwen3.5 modellerinde döngü oranı belirgin şekilde düştü.
AI Çıkarım Mühendisliği: Prefill ve Decode Ayrımının Anatomisi
LLM çıkarımının prefill ve decode aşamaları, GPU darboğazları ve batching, prefix caching gibi optimizasyon teknikleri mühendislik perspektifiyle ele alınıyor.