» Etiket
gpu
64 yayınMetin Difüzyonu mu Otoregresif Model mi: GPU Kullanımının Gerçek Hesabı
Difüzyon tabanlı dil modelleri ile otoregresif modellerin GPU kullanım ekonomisi karşılaştırması: gecikme, batching ve gerçek token maliyeti.
Meta, GPU Duraksamalarını Azaltmak için BLOB Depolamayı Yeniden Yapılandırdı
Meta, GPU duraksamalarını ortadan kaldırmak için BLOB depolama mimarisini birleşik metadata ve doğrudan istemci akışıyla yeniden tasarladı.
Bw24: RTX 50 Serisi Blackwell için Sıfırdan Rust+CUDA Çıkarım Motoru
Bw24, RTX 50 serisi Blackwell GPU'lar için sıfırdan yazılmış Rust+CUDA çıkarım motoru; spekülatif kod çözmede llama.cpp'ye karşı 2,3 kata varan hız sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comGPU Mikroarşitektüründe AI Performansını Kısan Donanım Anahtarları
GPU mikroarşitektüründe AI performansını dinamik sınırlayan dört donanım anahtarı: düşük maliyetli, hızlı stabilize olan güvenlik mekanizması.
LLM Çıkarım Hızı: Darboğaz FLOPS Değil, Bellek Bant Genişliği
LLM çıkarımında gerçek darboğaz bellek bant genişliği. GPU, kuantizasyon ve batching seçimlerinin tok/s üzerindeki etkisini adım adım inceliyoruz.
LLM Çıkarımının Enerji Maliyeti: LLaMA Üzerinde Ölçüm
Araştırmacılar, LLaMA modelinin farklı boyutlarını V100 ve A100 GPU'larda test ederek LLM çıkarımının enerji ve hesaplama maliyetini analiz etti.
NVIDIA Exemplar Cloud: AI Kümelerinde %8-12 Performans Açığı Nasıl Kapanır?
NVIDIA'nın H100 ve GB200 NVL72 kümelerinde %8-12'lik AI eğitim performans açıklarını perf, Nsight Systems, SMMU ve NUMA ayarlarıyla nasıl çözdüğü.
SkyPilot ve Hugging Face'ten sıfır egress'li çoklu bulut AI depolama
SkyPilot ve Hugging Face, modelleri Hub'da tutup GPU'ları herhangi bir bulutta egress ücreti olmadan çalıştırmayı sağlayan yeni bir depolama entegrasyonu sundu.
Speculative Decoding: Yerel LLM'lerde Kullanılmayan Ücretsiz Hız Kazancı
Speculative decoding, yerel LLM çıktısını değiştirmeden 1.5-2.5 kat hızlandırıyor; 2026'da MTP ile modellere doğrudan entegre edildi.
ZML/LLMD Alfa: CUDA'dan Apple Metal'e Tek LLM Sunucusu
ZML/LLMD alfa; LLaMa, Gemma, Qwen ve Mistral modellerini NVIDIA, AMD, TPU, Intel ve Apple Metal'de tek sunucuyla çalıştırıyor, DFlash ile hızlanma sağlıyor.