» Etiket
gpu
91 yayınLLM Çıkarımının Enerji Maliyeti: LLaMA Üzerinde Ölçüm
Araştırmacılar, LLaMA modelinin farklı boyutlarını V100 ve A100 GPU'larda test ederek LLM çıkarımının enerji ve hesaplama maliyetini analiz etti.
NoGraphicsAPI: GPU İşaretçileriyle Descriptor Set'siz Vulkan Denemesi
NoGraphicsAPI, descriptor set ve pipeline layout'ları GPU işaretçileri ve uygulama sahipli heap'lerle değiştiren deneysel Vulkan 1.4 arka ucudur.
NVIDIA Exemplar Cloud: AI Kümelerinde %8-12 Performans Açığı Nasıl Kapanır?
NVIDIA'nın H100 ve GB200 NVL72 kümelerinde %8-12'lik AI eğitim performans açıklarını perf, Nsight Systems, SMMU ve NUMA ayarlarıyla nasıl çözdüğü.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comSkyPilot ve Hugging Face'ten sıfır egress'li çoklu bulut AI depolama
SkyPilot ve Hugging Face, modelleri Hub'da tutup GPU'ları herhangi bir bulutta egress ücreti olmadan çalıştırmayı sağlayan yeni bir depolama entegrasyonu sundu.
Speculative Decoding: Yerel LLM'lerde Kullanılmayan Ücretsiz Hız Kazancı
Speculative decoding, yerel LLM çıktısını değiştirmeden 1.5-2.5 kat hızlandırıyor; 2026'da MTP ile modellere doğrudan entegre edildi.
ZML/LLMD Alfa: CUDA'dan Apple Metal'e Tek LLM Sunucusu
ZML/LLMD alfa; LLaMa, Gemma, Qwen ve Mistral modellerini NVIDIA, AMD, TPU, Intel ve Apple Metal'de tek sunucuyla çalıştırıyor, DFlash ile hızlanma sağlıyor.
NVIDIA Dynamo ile LLM Çıktı Kapasitesini Hızla Yenileyin
NVIDIA Dynamo'daki gölge motoru kurtarma, LLM süreçlerinin hızlı bir şekilde yeniden başlatılmasını sağlıyor.
CUDA C++, Rust ve Triton: Düzensizlik Maliyetleri
CUDA C++, Rust ve Triton ile GPU dilleri karşılaştırması. Düzensiz iş yüklerinde performans farkları incelendi.
CUDA'dan MLX'e: K-Search ile Apple Silicon'a Geçiş
K-Search, CUDA optimizasyonunu Apple Silicon için MLX'e dönüştürüyor. GPU çekirdekleri için önemli bir gelişme.
XY: Hızlı ve Özelleştirilebilir GPU Destekli Grafik Kütüphanesi
XY, GPU hızlandırmalı hızlı ve etkileşimli bir Python grafik kütüphanesidir.