» Etiket
cuda
16 yayınLLM ile Üretilen GPU Çekirdeklerinde Gizli Hatalar Bulundu
12 kapılı yeni bir doğrulayıcı, LLM üretimi GPU çekirdeklerinin %39,5'inin standart testleri geçmesine rağmen bozuk olduğunu ortaya koyuyor.
NVIDIA CUDA Rust'ı Duyurdu: GPU Çekirdekleri Artık Native Rust'ta Yazılabiliyor
NVIDIA'nın CUDA Rust'ı, GPU kernellerini native Rust'ta yazmak için iki yol sunuyor: SIMT tabanlı cuda-oxide ve Tile tabanlı cutile-rs.
CUDA 13.3, GPU'lara Taşımasız Çarpma İçin Donanım Desteği Getiriyor
CUDA 13.3'teki yeni clmad PTX komutu, GPU'larda taşımasız çarpmayı hızlandırarak GHASH ve sum-check protokolünde 18 kata varan performans artışı sağlıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comTesla P100'ün llama.cpp'deki yıllık FP16 hatası 3 satırla çözüldü
llama.cpp'deki 3 satırlık CUDA yaması, Tesla P100'ün yıllardır süren gizli FP16 hassasiyet hatasını performans kaybı olmadan gideriyor.
PXQ: ik_llama.cpp forku eski Tesla/Pascal GPU'larda +88% prefill kazandırıyor
ik_llama.cpp forku pxq_llama, yeni PXQ quant formatıyla Tesla P100/V100 ve 1080 Ti'de prefill ve decode hızını ciddi oranda artırıyor.
Flash-MSA: Seyrek Dikkatle Milyon Token Eğitimini Hızlandırma
Flash-MSA, Hopper/Blackwell GPU'larda MiniMax Sparse Attention için açık kaynak CuTeDSL eğitim çekirdekleri sunuyor; geri yayılım doğrusal zamanda çalışıyor.
CUDA Toolkit 13.4: Windows on Arm Desteği, Rubin Önizlemesi ve MPS V3
CUDA Toolkit 13.4, Windows on Arm desteği, Rubin GPU önizlemesi, paylaşılan GPU'lar için MPS V3 ve genişletilmiş CUDA Python API'leri getiriyor.
Nunchaku'nun 4-bit Difüzyon Çıkarımı Artık Diffusers'ta
Nunchaku'nun 4-bit SVDQuant kuantizasyonu artık Diffusers'a native entegre; ayrı motor veya derleme gerekmeden from_pretrained ile yüklenebiliyor.
CAKE: Yapay Zeka Ajanlarına Özel Derleyici Tasarımıyla Hızlı GPU Çekirdekleri
CAKE, yapay zeka ajanlarını donanıma özgü derleyici IR'ı ile birleştirerek B200'de ayarlanmış GPU çekirdek performansını geçiyor.
Bw24: RTX 50 Serisi Blackwell için Sıfırdan Rust+CUDA Çıkarım Motoru
Bw24, RTX 50 serisi Blackwell GPU'lar için sıfırdan yazılmış Rust+CUDA çıkarım motoru; spekülatif kod çözmede llama.cpp'ye karşı 2,3 kata varan hız sunuyor.