» Etiket
cuda
14 yayınLLM ile Üretilen GPU Çekirdeklerinde Gizli Hatalar Bulundu
12 kapılı yeni bir doğrulayıcı, LLM üretimi GPU çekirdeklerinin %39,5'inin standart testleri geçmesine rağmen bozuk olduğunu ortaya koyuyor.
CUDA 13.3, GPU'lara Taşımasız Çarpma İçin Donanım Desteği Getiriyor
CUDA 13.3'teki yeni clmad PTX komutu, GPU'larda taşımasız çarpmayı hızlandırarak GHASH ve sum-check protokolünde 18 kata varan performans artışı sağlıyor.
Tesla P100'ün llama.cpp'deki yıllık FP16 hatası 3 satırla çözüldü
llama.cpp'deki 3 satırlık CUDA yaması, Tesla P100'ün yıllardır süren gizli FP16 hassasiyet hatasını performans kaybı olmadan gideriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comPXQ: ik_llama.cpp forku eski Tesla/Pascal GPU'larda +88% prefill kazandırıyor
ik_llama.cpp forku pxq_llama, yeni PXQ quant formatıyla Tesla P100/V100 ve 1080 Ti'de prefill ve decode hızını ciddi oranda artırıyor.
Flash-MSA: Seyrek Dikkatle Milyon Token Eğitimini Hızlandırma
Flash-MSA, Hopper/Blackwell GPU'larda MiniMax Sparse Attention için açık kaynak CuTeDSL eğitim çekirdekleri sunuyor; geri yayılım doğrusal zamanda çalışıyor.
Nunchaku'nun 4-bit Difüzyon Çıkarımı Artık Diffusers'ta
Nunchaku'nun 4-bit SVDQuant kuantizasyonu artık Diffusers'a native entegre; ayrı motor veya derleme gerekmeden from_pretrained ile yüklenebiliyor.
CAKE: Yapay Zeka Ajanlarına Özel Derleyici Tasarımıyla Hızlı GPU Çekirdekleri
CAKE, yapay zeka ajanlarını donanıma özgü derleyici IR'ı ile birleştirerek B200'de ayarlanmış GPU çekirdek performansını geçiyor.
Bw24: RTX 50 Serisi Blackwell için Sıfırdan Rust+CUDA Çıkarım Motoru
Bw24, RTX 50 serisi Blackwell GPU'lar için sıfırdan yazılmış Rust+CUDA çıkarım motoru; spekülatif kod çözmede llama.cpp'ye karşı 2,3 kata varan hız sunuyor.
CUDA C++, Rust ve Triton: Düzensizlik Maliyetleri
CUDA C++, Rust ve Triton ile GPU dilleri karşılaştırması. Düzensiz iş yüklerinde performans farkları incelendi.
CUDA'dan MLX'e: K-Search ile Apple Silicon'a Geçiş
K-Search, CUDA optimizasyonunu Apple Silicon için MLX'e dönüştürüyor. GPU çekirdekleri için önemli bir gelişme.