» Etiket
moe
15 yayın397B Parametreli MoE Modeli Tek RTX PRO 6000 96GB GPU'da Çalıştı
Krasis çalışma zamanı, 397B parametreli MoE modelini tek RTX PRO 6000 96GB GPU'da 2.354 tok/s prefill hızıyla çalıştırdı.
vLLM'de Transformers Arka Ucu Artık Yerli Hıza Ulaştı
Transformers'ın vLLM modelleme arka ucu artık native implementasyonlarla aynı hızda; torch.fx ve ast ile otomatik kernel füzyonu sağlıyor.
Thinking Machines Lab'dan Inkling: 975B Parametreli Açık MoE, Ayarlanabilir Düşünme
Thinking Machines Lab'ın 975B parametreli, 41B aktif Inkling modeli encoder-free multimodal MoE mimarisi ve ayarlanabilir reasoning effort sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comColibri: 744B parametreli GLM-5.2'yi 25GB RAM ile çalıştırma
Colibri, tek dosyalık C motoruyla GLM-5.2'nin 744B parametreli MoE modelini GPU'suz, 25GB RAM'lik makinede çalıştırıyor.
GLM 5.2 açık kaynak devrimi: AI kâr marjları çöküyor
Zhipu AI'nin GLM 5.2 modeli, MoE mimarisiyle GPT-4o seviyesinde performansı çok daha düşük maliyetle sunarak açık kaynak modellerin gücünü gösteriyor.
2.8 Trilyon Parametreli Kimi K3, 64GB M1 Mac'te Çalıştırıldı
Deltafin, 2.8 trilyon parametreli Kimi K3 MoE modelini 64GB'lık M1 Mac'te, tam kurulum veya akış modu ile çalıştırıyor.
MiniMax M2.7: Kendi Eğitimini Optimize Eden Açık Kaynak AI
MiniMax'ın açık kaynaklı M2.7 modeli, eğitim sürecine bellek yazma ve beceri geliştirme yetkisiyle katılarak %30 verimlilik artışı sağladı; SWE-bench Pro'da GPT-5.3-Codex'i yakaladı.
PXQ: ik_llama.cpp forku eski Tesla/Pascal GPU'larda +88% prefill kazandırıyor
ik_llama.cpp forku pxq_llama, yeni PXQ quant formatıyla Tesla P100/V100 ve 1080 Ti'de prefill ve decode hızını ciddi oranda artırıyor.
120B parametreli LLM, expert akışıyla Android telefonda çalışıyor
Açık kaynaklı bir Android uygulaması, MoE uzmanlarını flash depodan akıtarak 120B parametreli LLM'i telefon CPU'sunda çalıştırıyor, 30B modeller kullanılabilir hızda.
Yerel Model Showdown 9. Tur: Qwen 3.6, Nemotron ve Qwythos Kod Testinde
RTX 5090'da llama.cpp ile beş LLM'in gerçek kodlama görevinde karşılaştırıldığı Local Model Showdown 9. tur analizi ve bulguları.