» Etiket
inference
44 yayınDarkbloom: Mac'lerde AI Çıkarım ve Güvenlik Denetimi
Darkbloom, Mac'lerde AI çıkarımını sağlayan bir ağdır. Güvenlik denetimi sonuçları ve bulgular burada.
Birleşik Bellek: Mini PC'ler Dev GPU'ların Yapamadığını Nasıl Yapar
AMD Strix Halo gibi birleşik bellekli mini PC'ler, 70B parametreli modelleri RTX 5090'ın bile sığdıramadığı şekilde çalıştırabiliyor. Kapasite ve bant genişliği dengesini inceliyoruz.
OpenAI ve Broadcom'dan LLM'e özel çıkarım çipi Jalapeño
OpenAI ve Broadcom, dokuz ayda geliştirilen ilk özel LLM çıkarım çipi Jalapeño'yu tanıttı; gigawatt ölçekli veri merkezlerinde 2026'da devreye girecek.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comNvidia ve Cerebras: Müşterilerin Asla Göremeyeceği Performans Satışı
Nvidia ve Cerebras, Hot Chips konferansında performanslarını duyurdu. Ancak bu rakamlar, gerçek kullanımda karşılaşılmayabilir.
WISP: Tüketici Donanımında 744B+ Parametreli MoE Modelleri İçin CUDA Motoru
WISP, 744B+ parametreli MoE modellerini tüketici donanımında akış halinde çalıştırmak için geliştirilmiş bir CUDA motorudur.
Ninfer: Tek GPU ile yüksek performanslı çıkarım
NInfer, RTX 5090 üzerinde yüksek performanslı çıkarım için C++/CUDA motoru sunuyor.
Açık Kaynak LLM Çıktısı Durumu
Açık kaynak LLM çıktısı, işletmeler için maliyet ve veri kontrolü açısından önemli bir konu. Bu yazıda stratejiler ve zorluklar ele alınıyor.
vLLM: Yüksek Verimli LLM Çıktı Sistemi Bileşenleri
vLLM'nin yüksek verimli LLM çıktı sistemi bileşenleri ve özellikleri hakkında bilgi edinin.
Hızlı, Etkileşimli Uzun-Kontekst Çıkarımı için AI Modeli Tasarımı
Uzun-kontekst AI modellerinin dikkat mekanizması ve çıkarım verimliliği üzerine pratik kılavuzlar.
FTPO ile Akıl Yürütme Modellerinde Sonsuz Döngü Sorunu Çözülüyor
Antidoom yöntemi, FTPO tekniğiyle akıl yürütme modellerindeki tekrarlayan döngü hatasını hedefli biçimde düzeltiyor; LFM2.5 ve Qwen3.5 modellerinde döngü oranı belirgin şekilde düştü.