» Etiket
inference
33 yayınAçık Kaynak LLM Çıktısı Durumu
Açık kaynak LLM çıktısı, işletmeler için maliyet ve veri kontrolü açısından önemli bir konu. Bu yazıda stratejiler ve zorluklar ele alınıyor.
vLLM: Yüksek Verimli LLM Çıktı Sistemi Bileşenleri
vLLM'nin yüksek verimli LLM çıktı sistemi bileşenleri ve özellikleri hakkında bilgi edinin.
Hızlı, Etkileşimli Uzun-Kontekst Çıkarımı için AI Modeli Tasarımı
Uzun-kontekst AI modellerinin dikkat mekanizması ve çıkarım verimliliği üzerine pratik kılavuzlar.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comFTPO ile Akıl Yürütme Modellerinde Sonsuz Döngü Sorunu Çözülüyor
Antidoom yöntemi, FTPO tekniğiyle akıl yürütme modellerindeki tekrarlayan döngü hatasını hedefli biçimde düzeltiyor; LFM2.5 ve Qwen3.5 modellerinde döngü oranı belirgin şekilde düştü.
vLLM'nin sunum yığını C++20'ye taşındı: 66 MiB ikili dosya
vLLM'nin C++20'ye taşınmasıyla Python bağımlılığı olmadan 66 MiB boyutunda bir ikili dosya elde edildi. Yüksek eşzamanlılıkta benzer hızlar sunuyor.
AMD, Taalas'ı satın alarak AI çip performansını artırmayı hedefliyor
AMD, Taalas'ı satın alarak AI çip performansını artırmayı ve Nvidia'ya karşı rekabet etmeyi hedefliyor.
Patlayıcı Gelen Talepler LLM Çıktı Sürelerini Hızlandırıyor
Patlayıcı yüklerin LLM çıktılarında beklenmedik hız artışı sağladığı keşfedildi.
Vektör İşlemcilerde İnferans için Çatı Hattı Sparse Tensör Kontraksiyonları
Ventaglio, vektör işlemcilerde seyrek tensör kontraksiyonlarını hızlandırarak performansı artırıyor.
Kimi K3 ile LLM Çıkarımının Karlılığı: Hesaplamalar
Kimi K3 ile LLM çıkarımının karlılığı üzerine yapılan hesaplamalar ve analizler.
Kimi K3 için Day-0 API Geliştirdik
Baseten, Kimi K3 için Model API'lerinde day-0 desteği sağladı. Kimi K3, 2.8T parametre ile önceki açık modellerden çok daha büyük.