» Etiket
inference-optimization
5 yayınLeakyLMs: Zamanlama Analiziyle LLM Mimarisi ve Optimizasyonları Sızdırılıyor
LeakyLMs araştırması, token zamanlama analiziyle LLM API'lerinden mimari ve speculative decoding bilgilerinin nasıl sızdırılabileceğini ortaya koyuyor.
Android'de llama.cpp KV Durumuyla TTFT 9,9x Azaldı
EdgeSync-LLM, llama.cpp KV API'leriyle tekrar prompt işlemeden Android'de TTFT'yi 9,9x düşürdü; sahte 8,8x hızlanmayı da tespit edip eledi.
Tek MI300X GPU'da DeepSeek V4 Flash: Gerçek Kodlama Ajanı Testi
Tek AMD MI300X GPU'da DeepSeek V4 Flash'ın gerçek kodlama ajanlarıyla ölçülen throughput, cache isabet oranı ve maliyet analizi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comNunchaku'nun 4-bit Difüzyon Çıkarımı Artık Diffusers'ta
Nunchaku'nun 4-bit SVDQuant kuantizasyonu artık Diffusers'a native entegre; ayrı motor veya derleme gerekmeden from_pretrained ile yüklenebiliyor.
llama.cpp'de DFlash: Qwen 3.6 27B'de 4.44 kat hız artışı
llama.cpp'ye eklenen DFlash, blok difüzyon tabanlı draft modeliyle Qwen 3.6 27B'de bağlam uzadıkça hızı artırıyor; 36K bağlamda 4.44 kat, kalite kaybı yok denecek kadar az.