» Etiket
inference-optimization
4 yayınLeakyLMs: Zamanlama Analiziyle LLM Mimarisi ve Optimizasyonları Sızdırılıyor
LeakyLMs araştırması, token zamanlama analiziyle LLM API'lerinden mimari ve speculative decoding bilgilerinin nasıl sızdırılabileceğini ortaya koyuyor.
Android'de llama.cpp KV Durumuyla TTFT 9,9x Azaldı
EdgeSync-LLM, llama.cpp KV API'leriyle tekrar prompt işlemeden Android'de TTFT'yi 9,9x düşürdü; sahte 8,8x hızlanmayı da tespit edip eledi.
Nunchaku'nun 4-bit Difüzyon Çıkarımı Artık Diffusers'ta
Nunchaku'nun 4-bit SVDQuant kuantizasyonu artık Diffusers'a native entegre; ayrı motor veya derleme gerekmeden from_pretrained ile yüklenebiliyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comllama.cpp'de DFlash: Qwen 3.6 27B'de 4.44 kat hız artışı
llama.cpp'ye eklenen DFlash, blok difüzyon tabanlı draft modeliyle Qwen 3.6 27B'de bağlam uzadıkça hızı artırıyor; 36K bağlamda 4.44 kat, kalite kaybı yok denecek kadar az.