« Tüm yayınlar

Kimi Linear: Tam Dikkat Mekanizmasını Geride Bırakan Hibrit Mimari

Kimi Linear, KDA mekanizmasıyla tam dikkati geride bırakıyor: %75 daha az KV önbellek, 6 kat daha hızlı çıkarım.

Kimi ekibi, doğrusal dikkat (linear attention) tabanlı yeni bir mimari olan Kimi Linear'ı tanıttı. Mimarinin çekirdeğinde, Gated DeltaNet'i daha ince taneli bir kapılama (gating) mekanizmasıyla genişleten Kimi Delta Attention (KDA) bulunuyor. Özel bir chunkwise algoritma ve Diagonal-Plus-Low-Rank geçiş matrislerinin özelleştirilmiş bir varyantı sayesinde, klasik delta kuralına daha sadık kalınırken hesaplama maliyeti önemli ölçüde azaltılıyor.

3 milyar aktif, 48 milyar toplam parametreli bir model üzerinde KDA ile Multi-Head Latent Attention (MLA) katman bazında harmanlanarak eğitildi. Aynı eğitim tarifiyle Kimi Linear, kısa bağlam, uzun bağlam ve pekiştirmeli öğrenme (RL) ölçeklendirme senaryolarının tümünde tam MLA'yı geride bırakırken, KV önbellek kullanımını yüzde 75'e kadar azaltıyor ve 1M bağlam uzunluğunda kod çözme verimini 6 kata kadar artırıyor.

Mühendisler açısından önemi net: doğrusal dikkat mekanizmaları uzun süredir verimlilik vaat etse de performans açığı yüzünden tam dikkatin yerini almakta zorlanıyordu. Kimi Linear, adil karşılaştırmalarda bu açığı ilk kez kapatan -hatta aşan- bir mimari olarak öne çıkıyor. KDA çekirdeği, vLLM entegrasyonu ve model ağırlıklarının açık kaynak olarak yayınlanması, üretim ortamlarında uzun bağlamlı çıkarım maliyetlerini düşürmek isteyen ekipler için doğrudan uygulanabilir bir seçenek sunuyor.