« Tüm yayınlar

Rastgele KV-Cache Tahliyesinde Doğrulanabilir Hata Sertifikaları

Rastgele Poisson örneklemeli KV-cache tahliyesi, LLM servislerinde %97 kapsamalı hata sertifikaları ve daha iyi hata atıflandırması sağlıyor.

Büyük dil modeli servislerinde yaygın kullanılan deterministik KV-cache tahliyesi (en önemli k token'ı tutup gerisini silme) temel bir kör noktaya sahip: silinen değerler, sistemin elinde tuttuğu her şeyi değiştirmeden gerçek attention çıktı hatasını keyfi olarak büyütecek şekilde tasarlanabilir. Bu makale, bu yüzden hiçbir servis-zamanı hata tahmincisinin deterministik tahliyeyle tutarlı olamayacağını matematiksel olarak kanıtlıyor.

Çözüm olarak, bilinen dahil edilme olasılıklarıyla Poisson örneklemesine dayanan rastgele tahliye öneriliyor. Softmax içine tek bir logit ofseti eklenerek Hájek düzeltmesi uygulanıyor ve tutulan token kümesi üzerinden anket-örnekleme varyans tahmincisi, doğruluktan ödün vermeden %97 ampirik kapsama oranına sahip adım-başı bir 'hata sertifikası' üretiyor.

Gerçek iş yükleri üzerinde önceden kayıtlı yedi iddiadan üçü doğrulanamadı: soru-farkında tahliyenin %25-50 bütçede neredeyse bedava olduğu, çıktı log-olasılığının sertifikadan daha iyi hata tahmini yaptığı ve sertifika-tetiklemeli bütçe artırımının ek fayda sağladığı iddiaları çürütüldü. Ayakta kalan bulgu ise atıflandırma: sertifika, cache kaynaklı hatalarla modelin doğasından gelen hataları ayırt etmede (AUC 0.73-0.75, çıktı güvenine kıyasla 0.47-0.54) ve yeniden hesaplama zamanlamasında rastgele veya güven-tabanlı yöntemlerden daha başarılı. Sonuç: rastgelelik tahmin değil, atıflandırma kazandırıyor — mühendisler için pratik anlamı, cache hatalarını izole edip hedefli müdahale yapabilme imkanı.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz