« Tüm yayınlar

LeakyLMs: Zamanlama Analiziyle LLM Mimarisi ve Optimizasyonları Sızdırılıyor

LeakyLMs araştırması, token zamanlama analiziyle LLM API'lerinden mimari ve speculative decoding bilgilerinin nasıl sızdırılabileceğini ortaya koyuyor.

Yeni bir araştırma, üretim ortamındaki büyük dil modellerinden yalnızca token üretim zamanlamasını ölçerek gizli mimari ve dağıtım bilgilerinin çıkarılabileceğini gösteriyor. LeakyLMs adlı saldırı yöntemi, uzak API çağrıları üzerinden bile modelin speculative decoding kullanıp kullanmadığını ve kullanılan taslak (draft) modelin bağlam penceresi uzunluğunu tespit edebiliyor. Örneğin araştırmacılar, Google Gemini Flash 2.5'in yaklaşık 128K token'lık bir taslak bağlam penceresiyle speculative decoding kullandığını ölçümlerle doğrulamış.

İkinci saldırı ise NVIDIA GPU'larda token üretim gecikmesinin model konfigürasyonuna ve donanım parametrelerine göre nasıl değiştiğini modelleyerek transformer katman sayısı, gizli boyut büyüklüğü ve dikkat başlığı sayısı gibi mimari detayları geri çıkarıyor. Llama modelleri üzerinde yapılan deneylerde, doğru mimari konfigürasyonun en olası ilk 10 tahmin arasına girme oranı yüzde 90'ı aşıyor.

Bu bulgular, ticari LLM sağlayıcılarının API üzerinden fikri mülkiyet ve altyapı sırlarını istemeden ifşa edebileceğini gösteriyor; bu da model güvenliği ve API tasarımı açısından yeni bir tehdit vektörü ortaya koyuyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz