HuggingFace'in 7.6 Petabaytlık Eğitim Verisinde 221 Bin Canlı Sızıntı
Araştırmacılar Hugging Face'teki 7.6 petabaytlık eğitim verisini taradı; GitHub, GCP, veritabanı ve AI sağlayıcı hesaplarına ait 221 bin canlı anahtar buldu.
Güvenlik araştırmacıları, Hugging Face üzerindeki tüm herkese açık veri setlerini taradı: 187 milyon dosyada toplam 7.6 petabayt, bugüne kadar AI eğitim verisi üzerinde yapılmış en büyük sızıntı taraması olarak öne çıkıyor. Tarama, 6.003 veri setine dağılmış 221.303 benzersiz, canlı kimlik bilgisi ortaya çıkardı; bulut yönetici anahtarlarından veritabanı girişlerine ve CI/CD token'larına kadar geniş bir yelpaze söz konusu.
Bulgular arasında 349 canlı GitHub kişisel erişim token'ı (birçoğu tam repo yazma veya admin:org yetkisiyle), 318 Docker Hub push token'ı, 3.811 projeye yayılmış 8.557 canlı GCP servis hesabı anahtarı ve binlerce çalışan veritabanı/mesajlaşma kimlik bilgisi bulunuyor. Repo yetkili bir token, 178.000'den fazla toplam GitHub yıldızına sahip, yaygın kullanılan bir Model Context Protocol kayıt defterine bağlı bir bakımcıya kadar izlenebildi.
Ekip, AI sağlayıcı hesaplarına yönelik riski de sayısallaştırdı: OpenAI, Azure OpenAI, Anthropic, Gemini ve diğerleri için 11.496 canlı anahtar, sadece varsayılan harcama limitleri üzerinden hesaplandığında yıllık en az yaklaşık 920.000 dolarlık potansiyel çalıntı çıkarım kapasitesine denk geliyor. Hugging Face yayından önce bilgilendirildi ve CTO'su, araştırmada kullanılan açık kaynaklı TruffleHog aracına depolama kovası tarama desteği ekledi.
Bu bulgular, AI tedarik zincirindeki kalıcı bir riski gözler önüne seriyor: koda, not defterlerine ya da sohbet botu konuşmalarına yapıştırılan gizli bilgiler, herkese açık eğitim korpuslarına gömülüyor ve orijinal sızıntıdan çok sonra da saldırganlara kalıcı, iptal edilmesi zor erişim sağlıyor.