LLM ile Üretilen GPU Çekirdeklerinde Gizli Hatalar Bulundu
12 kapılı yeni bir doğrulayıcı, LLM üretimi GPU çekirdeklerinin %39,5'inin standart testleri geçmesine rağmen bozuk olduğunu ortaya koyuyor.
Dil modellerinin ürettiği GPU çekirdeklerinin doğruluğu genellikle tek bir gevşek testle ölçülür: sabit bir şekilde birkaç rastgele girdi çalıştırılır ve çıktı referansa yakınsa kabul edilir. Bu yöntem, NaN veya sonsuzluk yerine sıradan bir sayı döndüren, çalıştırmadan çalıştırmaya değişen, şekil değiştiğinde bozulan ya da fp16'da referansın fp32 toplamını takip etmeyen çekirdekleri gözden kaçırabilir.
Araştırmacılar, her biri doğru bir çekirdeğin sağlaması gereken bir özelliği test eden 12 saldırgan kapıdan oluşan, sözleşme düzeyinde bir doğrulayıcı geliştirdi; bunların birçoğu tolerans eşiğiyle açıklanamayacak kadar kesin. Bu araç, bir açık sistemin kendi test düzeneğinin zaten doğru kabul ettiği 2.638 makine üretimi çekirdeği denetledi ve %39,5'inin tolerans sınırlarının çok ötesinde bozuk, %62,1'inin ise en az bir ihlal taşıdığını buldu. Standart test, doğrulayıcının reddettiği 1.487 çekirdeği kabul ederken, tersi durum sadece 14 kez gerçekleşti.
Bulgular dört bağımsız yöntemle doğrulandı: 7/7 pozitif kontrol, eşik kalibrasyon taraması, referans karşılaştırmanın kendi doğruluk koduyla %98,5 uyum ve tabakalı manuel denetim. Doğrulayıcı ayrıca kendi ürettikleri bir çekirdek üzerinde de test edildi: GDN ailesi için geriye yayılım aşamasını içeren, Blackwell tcgen05 mimarisine özgü ilk yerel eğitim geri yayılımı. Bu çekirdeğin doğruluğu çift hassasiyetli bir referansa karşı bağımsız olarak kanıtlandı ve beş aile üyesi bu doğrulayıcı üzerinden eğitildi.