CAKE: Yapay Zeka Ajanlarına Özel Derleyici Tasarımıyla Hızlı GPU Çekirdekleri
CAKE, yapay zeka ajanlarını donanıma özgü derleyici IR'ı ile birleştirerek B200'de ayarlanmış GPU çekirdek performansını geçiyor.
CAKE, GPU çekirdekleri üreten yapay zeka ajanları için derleyiciyi kapalı bir kutu olarak ele almak yerine, ajanlarla birlikte tasarlanmış bir ara temsil (IR) sunuyor. Tipik, donanıma özgü CAKE IR; warp rollerini, bellek hareketlerini, senkronizasyonu ve pipeline yapısını doğrudan ajanlara açarken doğrulama, maliyet modellemesi ve yerelleştirilmiş tanılama da sağlıyor — böylece belirsiz hata/zamanlama geri bildirimleri eyleme dönüştürülebilir sinyallere dönüşüyor.
Sistemin çalışma altyapısı zamanla kendini geliştiriyor: tekrarlayan hatalar yeni doğrulayıcı kurallarına, IR ilkellerine, kalibre edilmiş maliyet modellerine ve yeniden kullanılabilir optimizasyon taktiklerine dönüştürülüyor; bu da gelecekteki çekirdek üretim görevleri için kurumsal bir bilgi birikimi oluşturuyor.
B200 GPU'larda, Flash-KMeans için CAKE tarafından üretilen çekirdekler 80 milyon token bütçesinde ayarlanmış FlashML temel çizgisinin 1.144 katına ulaşırken, ajanların doğrudan ham CUDA/PTX yazdığı durumda bu oran sadece 0.928x kaldı. Ajanların yazdığı Kimi Delta Attention, resmi FlashKDA uygulamasına göre geometrik ortalamada 2.05x hızlanma sağladı ve uçtan uca servis testlerini geçti; dispatcher destekli KNN/KMeans çekirdekleri ise 400'den fazla girdi şeklinde 1.42x-2.12x arasında performans artışı gösterdi — sonuçtaki dört çekirdek değişikliği de upstream PR olarak birleştirildi.
Mühendisler için bu, ajanlara ham çekirdek kodu yazdırmak yerine yapılandırılmış, doğrulanabilir bir ara temsil sunmaya doğru bir kaymayı işaret ediyor — Ampere'den Blackwell'e kadar donanımlarda, elle ayarlanmış uzman çekirdekler ile LLM tabanlı pipeline'ların üretebildikleri arasındaki farkı kapatma potansiyeli taşıyor.