Dünya modeli hatırlar, aktör unutur: RL'de katastrofik unutmanın anatomisi
Model tabanlı RL'de dünya modeli belleği korur ama aktör unutur; derecelendirilmiş rüya provası ortam etkileşimi olmadan beceriyi geri kazandırıyor.
DreamerV3 ailesinden model tabanlı pekiştirmeli öğrenme (RL) ajanları, ardışık görevlerle eğitildiğinde katastrofik şekilde unutuyor — üstelik sınırsız bir tekrar oynatma (replay) tamponu tüm eski deneyimleri sakladığı halde. Araştırma, literatürün şimdiye dek varsaymış ama hiç ölçmemiş olduğu bir soruyu ele alıyor: sistemin hangi bileşeni unutuyor?
Bileşen düzeyinde yapılan ön-kayıtlı ölçümler, dünya modelinin eski görevlere dair ödül ayrımı, değer tahminleri ve bitiş yapısı gibi neredeyse her ölçülebilir bilgiyi koruduğunu, buna karşılık aktörün davranışının çöktüğünü gösteriyor. Yani sorun bir hafıza sorunu değil, bir 'kanal' sorunu.
Müdahale deneyleri bunu doğruluyor: dünya modeli dondurulup hayal edilen (imagined) rollout'larla RL uygulandığında kayıp beceri geri kazanılamıyor, ancak dünya modelinin kendi ürettiği derecelendirilmiş 'rüyalar' üzerinde denetimli öz-taklit, ortamla hiç etkileşime girmeden beceriyi tam olarak geri getiriyor. Bu yöntem eğitime dahil edildiğinde, görev etiketi gerektirmeyen, parametre sayısı sabit kalan bir sürekli öğrenme yaklaşımı ortaya çıkıyor; dört ve sekiz görevlik zincirlerde düz replay'i ve gerçek bölüm klonlamasını istikrarlı biçimde geride bırakıyor.
Çalışma ayrıca 'rüya derecelendirme' adımının kritik önemini, bunun başarısızlık modlarını ve bunları erken yakalayan bir çevrimdışı ölçüm yöntemini ortaya koyuyor. Tüm deneyler önceden kayıt altına alınmış protokollerle, tek GPU üzerinde yürütülmüş ve reddedilen hipotezler de raporlanmış.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz