» Etiket
reinforcement-learning
2 yayınDünya modeli hatırlar, aktör unutur: RL'de katastrofik unutmanın anatomisi
Model tabanlı RL'de dünya modeli belleği korur ama aktör unutur; derecelendirilmiş rüya provası ortam etkileşimi olmadan beceriyi geri kazandırıyor.
Yeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com