« Tüm yayınlar

Büyük Dil Modellerinde RL ile Akıl Yürütme: Politika Seçimi

Pekiştirme öğrenimi, büyük dil modellerinde akıl yürütmeyi geliştirmekte ancak yeni stratejiler öğretmemektedir.

Güçlü dil modellerinin akıl yürütme yeteneklerini geliştirmek için pekiştirme öğrenimi (RL) standart hale gelmiştir. Ancak, yeni stratejiler öğretmekten ziyade, mevcut çözümler arasında olasılık dağılımını yeniden düzenlediği giderek daha fazla kanıtla gösterilmektedir. Bu çalışma, RL optimizasyon döngüsünün gerekli olup olmadığını sorgulamakta ve token düzeyinde yapılan analizler, RL'nin faydalı etkisinin belirsiz karar noktalarında yoğunlaştığını göstermektedir. Sonuçlar, ReasonMaxxer adında, RL gerektirmeyen bir yönteme dönüşmektedir.