» Etiket
reinforcement-learning
15 yayınAraştırma: LLM Ajanlarında Adım Bazlı Kredi Sinyalleri Rastgeleden Farksız
ALFWorld'de yapılan nedensel denetim, LLM ajan eğitiminde kullanılan hakem ve güven tabanlı kredi sinyallerinin rastgeleden farksız olduğunu ortaya koyuyor.
Denetim: Dağılımsal RL Ajanlarının Risk İddiaları Büyük Ölçüde Yanlış
Yeni bir denetim çerçevesi, QR-DQN ve C51 gibi dağılımsal RL ajanlarının risk iddialarının çoğunun gerçek değil, eğitim yapısına bağlı bir yanılgı olduğunu ortaya koyuyor.
Dünya modeli hatırlar, aktör unutur: RL'de katastrofik unutmanın anatomisi
Model tabanlı RL'de dünya modeli belleği korur ama aktör unutur; derecelendirilmiş rüya provası ortam etkileşimi olmadan beceriyi geri kazandırıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comHarness Pretraining'den Önce mi Gelmeli? Veri Çarkı Perspektifi
AI ajanlarında harness ve pretraining ilişkisini, veri çarkı ve model önyargıları üzerinden inceleyen teknik bir analiz.
LLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
Google'dan Kendi Kendini Kalibre Eden Kuantum İşlemci
Google'ın Willow işlemcisinde denenen yapay zeka, hesaplama sürerken kendi kalibrasyonunu güncelleyerek hata oranını %20-31 azaltıyor.
Yeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.
Büyük Dil Modellerinde RL ile Akıl Yürütme: Politika Seçimi
Pekiştirme öğrenimi, büyük dil modellerinde akıl yürütmeyi geliştirmekte ancak yeni stratejiler öğretmemektedir.
Açık Modelin Bilim Yapma Yeteneği Geliştirildi
Loka ve Arcee AI işbirliğiyle geliştirilen açık model, bilimsel araştırmalarda araç kullanma ve mantıksal çıkarım yapma yeteneği kazandı.
Hedef Koşullu Minecraft Modeli Geliştirildi
Pantograph, internet ölçeğinde video ile hedef koşullu robotik modeller geliştiriyor.