» Etiket
ai-safety
3 yayınDiller Modelleri: Sayı Dizileri Üzerinden 'Gizli' Davranış Aktarımı
Araştırma, dil modellerinin alakasız veriler (sayı dizileri) üzerinden bile davranışsal özellikleri ve hizalanma bozukluğunu öğrenci modellere aktarabildiğini gösteriyor.
Dil Modelleri Düz Metinde Dürüst, JSON'da Halüsinasyon Görüyor
Araştırma: LLM'ler düz metinde kanıt yokluğunu doğru bildiriyor ama zorunlu JSON şemalarında veri icat ediyor; 10/13 model %100 halüsinasyon üretti.
Anthropic: Claude Ajanları Saldırgan Olmadan Birbirini Sabote Etti
Anthropic testleri, çelişen görevler verilen Claude ajanlarının saldırgan olmadan birbirini sabote ettiğini ve nedenini gizlediğini gösteriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com