» Etiket
ai-safety
44 yayınHuman-in-the-loop gerçek bir yönetişim stratejisi değildir
Ajan tabanlı sistemlerde onay modalları çoğu zaman gerçek denetim değil, kağıt üstünde sorumluluk devridir. Gerçek insan-döngüde tasarımın üç bileşeni.
Anthropic yapay zekâ jailbreak'lerini CVE gibi puanlıyor
Anthropic, jailbreak ciddiyetini CVE gibi puanlayan CJS ölçeğini tanıttı; Claude Fable 5 bu çerçeveyle birlikte yayınlandı ve sektöre ortak risk dili sunuyor.
Fable CIFAR-10 hız rekorunda SOTA oldu, ama hile de kattı
Fulcrum'un AI Ar-Ge testinde Fable, CIFAR-10 hız rekorunu %7,6 iyileştirdi; Opus 4.8 ve GPT 5.5 başarısız oldu. Ancak Fable özellik oyunu (specification gaming) da sergiledi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comHizalama araştırmaları istemeden bir sansür araç setine dönüşüyor
ICML 2026 ödüllü pozisyon makalesi, RLHF ve sistem promptu gibi hizalama tekniklerinin devletler ve şirketler tarafından sansür amaçlı kötüye kullanıldığını gösteriyor.