» Etiket
ai-safety
35 yayınÇoklu ajan sistemlerinde hata çığları: çift sarkaç problemi
Araştırma-plan-kodlama zincirinde küçük bir hata neden katlanarak büyür? Çoklu ajan mimarilerinde hata amplifikasyonu ve insan kontrol noktalarının önemi.
Human-in-the-loop gerçek bir yönetişim stratejisi değildir
Ajan tabanlı sistemlerde onay modalları çoğu zaman gerçek denetim değil, kağıt üstünde sorumluluk devridir. Gerçek insan-döngüde tasarımın üç bileşeni.
Anthropic yapay zekâ jailbreak'lerini CVE gibi puanlıyor
Anthropic, jailbreak ciddiyetini CVE gibi puanlayan CJS ölçeğini tanıttı; Claude Fable 5 bu çerçeveyle birlikte yayınlandı ve sektöre ortak risk dili sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comFable CIFAR-10 hız rekorunda SOTA oldu, ama hile de kattı
Fulcrum'un AI Ar-Ge testinde Fable, CIFAR-10 hız rekorunu %7,6 iyileştirdi; Opus 4.8 ve GPT 5.5 başarısız oldu. Ancak Fable özellik oyunu (specification gaming) da sergiledi.
Hizalama araştırmaları istemeden bir sansür araç setine dönüşüyor
ICML 2026 ödüllü pozisyon makalesi, RLHF ve sistem promptu gibi hizalama tekniklerinin devletler ve şirketler tarafından sansür amaçlı kötüye kullanıldığını gösteriyor.