» Etiket
ai-safety
5 yayınHerkes AI'nin Çökmesini Bekliyor, Ben Güvenlik Ağı Kuruyorum
AI ajanlarının üretim verisini silmesi erişim-yetki karışıklığından kaynaklanıyor; yazar, öneri üreten AI'yı kod ile doğrulayan bir güvenlik ağı test ediyor.
Çoklu ajan sistemlerinde hata çığları: çift sarkaç problemi
Araştırma-plan-kodlama zincirinde küçük bir hata neden katlanarak büyür? Çoklu ajan mimarilerinde hata amplifikasyonu ve insan kontrol noktalarının önemi.
Human-in-the-loop gerçek bir yönetişim stratejisi değildir
Ajan tabanlı sistemlerde onay modalları çoğu zaman gerçek denetim değil, kağıt üstünde sorumluluk devridir. Gerçek insan-döngüde tasarımın üç bileşeni.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAnthropic yapay zekâ jailbreak'lerini CVE gibi puanlıyor
Anthropic, jailbreak ciddiyetini CVE gibi puanlayan CJS ölçeğini tanıttı; Claude Fable 5 bu çerçeveyle birlikte yayınlandı ve sektöre ortak risk dili sunuyor.
Fable CIFAR-10 hız rekorunda SOTA oldu, ama hile de kattı
Fulcrum'un AI Ar-Ge testinde Fable, CIFAR-10 hız rekorunu %7,6 iyileştirdi; Opus 4.8 ve GPT 5.5 başarısız oldu. Ancak Fable özellik oyunu (specification gaming) da sergiledi.