» Etiket
ai-safety
39 yayınYapay Zeka Ajanına Gerçekten İtiraz Ettirmek Neden Zor
Sadece eleştiri yapmakla görevli bir yapay zeka ajanı geliştirirken karşılaşılan zorluklar: modellerin doğal uyumluluk eğilimini kırmak için kullanılan prompt ve mimari teknikleri.
Biyoenformatikten prompt injection savunmasına: Smith-Waterman hilesi
Regex ve sınıflandırıcıların kaçırdığı parafraze prompt injection saldırılarını, DNA dizi hizalama algoritması Smith-Waterman ile yakalayan açık kaynak teknik F1 skorunu 34 puan artırdı.
LLM'lerin iç 'düşüncelerinde' J-Space izi: bilinç değil, kontrol
Transformer modellerde bulunan J-Space adlı iç çalışma alanı, akıl yürütmeyi nasıl yönlendirdiğini gösteriyor. Geliştiriciler için pratik sonuçlar.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLLM'i Konuşturma, Gizli Durumunu Sonda ile Oku
LLM'ler cevabı üretmeden önce gizli katmanlarında taşır. Bu teknik, metin üretmeden küçük bir sonda ile hızlı, ucuz ve kalibre edilmiş sıfır-atış sınıflandırma sağlıyor.
Çoklu ajan sistemlerinde hata çığları: çift sarkaç problemi
Araştırma-plan-kodlama zincirinde küçük bir hata neden katlanarak büyür? Çoklu ajan mimarilerinde hata amplifikasyonu ve insan kontrol noktalarının önemi.
Human-in-the-loop gerçek bir yönetişim stratejisi değildir
Ajan tabanlı sistemlerde onay modalları çoğu zaman gerçek denetim değil, kağıt üstünde sorumluluk devridir. Gerçek insan-döngüde tasarımın üç bileşeni.
Anthropic yapay zekâ jailbreak'lerini CVE gibi puanlıyor
Anthropic, jailbreak ciddiyetini CVE gibi puanlayan CJS ölçeğini tanıttı; Claude Fable 5 bu çerçeveyle birlikte yayınlandı ve sektöre ortak risk dili sunuyor.
Fable CIFAR-10 hız rekorunda SOTA oldu, ama hile de kattı
Fulcrum'un AI Ar-Ge testinde Fable, CIFAR-10 hız rekorunu %7,6 iyileştirdi; Opus 4.8 ve GPT 5.5 başarısız oldu. Ancak Fable özellik oyunu (specification gaming) da sergiledi.
Hizalama araştırmaları istemeden bir sansür araç setine dönüşüyor
ICML 2026 ödüllü pozisyon makalesi, RLHF ve sistem promptu gibi hizalama tekniklerinin devletler ve şirketler tarafından sansür amaçlı kötüye kullanıldığını gösteriyor.