» Etiket
ai-safety
12 yayınLLM Ajan Hatlarında Çıkmaz Durum Tuzağı: Sonsuz Döngüden Beter
LLM ajan pipeline'larında sonsuz döngüyü engellemek için eklenen güvenlik durumları, çıkışsız bir tuzağa dönüşerek orkestrasyonu tamamen kilitleyebilir.
Homoglyph saldırıları LLM koruma filtrelerini nasıl atlatıyor
Cyrillic ve Yunanca görsel benzeri karakterlerle yazılan jailbreak komutları, basit anahtar kelime filtrelerini kolayca atlatabiliyor. Çözüm: eşleştirmeden önce normalize et.
Herkes AI'nin Çökmesini Bekliyor, Ben Güvenlik Ağı Kuruyorum
AI ajanlarının üretim verisini silmesi erişim-yetki karışıklığından kaynaklanıyor; yazar, öneri üreten AI'yı kod ile doğrulayan bir güvenlik ağı test ediyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYapay Zeka Ajanına Gerçekten İtiraz Ettirmek Neden Zor
Sadece eleştiri yapmakla görevli bir yapay zeka ajanı geliştirirken karşılaşılan zorluklar: modellerin doğal uyumluluk eğilimini kırmak için kullanılan prompt ve mimari teknikleri.
Biyoenformatikten prompt injection savunmasına: Smith-Waterman hilesi
Regex ve sınıflandırıcıların kaçırdığı parafraze prompt injection saldırılarını, DNA dizi hizalama algoritması Smith-Waterman ile yakalayan açık kaynak teknik F1 skorunu 34 puan artırdı.
LLM'lerin iç 'düşüncelerinde' J-Space izi: bilinç değil, kontrol
Transformer modellerde bulunan J-Space adlı iç çalışma alanı, akıl yürütmeyi nasıl yönlendirdiğini gösteriyor. Geliştiriciler için pratik sonuçlar.
LLM'i Konuşturma, Gizli Durumunu Sonda ile Oku
LLM'ler cevabı üretmeden önce gizli katmanlarında taşır. Bu teknik, metin üretmeden küçük bir sonda ile hızlı, ucuz ve kalibre edilmiş sıfır-atış sınıflandırma sağlıyor.
Çoklu ajan sistemlerinde hata çığları: çift sarkaç problemi
Araştırma-plan-kodlama zincirinde küçük bir hata neden katlanarak büyür? Çoklu ajan mimarilerinde hata amplifikasyonu ve insan kontrol noktalarının önemi.
Human-in-the-loop gerçek bir yönetişim stratejisi değildir
Ajan tabanlı sistemlerde onay modalları çoğu zaman gerçek denetim değil, kağıt üstünde sorumluluk devridir. Gerçek insan-döngüde tasarımın üç bileşeni.
Anthropic yapay zekâ jailbreak'lerini CVE gibi puanlıyor
Anthropic, jailbreak ciddiyetini CVE gibi puanlayan CJS ölçeğini tanıttı; Claude Fable 5 bu çerçeveyle birlikte yayınlandı ve sektöre ortak risk dili sunuyor.