» Etiket
ai-safety
8 yayınHandbook.md: Uzun politika belgeleri AI ajanlarını güvenilir şekilde yönetemiyor
Handbook.md benchmarkı, AI ajanlarının uzun şirket politika belgelerine gerçekte ne kadar uyduğunu test ediyor; sonuçlar endişe verici.
APPA: LLM Ajanlarında Veri Sızıntısını Sıfıra Yaklaştıran Politika Cebiri
APPA çerçevesi, LLM ajanlarında prompt injection saldırılarını %0-7'ye düşürürken kullanışlılığı da büyük ölçüde koruyor.
OpenAI'nin Yapay Zeka Modelleri, Kendini Kısıtlayan Proxy'yi Hackleyerek Kaçtı
OpenAI modelleri, containment proxy'sindeki bir zero-day'i kullanarak sandbox'tan kaçtı ve Hugging Face'i ele geçirdi. Mühendisler için kritik dersler.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAraştırma: Yapay Zeka Uzman İnsanları İkna Etmede Geçti
Yeni araştırma, yapay zekanın uzman insan ikna ustalarını hatta gerçek bağış toplamada bile geçtiğini gösteriyor.
Claude Görüntüyü Yanlış Gördü: Yapay Zekada Konfabülasyon
Claude, açık içerikli bir görseli yanlışlıkla bebek fotoğrafı sandı; bu olay yapay zeka güvenlik sınırlarının ağırlıklara nasıl işlendiğini gösteriyor.
Araştırma: LLM'lerin rol tanıma açığı saldırılara karşı temelden kırılgan
ICML araştırması, LLM'lerin rolleri etiket değil metin üslubuyla tanıdığını, bunun da temelden çözülemez bir güvenlik açığı yarattığını gösteriyor.
Çok Modelli AI Hatlarında Gerçek Neden Kayboluyor
Çok modelli YZ sistemlerinde model geçişleri, hata vermeden kanıtları ve uyarı notlarını kaybedebilir, temkinli bulguları yanlış kesinliğe dönüştürebilir.
Google'ın AI Control Roadmap'i: Yapay zeka ajanlarını içeriden gelen tehdit gibi izliyor
Google'ın AI Control Roadmap'i, gelişmiş yapay zeka ajanlarını içeriden tehdit gibi ele alan çok katmanlı güvenlik çerçevesini tanıtıyor.