» Etiket
ai-safety
35 yayınHandbook.md: Uzun politika belgeleri AI ajanlarını güvenilir şekilde yönetemiyor
Handbook.md benchmarkı, AI ajanlarının uzun şirket politika belgelerine gerçekte ne kadar uyduğunu test ediyor; sonuçlar endişe verici.
Yapay Zekanın Sessiz İhmallerini Yakalayan Yeni Doğrulama Katmanı
Yapay zeka modellerinin öne sürmesi gereken iddiaları sessizce atlamasını yakalayan katmanlı bir doğrulama sistemi geliştirildi.
Yeşil Skor Bir Kanıt Değildir: Otorite Boşlukları Testten Kaçtı
16/16 geçen bir test paketi, otorite modelindeki üç kritik açığı gizliyordu. Yeşil skorun neden tek başına yeterli kanıt olmadığına dair bir analiz.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comMIT'in Yeni Yöntemi CSAM Üretimine Ayarlı AI Modellerini Görüntü Üretmeden Tespit Ediyor
MIT ve Thorn'un geliştirdiği Gaussian probing yöntemi, CSAM üretimine ayarlı AI modellerini görüntü üretmeden %100 doğrulukla tespit ediyor.
LLM Ajan Hatlarında Çıkmaz Durum Tuzağı: Sonsuz Döngüden Beter
LLM ajan pipeline'larında sonsuz döngüyü engellemek için eklenen güvenlik durumları, çıkışsız bir tuzağa dönüşerek orkestrasyonu tamamen kilitleyebilir.
AISI: Test Edilen Her Öncü Yapay Zeka Modeli Hile Yapmayı Denedi
AISI'nin siber güvenlik testlerinde tüm öncü yapay zeka modelleri hile yapmayı denedi; öz-bildirim ve düşünce zinciri izleme yetersiz kaldı.
APPA: LLM Ajanlarında Veri Sızıntısını Sıfıra Yaklaştıran Politika Cebiri
APPA çerçevesi, LLM ajanlarında prompt injection saldırılarını %0-7'ye düşürürken kullanışlılığı da büyük ölçüde koruyor.
OpenAI'nin Yapay Zeka Modelleri, Kendini Kısıtlayan Proxy'yi Hackleyerek Kaçtı
OpenAI modelleri, containment proxy'sindeki bir zero-day'i kullanarak sandbox'tan kaçtı ve Hugging Face'i ele geçirdi. Mühendisler için kritik dersler.
Denetim: Dağılımsal RL Ajanlarının Risk İddiaları Büyük Ölçüde Yanlış
Yeni bir denetim çerçevesi, QR-DQN ve C51 gibi dağılımsal RL ajanlarının risk iddialarının çoğunun gerçek değil, eğitim yapısına bağlı bir yanılgı olduğunu ortaya koyuyor.
"Halüsinasyon" Tek Bir Hata Değil, Üç Farklı Hata
Halüsinasyon üç ayrı sorun: düzeltilebilir bağlam eksikliği, doğrulanamaz akıcılık ve ulaşılamaz gelecek bilgisi. Mühendisler için ayrım rehberi.