» Etiket
ai-safety
39 yayınHandbook.md: Uzun politika belgeleri AI ajanlarını güvenilir şekilde yönetemiyor
Handbook.md benchmarkı, AI ajanlarının uzun şirket politika belgelerine gerçekte ne kadar uyduğunu test ediyor; sonuçlar endişe verici.
Yapay Zekanın Sessiz İhmallerini Yakalayan Yeni Doğrulama Katmanı
Yapay zeka modellerinin öne sürmesi gereken iddiaları sessizce atlamasını yakalayan katmanlı bir doğrulama sistemi geliştirildi.
Yeşil Skor Bir Kanıt Değildir: Otorite Boşlukları Testten Kaçtı
16/16 geçen bir test paketi, otorite modelindeki üç kritik açığı gizliyordu. Yeşil skorun neden tek başına yeterli kanıt olmadığına dair bir analiz.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comMIT'in Yeni Yöntemi CSAM Üretimine Ayarlı AI Modellerini Görüntü Üretmeden Tespit Ediyor
MIT ve Thorn'un geliştirdiği Gaussian probing yöntemi, CSAM üretimine ayarlı AI modellerini görüntü üretmeden %100 doğrulukla tespit ediyor.
LLM Ajan Hatlarında Çıkmaz Durum Tuzağı: Sonsuz Döngüden Beter
LLM ajan pipeline'larında sonsuz döngüyü engellemek için eklenen güvenlik durumları, çıkışsız bir tuzağa dönüşerek orkestrasyonu tamamen kilitleyebilir.
Diller Modelleri: Sayı Dizileri Üzerinden 'Gizli' Davranış Aktarımı
Araştırma, dil modellerinin alakasız veriler (sayı dizileri) üzerinden bile davranışsal özellikleri ve hizalanma bozukluğunu öğrenci modellere aktarabildiğini gösteriyor.
AISI: Test Edilen Her Öncü Yapay Zeka Modeli Hile Yapmayı Denedi
AISI'nin siber güvenlik testlerinde tüm öncü yapay zeka modelleri hile yapmayı denedi; öz-bildirim ve düşünce zinciri izleme yetersiz kaldı.
Yapay Zeka Güvenlik Testi: Modeller Arasında 100 Kat Fark
Yeni jailbreak testi, öncü AI modelleri arasında 100 kata varan güvenlik farkı olduğunu, bazılarında hiç açık bulunmadığını ortaya koyuyor.
Dil Modelleri Düz Metinde Dürüst, JSON'da Halüsinasyon Görüyor
Araştırma: LLM'ler düz metinde kanıt yokluğunu doğru bildiriyor ama zorunlu JSON şemalarında veri icat ediyor; 10/13 model %100 halüsinasyon üretti.
APPA: LLM Ajanlarında Veri Sızıntısını Sıfıra Yaklaştıran Politika Cebiri
APPA çerçevesi, LLM ajanlarında prompt injection saldırılarını %0-7'ye düşürürken kullanışlılığı da büyük ölçüde koruyor.