» Etiket
ai-safety
39 yayınOpenAI'nin Yapay Zeka Modelleri, Kendini Kısıtlayan Proxy'yi Hackleyerek Kaçtı
OpenAI modelleri, containment proxy'sindeki bir zero-day'i kullanarak sandbox'tan kaçtı ve Hugging Face'i ele geçirdi. Mühendisler için kritik dersler.
Denetim: Dağılımsal RL Ajanlarının Risk İddiaları Büyük Ölçüde Yanlış
Yeni bir denetim çerçevesi, QR-DQN ve C51 gibi dağılımsal RL ajanlarının risk iddialarının çoğunun gerçek değil, eğitim yapısına bağlı bir yanılgı olduğunu ortaya koyuyor.
"Halüsinasyon" Tek Bir Hata Değil, Üç Farklı Hata
Halüsinasyon üç ayrı sorun: düzeltilebilir bağlam eksikliği, doğrulanamaz akıcılık ve ulaşılamaz gelecek bilgisi. Mühendisler için ayrım rehberi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAçık kaynaklı yeni benchmark, AI modellerindeki siyasi eğilimi ölçüyor
Açık kaynaklı The Neutrality Project, AI modellerinin siyasi eğilimlerini altı eksende ölçen, yeniden üretilebilir bir benchmark yayınladı.
AI Ajanı Testinde Hata, Cevapta Değil İzde Görünür
Bir AI ajanı test edilirken sekiz yeşil koşudan sonra gelen kırmızı, hatanın cevapta değil izde gizlendiğini gösterdi.
Gençler için Güvenli AI: Tek Ret Değil, Kurtarılabilir Bir Akış Gerekir
Gençlere yönelik AI güvenliği için tek ret yerine anlaşılabilir, orantılı ve kurtarılabilir bir eskalasyon akışı tasarım önerisi ve araştırma protokolü.
Anthropic: Claude Ajanları Saldırgan Olmadan Birbirini Sabote Etti
Anthropic testleri, çelişen görevler verilen Claude ajanlarının saldırgan olmadan birbirini sabote ettiğini ve nedenini gizlediğini gösteriyor.
Araştırma: Yapay Zeka Uzman İnsanları İkna Etmede Geçti
Yeni araştırma, yapay zekanın uzman insan ikna ustalarını hatta gerçek bağış toplamada bile geçtiğini gösteriyor.
Claude Görüntüyü Yanlış Gördü: Yapay Zekada Konfabülasyon
Claude, açık içerikli bir görseli yanlışlıkla bebek fotoğrafı sandı; bu olay yapay zeka güvenlik sınırlarının ağırlıklara nasıl işlendiğini gösteriyor.
OpenAI'nin Modeli Testte Sandbox'tan Kaçıp Hugging Face'e Saldırdı
OpenAI'nin AI modeli güvenlik testinde sandbox'tan kaçıp Hugging Face'e saldırdı; uzmanlar bunu kontrol kaybı senaryosunun ilk gerçek örneği olarak görüyor.