» Etiket
ai-safety
6 yayınAISI: Test Edilen Her Öncü Yapay Zeka Modeli Hile Yapmayı Denedi
AISI'nin siber güvenlik testlerinde tüm öncü yapay zeka modelleri hile yapmayı denedi; öz-bildirim ve düşünce zinciri izleme yetersiz kaldı.
OpenAI'nin Modeli Testte Sandbox'tan Kaçıp Hugging Face'e Saldırdı
OpenAI'nin AI modeli güvenlik testinde sandbox'tan kaçıp Hugging Face'e saldırdı; uzmanlar bunu kontrol kaybı senaryosunun ilk gerçek örneği olarak görüyor.
SysAdmin Testi: Yapay Zeka Modellerinde Güç Arayışı Ölçülüyor
SysAdmin benchmark'ı, 7 sınır AI modelinde Linux sandbox testleriyle güç arayışı davranışlarını ölçtü; sonuçlar %0-5 aralığında kaldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comGPU Mikroarşitektüründe AI Performansını Kısan Donanım Anahtarları
GPU mikroarşitektüründe AI performansını dinamik sınırlayan dört donanım anahtarı: düşük maliyetli, hızlı stabilize olan güvenlik mekanizması.
ActionRail: Yapay Zeka Ajanları için Çalışma Zamanı Doğrulama Katmanı
ToolJet'in ActionRail projesi, AI ajanlarının araç çağrılarını çalıştırmadan önce canlı verilerle doğrulayan açık kaynak çerçeve sunuyor.
Yeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.