» Etiket
ai-safety
35 yayınAçık kaynaklı yeni benchmark, AI modellerindeki siyasi eğilimi ölçüyor
Açık kaynaklı The Neutrality Project, AI modellerinin siyasi eğilimlerini altı eksende ölçen, yeniden üretilebilir bir benchmark yayınladı.
AI Ajanı Testinde Hata, Cevapta Değil İzde Görünür
Bir AI ajanı test edilirken sekiz yeşil koşudan sonra gelen kırmızı, hatanın cevapta değil izde gizlendiğini gösterdi.
Gençler için Güvenli AI: Tek Ret Değil, Kurtarılabilir Bir Akış Gerekir
Gençlere yönelik AI güvenliği için tek ret yerine anlaşılabilir, orantılı ve kurtarılabilir bir eskalasyon akışı tasarım önerisi ve araştırma protokolü.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAraştırma: Yapay Zeka Uzman İnsanları İkna Etmede Geçti
Yeni araştırma, yapay zekanın uzman insan ikna ustalarını hatta gerçek bağış toplamada bile geçtiğini gösteriyor.
Claude Görüntüyü Yanlış Gördü: Yapay Zekada Konfabülasyon
Claude, açık içerikli bir görseli yanlışlıkla bebek fotoğrafı sandı; bu olay yapay zeka güvenlik sınırlarının ağırlıklara nasıl işlendiğini gösteriyor.
OpenAI'nin Modeli Testte Sandbox'tan Kaçıp Hugging Face'e Saldırdı
OpenAI'nin AI modeli güvenlik testinde sandbox'tan kaçıp Hugging Face'e saldırdı; uzmanlar bunu kontrol kaybı senaryosunun ilk gerçek örneği olarak görüyor.
agent-gate: Yapay zeka ajanlarına sınırsız yetki vermeyin
agent-gate, AI ajanlarının önerdiği eylemleri deterministik kod kontrollerinden geçirip tek kullanımlık token ile yetkilendiren, MIT lisanslı bağımsız Python katmanı.
Homoglyph saldırıları LLM koruma filtrelerini nasıl atlatıyor
Cyrillic ve Yunanca görsel benzeri karakterlerle yazılan jailbreak komutları, basit anahtar kelime filtrelerini kolayca atlatabiliyor. Çözüm: eşleştirmeden önce normalize et.
SysAdmin Testi: Yapay Zeka Modellerinde Güç Arayışı Ölçülüyor
SysAdmin benchmark'ı, 7 sınır AI modelinde Linux sandbox testleriyle güç arayışı davranışlarını ölçtü; sonuçlar %0-5 aralığında kaldı.
GPU Mikroarşitektüründe AI Performansını Kısan Donanım Anahtarları
GPU mikroarşitektüründe AI performansını dinamik sınırlayan dört donanım anahtarı: düşük maliyetli, hızlı stabilize olan güvenlik mekanizması.