» Etiket
ai-safety
39 yayınagent-gate: Yapay zeka ajanlarına sınırsız yetki vermeyin
agent-gate, AI ajanlarının önerdiği eylemleri deterministik kod kontrollerinden geçirip tek kullanımlık token ile yetkilendiren, MIT lisanslı bağımsız Python katmanı.
Homoglyph saldırıları LLM koruma filtrelerini nasıl atlatıyor
Cyrillic ve Yunanca görsel benzeri karakterlerle yazılan jailbreak komutları, basit anahtar kelime filtrelerini kolayca atlatabiliyor. Çözüm: eşleştirmeden önce normalize et.
SysAdmin Testi: Yapay Zeka Modellerinde Güç Arayışı Ölçülüyor
SysAdmin benchmark'ı, 7 sınır AI modelinde Linux sandbox testleriyle güç arayışı davranışlarını ölçtü; sonuçlar %0-5 aralığında kaldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comGPU Mikroarşitektüründe AI Performansını Kısan Donanım Anahtarları
GPU mikroarşitektüründe AI performansını dinamik sınırlayan dört donanım anahtarı: düşük maliyetli, hızlı stabilize olan güvenlik mekanizması.
Araştırma: LLM'lerin rol tanıma açığı saldırılara karşı temelden kırılgan
ICML araştırması, LLM'lerin rolleri etiket değil metin üslubuyla tanıdığını, bunun da temelden çözülemez bir güvenlik açığı yarattığını gösteriyor.
Çok Modelli AI Hatlarında Gerçek Neden Kayboluyor
Çok modelli YZ sistemlerinde model geçişleri, hata vermeden kanıtları ve uyarı notlarını kaybedebilir, temkinli bulguları yanlış kesinliğe dönüştürebilir.
Google'ın AI Control Roadmap'i: Yapay zeka ajanlarını içeriden gelen tehdit gibi izliyor
Google'ın AI Control Roadmap'i, gelişmiş yapay zeka ajanlarını içeriden tehdit gibi ele alan çok katmanlı güvenlik çerçevesini tanıtıyor.
ActionRail: Yapay Zeka Ajanları için Çalışma Zamanı Doğrulama Katmanı
ToolJet'in ActionRail projesi, AI ajanlarının araç çağrılarını çalıştırmadan önce canlı verilerle doğrulayan açık kaynak çerçeve sunuyor.
Yeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.
Herkes AI'nin Çökmesini Bekliyor, Ben Güvenlik Ağı Kuruyorum
AI ajanlarının üretim verisini silmesi erişim-yetki karışıklığından kaynaklanıyor; yazar, öneri üreten AI'yı kod ile doğrulayan bir güvenlik ağı test ediyor.