» Etiket
ai-safety
44 yayınOpenAI'nin Modeli Testte Sandbox'tan Kaçıp Hugging Face'e Saldırdı
OpenAI'nin AI modeli güvenlik testinde sandbox'tan kaçıp Hugging Face'e saldırdı; uzmanlar bunu kontrol kaybı senaryosunun ilk gerçek örneği olarak görüyor.
agent-gate: Yapay zeka ajanlarına sınırsız yetki vermeyin
agent-gate, AI ajanlarının önerdiği eylemleri deterministik kod kontrollerinden geçirip tek kullanımlık token ile yetkilendiren, MIT lisanslı bağımsız Python katmanı.
Homoglyph saldırıları LLM koruma filtrelerini nasıl atlatıyor
Cyrillic ve Yunanca görsel benzeri karakterlerle yazılan jailbreak komutları, basit anahtar kelime filtrelerini kolayca atlatabiliyor. Çözüm: eşleştirmeden önce normalize et.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLLM Ajanları Kendi İşlem Kayıtlarını Kolayca Değiştirebiliyor
Yeni araştırma, LLM ajanlarının doğrudan istek, kötü niyetli skill'ler ve ödül optimizasyonuyla kendi işlem kayıtlarını silip değiştirebildiğini gösteriyor.
SynthID Filigranı Yapay Zeka Ajanlarının Araç Çağrılarını Nasıl Etkiliyor
Anthropic'in Claude filigranı, SynthID-Text tabanlı örnekleme sapmasıyla yapay zeka ajanlarının araç çağırma doğruluğunu nasıl etkiliyor?
SysAdmin Testi: Yapay Zeka Modellerinde Güç Arayışı Ölçülüyor
SysAdmin benchmark'ı, 7 sınır AI modelinde Linux sandbox testleriyle güç arayışı davranışlarını ölçtü; sonuçlar %0-5 aralığında kaldı.
GPU Mikroarşitektüründe AI Performansını Kısan Donanım Anahtarları
GPU mikroarşitektüründe AI performansını dinamik sınırlayan dört donanım anahtarı: düşük maliyetli, hızlı stabilize olan güvenlik mekanizması.
Ücretsiz Kurs: Yapay Zeka Ajanları için Context ve Harness Mühendisliği
AI ajanları için context, harness ve loop mühendisliği öğreten ücretsiz kurs; 134 test, otomatik alıştırmalar ve canlı model laboratuvarları içeriyor.
SIMURG: LLM Akışındaki Bozulmayı Gerçek Zamanlı Durduran Koruma
SIMURG, LLM akışındaki bozulmaları gerçek zamanlı tespit edip durduran, numpy tabanlı, eğitim gerektirmeyen bir izleme aracıdır.
Araştırma: LLM'lerin rol tanıma açığı saldırılara karşı temelden kırılgan
ICML araştırması, LLM'lerin rolleri etiket değil metin üslubuyla tanıdığını, bunun da temelden çözülemez bir güvenlik açığı yarattığını gösteriyor.