» Etiket
ai-safety
35 yayınAraştırma: LLM'lerin rol tanıma açığı saldırılara karşı temelden kırılgan
ICML araştırması, LLM'lerin rolleri etiket değil metin üslubuyla tanıdığını, bunun da temelden çözülemez bir güvenlik açığı yarattığını gösteriyor.
Çok Modelli AI Hatlarında Gerçek Neden Kayboluyor
Çok modelli YZ sistemlerinde model geçişleri, hata vermeden kanıtları ve uyarı notlarını kaybedebilir, temkinli bulguları yanlış kesinliğe dönüştürebilir.
Google'ın AI Control Roadmap'i: Yapay zeka ajanlarını içeriden gelen tehdit gibi izliyor
Google'ın AI Control Roadmap'i, gelişmiş yapay zeka ajanlarını içeriden tehdit gibi ele alan çok katmanlı güvenlik çerçevesini tanıtıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comActionRail: Yapay Zeka Ajanları için Çalışma Zamanı Doğrulama Katmanı
ToolJet'in ActionRail projesi, AI ajanlarının araç çağrılarını çalıştırmadan önce canlı verilerle doğrulayan açık kaynak çerçeve sunuyor.
Yeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.
Herkes AI'nin Çökmesini Bekliyor, Ben Güvenlik Ağı Kuruyorum
AI ajanlarının üretim verisini silmesi erişim-yetki karışıklığından kaynaklanıyor; yazar, öneri üreten AI'yı kod ile doğrulayan bir güvenlik ağı test ediyor.
Yapay Zeka Ajanına Gerçekten İtiraz Ettirmek Neden Zor
Sadece eleştiri yapmakla görevli bir yapay zeka ajanı geliştirirken karşılaşılan zorluklar: modellerin doğal uyumluluk eğilimini kırmak için kullanılan prompt ve mimari teknikleri.
Biyoenformatikten prompt injection savunmasına: Smith-Waterman hilesi
Regex ve sınıflandırıcıların kaçırdığı parafraze prompt injection saldırılarını, DNA dizi hizalama algoritması Smith-Waterman ile yakalayan açık kaynak teknik F1 skorunu 34 puan artırdı.
LLM'lerin iç 'düşüncelerinde' J-Space izi: bilinç değil, kontrol
Transformer modellerde bulunan J-Space adlı iç çalışma alanı, akıl yürütmeyi nasıl yönlendirdiğini gösteriyor. Geliştiriciler için pratik sonuçlar.
LLM'i Konuşturma, Gizli Durumunu Sonda ile Oku
LLM'ler cevabı üretmeden önce gizli katmanlarında taşır. Bu teknik, metin üretmeden küçük bir sonda ile hızlı, ucuz ve kalibre edilmiş sıfır-atış sınıflandırma sağlıyor.