» Etiket
ai-safety
44 yayınÇok Modelli AI Hatlarında Gerçek Neden Kayboluyor
Çok modelli YZ sistemlerinde model geçişleri, hata vermeden kanıtları ve uyarı notlarını kaybedebilir, temkinli bulguları yanlış kesinliğe dönüştürebilir.
Google'ın AI Control Roadmap'i: Yapay zeka ajanlarını içeriden gelen tehdit gibi izliyor
Google'ın AI Control Roadmap'i, gelişmiş yapay zeka ajanlarını içeriden tehdit gibi ele alan çok katmanlı güvenlik çerçevesini tanıtıyor.
ActionRail: Yapay Zeka Ajanları için Çalışma Zamanı Doğrulama Katmanı
ToolJet'in ActionRail projesi, AI ajanlarının araç çağrılarını çalıştırmadan önce canlı verilerle doğrulayan açık kaynak çerçeve sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.
Herkes AI'nin Çökmesini Bekliyor, Ben Güvenlik Ağı Kuruyorum
AI ajanlarının üretim verisini silmesi erişim-yetki karışıklığından kaynaklanıyor; yazar, öneri üreten AI'yı kod ile doğrulayan bir güvenlik ağı test ediyor.
Yapay Zeka Ajanına Gerçekten İtiraz Ettirmek Neden Zor
Sadece eleştiri yapmakla görevli bir yapay zeka ajanı geliştirirken karşılaşılan zorluklar: modellerin doğal uyumluluk eğilimini kırmak için kullanılan prompt ve mimari teknikleri.
Biyoenformatikten prompt injection savunmasına: Smith-Waterman hilesi
Regex ve sınıflandırıcıların kaçırdığı parafraze prompt injection saldırılarını, DNA dizi hizalama algoritması Smith-Waterman ile yakalayan açık kaynak teknik F1 skorunu 34 puan artırdı.
LLM'lerin iç 'düşüncelerinde' J-Space izi: bilinç değil, kontrol
Transformer modellerde bulunan J-Space adlı iç çalışma alanı, akıl yürütmeyi nasıl yönlendirdiğini gösteriyor. Geliştiriciler için pratik sonuçlar.
LLM'i Konuşturma, Gizli Durumunu Sonda ile Oku
LLM'ler cevabı üretmeden önce gizli katmanlarında taşır. Bu teknik, metin üretmeden küçük bir sonda ile hızlı, ucuz ve kalibre edilmiş sıfır-atış sınıflandırma sağlıyor.
Çoklu ajan sistemlerinde hata çığları: çift sarkaç problemi
Araştırma-plan-kodlama zincirinde küçük bir hata neden katlanarak büyür? Çoklu ajan mimarilerinde hata amplifikasyonu ve insan kontrol noktalarının önemi.