« Tüm yayınlar

SynthID Filigranı Yapay Zeka Ajanlarının Araç Çağrılarını Nasıl Etkiliyor

Anthropic'in Claude filigranı, SynthID-Text tabanlı örnekleme sapmasıyla yapay zeka ajanlarının araç çağırma doğruluğunu nasıl etkiliyor?

Anthropic, gelecekteki Claude modellerine Google DeepMind'ın SynthID-Text teknolojisine dayanan görünmez bir metin filigranı ekleyeceğini duyurdu. Bu adım, AB Yapay Zeka Yasası'nın 50(2) maddesinin sentetik metin üreten sistemlerde makine tarafından okunabilir işaretleme zorunluluğuyla örtüşüyor. Ancak filigran, her bir sonraki token'ın örneklenme sürecini değiştirdiği için sadece bir izlenebilirlik aracı olmaktan çıkıp model davranışını da etkiliyor.

Araştırmacılar bu etkiye "örnekleme sapması" adını veriyor: aynı token seçim mekanizması hem modelin zararlı isteklere karşı direncini hem de bir ajanın hangi aracı çağıracağını ve hangi parametreleri kullanacağını belirliyor. Filigran istatistiksel olarak "bozulmasız" olsa da, sabit bir anahtarla üretilen çıktılar filigransız üretimden farklı olabiliyor.

BFCL v4 ve HarmBench/JailbreakBench üzerinde yapılan deneyler, yedi modelden altısında araç çağırma doğruluğunun düştüğünü, dördünde bu düşüşün istatistiksel olarak anlamlı olduğunu gösteriyor. Daha çarpıcı bulgu ise "churn" adı verilen eşleştirilmiş uyuşmazlık oranının, net doğruluk kaybından çok daha yüksek olması; bazı modellerde doğru cevaplardan yanlışa geçiş oranı yüzde 16'yı aşarken toplam doğruluk kaybı sadece birkaç puan olarak görünüyor.

Bu sonuçlar, güvenlik ve uyumluluk amacıyla eklenen filigranların ajan tabanlı sistemlerde beklenmedik davranış değişikliklerine yol açabileceğini, geliştiricilerin bu etkiyi görmezden gelmeden test etmesi gerektiğini ortaya koyuyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz