« Tüm yayınlar

Yapay Zeka Tersine Mühendislik Ölçeği

AgentRE-Bench, AI ajanlarının tersine mühendislik yeteneklerini değerlendiriyor. Kalibrasyon, akıl yürütme derinliğinden daha etkili.

AgentRE-Bench, LLM ajanlarını kaynak kodu olmadan derlenmiş tersine mühendislik görevlerinde değerlendiriyor. Sonuçlar, derin akıl yürütmenin her zaman kazanmadığını, yanılsama kalibrasyonunun önemli olduğunu gösteriyor. Bu halka açık ölçek, AI tersine mühendislik ajanları için güvenilir bir katman sunuyor ve özel değerlendirmeler, ajanların yayımlanmamış ikili dosyalara genel olarak uyum sağlama yeteneklerini test ediyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz