ScarfBench: Java Framework Göçünde AI Ajanlarını Test Eden Benchmark
ScarfBench, AI ajanlarının Spring/Jakarta EE/Quarkus arası Java göçlerinde derleme, dağıtım ve davranış başarısını ölçen açık benchmark.
ScarfBench, kurumsal Java uygulamalarını Spring, Jakarta EE ve Quarkus arasında taşıma görevlerinde AI kodlama ajanlarını değerlendiren açık bir benchmark. Klasik kod üretimi kıyaslamalarının aksine, göçün gerçekten derlenip dağıtılıp davranışsal olarak doğru çalıştığını ölçüyor; 34 uygulama, 204 göç görevi ve 1.331 uzman testinden oluşuyor.
Sonuçlar dikkat çekici: en güçlü ajanlar bile %10'un altında davranışsal başarı elde ediyor. Derleme başarısı dağıtım başarısını, dağıtım başarısı da davranışsal başarıyı sürekli aşıyor — yani sadece derlenen kod, göçün kalitesini ciddi şekilde yanıltıcı gösteriyor. Jakarta EE hedef olarak özellikle zorlayıcı çıktı.
Ayrıca ajanların kendi kendini değerlendirmesi güvenilir bulunmadı: Claude Code 30 uygulamadan 29'unu başarılı derlendi olarak raporladı, ama bağımsız doğrulamada sadece 22'si gerçekten derlendi. Göç işlemi doğrusal değil, konfigürasyon-web-veritabanı-servis katmanları arasında yinelemeli bir bağımlılık çözümü sürecine benziyor; Docker önbelleği, port bağlantısı ve Maven wrapper gibi ortam/araçlama sorunları da göçü sık sık geciktiriyor.
Ekip; veri seti, değerlendirme altyapısı, açık kaynak kod ve genel sıralama tablosunu araştırmacılar ve pratisyenler için ücretsiz olarak yayınladı.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz