data-eng-bench: Snowflake'in dbt ajan benchmark'ı
Snowflake'in data-eng-bench'i, dbt kodlama ajanlarını DuckDB ve Snowflake üzerinde 103 gerçekçi görevle test eden açık kaynak Harbor benchmark'ı.
Snowflake, kodlama ajanlarının gerçek dbt veri mühendisliği görevlerindeki performansını ölçen data-eng-bench'i yayınladı. Benchmark, büyük ve gerçekçi bir perakende veri ambarı üzerinde 103 görevden oluşuyor; her görev ajanı konteynerlenmiş bir dbt projesine bilet tarzı bir talimatla bırakıyor, ajan dbt modellerini düzenliyor veya oluşturuyor, dbt'yi çalıştırıyor ve gizli bir pytest doğrulayıcı sonuçları referans çözümle satır satır karşılaştırıyor.
Görevler analitik, geliştirme/hata düzeltme, boyutsal modelleme ile anlık görüntüler ve veri mühendisliği kategorilerine ayrılıyor; zorluk seviyeleri kolaydan çok zora kadar dağılıyor. Benchmark, Harbor çerçevesi üzerinde çalıştığı için Claude Code, Codex, Cortex Code ve Terminus gibi Harbor destekli herhangi bir ajan tek komutla değerlendirilebiliyor.
Aynı 103 görev, DB_TYPE ortam değişkeniyle seçilen DuckDB (hesap gerektirmeyen, tamamen izole) veya gerçek Snowflake backend'i üzerinde çalıştırılabiliyor. İkisini karşılaştırmak, DuckDB'de geçen ama Snowflake'de başarısız olan bir görevin, modelleme hatasından ziyade Snowflake'e özgü bir açığı işaret ettiğini gösteriyor. Ajan geliştiricileri için bu, dbt SQL doğruluğu ile platforma özgü lehçe/depo bilgisini ayrıştırma imkanı sunuyor.
Proje Apache-2.0 lisanslı, hızlı testler için dengeli bir 30 görevlik alt küme ve genel bir liderlik tablosu içeriyor; sonuçlar Harbor üzerinden yüklenip PR ile gönderilebiliyor.