« Tüm yayınlar

Grab, Data Lake'ini Apache Iceberg'e Taşıyarak Ölçeklendirdi

Grab'in Hive Parquet'ten Apache Iceberg'e geçiş süreci, performans kazanımları ve açık kaynak UnifiedSparkCatalog aracı hakkında teknik özet.

Grab, petabaytlarca veriyi barındıran Hive Parquet tabanlı data lake mimarisinden Apache Iceberg'e geçişini anlattı. Dizin tabanlı Hive Metastore yaklaşımı; yüksek eşzamanlılıkta katalog gecikmesi, küçük dosya sorunu, manuel partition yönetimi ve depolama-katalog senkronizasyon kopukluğu gibi ölçeklenme sorunlarına yol açıyordu.

Iceberg'e geçişle birlikte somut kazanımlar elde edildi: Z-ordering sayesinde bazı sorgularda 70 saniyeden 6 saniyeye inen 10 kata varan performans artışı, günlük S3 API maliyetlerinde yüzde 95'e varan düşüş ve bazı işlem hatlarında yaklaşık yarı yarıya azalan compute kullanımı.

Ekip ayrıca, farklı tablo formatlarının (Iceberg, Delta, Hudi, Hive) Spark üzerinde şeffaf biçimde kullanılmasını sağlayan UnifiedSparkCatalog aracını açık kaynak olarak paylaştı. Bu katalog, kullanıcıların tabloların altında yatan formatı bilmesine gerek kalmadan sorgu yazabilmesini sağlıyor ve format geçişlerinin downstream sorguları kırmasını önlüyor.

Mühendisler için bu yazı, büyük ölçekli bir lakehouse mimarisinde tablo formatı geçişinin pratik zorluklarını ve kilit kararlarını somut sayılarla ortaya koyuyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz