« Tüm yayınlar

Gigatoken: HuggingFace tokenizer'lardan ~1000x hızlı tokenizasyon

Gigatoken, HuggingFace tokenizers'a kıyasla ~1000x hızlı, Rust tabanlı drop-in tokenizasyon kütüphanesi; GB/s seviyesinde işleme sunuyor.

Gigatoken, Rust ile yazılmış ve HuggingFace Tokenizers ile tiktoken'a doğrudan alternatif olarak konumlanan yeni bir tokenizer kütüphanesi. GPT-2, Llama, Qwen, DeepSeek ve GLM gibi yaygın kullanılan tokenizer mimarilerini destekliyor ve CPU başına GB/s seviyesinde işleme hızına ulaşıyor. Yayımlanan ölçümlere göre AMD EPYC 9565 (144 çekirdek) üzerinde HuggingFace tokenizers'a kıyasla 989 kata, Apple M4 Max'te ise 1353 kata varan hızlanma sağlanıyor.

Kütüphane iki kullanım modu sunuyor: mevcut HF veya tiktoken kodunu neredeyse hiç değiştirmeden çalıştıran uyumluluk modu, ve maksimum performans için Rust tarafında dosyaları doğrudan okuyan native Gigatoken API'si. Hız artışının büyük kısmı, genellikle regex motorlarına devredilen pretoken ayrıştırma işleminin SIMD ile optimize edilmesinden ve tekrar eden kelimeler için önbellekleme stratejisinden geliyor.

Büyük dil modeli eğitim hatlarında tokenizasyon sıklıkla veri işleme darboğazı oluşturuyor; bu ölçekte bir hızlanma, büyük corpus'ların (ör. Common Crawl) saatler yerine dakikalar içinde işlenmesini mümkün kılabilir ve GPU maliyetli eğitim öncesi veri hazırlama süresini önemli ölçüde kısaltabilir.