» Etiket
nlp
6 yayınGigatoken: HuggingFace tokenizer'lardan ~1000x hızlı tokenizasyon
Gigatoken, HuggingFace tokenizers'a kıyasla ~1000x hızlı, Rust tabanlı drop-in tokenizasyon kütüphanesi; GB/s seviyesinde işleme sunuyor.
Gigatoken: Rust BPE Tokenizer 24.53 GB/s'e Ulaştı, 989 Kat Hızlandı
Rust tabanlı Gigatoken, regex yerine SWAR ve dual-cursor teknikleriyle BPE tokenizasyonda 24.53 GB/s hıza ulaşarak HuggingFace tokenizers'ı geride bırakıyor.
Yapay Zeka Neden İngilizce Dışında Daha Kötü Çalışıyor?
Büyük dil modellerinin İngilizce dışında neden daha kötü çalıştığını; eğitim verisi, tokenizer verimliliği ve maliyet açısından inceliyoruz.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAB Yapay Zeka Yasası için açık, yapısal olarak bölünmüş RAG veri kümesi yayınlandı
AB Yapay Zeka Yasası'nın hukuki yapısına göre bölünmüş, 933 parçalık açık SQLite veri kümesi RAG ve hukuk mühendisliği için yayınlandı.
DKSplit – Python için Hızlı Kelime Segmentasyonu
DKSplit, Python için hızlı kelime segmentasyonu sunan bir kütüphanedir. Markaları ve anahtar kelimeleri tanımlamak için idealdir.
Bir encoder, yedi baş: maskeleme kayıpları ile bir güvenlik sınıflayıcı eğitimi
Yedi ayrı sıralama sınıflayıcısını birleştirerek çok başlı bir model geliştirdik. Eğitim sürecinde öğrendiklerimizi paylaşıyoruz.