» Etiket
nlp
20 yayınGigatoken: HuggingFace tokenizer'lardan ~1000x hızlı tokenizasyon
Gigatoken, HuggingFace tokenizers'a kıyasla ~1000x hızlı, Rust tabanlı drop-in tokenizasyon kütüphanesi; GB/s seviyesinde işleme sunuyor.
Farklı tokenizer'lı öğretmenden distilasyon: bilginin %85'i haritalamada kayboluyor
Farklı tokenizer'lı model damıtmasında top-K logit projeksiyonu bilginin %85'ini yok edebilir; zincir kuralı tabanlı düzeltme korunumu %86'ya çıkarıyor.
LLM Hakemlerdeki Önyargı: Aktivasyon Geometrisiyle Açıklanıyor
LLM-as-judge önyargısını aktivasyon geometrisiyle açıklayan çalışma; nedensel steering ve doğrusal problarla hata öngörüsü sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comGigatoken: Rust BPE Tokenizer 24.53 GB/s'e Ulaştı, 989 Kat Hızlandı
Rust tabanlı Gigatoken, regex yerine SWAR ve dual-cursor teknikleriyle BPE tokenizasyonda 24.53 GB/s hıza ulaşarak HuggingFace tokenizers'ı geride bırakıyor.
pdfmuse: Gerçek Verilerde Sınanan Deterministik PDF Ayrıştırıcı
pdfmuse deterministik PDF ayrıştırıcısı, gerçek özgeçmiş verilerinde %10 sessiz hata bulup form XObject işleme sorununu nasıl çözdü.
Yapay Zeka Neden İngilizce Dışında Daha Kötü Çalışıyor?
Büyük dil modellerinin İngilizce dışında neden daha kötü çalıştığını; eğitim verisi, tokenizer verimliliği ve maliyet açısından inceliyoruz.
StoryScope: Yapay Zekanın Anlatı İmzasını Ortaya Çıkarıyor
StoryScope, üslup yerine anlatı yapısına odaklanarak yapay zeka kurgusunu %93 doğrulukla tespit ediyor ve modele özgü anlatı imzalarını ortaya çıkarıyor.
AB Yapay Zeka Yasası için açık, yapısal olarak bölünmüş RAG veri kümesi yayınlandı
AB Yapay Zeka Yasası'nın hukuki yapısına göre bölünmüş, 933 parçalık açık SQLite veri kümesi RAG ve hukuk mühendisliği için yayınlandı.
Biyoenformatikten prompt injection savunmasına: Smith-Waterman hilesi
Regex ve sınıflandırıcıların kaçırdığı parafraze prompt injection saldırılarını, DNA dizi hizalama algoritması Smith-Waterman ile yakalayan açık kaynak teknik F1 skorunu 34 puan artırdı.
RAG Değerlendirmesi: Güvenilirlik, Bağlam Hatırlama ve Cevap Alaka Düzeyi
RAGAs değerlendirmesi, AI sistemlerinin güvenilirliğini artırmak için üç ana metriği kullanır: güvenilirlik, bağlam hatırlama ve cevap alaka düzeyi.