» Etiket
llm
535 yayınFine-tuning Yok: Gerçekler Doğrudan Llama-3.1-8B Ağırlıklarına Elle Kodlandı
Llama-3.1-8B'ye fine-tuning, LoRA veya RAG olmadan, elle kodlanmış nöron devreleriyle gerçek ekleyen mekanistik yorumlanabilirlik projesi ve canlı görselleştirici.
Gigatoken: HuggingFace tokenizer'lardan ~1000x hızlı tokenizasyon
Gigatoken, HuggingFace tokenizers'a kıyasla ~1000x hızlı, Rust tabanlı drop-in tokenizasyon kütüphanesi; GB/s seviyesinde işleme sunuyor.
Stagehand: Doğal Dille Konuşan AI Destekli Tarayıcı Otomasyonu
Stagehand, AI ile doğal dil talimatlarını gerçek zamanlı olarak deterministik tarayıcı eylemlerine dönüştüren açık kaynaklı otomasyon SDK'sı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comReview-Loop Engineering: Ajan Döngülerinde İnsan Denetimini Tasarlamak
Ajan kodlama döngülerinde insan denetimini gerçek kılan 'review-loop engineering' yaklaşımı: üç döngü, inceleme paketleri ve rubber-stamp riski.
Ajan Tabanlı Yapay Zekada ROI: Token Değil, Sonuç Maliyeti Ölçün
Ajan tabanlı yapay zeka yatırımlarında ROI'yi token yerine kabul edilen sonuç başına maliyetle ölçmek için beş adımlı bir çerçeve.
Yapay Zekanın Sessiz İhmallerini Yakalayan Yeni Doğrulama Katmanı
Yapay zeka modellerinin öne sürmesi gereken iddiaları sessizce atlamasını yakalayan katmanlı bir doğrulama sistemi geliştirildi.
Thinking Machines Lab'dan Inkling: 975B Parametreli Açık MoE, Ayarlanabilir Düşünme
Thinking Machines Lab'ın 975B parametreli, 41B aktif Inkling modeli encoder-free multimodal MoE mimarisi ve ayarlanabilir reasoning effort sunuyor.
Altı LLM değerlendirme aracını CI'a bağladık, sadece ikisi ayakta kaldı
Sekiz aylık gerçek CI testinde altı LLM eval aracından sadece Promptfoo ve DeepEval merge queue gate'i olarak güvenilir çıktı; nedeni determinizm.
Bir AI kod tabanınızı gerçekten anlıyor mu? Bunu nasıl test edersiniz
Bir AI ajanının kod tabanı anlayışını nasıl test edersiniz? Teardown denetimi yöntemi, on üç Ruby projesinde sınandı; güçlü ve zayıf yanları.
Colibri: 744B parametreli GLM-5.2'yi 25GB RAM ile çalıştırma
Colibri, tek dosyalık C motoruyla GLM-5.2'nin 744B parametreli MoE modelini GPU'suz, 25GB RAM'lik makinede çalıştırıyor.