» Etiket
machine-learning
51 yayın78.130 Tweet, Llama-3.3-70B: Trump Piyasayı Değil, Piyasa Trump'ı Yönlendiriyor
78.130 tweet üzerinde LLM analizi: Trump'ın paylaşımları piyasayı mı yönlendiriyor, yoksa tersi mi? Yedi istatistiksel hata, tek null sonuç.
Farklı tokenizer'lı öğretmenden distilasyon: bilginin %85'i haritalamada kayboluyor
Farklı tokenizer'lı model damıtmasında top-K logit projeksiyonu bilginin %85'ini yok edebilir; zincir kuralı tabanlı düzeltme korunumu %86'ya çıkarıyor.
"Halüsinasyon" Tek Bir Hata Değil, Üç Farklı Hata
Halüsinasyon üç ayrı sorun: düzeltilebilir bağlam eksikliği, doğrulanamaz akıcılık ve ulaşılamaz gelecek bilgisi. Mühendisler için ayrım rehberi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comSDABench: LLM'leri Bilimsel Keşifte Test Eden Yeni Kıstas
SDABench, LLM'leri kod çalıştırma yerine altı bilimsel yetenek üzerinden test eden yeni bir kıstas; sonuçlar ciddi eksiklikleri ortaya koyuyor.
Harness Pretraining'den Önce mi Gelmeli? Veri Çarkı Perspektifi
AI ajanlarında harness ve pretraining ilişkisini, veri çarkı ve model önyargıları üzerinden inceleyen teknik bir analiz.
Airbnb LLM Değerlendirmesini Haftalardan Bir Güne Nasıl İndirdi
Airbnb'nin dört katmanlı LLM değerlendirme altyapısı, deterministik önbellekleme ve micro LoRA adaptörleriyle iterasyon süresini haftalardan bir güne indiriyor.
Few-shot örnekleri eval setinden geldi: 0.94 skoru bir kurguydu
Few-shot seçici ve eval seti aynı JSONL dosyasını paylaşınca 0.94 skoru sahteydi. Prompt-zamanı veri kirlenmesi ve kontrol yöntemi.
IRT benzeri pratik skoru, gerçek bir IQ testi değildir
IntelligenceMax'in IRT-benzeri pratik skoru neden gerçek bir IQ ölçümü değil; madde parametreleri, kalibrasyon ve transfer sınırları incelendi.
x86'nın yeni matris hızlandırıcısı ACE, Arm SME'ye rakip oluyor
Intel'in ACE hızlandırıcısı AMX'i dış çarpım mimarisine taşıyor; Arm SME2 ile karşılaştırmalı teknik analiz.
Kod onarım eğitim verisi oluşturuldu ve değerlendirme paylaşıldı
Yeni kod onarım veri seti, mühendislerin doğruluğu test etmesine olanak tanıyor. Hata düzeltme oranları %17'den %40'a çıkıyor.