» Etiket
machine-learning
163 yayınLLM Quantization Rehberi: GPTQ, AWQ ve GGUF Karşılaştırması
Büyük dil modellerini 4-bit'e sıkıştırarak VRAM ihtiyacını düşüren quantization tekniklerini; GPTQ, AWQ, GGUF ve bitsandbytes yöntemlerini karşılaştırmalı olarak inceliyoruz.
Ölçekleme Yasaları: Kaplan'dan Chinchilla'ya, Aşırı Eğitime
LLM ölçekleme yasalarının Kaplan'dan Chinchilla'ya evrimi ve mühendislerin neden modelleri kasıtlı olarak aşırı eğittiği açıklanıyor.
Araştırma: LLM'lerin rol tanıma açığı saldırılara karşı temelden kırılgan
ICML araştırması, LLM'lerin rolleri etiket değil metin üslubuyla tanıdığını, bunun da temelden çözülemez bir güvenlik açığı yarattığını gösteriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comHer Şeyi Fine-Tune Etmeyin: Model Uyarlama Karar Çerçevesi
Fine-tuning tek seçenek değil: prompt engineering, RAG, ICL ve domain pre-training arasında doğru stratejiyi seçmek için karar çerçevesi.
Yapay Zeka Kodlama Ajanları: Ağacın Dalını mı, Kökünü mü Alıyor?
SWE-bench ve METR verileri AI kodlama ajanlarının ilerleyişini gösteriyor; ama doğrulama maliyeti mühendislik için hâlâ belirleyici sınır.
Few-shot örnekleri eval setinden geldi: 0.94 skoru bir kurguydu
Few-shot seçici ve eval seti aynı JSONL dosyasını paylaşınca 0.94 skoru sahteydi. Prompt-zamanı veri kirlenmesi ve kontrol yöntemi.
IRT benzeri pratik skoru, gerçek bir IQ testi değildir
IntelligenceMax'in IRT-benzeri pratik skoru neden gerçek bir IQ ölçümü değil; madde parametreleri, kalibrasyon ve transfer sınırları incelendi.
x86'nın yeni matris hızlandırıcısı ACE, Arm SME'ye rakip oluyor
Intel'in ACE hızlandırıcısı AMX'i dış çarpım mimarisine taşıyor; Arm SME2 ile karşılaştırmalı teknik analiz.
Kendi Kendine Ödüllenen LLM'ler: Doğruluk Değil İkna Kazanıyor
Referanssız LLM hakemleriyle kendi çıktısını değerlendiren modeller doğruluğu değil ikna ediciliği ödüllendiriyor; GSM8K deneyinde hakem onayı artarken gerçek doğruluk sabit kalıyor.
1 milyon token başına fiyat neden yanıltıcı bir metrik
AI modellerini token başına fiyatla karşılaştırmak yanıltıcı olabilir. Tokenizer farkları ve chain-of-thought verimliliği, gerçek görev maliyetini token fiyatından çok daha fazla etkiliyor.