» Etiket
machine-learning
138 yayınAraştırma: LLM'lerin rol tanıma açığı saldırılara karşı temelden kırılgan
ICML araştırması, LLM'lerin rolleri etiket değil metin üslubuyla tanıdığını, bunun da temelden çözülemez bir güvenlik açığı yarattığını gösteriyor.
Her Şeyi Fine-Tune Etmeyin: Model Uyarlama Karar Çerçevesi
Fine-tuning tek seçenek değil: prompt engineering, RAG, ICL ve domain pre-training arasında doğru stratejiyi seçmek için karar çerçevesi.
Yapay Zeka Kodlama Ajanları: Ağacın Dalını mı, Kökünü mü Alıyor?
SWE-bench ve METR verileri AI kodlama ajanlarının ilerleyişini gösteriyor; ama doğrulama maliyeti mühendislik için hâlâ belirleyici sınır.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comFew-shot örnekleri eval setinden geldi: 0.94 skoru bir kurguydu
Few-shot seçici ve eval seti aynı JSONL dosyasını paylaşınca 0.94 skoru sahteydi. Prompt-zamanı veri kirlenmesi ve kontrol yöntemi.
IRT benzeri pratik skoru, gerçek bir IQ testi değildir
IntelligenceMax'in IRT-benzeri pratik skoru neden gerçek bir IQ ölçümü değil; madde parametreleri, kalibrasyon ve transfer sınırları incelendi.
x86'nın yeni matris hızlandırıcısı ACE, Arm SME'ye rakip oluyor
Intel'in ACE hızlandırıcısı AMX'i dış çarpım mimarisine taşıyor; Arm SME2 ile karşılaştırmalı teknik analiz.
Kendi Kendine Ödüllenen LLM'ler: Doğruluk Değil İkna Kazanıyor
Referanssız LLM hakemleriyle kendi çıktısını değerlendiren modeller doğruluğu değil ikna ediciliği ödüllendiriyor; GSM8K deneyinde hakem onayı artarken gerçek doğruluk sabit kalıyor.
1 milyon token başına fiyat neden yanıltıcı bir metrik
AI modellerini token başına fiyatla karşılaştırmak yanıltıcı olabilir. Tokenizer farkları ve chain-of-thought verimliliği, gerçek görev maliyetini token fiyatından çok daha fazla etkiliyor.
Thinking Machines, Inkling Small ile Açık Kaynak AI Modelini Tanıttı
Thinking Machines, Inkling-Small modelini tanıttı. Daha küçük boyutla yüksek performans sunuyor.
LLM'lerin Kriptanaliz Yeteneğini Ölçme
Yeni benchmark, LLM'lerin kriptanaliz yeteneğini ölçüyor. Anthropic'in modeli yeni saldırılar keşfetti.