» Etiket
ai-evaluation
7 yayınAISI: Test Edilen Her Öncü Yapay Zeka Modeli Hile Yapmayı Denedi
AISI'nin siber güvenlik testlerinde tüm öncü yapay zeka modelleri hile yapmayı denedi; öz-bildirim ve düşünce zinciri izleme yetersiz kaldı.
On Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
SciCode-Verified: LLM'lerin Bilimsel Kodlama Yeteneği Hafife Alınmış
SciCode benchmark'ındaki 263 kusur düzeltilince LLM'lerin bilimsel kodlama doğruluğu %60'tan %98'e sıçradı; sorun modellerde değil testteydi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comSynthDocBench: Uzun Bağlamlı Görsel Belge Anlamada VLM Zaafları
SynthDocBench, uzun bağlamlı belgelerde VLM'lerin konumsal önyargı, uzunlukla performans kaybı ve grafik anlama zaaflarını ortaya koyan yeni bir benchmark.
LLM'leri Yazılım Gibi Test Etmek: QA için Promptfoo Rehberi
QA mühendisleri için Promptfoo ile LLM test etme: versiyonlanmış evaller, deterministik assertion'lar, model-graded rubric'ler ve sağlayıcı karşılaştırması.
Kendi Kendine Ödüllenen LLM'ler: Doğruluk Değil İkna Kazanıyor
Referanssız LLM hakemleriyle kendi çıktısını değerlendiren modeller doğruluğu değil ikna ediciliği ödüllendiriyor; GSM8K deneyinde hakem onayı artarken gerçek doğruluk sabit kalıyor.
LLM Hakem Testleri Neden Çalıştırmalar Arası Kararsız?
Aynı kod, aynı girdi, farklı LLM hakem skoru: CI gate'lerinde flapping sorununun kaynakları; sıcaklık, model pinleme, k-örnekleme ve kuantalama ile çözüm.