» Etiket
benchmarks
10 yayınSWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
Thinking Machines Lab'dan Inkling: 975B Parametreli Açık MoE, Ayarlanabilir Düşünme
Thinking Machines Lab'ın 975B parametreli, 41B aktif Inkling modeli encoder-free multimodal MoE mimarisi ve ayarlanabilir reasoning effort sunuyor.
SirixDB: Sayfa-altı sürümlemeyle bitemporal JSON veritabanı
SirixDB, copy-on-write ve sayfa-altı sürümleme ile her revizyonu anlık sorgulanabilir kılan bitemporal bir JSON veritabanı sistemi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comNVIDIA Nemotron 3 Super, Kodlamada GPT-OSS-120B'yi Geride Bıraktı
NVIDIA'nın açık modeli Nemotron 3 Super, SWE-Bench'te GPT-OSS-120B'yi 20 puan geçti ve 2,2x daha hızlı çıkarım sunuyor.
"Halüsinasyon" Tek Bir Hata Değil, Üç Farklı Hata
Halüsinasyon üç ayrı sorun: düzeltilebilir bağlam eksikliği, doğrulanamaz akıcılık ve ulaşılamaz gelecek bilgisi. Mühendisler için ayrım rehberi.
Açık kaynaklı yeni benchmark, AI modellerindeki siyasi eğilimi ölçüyor
Açık kaynaklı The Neutrality Project, AI modellerinin siyasi eğilimlerini altı eksende ölçen, yeniden üretilebilir bir benchmark yayınladı.
SynthDocBench: Uzun Bağlamlı Görsel Belge Anlamada VLM Zaafları
SynthDocBench, uzun bağlamlı belgelerde VLM'lerin konumsal önyargı, uzunlukla performans kaybı ve grafik anlama zaaflarını ortaya koyan yeni bir benchmark.
WANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
Text-to-SQL Neden Model Değil, Veri Ambarınız Yüzünden Başarısız Oluyor
Text-to-SQL doğruluğu gerçek kurumsal veri ambarlarında çöküyor. Kanıtlar, sorunun model kalitesi değil, dokümante edilmemiş şema ve bağlam olduğunu gösteriyor.
ArborDb: Kayıt büyüse de alan okuma hızını koruyan Rust veritabanı
ArborDb, ofset tabloları ve zero-copy blob depolamayla kayıt boyutundan bağımsız sabit süreli alan okuma sağlayan Rust doküman veritabanı.