» Etiket
benchmarks
35 yayınTutorMoments: Yapay Zeka Öğretmenler Ne Zaman Yardım Etmeli?
Allen AI'nin TutorMoments benchmark'ı, LLM öğretmenlerin ne zaman destek olup ne zaman öğrenciyi zorlaması gerektiğini bilip bilmediğini test ediyor.
Text-to-SQL benchmarklarında cevap anahtarı yerine veritabanı üretmek
UIUC'nin denetimi BIRD ve Spider 2.0'daki anotasyonların yarısından fazlasının hatalı olduğunu gösterdi. Bir geliştirici, cevabı önce tanımlayıp veritabanını sonra üreten ters bir yaklaşım denedi.
DeepSeek'ten GPT-OSS'e Damıtma Sansürü Değil, Sadece Beceriyi Aktarıyor
LineageEval testine göre, DeepSeek'ten GPT-OSS-120B'ye damıtma finansal akıl yürütmeyi artırırken öğretmenin siyasi sansürünü öğrenciye aktarmıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAMD'nin 256 çekirdekli Epyc 9996 'Venice'i Xeon'u 3,4 kat geride bırakıyor
AMD'nin 256 çekirdekli Epyc 9996 Venice Zen 6 işlemcisi, ilk testlerde Intel Xeon 6980P'ye göre 3,4 kat, Nvidia Vera'ya göre 2,2 kat üstünlük iddia ediyor.
Yapay Zeka Kodlama Ajanları: Ağacın Dalını mı, Kökünü mü Alıyor?
SWE-bench ve METR verileri AI kodlama ajanlarının ilerleyişini gösteriyor; ama doğrulama maliyeti mühendislik için hâlâ belirleyici sınır.
WANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
Text-to-SQL Neden Model Değil, Veri Ambarınız Yüzünden Başarısız Oluyor
Text-to-SQL doğruluğu gerçek kurumsal veri ambarlarında çöküyor. Kanıtlar, sorunun model kalitesi değil, dokümante edilmemiş şema ve bağlam olduğunu gösteriyor.
ArborDb: Kayıt büyüse de alan okuma hızını koruyan Rust veritabanı
ArborDb, ofset tabloları ve zero-copy blob depolamayla kayıt boyutundan bağımsız sabit süreli alan okuma sağlayan Rust doküman veritabanı.
OpenAI, kendi önerdiği SWE-Bench Pro'yu geçersiz ilan etti
OpenAI'nin yaptığı denetime göre SWE-Bench Pro görevlerinin yaklaşık %30'u kusurlu çıktı. Şirket, ajan tabanlı kodlama benchmark'ı için verdiği önceki tavsiyeyi geri çekti.
Yapay Zekada Asıl Fark: Büyük Bağlam Değil, Akıllı Mimari
Devasa context window'lar AI'ı çözmedi. ARC-AGI-3 testinde modeller %1'in altında kalırken, kazananlar artık modeli değil, etrafındaki sistemi tasarlıyor.