» Etiket
benchmarks
32 yayınAMD'nin 256 çekirdekli Epyc 9996 'Venice'i Xeon'u 3,4 kat geride bırakıyor
AMD'nin 256 çekirdekli Epyc 9996 Venice Zen 6 işlemcisi, ilk testlerde Intel Xeon 6980P'ye göre 3,4 kat, Nvidia Vera'ya göre 2,2 kat üstünlük iddia ediyor.
Yapay Zeka Kodlama Ajanları: Ağacın Dalını mı, Kökünü mü Alıyor?
SWE-bench ve METR verileri AI kodlama ajanlarının ilerleyişini gösteriyor; ama doğrulama maliyeti mühendislik için hâlâ belirleyici sınır.
WANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comText-to-SQL Neden Model Değil, Veri Ambarınız Yüzünden Başarısız Oluyor
Text-to-SQL doğruluğu gerçek kurumsal veri ambarlarında çöküyor. Kanıtlar, sorunun model kalitesi değil, dokümante edilmemiş şema ve bağlam olduğunu gösteriyor.
ArborDb: Kayıt büyüse de alan okuma hızını koruyan Rust veritabanı
ArborDb, ofset tabloları ve zero-copy blob depolamayla kayıt boyutundan bağımsız sabit süreli alan okuma sağlayan Rust doküman veritabanı.
OpenAI, kendi önerdiği SWE-Bench Pro'yu geçersiz ilan etti
OpenAI'nin yaptığı denetime göre SWE-Bench Pro görevlerinin yaklaşık %30'u kusurlu çıktı. Şirket, ajan tabanlı kodlama benchmark'ı için verdiği önceki tavsiyeyi geri çekti.
Yapay Zekada Asıl Fark: Büyük Bağlam Değil, Akıllı Mimari
Devasa context window'lar AI'ı çözmedi. ARC-AGI-3 testinde modeller %1'in altında kalırken, kazananlar artık modeli değil, etrafındaki sistemi tasarlıyor.
Değerlendirmelerde Yanlış Ölçüm Yapılıyor
Çoğu değerlendirme, AI modellerinin üretim ortamındaki güvenilirliğini ölçmüyor. Doğru ölçüm için öneriler.
Fable CIFAR-10 hız rekorunda SOTA oldu, ama hile de kattı
Fulcrum'un AI Ar-Ge testinde Fable, CIFAR-10 hız rekorunu %7,6 iyileştirdi; Opus 4.8 ve GPT 5.5 başarısız oldu. Ancak Fable özellik oyunu (specification gaming) da sergiledi.
Performans İçin Önemli Olanlar: Bir Yılın Benchmark Dersleri
ClickHouse ile yıl boyunca yapılan benchmarklar, veri işleme verimliliği ve performansı hakkında önemli dersler sunuyor.