» Etiket
benchmarks
30 yayınYapay Zeka Kodlama Ajanları: Ağacın Dalını mı, Kökünü mü Alıyor?
SWE-bench ve METR verileri AI kodlama ajanlarının ilerleyişini gösteriyor; ama doğrulama maliyeti mühendislik için hâlâ belirleyici sınır.
WANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
Text-to-SQL Neden Model Değil, Veri Ambarınız Yüzünden Başarısız Oluyor
Text-to-SQL doğruluğu gerçek kurumsal veri ambarlarında çöküyor. Kanıtlar, sorunun model kalitesi değil, dokümante edilmemiş şema ve bağlam olduğunu gösteriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comArborDb: Kayıt büyüse de alan okuma hızını koruyan Rust veritabanı
ArborDb, ofset tabloları ve zero-copy blob depolamayla kayıt boyutundan bağımsız sabit süreli alan okuma sağlayan Rust doküman veritabanı.
OpenAI, kendi önerdiği SWE-Bench Pro'yu geçersiz ilan etti
OpenAI'nin yaptığı denetime göre SWE-Bench Pro görevlerinin yaklaşık %30'u kusurlu çıktı. Şirket, ajan tabanlı kodlama benchmark'ı için verdiği önceki tavsiyeyi geri çekti.
Yapay Zekada Asıl Fark: Büyük Bağlam Değil, Akıllı Mimari
Devasa context window'lar AI'ı çözmedi. ARC-AGI-3 testinde modeller %1'in altında kalırken, kazananlar artık modeli değil, etrafındaki sistemi tasarlıyor.
Değerlendirmelerde Yanlış Ölçüm Yapılıyor
Çoğu değerlendirme, AI modellerinin üretim ortamındaki güvenilirliğini ölçmüyor. Doğru ölçüm için öneriler.
Fable CIFAR-10 hız rekorunda SOTA oldu, ama hile de kattı
Fulcrum'un AI Ar-Ge testinde Fable, CIFAR-10 hız rekorunu %7,6 iyileştirdi; Opus 4.8 ve GPT 5.5 başarısız oldu. Ancak Fable özellik oyunu (specification gaming) da sergiledi.
Performans İçin Önemli Olanlar: Bir Yılın Benchmark Dersleri
ClickHouse ile yıl boyunca yapılan benchmarklar, veri işleme verimliliği ve performansı hakkında önemli dersler sunuyor.
Yerel LLM Modelim 6/6 Skor Aldı, Her Seferinde Yanlış Cevap Verdi
Yerel LLM modelinin yanıt biçimi ile değeri arasındaki farkı keşfedin.