» Etiket
benchmarks
30 yayınExploitGym: Yapay Zeka Ajanları Açıkları Gerçek İstismara Dönüştürüyor mu?
ExploitGym, yapay zeka ajanlarının 869 gerçek güvenlik açığını çalışan istismara dönüştürme yeteneğini test eden yeni bir kıyaslama sunuyor.
Handbook.md: Uzun politika belgeleri AI ajanlarını güvenilir şekilde yönetemiyor
Handbook.md benchmarkı, AI ajanlarının uzun şirket politika belgelerine gerçekte ne kadar uyduğunu test ediyor; sonuçlar endişe verici.
SWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comThinking Machines Lab'dan Inkling: 975B Parametreli Açık MoE, Ayarlanabilir Düşünme
Thinking Machines Lab'ın 975B parametreli, 41B aktif Inkling modeli encoder-free multimodal MoE mimarisi ve ayarlanabilir reasoning effort sunuyor.
Kimi K3 testi: Çin modelleri kodlamada ucuz, planlamada değil
Kimi K3 benchmark testinde Çin yapay zeka modelleri planlamada pahalı, kodlamada ise 19 kat daha ucuz çıktı. Gerçek maliyet analizi.
SirixDB: Sayfa-altı sürümlemeyle bitemporal JSON veritabanı
SirixDB, copy-on-write ve sayfa-altı sürümleme ile her revizyonu anlık sorgulanabilir kılan bitemporal bir JSON veritabanı sistemi.
FOMO'yla AI Kodlama: Hız Efsanesi, Gizli İnceleme Borcu
GitHub'ın %55 hız kazancı ile METR'in %19 yavaşlama bulgusu arasındaki fark, AI kodlama araçlarının FOMO ile alınmasının inceleme ve doğrulama maliyetini nasıl gizlediğini gösteriyor.
GPT-5.6 mi, Claude Fable 5 mi: Fiziksel AI simülasyon testi
JuliaHub'ın Dyad ajanıyla GPT-5.6 ve Claude Fable 5, beş fiziksel modelleme probleminde karşılaştırıldı; maliyet, hız ve doğrulama tarzları analiz edildi.
NVIDIA Nemotron 3 Super, Kodlamada GPT-OSS-120B'yi Geride Bıraktı
NVIDIA'nın açık modeli Nemotron 3 Super, SWE-Bench'te GPT-OSS-120B'yi 20 puan geçti ve 2,2x daha hızlı çıkarım sunuyor.
"Halüsinasyon" Tek Bir Hata Değil, Üç Farklı Hata
Halüsinasyon üç ayrı sorun: düzeltilebilir bağlam eksikliği, doğrulanamaz akıcılık ve ulaşılamaz gelecek bilgisi. Mühendisler için ayrım rehberi.