» Etiket
benchmarks
7 yayınExploitGym: Yapay Zeka Ajanları Açıkları Gerçek İstismara Dönüştürüyor mu?
ExploitGym, yapay zeka ajanlarının 869 gerçek güvenlik açığını çalışan istismara dönüştürme yeteneğini test eden yeni bir kıyaslama sunuyor.
Kimi K3 testi: Çin modelleri kodlamada ucuz, planlamada değil
Kimi K3 benchmark testinde Çin yapay zeka modelleri planlamada pahalı, kodlamada ise 19 kat daha ucuz çıktı. Gerçek maliyet analizi.
GPT-5.6 mi, Claude Fable 5 mi: Fiziksel AI simülasyon testi
JuliaHub'ın Dyad ajanıyla GPT-5.6 ve Claude Fable 5, beş fiziksel modelleme probleminde karşılaştırıldı; maliyet, hız ve doğrulama tarzları analiz edildi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comDizüstülerde Sürekli Performans Açığı: Boost Clock Neden Yanıltır
Dizüstü bilgisayarlarda boost clock neden kısa sürer? Termal kısıtlama, PL1/PL2 güç limitleri ve TGP manipülasyonunun gerçek performansa etkisi.
600 Mimari: LLM'ler Sistem Tasarlarken Neyi Varsayılan Seçiyor?
Altı LLM ailesine 20 mimari brifi verilerek 600 tasarım toplandı; sonuçlar modellerin varsayılan teknoloji tercihlerini ve tutarsızlıklarını ortaya koyuyor.
AMD'nin 256 çekirdekli Epyc 9996 'Venice'i Xeon'u 3,4 kat geride bırakıyor
AMD'nin 256 çekirdekli Epyc 9996 Venice Zen 6 işlemcisi, ilk testlerde Intel Xeon 6980P'ye göre 3,4 kat, Nvidia Vera'ya göre 2,2 kat üstünlük iddia ediyor.
Yapay Zeka Kodlama Ajanları: Ağacın Dalını mı, Kökünü mü Alıyor?
SWE-bench ve METR verileri AI kodlama ajanlarının ilerleyişini gösteriyor; ama doğrulama maliyeti mühendislik için hâlâ belirleyici sınır.