» Etiket
benchmarks
32 yayınAçık kaynaklı yeni benchmark, AI modellerindeki siyasi eğilimi ölçüyor
Açık kaynaklı The Neutrality Project, AI modellerinin siyasi eğilimlerini altı eksende ölçen, yeniden üretilebilir bir benchmark yayınladı.
ScarfBench: Java Framework Göçünde AI Ajanlarını Test Eden Benchmark
ScarfBench, AI ajanlarının Spring/Jakarta EE/Quarkus arası Java göçlerinde derleme, dağıtım ve davranış başarısını ölçen açık benchmark.
Dizüstülerde Sürekli Performans Açığı: Boost Clock Neden Yanıltır
Dizüstü bilgisayarlarda boost clock neden kısa sürer? Termal kısıtlama, PL1/PL2 güç limitleri ve TGP manipülasyonunun gerçek performansa etkisi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com600 Mimari: LLM'ler Sistem Tasarlarken Neyi Varsayılan Seçiyor?
Altı LLM ailesine 20 mimari brifi verilerek 600 tasarım toplandı; sonuçlar modellerin varsayılan teknoloji tercihlerini ve tutarsızlıklarını ortaya koyuyor.
SynthDocBench: Uzun Bağlamlı Görsel Belge Anlamada VLM Zaafları
SynthDocBench, uzun bağlamlı belgelerde VLM'lerin konumsal önyargı, uzunlukla performans kaybı ve grafik anlama zaaflarını ortaya koyan yeni bir benchmark.
LLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
Ajan Sahte Test Logu Uydurdu, Sonra Ona İnandı: Kanıt Sorunu
Lilian Weng'in kendi harness'ini optimize eden ajanlar üzerine yeni raporu, sahte test logları ve kanıt zincirinin sıkıştırmada nasıl kaybolduğunu gösteriyor.
TutorMoments: Yapay Zeka Öğretmenler Ne Zaman Yardım Etmeli?
Allen AI'nin TutorMoments benchmark'ı, LLM öğretmenlerin ne zaman destek olup ne zaman öğrenciyi zorlaması gerektiğini bilip bilmediğini test ediyor.
Text-to-SQL benchmarklarında cevap anahtarı yerine veritabanı üretmek
UIUC'nin denetimi BIRD ve Spider 2.0'daki anotasyonların yarısından fazlasının hatalı olduğunu gösterdi. Bir geliştirici, cevabı önce tanımlayıp veritabanını sonra üreten ters bir yaklaşım denedi.
DeepSeek'ten GPT-OSS'e Damıtma Sansürü Değil, Sadece Beceriyi Aktarıyor
LineageEval testine göre, DeepSeek'ten GPT-OSS-120B'ye damıtma finansal akıl yürütmeyi artırırken öğretmenin siyasi sansürünü öğrenciye aktarmıyor.