» Etiket
benchmarks
35 yayın"Halüsinasyon" Tek Bir Hata Değil, Üç Farklı Hata
Halüsinasyon üç ayrı sorun: düzeltilebilir bağlam eksikliği, doğrulanamaz akıcılık ve ulaşılamaz gelecek bilgisi. Mühendisler için ayrım rehberi.
Kodlama Ajanları Sıfırdan Satranç Motoru Üretti: Rust'tan Brainfuck'a 12 Dil
AI kodlama ajanları Rust, C++, COBOL, LaTeX ve Brainfuck dahil 12 dilde sıfırdan satranç motoru yazdı; bazıları 2000+ Elo'ya ulaştı.
LLM Hakemler Eksiklikleri Değil Sadece Varlığı Doğruluyor: Klinik Notlarda Kör Nokta
Araştırma, LLM hakemlerin yapay zeka klinik notlarındaki eksiklikleri tespit edemediğini; yeniden yapılandırılmış doğrulamanın tespiti artırdığını gösteriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAçık kaynaklı yeni benchmark, AI modellerindeki siyasi eğilimi ölçüyor
Açık kaynaklı The Neutrality Project, AI modellerinin siyasi eğilimlerini altı eksende ölçen, yeniden üretilebilir bir benchmark yayınladı.
ScarfBench: Java Framework Göçünde AI Ajanlarını Test Eden Benchmark
ScarfBench, AI ajanlarının Spring/Jakarta EE/Quarkus arası Java göçlerinde derleme, dağıtım ve davranış başarısını ölçen açık benchmark.
Dizüstülerde Sürekli Performans Açığı: Boost Clock Neden Yanıltır
Dizüstü bilgisayarlarda boost clock neden kısa sürer? Termal kısıtlama, PL1/PL2 güç limitleri ve TGP manipülasyonunun gerçek performansa etkisi.
600 Mimari: LLM'ler Sistem Tasarlarken Neyi Varsayılan Seçiyor?
Altı LLM ailesine 20 mimari brifi verilerek 600 tasarım toplandı; sonuçlar modellerin varsayılan teknoloji tercihlerini ve tutarsızlıklarını ortaya koyuyor.
SynthDocBench: Uzun Bağlamlı Görsel Belge Anlamada VLM Zaafları
SynthDocBench, uzun bağlamlı belgelerde VLM'lerin konumsal önyargı, uzunlukla performans kaybı ve grafik anlama zaaflarını ortaya koyan yeni bir benchmark.
LLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
Ajan Sahte Test Logu Uydurdu, Sonra Ona İnandı: Kanıt Sorunu
Lilian Weng'in kendi harness'ini optimize eden ajanlar üzerine yeni raporu, sahte test logları ve kanıt zincirinin sıkıştırmada nasıl kaybolduğunu gösteriyor.