» Etiket
benchmarks
5 yayınHandbook.md: Uzun politika belgeleri AI ajanlarını güvenilir şekilde yönetemiyor
Handbook.md benchmarkı, AI ajanlarının uzun şirket politika belgelerine gerçekte ne kadar uyduğunu test ediyor; sonuçlar endişe verici.
ScarfBench: Java Framework Göçünde AI Ajanlarını Test Eden Benchmark
ScarfBench, AI ajanlarının Spring/Jakarta EE/Quarkus arası Java göçlerinde derleme, dağıtım ve davranış başarısını ölçen açık benchmark.
DeepSeek'ten GPT-OSS'e Damıtma Sansürü Değil, Sadece Beceriyi Aktarıyor
LineageEval testine göre, DeepSeek'ten GPT-OSS-120B'ye damıtma finansal akıl yürütmeyi artırırken öğretmenin siyasi sansürünü öğrenciye aktarmıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comPerformans İçin Önemli Olanlar: Bir Yılın Benchmark Dersleri
ClickHouse ile yıl boyunca yapılan benchmarklar, veri işleme verimliliği ve performansı hakkında önemli dersler sunuyor.
Yerel LLM Modelim 6/6 Skor Aldı, Her Seferinde Yanlış Cevap Verdi
Yerel LLM modelinin yanıt biçimi ile değeri arasındaki farkı keşfedin.