» Etiket
llm-evaluation
3 yayın«Ağustos 2026
Araştırma: LLM Ajanlarında Adım Bazlı Kredi Sinyalleri Rastgeleden Farksız
ALFWorld'de yapılan nedensel denetim, LLM ajan eğitiminde kullanılan hakem ve güven tabanlı kredi sinyallerinin rastgeleden farksız olduğunu ortaya koyuyor.
SciCode-Verified: LLM'lerin Bilimsel Kodlama Yeteneği Hafife Alınmış
SciCode benchmark'ındaki 263 kusur düzeltilince LLM'lerin bilimsel kodlama doğruluğu %60'tan %98'e sıçradı; sorun modellerde değil testteydi.
data-eng-bench: Snowflake'in dbt ajan benchmark'ı
Snowflake'in data-eng-bench'i, dbt kodlama ajanlarını DuckDB ve Snowflake üzerinde 103 gerçekçi görevle test eden açık kaynak Harbor benchmark'ı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com