» Etiket
benchmarks
2 yayınLLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
Yapay Zekada Asıl Fark: Büyük Bağlam Değil, Akıllı Mimari
Devasa context window'lar AI'ı çözmedi. ARC-AGI-3 testinde modeller %1'in altında kalırken, kazananlar artık modeli değil, etrafındaki sistemi tasarlıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com