» Etiket
llm-benchmarks
4 yayınSciCode-Verified: LLM'lerin Bilimsel Kodlama Yeteneği Hafife Alınmış
SciCode benchmark'ındaki 263 kusur düzeltilince LLM'lerin bilimsel kodlama doğruluğu %60'tan %98'e sıçradı; sorun modellerde değil testteydi.
Qwen 3.8-Max ve Claude Opus 5: Skorlar Faturayı Tahmin Etmiyor
Qwen 3.8-Max ve Claude Opus 5 örnekleri, token fiyatının artık gerçek maliyeti göstermediğini, başarılı görev başına maliyetin neden önemli olduğunu gösteriyor.
GPT-5.6 Sol, Design Arena'da Yapay Zeka Klişelerini Nasıl Eledi
GPT-5.6 Sol, Design Arena liderlik tablosunda birinci oldu; CLIP+UMAP analizi modelin yapay zeka tasarım klişelerini nasıl eleyip kişiselleştirdiğini gösteriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYapay zekada yeni evre: sohbetten kontrollü sistemlere geçiş
HalluSquatting saldırısı, Prime Intellect'in 130M$'lık yatırımı ve DeepSeek'in çip planları; yapay zekanın artık model seçiminden iş akışı kontrolüne kaydığını gösteriyor.