» Etiket
llm
136 yayınVetoBench: Ajan Belleği Reddedilen Kararları Hatırlıyor mu?
VetoBench, ajan bellek sistemlerinin reddedilen kararları (vetoları) hatırlayıp hatırlamadığını test eden açık kaynaklı bir kıyaslama.
Claude Code, Prompt'u Okumadan Önce 33 Bin Token Harcıyor
Wire-level analiz: Claude Code, prompt okunmadan önce ~33K token harcıyor; OpenCode'a göre 4,7 kat fazla, gerçek görevlerde 3,7 kat maliyet farkı.
Hermes Agent: Kalıcı Bellek ve Öz-İyileşen Bir AI Ajan Çerçevesi
Nous Research'ün açık kaynaklı Hermes Agent çerçevesi; kalıcı bellek, yeniden kullanılabilir skill'ler ve çoklu ajan mimarisiyle öz-iyileşen bir AI sistemi sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comMarkdown Bilgi Grafiğini Yapay Zeka Ajan Belleği Olarak Ölçmek
IWE, LOCOMO benchmarkıyla markdown bilgi grafiklerini yapay zeka ajan belleği olarak test etti; ucuz bir küratör modeliyle yüzde 96 performansa ulaştı.
Açık kaynaklı yeni benchmark, AI modellerindeki siyasi eğilimi ölçüyor
Açık kaynaklı The Neutrality Project, AI modellerinin siyasi eğilimlerini altı eksende ölçen, yeniden üretilebilir bir benchmark yayınladı.
Hugging Face'e Otonom AI Ajanıyla Yapılan Siber Saldırı Açıklandı
Hugging Face, üretim altyapısına yönelik otonom AI ajanı tabanlı bir siber saldırıyı ve LLM destekli adli analiz sürecini açıkladı.
Yapay Zeka Ajanları İçin API Tasarımı: Pratik Rehber
crmkit'in ajan odaklı API tasarımı: JSON yerine metin, kısa kimlikler, toplu işlemler ve kendi kendini belgeleyen uç noktalar.
LLM'in Eğitim Verisi Bayatlayınca: Nijerya Araç Fiyatlama Motoru Nasıl Düzeltildi
Bir LLM, Nijerya araç fiyatlarını eski dolar kuruyla hatırlayınca fiyatlama motoru bozuldu; canlı veri zorunluluğu ve önbellek kirliliği dersleri.
Kodlama Ajanlarını Model Değil, Harness Tasarımı İyileştiriyor
LangChain bir kodlama ajanını modeli değiştirmeden Terminal-Bench'te ilk 5'e taşıdı; kazanç tamamen harness tasarımından geldi.
TormentNexus AI Beceri Kayıt Defteri 5.776 Modüle Ulaştı
TormentNexus'un 5.776 modüllük AI beceri kayıt defteri; kod inceleme, Terraform üretimi ve veritabanı migrasyonunda zincirlenebilir otomasyon sunuyor.