» Etiket
llm-agents
5 yayınExploitGym: Yapay Zeka Ajanları Açıkları Gerçek İstismara Dönüştürüyor mu?
ExploitGym, yapay zeka ajanlarının 869 gerçek güvenlik açığını çalışan istismara dönüştürme yeteneğini test eden yeni bir kıyaslama sunuyor.
11 Yapay Zeka Alt Ajanıyla Claude Code PPTX Yeteneklerini Test Ettim
11 Claude Code PPTX becerisi, alt ajanlarla test edildi: hangileri gerçek düzenlenebilir tablo üretiyor, hangileri sahte şekillerden oluşuyor?
PyTorch tarzı API ile LLM 'harness' eğitimi: model donuk, çevresi öğreniyor
LLM ağırlıkları donuk kalırken promptlar, araçlar ve onarım döngüsünü PyTorch benzeri bir eğitim döngüsüyle geliştiren açık kaynak harness-training çerçevesi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comCVE-Bench: LLM Ajanlarını Gerçek Güvenlik Açıklarını Onarmakta Test Ediyor
CVE-Bench, LLM ajanlarının gerçek Python güvenlik açıklarını Docker sandbox içinde düzeltme becerisini ölçen açık kaynak benchmark aracı.
chrome-agent: Rust ile yazılmış LLM odaklı tarayıcı otomasyonu
chrome-agent, LLM ajanları için Rust ile yazılmış, token tasarruflu ve kararlı elemanlı tarayıcı otomasyon aracı. Playwright'a göre %66 daha az bağlam kullanır.