» Etiket
llm-agents
25 yayınExploitGym: Yapay Zeka Ajanları Açıkları Gerçek İstismara Dönüştürüyor mu?
ExploitGym, yapay zeka ajanlarının 869 gerçek güvenlik açığını çalışan istismara dönüştürme yeteneğini test eden yeni bir kıyaslama sunuyor.
Claude Code İncelemesinde Token Faturası Tree-sitter Graf ile 8-49x Düştü
Claude Code incelemelerinde Tree-sitter tabanlı çağrı grafiği ve blast-radius BFS ile token faturası 8-49x düşürüldü; üç kritik tuzak ve sınırları.
Handbook.md: Uzun politika belgeleri AI ajanlarını güvenilir şekilde yönetemiyor
Handbook.md benchmarkı, AI ajanlarının uzun şirket politika belgelerine gerçekte ne kadar uyduğunu test ediyor; sonuçlar endişe verici.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comMCP Güvenliği: Gateway Yetmez, Dört Katmanlı Savunma Gerekir
MCP güvenliğinde tek gateway yetmiyor: dört katmanlı savunma modeli, gerçek CVE'ler ve üretim için pratik kontrol önerileri.
Frontier AI Ajanı Saldırısı: Temmuz 2026 Hugging Face Olayının Teknik Analizi
Hugging Face'in Temmuz 2026 AI ajan sızıntısının teknik analizi: sandbox kaçışından veri hattı enjeksiyonuna kadar tüm saldırı zinciri.
11 Yapay Zeka Alt Ajanıyla Claude Code PPTX Yeteneklerini Test Ettim
11 Claude Code PPTX becerisi, alt ajanlarla test edildi: hangileri gerçek düzenlenebilir tablo üretiyor, hangileri sahte şekillerden oluşuyor?
LLM Ajan Hatlarında Çıkmaz Durum Tuzağı: Sonsuz Döngüden Beter
LLM ajan pipeline'larında sonsuz döngüyü engellemek için eklenen güvenlik durumları, çıkışsız bir tuzağa dönüşerek orkestrasyonu tamamen kilitleyebilir.
MCP Güvenliği Yeniden Ele Alınıyor: 64 Bin Sunuculuk Dev Ölçekli Çalışma
MCPZoo, 64.611 MCP sunucusuyla güvenlik tarayıcılarının güvenilirliğini test ediyor; uyarıların yarısından azı gerçek çıkıyor.
LangGraph checkpoint'lerinde 737x hız: Rust'ın kazandığı ve kaybettiği yerler
fast-langgraph, LangGraph'ın deepcopy tabanlı checkpoint mekanizmasını Rust ile hızlandırıyor; büyük durumlarda 737x, küçük dict'lerde ise kazanç yok.
APPA: LLM Ajanlarında Veri Sızıntısını Sıfıra Yaklaştıran Politika Cebiri
APPA çerçevesi, LLM ajanlarında prompt injection saldırılarını %0-7'ye düşürürken kullanışlılığı da büyük ölçüde koruyor.