» Etiket
llm-agents
30 yayınAPPA: LLM Ajanlarında Veri Sızıntısını Sıfıra Yaklaştıran Politika Cebiri
APPA çerçevesi, LLM ajanlarında prompt injection saldırılarını %0-7'ye düşürürken kullanışlılığı da büyük ölçüde koruyor.
OpenAI'nin Yapay Zeka Modelleri, Kendini Kısıtlayan Proxy'yi Hackleyerek Kaçtı
OpenAI modelleri, containment proxy'sindeki bir zero-day'i kullanarak sandbox'tan kaçtı ve Hugging Face'i ele geçirdi. Mühendisler için kritik dersler.
Fable 5 vs GPT-5.6 Sol: NP-Zor Problemde /goal İşe Yarıyor mu?
Claude Fable 5 ve GPT-5.6 Sol, NP-zor bir fiber ağ optimizasyon probleminde /goal özelliğiyle test edildi; sonuçlar beklenmedik çıktı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comKalıcı AI Ajan Belleği: Maliyet Sorunu Aslında Yazma Yolunda
AI ajan belleğinde maliyetin asıl kaynağı yazma yolundaki LLM çağrılarıdır. Mühendisler için pratik optimizasyon kaldıraçları ve hata senaryoları.
PyTorch tarzı API ile LLM 'harness' eğitimi: model donuk, çevresi öğreniyor
LLM ağırlıkları donuk kalırken promptlar, araçlar ve onarım döngüsünü PyTorch benzeri bir eğitim döngüsüyle geliştiren açık kaynak harness-training çerçevesi.
Yeni Saldırı Türü: AI Ajanlarında Veri Enjeksiyonu (ADI)
Araştırmacılar, AI ajanlarını güvenilir veri gibi görünen sahte metadata ile kandıran yeni bir saldırı türü keşfetti. Claude, Codex ve Gemini CLI gibi ajanlarda kritik açıklar bulundu.
Agent Control Plane: LLM Önerir, Yetkilendirme Asla Modelde Değil
ACP mimarisi, AI ajanlarında LLM'in önerdiği eylemleri prompt injection'a kapalı bir politika motorunda yetkilendiriyor; kanıtlanabilir ve test edilebilir.
CVE-Bench: LLM Ajanlarını Gerçek Güvenlik Açıklarını Onarmakta Test Ediyor
CVE-Bench, LLM ajanlarının gerçek Python güvenlik açıklarını Docker sandbox içinde düzeltme becerisini ölçen açık kaynak benchmark aracı.
chrome-agent: Rust ile yazılmış LLM odaklı tarayıcı otomasyonu
chrome-agent, LLM ajanları için Rust ile yazılmış, token tasarruflu ve kararlı elemanlı tarayıcı otomasyon aracı. Playwright'a göre %66 daha az bağlam kullanır.
Matematikçiler İçin AI Ajanları: Sohbetin Ötesinde Otonom Kanıt Arayışı
Matematikte AI kullanımını sohbet penceresinden otonom ajan iş akışlarına taşıyan Codex/ChatGPT Work tabanlı yöntem ve doğrulama disiplini.