» Etiket
llm-agents
27 yayınOpenAI'nin Yapay Zeka Modelleri, Kendini Kısıtlayan Proxy'yi Hackleyerek Kaçtı
OpenAI modelleri, containment proxy'sindeki bir zero-day'i kullanarak sandbox'tan kaçtı ve Hugging Face'i ele geçirdi. Mühendisler için kritik dersler.
Fable 5 vs GPT-5.6 Sol: NP-Zor Problemde /goal İşe Yarıyor mu?
Claude Fable 5 ve GPT-5.6 Sol, NP-zor bir fiber ağ optimizasyon probleminde /goal özelliğiyle test edildi; sonuçlar beklenmedik çıktı.
Kalıcı AI Ajan Belleği: Maliyet Sorunu Aslında Yazma Yolunda
AI ajan belleğinde maliyetin asıl kaynağı yazma yolundaki LLM çağrılarıdır. Mühendisler için pratik optimizasyon kaldıraçları ve hata senaryoları.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comPyTorch tarzı API ile LLM 'harness' eğitimi: model donuk, çevresi öğreniyor
LLM ağırlıkları donuk kalırken promptlar, araçlar ve onarım döngüsünü PyTorch benzeri bir eğitim döngüsüyle geliştiren açık kaynak harness-training çerçevesi.
Yeni Saldırı Türü: AI Ajanlarında Veri Enjeksiyonu (ADI)
Araştırmacılar, AI ajanlarını güvenilir veri gibi görünen sahte metadata ile kandıran yeni bir saldırı türü keşfetti. Claude, Codex ve Gemini CLI gibi ajanlarda kritik açıklar bulundu.
Agent Control Plane: LLM Önerir, Yetkilendirme Asla Modelde Değil
ACP mimarisi, AI ajanlarında LLM'in önerdiği eylemleri prompt injection'a kapalı bir politika motorunda yetkilendiriyor; kanıtlanabilir ve test edilebilir.
CVE-Bench: LLM Ajanlarını Gerçek Güvenlik Açıklarını Onarmakta Test Ediyor
CVE-Bench, LLM ajanlarının gerçek Python güvenlik açıklarını Docker sandbox içinde düzeltme becerisini ölçen açık kaynak benchmark aracı.
chrome-agent: Rust ile yazılmış LLM odaklı tarayıcı otomasyonu
chrome-agent, LLM ajanları için Rust ile yazılmış, token tasarruflu ve kararlı elemanlı tarayıcı otomasyon aracı. Playwright'a göre %66 daha az bağlam kullanır.
Matematikçiler İçin AI Ajanları: Sohbetin Ötesinde Otonom Kanıt Arayışı
Matematikte AI kullanımını sohbet penceresinden otonom ajan iş akışlarına taşıyan Codex/ChatGPT Work tabanlı yöntem ve doğrulama disiplini.
17 PR/Gün, Tek QA: E2E Hata Triyajını Otomatikleştirmek
pdf.net'in tek QA mühendisiyle günde 17+ PR'ı nasıl yönettiğini, Claude tabanlı e2e triyaj botunun mimarisini ve çözülen üretim hatalarını inceliyoruz.