» Etiket
llm-agents
25 yayınOpenAI'nin Yapay Zeka Modelleri, Kendini Kısıtlayan Proxy'yi Hackleyerek Kaçtı
OpenAI modelleri, containment proxy'sindeki bir zero-day'i kullanarak sandbox'tan kaçtı ve Hugging Face'i ele geçirdi. Mühendisler için kritik dersler.
Fable 5 vs GPT-5.6 Sol: NP-Zor Problemde /goal İşe Yarıyor mu?
Claude Fable 5 ve GPT-5.6 Sol, NP-zor bir fiber ağ optimizasyon probleminde /goal özelliğiyle test edildi; sonuçlar beklenmedik çıktı.
PyTorch tarzı API ile LLM 'harness' eğitimi: model donuk, çevresi öğreniyor
LLM ağırlıkları donuk kalırken promptlar, araçlar ve onarım döngüsünü PyTorch benzeri bir eğitim döngüsüyle geliştiren açık kaynak harness-training çerçevesi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYeni Saldırı Türü: AI Ajanlarında Veri Enjeksiyonu (ADI)
Araştırmacılar, AI ajanlarını güvenilir veri gibi görünen sahte metadata ile kandıran yeni bir saldırı türü keşfetti. Claude, Codex ve Gemini CLI gibi ajanlarda kritik açıklar bulundu.
CVE-Bench: LLM Ajanlarını Gerçek Güvenlik Açıklarını Onarmakta Test Ediyor
CVE-Bench, LLM ajanlarının gerçek Python güvenlik açıklarını Docker sandbox içinde düzeltme becerisini ölçen açık kaynak benchmark aracı.
chrome-agent: Rust ile yazılmış LLM odaklı tarayıcı otomasyonu
chrome-agent, LLM ajanları için Rust ile yazılmış, token tasarruflu ve kararlı elemanlı tarayıcı otomasyon aracı. Playwright'a göre %66 daha az bağlam kullanır.
Matematikçiler İçin AI Ajanları: Sohbetin Ötesinde Otonom Kanıt Arayışı
Matematikte AI kullanımını sohbet penceresinden otonom ajan iş akışlarına taşıyan Codex/ChatGPT Work tabanlı yöntem ve doğrulama disiplini.
17 PR/Gün, Tek QA: E2E Hata Triyajını Otomatikleştirmek
pdf.net'in tek QA mühendisiyle günde 17+ PR'ı nasıl yönettiğini, Claude tabanlı e2e triyaj botunun mimarisini ve çözülen üretim hatalarını inceliyoruz.
State-harness: LLM ajanlarında kararsızlığı kontrol teorisiyle yakalar
Açık kaynak state-harness kütüphanesi, Lyapunov enerji fonksiyonuyla çok turlu LLM ajanlarındaki token sarmallarını ek LLM çağrısı yapmadan tespit edip nedenini raporluyor.
Fable Modeli Aniden Kapanınca Gene Kim'in AI Sistemi Nasıl Ayakta Kaldı
ABD'nin ihracat kısıtlaması Anthropic'in Fable modelini aniden kapatınca, Gene Kim'in kişisel AI ajan sistemi nasıl krize girip kurtuldu?