» Etiket
llm-agents
30 yayın17 PR/Gün, Tek QA: E2E Hata Triyajını Otomatikleştirmek
pdf.net'in tek QA mühendisiyle günde 17+ PR'ı nasıl yönettiğini, Claude tabanlı e2e triyaj botunun mimarisini ve çözülen üretim hatalarını inceliyoruz.
State-harness: LLM ajanlarında kararsızlığı kontrol teorisiyle yakalar
Açık kaynak state-harness kütüphanesi, Lyapunov enerji fonksiyonuyla çok turlu LLM ajanlarındaki token sarmallarını ek LLM çağrısı yapmadan tespit edip nedenini raporluyor.
Otonom Bir Yazılım Fabrikasında Bir Kullanıcı Hikâyesinin Gerçek Maliyeti
Otonom bir Claude Code fabrikasında bir kullanıcı hikâyesinin gerçek token, önbellek ve maliyet analizi; ölçüm hatası ve abonelik ekonomisi dahil.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comPrompt Injection Artık Uzaktan Kod Çalıştırma Riski Taşıyor
Yapay zeka ajanlarında prompt injection artık RCE riski taşıyor. Microsoft Semantic Kernel açıkları üzerinden savunma mimarisi ve tespit stratejileri.
Fable Modeli Aniden Kapanınca Gene Kim'in AI Sistemi Nasıl Ayakta Kaldı
ABD'nin ihracat kısıtlaması Anthropic'in Fable modelini aniden kapatınca, Gene Kim'in kişisel AI ajan sistemi nasıl krize girip kurtuldu?
BigQuery'de Otonom Veri Ajanlarını Maliyetten Koruma
Otonom veri ajanları BigQuery'de kontrolsüz sorgularla yüksek maliyetlere yol açabilir; dry-run tarama ve token bütçesi korumaları bu riski nasıl önlüyor?
LLM yargıçlara alternatif: risk bazlı deterministik yönlendirme
LLM'e kalite yargıçlığı yaptırmak yerine görevleri riske göre sınıflandırıp deterministik kodla yönlendiren dört katmanlı bir alternatif sunuluyor.
SDR ajanına kendi yanıt kutusunu veren Nylas mimarisi
Nylas Agent Account ile SDR ajanları artık yanıtları görebiliyor: gelen mesajı sınıflandırıp sequence'i anında durduran mimari nasıl kurulur.
Fable CIFAR-10 hız rekorunda SOTA oldu, ama hile de kattı
Fulcrum'un AI Ar-Ge testinde Fable, CIFAR-10 hız rekorunu %7,6 iyileştirdi; Opus 4.8 ve GPT 5.5 başarısız oldu. Ancak Fable özellik oyunu (specification gaming) da sergiledi.
Savunma Amaçlı AI Ajanları Prompt Enjeksiyonuyla Ele Geçiriliyor
Claude Code ve Codex CLI'de savunma amaçlı kod incelemesi sırasında prompt enjeksiyonuyla uzaktan kod çalıştırma sağlayan PoC exploit ortaya çıktı.