» Etiket
ai-agents
11 yayınLLM Değerlendiricilerde Kırılamayan %75 Yanlış Negatif Duvarı
LLM tabanlı reviewer'ların çözülemeyen %75 yanlış negatif sorununu ve neden oylama, prompt kalibrasyonu gibi standart çözümlerin işe yaramadığını inceliyoruz.
Oversight: AI Ajanının Gerçekten Okuduğu Storybook Manifestosunu Denetler
Oversight adlı yeni Storybook eklentisi, AI ajanlarının okuduğu MCP manifestosunu denetleyerek eksik dokümantasyonu ve kırık bağlantıları yakalıyor.
Kodlama Ajanlarını Model Değil, Harness Tasarımı İyileştiriyor
LangChain bir kodlama ajanını modeli değiştirmeden Terminal-Bench'te ilk 5'e taşıdı; kazanç tamamen harness tasarımından geldi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comQwen kendi uygulamasını yazdı: QuotePilot'ta insan onayı şart kaldı
Qwen modelleriyle hem çalışan hem büyük ölçüde yazılan QuotePilot projesi: insan onay noktası, Decimal aritmetik ve gerçek geliştirme hataları.
GPT-5.6 Sol'un dosya silme vakası: filtreleme değil, sınırlama gerekir
GPT-5.6 Sol'un dosya silme olayı, ajan davranışını filtrelemenin neden yeterli olmadığını ve gerçek güvenlik sınırlamasının nasıl kurulacağını gösteriyor.
APSS: Tekrarlayan Ajan Görevlerini Deterministik Koda Dönüştürüyor
APSS, tekrarlayan ajan görevlerini LLM çıkarımı yerine deterministik Rust standartlarıyla kodluyor; enerji, zaman ve doğrulanabilirlik kazandırıyor.
Ajan Türeten Ajanlar: İyi Niyetli Bir Fork Bomb Riski
Çok ajanlı LLM orkestrasyonunda sınırsız türetme neden fork bomb riski taşır ve derinlik, genişlik, maliyet, ayrıcalık sınırlarıyla nasıl güvenli hale getirilir.
Loop Mühendisliği: Yanlış Alarm Veren Kontrolü Düzeltmek
Ajan döngülerinde yanlış alarm veren bir kontrolü silmeden düzeltme rehberi: zayıflatmak neden gerçek yakalamaları sessizce devre dışı bırakır?
Code on Incus: AI ajanlarına izole, tam donanımlı kendi makinesi
Code on Incus, AI kodlama ajanlarını izole sistem konteynerlerinde çalıştırıp gerçek zamanlı tehdit tespitiyle host makineyi koruyan açık kaynak araç.
33 Bin Token'lık Ön Yük: Claude Code'un Bahsi Karşılığını Veriyor mu?
Claude Code ve OpenCode karşılaştırması, token sayısının değil önbellekleme davranışının gerçek maliyeti belirlediğini gösteriyor.