» Etiket
agents
100 yayınAjan Sahte Test Logu Uydurdu, Sonra Ona İnandı: Kanıt Sorunu
Lilian Weng'in kendi harness'ini optimize eden ajanlar üzerine yeni raporu, sahte test logları ve kanıt zincirinin sıkıştırmada nasıl kaybolduğunu gösteriyor.
Büyük Ölçekli Araştırma: LLM Agent Yeteneklerinde Kimlik Bilgisi Sızıntısı
SkillsMP'den 17.022 LLM agent yeteneği incelendi: 1.708 kimlik bilgisi sızıntısı, debug loglama ve fork dağıtımı başlıca nedenler.
Python kütüphanesi imzalı AI ajan trafiğini doğruluyor (RFC 9421)
regent-httpsig: OpenAI'nin imzaladığı AI ajan HTTP trafiğini Python'da doğrulayan ve imzalayan açık kaynak kütüphane, RFC 9421 ve Web Bot Auth destekli.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comFavur Evals: Hangi yapay zeka modeli daha iyi kod yazıyor?
Favur, farklı yapay zeka modellerinin kodlama performansını karşılaştıran bağımsız ve halka açık bir liderlik tablosu olan Favur Evals'ı duyurdu.
Ajan Token Maliyetini %60 Azaltan 4 Katmanlı Altyapı
Ajan token maliyetini %60 düşüren 4 katmanlı altyapı: span ölçümü, 3 katmanlı önbellek, prompt sıkıştırma ve karmaşıklık bazlı model yönlendirme.
Ücretsiz Kurs: Yapay Zeka Ajanları için Context ve Harness Mühendisliği
AI ajanları için context, harness ve loop mühendisliği öğreten ücretsiz kurs; 134 test, otomatik alıştırmalar ve canlı model laboratuvarları içeriyor.
OpenAI Ajan Döngüsünü Nasıl Hızlandırıyor: Harness, API, Çıkarım
OpenAI'nin harness, API ve çıkarım katmanlarındaki ajan döngüsü optimizasyon tekniklerini ve maliyet-verimlilik yaklaşımını inceliyoruz.
2026'da Backend Mühendisliği: API'lerden Otonom Ajanlara Geçiş
2026'da backend mühendisliği API'lerden ajan tabanlı sistemlere kayıyor: orkestrasyon, asenkron görevler, araç yönetişimi ve akıl yürütme izleri.
WANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
Tekli Ajandan Orkestrasyona: Multi-Agent Sistemler Ne Zaman Gerekli
Tekli ajandan multi-agent orkestrasyona geçişin ne zaman gerekli olduğu, üretim desenleri ve Rust'ta koordinatör/worker örneği.