» Etiket
llm
423 yayınKodlama Ajanlarını Model Değil, Harness Tasarımı İyileştiriyor
LangChain bir kodlama ajanını modeli değiştirmeden Terminal-Bench'te ilk 5'e taşıdı; kazanç tamamen harness tasarımından geldi.
TormentNexus AI Beceri Kayıt Defteri 5.776 Modüle Ulaştı
TormentNexus'un 5.776 modüllük AI beceri kayıt defteri; kod inceleme, Terraform üretimi ve veritabanı migrasyonunda zincirlenebilir otomasyon sunuyor.
On Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comVoltMem: LLM Ajanları için Değişkenlik Duyarlı Bellek Katmanı
VoltMem, LLM ajan belleklerinde bilgi türüne göre değişen 'volatilite' skorlarıyla güncel ve kararlı gerçekleri ayırt eden açık kaynaklı bir katman.
Claude Code Prompt Cache Maliyeti: Başlatma Yolu Her Şeyi Değiştiriyor
Claude Code'da prompt cache maliyeti başlatma yoluna göre nasıl değişiyor? Ölçümler, sabit yükün ve subagent fan-out'un etkisini gösteriyor.
Synapse Yapay Zekaya Yanlış Pozitifleri İşaretletir, Asla Sildirmez
Synapse, güvenlik taramalarında yanlış pozitifleri iki modelli AI doğrulamasıyla işaretliyor; hiçbir bulguyu silmeden gate güvenilirliğini koruyor.
Yapay Zeka Ajanları Neden Unutur: Bellek Tasarım Sorunu
LLM API'leri durumsuzdur; her istek bağımsızdır ve bağlam penceresi gerçek bellek değildir. Bu mimari tercih, üretimde maliyet, gecikme ve tutarsızlık sorunlarına yol açar.
RAG Halüsinasyonları Vektör Veritabanını Nasıl Zehirliyor
Bir RAG pipeline'ı kendi halüsinasyonlarıyla vektör veritabanını zehirledi; deterministik doğrulama sorunu nasıl çözdü, inceliyoruz.
NVIDIA'dan Daha Güvenli AI Ajanları için Dört Öneri
NVIDIA AI Red Team'in bulgularına göre AI ajanlarını güvenli dağıtmak için dört kritik kontrol: erişim, kod çalıştırma, ağ egress ve sır yönetimi.
Netflix GenRec: Özellik Mühendisliği Yerine LLM Tabanlı Sıralayıcı
Netflix'in GenRec'i, özellik mühendisliği yerine LLM tabanlı sıralama kullanarak daha az veriyle üretim performansına ulaşıyor.