» Etiket
llm
423 yayınStagehand: Doğal Dille Konuşan AI Destekli Tarayıcı Otomasyonu
Stagehand, AI ile doğal dil talimatlarını gerçek zamanlı olarak deterministik tarayıcı eylemlerine dönüştüren açık kaynaklı otomasyon SDK'sı.
Review-Loop Engineering: Ajan Döngülerinde İnsan Denetimini Tasarlamak
Ajan kodlama döngülerinde insan denetimini gerçek kılan 'review-loop engineering' yaklaşımı: üç döngü, inceleme paketleri ve rubber-stamp riski.
Ajan Tabanlı Yapay Zekada ROI: Token Değil, Sonuç Maliyeti Ölçün
Ajan tabanlı yapay zeka yatırımlarında ROI'yi token yerine kabul edilen sonuç başına maliyetle ölçmek için beş adımlı bir çerçeve.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYapay Zekanın Sessiz İhmallerini Yakalayan Yeni Doğrulama Katmanı
Yapay zeka modellerinin öne sürmesi gereken iddiaları sessizce atlamasını yakalayan katmanlı bir doğrulama sistemi geliştirildi.
Thinking Machines Lab'dan Inkling: 975B Parametreli Açık MoE, Ayarlanabilir Düşünme
Thinking Machines Lab'ın 975B parametreli, 41B aktif Inkling modeli encoder-free multimodal MoE mimarisi ve ayarlanabilir reasoning effort sunuyor.
Altı LLM değerlendirme aracını CI'a bağladık, sadece ikisi ayakta kaldı
Sekiz aylık gerçek CI testinde altı LLM eval aracından sadece Promptfoo ve DeepEval merge queue gate'i olarak güvenilir çıktı; nedeni determinizm.
Bir AI kod tabanınızı gerçekten anlıyor mu? Bunu nasıl test edersiniz
Bir AI ajanının kod tabanı anlayışını nasıl test edersiniz? Teardown denetimi yöntemi, on üç Ruby projesinde sınandı; güçlü ve zayıf yanları.
Colibri: 744B parametreli GLM-5.2'yi 25GB RAM ile çalıştırma
Colibri, tek dosyalık C motoruyla GLM-5.2'nin 744B parametreli MoE modelini GPU'suz, 25GB RAM'lik makinede çalıştırıyor.
AI Ajan Runtime Politikası: Tehlikeli Araç Çağrılarını Durdurun
AI ajanlarının tehlikeli araç çağrıları yapmasını önlemek için runtime politika katmanı: risk seviyeleri, yetki devri ve doğrulama kuralları.
Yapay Zeka Ajanlarını Güvenceye Almak: Güvenden Sınırlamaya
Otonom AI ajanları modelden aktöre dönüşürken güvenlik sınırı da değişiyor. OWASP'ın 2025 rehberliğine dayanan risk sınıfları ve sınırlama stratejileri.