» Etiket
llm
136 yayınWANDR Benchmarkı: Geniş ve Derin Araştırma Yapan Ajanları Test Ediyor
WANDR benchmarkı, geniş ve derin araştırma ajanlarını kanıta dayalı, referanssız bir yöntemle değerlendiriyor; en iyi sistem bile düşük skorlar aldı.
2026'da Forward Deployed Engineer Nasıl Olunur?
2026'da Forward Deployed Engineer olmak için gereken beceriler, portföy projeleri, mülakat süreci ve gerçekçi hazırlık takvimi.
Few-shot örnekleri eval setinden geldi: 0.94 skoru bir kurguydu
Few-shot seçici ve eval seti aynı JSONL dosyasını paylaşınca 0.94 skoru sahteydi. Prompt-zamanı veri kirlenmesi ve kontrol yöntemi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comDiffusionGemma: Google'ın Difüzyon Tabanlı LLM Rehberi
Google'ın DiffusionGemma geliştirici rehberi: çift yönlü dikkatli difüzyon tabanlı LLM, 4 kat hızlı üretim, vLLM desteği ve Sudoku ince ayar sonuçları.
Text-to-SQL Neden Model Değil, Veri Ambarınız Yüzünden Başarısız Oluyor
Text-to-SQL doğruluğu gerçek kurumsal veri ambarlarında çöküyor. Kanıtlar, sorunun model kalitesi değil, dokümante edilmemiş şema ve bağlam olduğunu gösteriyor.
Tekli Ajandan Orkestrasyona: Multi-Agent Sistemler Ne Zaman Gerekli
Tekli ajandan multi-agent orkestrasyona geçişin ne zaman gerekli olduğu, üretim desenleri ve Rust'ta koordinatör/worker örneği.
MemGhost: Tek E-postayla AI Ajanlarının Hafızasını Kalıcı Olarak Zehirleme Saldırısı
MemGhost saldırısı, tek e-postayla AI ajanlarının kalıcı hafızasını zehirliyor; %87,5 başarı oranıyla yetkilendirme tasarımını sorguluyor.
GitHub'ın AI Ajanı Genel Issue Üzerinden Özel Depoları Sızdırıyor
Noma Labs, GitHub'ın AI ajanının gizli talimatlarla kandırılarak özel repo içeriğini herkese açık yorumda sızdırdığını gösterdi.
LLM Kararları Neden Deterministik Olmalı
LLM tabanlı sistemlerde kararların neden deterministik kodla verilmesi gerektiği ve denetlenebilirliğin mühendisler için önemi anlatılıyor.
Agent İş Akışları Olgunlaştıkça Deterministik Koda Dönüşmeli
Yeni araştırmaya göre agent iş akışları tekrarlandıkça deterministik koda dönüşmeli; LangGraph bu geçişi görünür kılıyor.