» Etiket
mlops
18 yayınSWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
Altı LLM değerlendirme aracını CI'a bağladık, sadece ikisi ayakta kaldı
Sekiz aylık gerçek CI testinde altı LLM eval aracından sadece Promptfoo ve DeepEval merge queue gate'i olarak güvenilir çıktı; nedeni determinizm.
Değerlendirme Borcu: Ajan Testleri Neden Üretimde Çöküyor
Ajan değerlendirme araçlarının üretimde neden yetersiz kaldığını, çok-ajanlı sistemlerde büyüyen eval sorununu ve oturum tabanlı çözümü inceliyoruz.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comPrometheus'ta Öngörücü Alarmlarda Yanlış Pozitifleri Çözmek
Prometheus tabanlı öngörücü alarm modellerinde offline başarıyla üretim gürültüsü arasındaki farkın nedeni ve query_range hizalama, rate() ve şema kontrolü ile çözümü.
NVIDIA ModelExpress: P2P RDMA ile Model Başlatma Saniyelere İniyor
NVIDIA ModelExpress, P2P GPU-to-GPU RDMA transferleriyle LLM ağırlık yüklemesini hızlandırıyor; model başlatma süresi dakikalardan saniyelere iniyor.
Netflix, LLM Sunumunu vLLM ve Triton ile Tamamen İçeride Kuruyor
Netflix'in vLLM, Triton ve OpenAI uyumlu API ile kendi LLM sunum altyapısını nasıl kurduğuna dair mühendislik kararları ve üretim dersleri.
Airbnb LLM Değerlendirmesini Haftalardan Bir Güne Nasıl İndirdi
Airbnb'nin dört katmanlı LLM değerlendirme altyapısı, deterministik önbellekleme ve micro LoRA adaptörleriyle iterasyon süresini haftalardan bir güne indiriyor.
Metin Difüzyonu mu Otoregresif Model mi: GPU Kullanımının Gerçek Hesabı
Difüzyon tabanlı dil modelleri ile otoregresif modellerin GPU kullanım ekonomisi karşılaştırması: gecikme, batching ve gerçek token maliyeti.
nebius-actions: GitHub Actions ile Nebius GPU'larında Model İnce Ayarı
nebius-actions: Axolotl, vLLM ve Nebius Endpoint kullanarak GitHub Actions üzerinden uçtan uca model ince ayarı ve dağıtımı sağlayan açık kaynak araç seti.
PromptLedger v0.7: Prompt değişiklikleri için regresyon kapıları
PromptLedger v0.7, prompt sürümlerine evaluation run, metrik karşılaştırma ve politika tabanlı CI regresyon kapıları ekliyor.