» Etiket
mlops
6 yayınSWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
Altı LLM değerlendirme aracını CI'a bağladık, sadece ikisi ayakta kaldı
Sekiz aylık gerçek CI testinde altı LLM eval aracından sadece Promptfoo ve DeepEval merge queue gate'i olarak güvenilir çıktı; nedeni determinizm.
Değerlendirme Borcu: Ajan Testleri Neden Üretimde Çöküyor
Ajan değerlendirme araçlarının üretimde neden yetersiz kaldığını, çok-ajanlı sistemlerde büyüyen eval sorununu ve oturum tabanlı çözümü inceliyoruz.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAirbnb LLM Değerlendirmesini Haftalardan Bir Güne Nasıl İndirdi
Airbnb'nin dört katmanlı LLM değerlendirme altyapısı, deterministik önbellekleme ve micro LoRA adaptörleriyle iterasyon süresini haftalardan bir güne indiriyor.
nebius-actions: GitHub Actions ile Nebius GPU'larında Model İnce Ayarı
nebius-actions: Axolotl, vLLM ve Nebius Endpoint kullanarak GitHub Actions üzerinden uçtan uca model ince ayarı ve dağıtımı sağlayan açık kaynak araç seti.
PromptLedger v0.7: Prompt değişiklikleri için regresyon kapıları
PromptLedger v0.7, prompt sürümlerine evaluation run, metrik karşılaştırma ve politika tabanlı CI regresyon kapıları ekliyor.