» Etiket
ci-cd
41 yayınPromptLedger v0.7: Prompt değişiklikleri için regresyon kapıları
PromptLedger v0.7, prompt sürümlerine evaluation run, metrik karşılaştırma ve politika tabanlı CI regresyon kapıları ekliyor.
Tasarım-Kod Kaymasını Yakalamak İçin AI Kullanmak Neden Riskli
AI ile üretilen arayüz kodundaki tasarım kayması artıyor; ancak bunu yakalamak için başka bir AI modeli kullanmak deterministik olmayan, maliyetli ve açıklanamaz sonuçlar doğuruyor.
Statgate: LLM Değerlendirmeleri için İstatistiksel Kalibre Kapıları
Statgate, LLM değerlendirmelerinde yanlış pozitifleri azaltan istatistiksel kapılar sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comuv audit incelendi: pip-audit'e göre hızlı ama sınırlı bir kapı
Astral'in uv paket yöneticisine eklenen uv audit ve UV_MALWARE_CHECK özellikleri gerçek bir projede test edildi; pip-audit ile karşılaştırıldı, sınırları ortaya çıktı.
Fender: Docker Hub bağımlılığını kaldıran soket proxy'si
Fender, Docker CLI ile daemon arasına girerek imaj referanslarını istediğiniz registry'lere yönlendiren şeffaf bir Unix soket proxy'si. Dockerfile veya CI değişikliği gerekmiyor.
Üretken Kod İçin Deterministik Bir Merge Kapısı Kurmak
AI ajanlarının ürettiği kodun ana dala girmeden önce geçmesi gereken deterministik bir POSIX shell kapısı: boyut sınırı, hassas yol kontrolü ve Git diff denetimi.
GitHub Actions'ta API E-posta Testleri: Sözleşme Yaklaşımı
E-posta testlerinin CI'da neden kırıldığını ve GitHub Actions'ta run-scoped inbox ile API sözleşmesini nasıl doğru test edeceğinizi anlatan pratik rehber.
LLM Hakem Testleri Neden Çalıştırmalar Arası Kararsız?
Aynı kod, aynı girdi, farklı LLM hakem skoru: CI gate'lerinde flapping sorununun kaynakları; sıcaklık, model pinleme, k-örnekleme ve kuantalama ile çözüm.
LLM Değerlendiricileriniz İçin Regresyon Testi Şart
rubric-bench v0.1, LLM tabanlı değerlendiricileri altın veri setleriyle test eden açık kaynak bir araç. CI'da regresyonları yakalayıp model sürüklenmesini önlüyor.
Eval Kapısında Ciddiyet Seviyesi, Düz Başarı Oranından Önemli
severity_gate.py, ajan eval sonuçlarını başarı yüzdesi yerine hata ciddiyetine göre değerlendirip SHIP/REVIEW/BLOCK kararı veren, çevrimdışı ve stdlib tabanlı bir CI aracı.