» Etiket
testing
27 yayınLLM Hakem Testleri Neden Çalıştırmalar Arası Kararsız?
Aynı kod, aynı girdi, farklı LLM hakem skoru: CI gate'lerinde flapping sorununun kaynakları; sıcaklık, model pinleme, k-örnekleme ve kuantalama ile çözüm.
LLM Değerlendiricileriniz İçin Regresyon Testi Şart
rubric-bench v0.1, LLM tabanlı değerlendiricileri altın veri setleriyle test eden açık kaynak bir araç. CI'da regresyonları yakalayıp model sürüklenmesini önlüyor.
Parlel: 250+ servisi gerçek protokolle yerelde taklit ediyor
Parlel, Postgres, Redis, Stripe, S3 gibi 250'den fazla servisi gerçek ağ protokolleriyle yerelde çalıştırıyor; test ve AI ajanları için ücretsiz, hızlı bir alternatif sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comReact Auth E-postalarında Test Kararlılığı için Run ID Deseni
React tabanlı auth e-posta testlerinde flakiness'in gerçek nedeni zamanlama değil, UI ile posta kutusu arasındaki korelasyon eksikliği. TypeScript tabanlı bir run id deseni çözümü sunuyor.
React Mention E-postalarında Çift Gönderim Nasıl Önlenir
React tabanlı mention bildirimlerinin neden iki kez gönderildiğini ve tek bir eventId sözleşmesiyle bu hatanın nasıl önlenebileceğini ele alıyoruz.
Zamanlanmış İşlerde E-posta Doğrulaması İçin Gelen Kutusu Sözleşmesi
Cron işleri ve zamanlanmış otomasyonlarda e-posta hatalarını yakalamak için her çalıştırmaya özel gelen kutusu, run id ve kanıt tabanlı doğrulama modeli.
LLM-as-judge testleri neden çalıştırma başına farklı sonuç verir
CI'da faithfulness eşiğini kontrol eden LLM hakem, aynı kodda bir gün 0.79 bir gün 0.82 verebilir. Sıcaklık, model sürümü ve belirsiz rubric jitter'ın kaynağı; k-örnekleme ve gürültü bandı çözüm.
PostgreSQL için Zararlı Yük Üreticisi: Noisia
PostgreSQL için tasarlanmış Noisia, zararlı yük senaryoları oluşturur ve test amaçlı kullanıma sunulur.
AGENTS.md'yi öneriden icra edilebilir kurala çevirmek
60 binden fazla projede kullanılan AGENTS.md, aslında sadece metindir; kimse doğruluğunu denetlemez. getff, iddiaları test ve CI kapılarıyla bağlayarak belgeyi icra edilebilir hale getiriyor.
327 PR İncelendi: AI Ajanları Kod İncelemesinde Nasıl Hile Yapıyor
327 AI ajanı pull request'i incelendi: testler zayıflatılıyor, hatalar yutuluyor. Açık kaynak bir denetim aracı bu hileleri nasıl yakalıyor?