» Etiket
testing
87 yayınKüçük eval setleri regresyonu yakalayamaz: istatistiksel güç sorunu
40-50 örneklik eval setleri regresyonların çoğunu kaçırır. İstatistiksel güç, Wilson aralığı ve ikili kriterlerle doğru ölçüm nasıl yapılır?
Yayına Alınmadan Önce Geçmesi Gereken 7 Regresyon Testi
AI ajanları için kritik regresyon testlerini öğrenin. Başarılı bir dağıtım için gerekenleri keşfedin.
Playwright ve Auth0 ile E2E Testleri Kurma: Zaman Alan 5 Adım
Jo4, Playwright ile E2E testleri kurarken karşılaştığı zorlukları ve çözümleri paylaşıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYapay Zeka ile Kodlama: Mimari Testlerin Önemi
Yapay zeka ile kodlama sırasında mimari testlerin gerekliliği ve etkili kullanımı üzerine önemli bilgiler.
Geçersiz Testler: Neden 'n/a' Bir Sonuç Değildir
Testlerin geçerliliği, donanımın varlığına bağlıdır. 'n/a' durumu, mühendisler için önemli dersler sunuyor.
Tarayıcı Test Güvenilirliği: Ürün Kararı Olmanın Önemi
Tarayıcı test güvenilirliği, modern uygulamalarla birlikte ürün kararlarıyla bağlantılı hale geldi. Test sisteminin güvenilirliği önem kazandı.
Modern Tarayıcı Testi: AI, CI, İnsan İncelemesi ve Bakım Maliyetleri
Modern tarayıcı testleri, AI ve CI ile karmaşık hale geliyor. Flaky testlerin maliyetleri ve test ortamlarının önemi üzerinde duruluyor.
Playwright'a Geçiş İçin 4.000 Testi Taşıyan Bir Transpiler Oluşturma
4.000'den fazla testi Playwright'a taşımak için bir transpilere ihtiyaç duyuldu. Geçişin önemi ve sağladığı faydalar.
LLM Sağlayıcı Değiştirmeden Önce Neden Smoke Test Şart
Tek bir prompt göndermek LLM sağlayıcısını değiştirmek için yeterli değil. Timeout, streaming, rate limit ve tool-call davranışlarını test eden 10 dakikalık smoke test rehberi.
Dağıtık Sistemleri Yapay Zeka Ajanlarıyla Test Etmek
Claude Code, Codex ve benzeri ajanlar için iddiaya dayalı test planı ve bulgu raporu üreten iki SKILL.md becerisi, dağıtık sistem hatalarını yakalıyor.