» Etiket
software-testing
9 yayınLLM Değerlendiricilerde Kırılamayan %75 Yanlış Negatif Duvarı
LLM tabanlı reviewer'ların çözülemeyen %75 yanlış negatif sorununu ve neden oylama, prompt kalibrasyonu gibi standart çözümlerin işe yaramadığını inceliyoruz.
Yapay Zekâ Ajanları Diff Tabanlı Kod İncelemesini Nasıl Geçersiz Kılıyor
Yapay zekâ kod ajanları diff tabanlı incelemeyi güvenilmez kılıyor; niyet artık test adları, builder API'leri ve kontrat testlerinde yaşıyor.
Testler Geçti, Sistem Bozuk: On Sahte Pozitif Deseni
Bir denetim gününden çıkan on gerçek örnekle, yeşil geçen testlerin ve kontrollerin neden yanıltıcı olabileceğini ve bunu nasıl fark edeceğinizi anlatan analiz.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAI Ajanı Testinde Hata, Cevapta Değil İzde Görünür
Bir AI ajanı test edilirken sekiz yeşil koşudan sonra gelen kırmızı, hatanın cevapta değil izde gizlendiğini gösterdi.
Bun'ın Milyon Satırlık Yapay Zeka Yeniden Yazımı: Testler Geçti, 19 Hata Çıktı
Bun'ın Zig'den Rust'a yapay zeka destekli milyon satırlık geçişi, testler geçse de 19 regresyon çıkardı; doğrulama standartları tartışmaya açıldı.
Uyurken Uygulamamdaki Hataları Avlayan Yapay Zeka Ajanı
Bir ajan uygulamayı saatlik test edip hata buluyor, ikincisi bulguları doğrulayıp düzeltiyor. Güven seviyesi ve tekrar üretme kuralı sistemi güvenilir yapıyor.
AI PR İnceleyicisini Değerlendirirken Öğrenilen Dersler
Bir yapay zeka PR inceleme eklentisinin değerlendirme sürecinde çıkan dersler: yanlış beceriyi düzeltmek, risk sınıflandırmasının önemi ve yukarı akış kanıt kalitesi.
Ajanik Otomatik Onarımı Değerlendirme: Kanarya Kapıları ve Hata Sınıfları
GitHub'ın Temmuz 2026 ajanik otomatik onarım önizlemesi, yapay zeka güvenlik yamalarını kanarya testi ve hata sınıflarıyla değerlendirme yöntemini akla getiriyor.
Yapay zeka ajanına zor işi verin: belirsizlik daha iyi sonuç üretir
Ajanlara net değil, belirsiz ve zor görevler vermek; onları gerçek testlerle doğrulamakla birleşince kod tabanlarında gizli hataları ve ihmal edilmiş işleri ortaya çıkarıyor.