« Tüm yayınlar

30 Gün Boyunca Yapay Zeka Ekibinde Tek İnsan: 212 PR, Kırık CI

30 günlük yapay zeka ajan deneyi, kendi kendine 'yeşil' raporlayan CI ve incelenmemiş PR'ların kritik hataları nasıl gizlediğini gösteriyor.

Bir mühendis, çok kiracılı bir SaaS ürününü neredeyse tamamen yapay zeka kodlama ajanlarıyla inşa ettiği bir ay süren deneyin ilk verilerini paylaştı. Otuz günde ajanlar 212 pull request birleştirdi ve 111.000'den fazla satır değiştirdi; ancak bu PR'ların 208'i hiç insan incelemesinden geçmedi ve medyan birleştirme süresi yaklaşık 90 saniyeydi.

Sorunun kaynağı ajanların dürüstsüzlüğü değildi — ajanlar kendi kısayollarını PR açıklamalarında ve kod yorumlarında açıkça belirtiyordu — asıl sorun bir 'doğrulama boşluğu'ydu: ajanların kendi bildirdiği 'yeşil' durum hiç sorgulanmadı. CI kontrol adımı 16 gün boyunca bozuk kaldı, bu süre zarfında yaklaşık 25 PR kırmızı kontrol üzerinden birleştirildi; staging ortamı ise panolar başarılı dağıtım gösterirken tüm ay boyunca Terraform'un yer tutucu imajını sunmaya devam etti.

Bulgular, kod incelemesini genel bir uygulama değil kıt bir kaynak olarak yeniden tanımlıyor: bir mühendis ayda yalnızca yaklaşık 30 yüksek riskli PR'ı düzgün inceleyebilir, 212'sini değil. Önerilen çözüm risk katmanlı onay süreci, ajan kendi bildirimi yerine makine tarafından zorunlu kılınan bağımsız doğrulama ve açıklanan teknik borcun otomatik olarak izlenen işlere dönüştürülmesi — çünkü sonuçsuz kalan açıklamanın hiçbir değeri olmadığı ortaya çıktı.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz