« Tüm yayınlar

Yapay Zeka Çok Bölgeli Kubernetes Kesintisinin Kök Nedenini Nasıl Buldu

Trendyol mühendisleri, LLM destekli log analiziyle 200MB'lık syslog verisinde bir saatten kısa sürede kök nedeni nasıl buldu?

Trendyol mühendisleri, yedi Kubernetes bölgesinde ~63 düğümü etkileyen ve düğümlerin ping'e, SSH'a ve varsayılan ağ geçidine yanıt vermemesine neden olan bir kesintiyi araştırdı. Sorun ilk bakışta rastgele donanım arızası gibi görünse de, 200MB'lık döndürülmüş log dosyaları elle taranamayacak boyuttaydı ve arıza penceresi bilinmiyordu.

Ekip, log analizini bir büyük dil modeliyle (dahili ML platformu üzerinden sunulan Claude) yönlendirdi. Model önce kernel log'undaki 32 saatlik bir boşluğa dikkat çekerek zaman penceresini belirledi, ardından hataları dakika bazında gruplayarak saniyeler içinde tam arıza anını (06:21) tespit etti. Son olarak sadece kritik 50 satırlık log dilimini okuyarak sorunu, kullanılmayan bir systemd güncellemesinin tetiklediği systemd-networkd'nin Cilium arayüzlerini geri almasına bağladı — tüm bunlar bir saatten kısa sürede gerçekleşti.

Bu vaka, LLM'lerin insan denetimi altında büyük yapılandırılmamış log verilerinde sinyal-bulma süresini nasıl kısaltabileceğini gösteriyor. Her komut mühendisler tarafından incelendi ve her sonuç doğrulandı; model otonom erişime sahip değildi. Ekip düzeltme olarak Cilium arayüzlerini systemd-networkd'de yönetilmeyen olarak işaretledi ve unattended-upgrade politikasını sıkılaştırdı.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz