« Tüm yayınlar

Uptime Barları İncidentlerden Değil Ölçümden Gelmeli

Uptime barının yayınlanan incidentlerden değil onaylı kontrollerden hesaplanması gerektiği ve donmuş 'public' flag'in kesintileri nasıl gizlediği.

Durum sayfaları iki farklı şeyi bir araya getirir: ölçülen uptime verisi ve insan tarafından yazılan incident notları. Uptime barı ham kontroller yerine incidentlerden oluşturulduğunda, hiç yayınlanmamış, yanlış yapılandırılmış ya da sayfaya sonradan eklenmiş her kesinti sessizce yeşile dönüşebilir.

İnce bir hata bunu daha da kötüleştirir: birçok sistem bir incident'ın "public" olup olmadığına sadece oluşturma anında karar verir ve bu bayrağı bir daha kontrol etmez. Bir monitörü sayfaya sonradan eklerseniz geçmiş kesintileri sonsuza dek gizli kalır, kod canlı bir kontrol gibi görünse bile.

Çözüm, uptime barını doğrudan ölçülen kontrollerden tek bir onay kuralıyla oluşturmaktır: kesintiyi saymadan önce birden fazla bölgenin art arda birden fazla kontrolde aynı anda başarısız olmasını beklemek. Kritik nokta, aynı kuralın hem alarmları hem de public timeline'ı beslemesidir; böylece on-call uyarıları ile status page asla birbiriyle çelişmez. Incident ve postmortem'ler ise neyin down sayılacağını belirlemek için değil, bağlam için var olan ayrı bir katman olarak kalır.

Mühendisler herhangi bir status page'i dakikalar içinde test edebilir: kesintiden sonra monitör ekleyip geçmişin temiz kalıp kalmadığına, gerçek bir incident'ı unpublish edip barın yeşile dönüp dönmediğine ya da tek bölgelik bir blip yaratıp barın aşırı tepki verip vermediğine bakarak. Bu ayrım, monitoring altyapısı kuran ya da vendor status page'lerinin SLA güvenilirliğini değerlendiren herkes için önemlidir.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz