Debajo de cada traza distribuida sigue habiendo un disco que se puede llenar

El 29 de junio de 2020, a las 00:28 UTC, la aplicación de gestión de clientes de GitLab (customers.gitlab.com) empezó a devolver errores 500. GitLab, que desde hace años lleva su gestión de incidentes en público —cualquiera puede leer hoy el issue original en su plataforma—, documentó la causa con la misma franqueza con la … Leer más

Gray failures: cuando nada está «caído» pero todo va mal

Un pod con 8 GB de heap Java lleva tres días subiendo su consumo de memoria un par de puntos porcentuales cada hora. El liveness probe lo comprueba cada diez segundos y siempre recibe la misma respuesta: 200, cuarenta milisegundos. Ese proceso está, a todos los efectos que mide Kubernetes, perfectamente sano. Pero cuando ese … Leer más

Alertas basadas en señales: más información, menos ruido

Un equipo SRE(Site Reliability Engineering (Ingeniería de Fiabilidad del Sitio)) recibe 47 alertas en una hora. Todas parecen urgentes. El sistema de ticketing colapsa, los canales de Slack arden, y cuando finalmente se identifica el problema real —una degradación en la capa de persistencia— ya han pasado 23 minutos desde la primera señal relevante. Las … Leer más