Gray failures: cuando nada está «caído» pero todo va mal

Un pod con 8 GB de heap Java lleva tres días subiendo su consumo de memoria un par de puntos porcentuales cada hora. El liveness probe lo comprueba cada diez segundos y siempre recibe la misma respuesta: 200, cuarenta milisegundos. Ese proceso está, a todos los efectos que mide Kubernetes, perfectamente sano. Pero cuando ese … Leer más

Continuous profiling en la práctica: Parca, Pyroscope y el agente eBPF de OpenTelemetry

Un servicio de checkout en Go que llevaba meses estable empieza a arrastrar la latencia tras el despliegue del martes. El p99 sube de 120 ms a 400 ms, pero nada cuadra: la CPU del pod está al 40 %, la memoria plana, los logs limpios y las trazas señalan que el tiempo se va … Leer más

Sampling de trazas: cómo no arruinar el presupuesto sin perder visibilidad

Es lunes por la mañana. Abres el correo y ahí está: la factura de tu plataforma de observabilidad ha subido un 40% este mes. Te conectas al panel de costes y descubres que las trazas distribuidas se están comiendo el presupuesto. Tu aplicación genera millones de trazas al día, la mayoría de peticiones rutinarias que … Leer más