Gray failures: cuando nada está «caído» pero todo va mal

Un pod con 8 GB de heap Java lleva tres días subiendo su consumo de memoria un par de puntos porcentuales cada hora. El liveness probe lo comprueba cada diez segundos y siempre recibe la misma respuesta: 200, cuarenta milisegundos. Ese proceso está, a todos los efectos que mide Kubernetes, perfectamente sano. Pero cuando ese … Leer más

Novedades Observabilidad: semana del 28/06/2026 al 05/07/2026

Resumen semanal del ecosistema cloud-native y SRE: OpenTelemetry, CNCF y SRE Weekly. Artículos y contenidos originales en inglés resumidos en español para facilitar el seguimiento de novedades, releases y tendencias del sector sin depender de ningún vendor concreto. CNCF Blog How data sovereignty is changing cloud native infrastructure design Publicado el 2026-07-03 — Leer artículo … Leer más

Prometheus: cambios importantes de las últimas versiones que todo administrador debe conocer

prometheus_30

Prometheus se ha consolidado como la piedra angular en la monitorización de sistemas y aplicaciones en entornos nativos de la nube. Su modelo de datos basado en series temporales, junto con su ecosistema abierto y extensible, lo convierten en la opción predilecta para ingenieros de fiabilidad de sitios (SRE) y arquitectos de observabilidad. Sin embargo, … Leer más

Stress-ng: Simulación de carga para validar tu monitorización básica

stress-ng

Como especialista en sistemas Linux y observabilidad, una de las tareas más importantes es validar que nuestras herramientas de monitorización funcionan correctamente y que las alertas se disparan cuando deben hacerlo. Una validación completa requeriría pruebas a varios niveles: carga de infraestructura, problemas de red, pruebas de aplicación, inyección de fallos, etc. Sin embargo, stress-ng … Leer más