blog/categorie

Observabilité

Savoir que ça casse avant vos utilisateurs : des SLO dimensionnés pour des équipes réduites, des métriques qui servent à décider, des alertes qu'on ne finit pas par couper. Chaque article part d'un système réellement instrumenté, ou d'un incident qui a montré ce qui manquait.

Ces sujets, je les traite aussi en mission : Fiabilité & observabilité.

Pour lire ces articles dans l'ordre plutôt que par date : Observabilité · Sécurité d’infrastructure.

Le vocabulaire du domaine : Burn rate · Cardinalité des métriques (Prometheus) · Error budget (budget d'erreur) · Observabilité · Percentile de latence (p99, p95) · SLO (Service Level Objective) · tout le glossaire.