Alertmanager: Routing, Grouping, Inhibiting Before the Storm
A well-written alerting rule isn't enough: without grouping or inhibition, a single incident fires dozens of identical notifications for the same cause.
A well-written alerting rule isn't enough: without grouping or inhibition, a single incident fires dozens of identical notifications for the same cause.
Sans Alertmanager bien configuré, un seul incident déclenche des dizaines de notifications identiques pour la même cause, une tempête qui noie le vrai signal.
Un Prometheus local garde ses métriques quelques semaines, sur son propre disque. Thanos déporte la rétention vers de l'object storage et unifie plusieurs clusters.
A local Prometheus keeps metrics for a few weeks, on its own disk. Thanos offloads retention to object storage and unifies multiple clusters into one view.
Un label à valeurs non bornées (ID de requête, IP client) multiplie les séries stockées à l'infini. La cardinalité, pas le nombre de métriques, dimensionne Prometheus.
An unbounded label (request ID, client IP) multiplies stored series without limit. Cardinality, not metric count, is what actually sizes Prometheus.
Le choix entre Prometheus auto-hébergé et une plateforme SaaS n'est pas idéologique. Un calcul de coût total : infrastructure et exploitation contre facturation à l'ingestion.
The choice between self-hosted Prometheus and SaaS observability isn't ideological. A total-cost calculation: infrastructure and operations versus ingestion billing.
Un SLO et un budget d'erreur ne disent pas quand alerter. La méthode burn-rate multi-fenêtres, simplifiée pour une PME, pour agir avant l'épuisement du budget.
A static SLO and error budget don't say when to page. Multi-window burn-rate alerting, simplified for a small team, catches trouble before the budget runs out.
Why symptom-based Prometheus alerts beat cause-based ones, how the for clause and severity labels cut noise, plus a bad rule rewritten into a good one.
Pourquoi alerter sur les symptômes et non les causes, comment régler la clause for et le label severity, et une mauvaise règle Prometheus réécrite proprement.
Golden signals, méthode RED et histogramme plutôt que summary pour la latence : comment instrumenter une application Prometheus, avec les requêtes PromQL.
Golden signals and the RED method: why latency uses a histogram, not a summary, when instrumenting an app for Prometheus, with matching PromQL queries.