glossaire

Percentile de latence (p99, p95)

Un percentile de latence répond à une question précise : quel temps de réponse la majorité des requêtes ne dépasse pas ? p99 à 200 ms signifie que 99 % des requêtes ont répondu en 200 ms ou moins, et donc que 1 % ont pris plus longtemps. p50 (la médiane) donne le temps de réponse typique ; p95 et p99 donnent la queue de distribution, là où vivent les requêtes qui font l’incident.

Pourquoi la moyenne ment

Une moyenne peut rester basse et rassurante pendant qu’une fraction réelle des utilisateurs subit des temps de réponse inacceptables : mille requêtes à 50 ms et dix requêtes à 5 secondes donnent une moyenne d’environ 100 ms, un chiffre qui ne raconte rien de ce qui vient de se passer pour ces dix utilisateurs. Le p99 les rend visibles ; la moyenne les noie dans le volume.

Le prix d’un p99 propre

Un p99 propre coûte plus cher qu’un p50 propre : améliorer la médiane optimise le cas courant, améliorer la queue de distribution demande de traiter les causes spécifiques et souvent variées de la lenteur (un appel réseau occasionnel, un garbage collector qui pause, une requête de base de données mal indexée qui ne se déclenche que sur certains paramètres). C’est pour cette raison qu’un SLO de latence se fixe presque toujours sur un percentile élevé (p95 ou p99), jamais sur la moyenne : la moyenne ne protège pas l’expérience des utilisateurs les plus mal servis.