glossaire

Vertical Pod Autoscaler (VPA)

Le Vertical Pod Autoscaler ajuste les requests CPU et mémoire d’un pod à partir de sa consommation réelle observée dans le temps, plutôt que de valeurs posées à la main une fois puis jamais revisitées. Il répond à une question différente de celle du HPA : pas « combien de pods faut-il ? » mais « chaque pod a-t-il la bonne taille ? ».

Trois modes, un seul vraiment sûr à activer partout

Le VPA fonctionne en mode Off (recommandation seule, aucune action automatique, le mode à utiliser pour mesurer avant de régler), en mode Initial (applique la recommandation seulement à la création du pod) ou en mode Auto (redémarre le pod pour appliquer une nouvelle recommandation, y compris sur un pod déjà en cours d’exécution). Ce dernier mode a un coût réel : chaque ajustement provoque une recréation du pod, avec l’interruption que cela implique, à ne pas activer sans avoir vérifié qu’elle est tolérable.

Pourquoi il ne remplace pas le HPA

Le VPA et le HPA agissent sur des axes différents et se marchent sur les pieds s’ils ciblent la même métrique en même temps : le HPA ajoute des replicas quand la charge par pod dépasse une cible calculée à partir de la request CPU, tandis que le VPA modifie cette request elle-même ; chacun peut invalider la base de calcul de l’autre. En pratique, on utilise le VPA en mode Off pour dimensionner les requests une fois avec de vraies données, puis on laisse le HPA gérer le nombre de replicas sur cette base stabilisée.