Vertical Pod Autoscaler (VPA)
Le Vertical Pod Autoscaler ajuste les requests CPU et mémoire d’un
pod à partir de sa consommation réelle observée dans le temps, plutôt
que de valeurs posées à la main une fois puis jamais revisitées. Il
répond à une question différente de celle du
HPA : pas « combien de
pods faut-il ? » mais « chaque pod a-t-il la bonne taille ? ».
Trois modes, un seul vraiment sûr à activer partout
Le VPA fonctionne en mode Off (recommandation seule, aucune action
automatique, le mode à utiliser pour mesurer avant de régler), en
mode Initial (applique la recommandation seulement à la création du
pod) ou en mode Auto (redémarre le pod pour appliquer une nouvelle
recommandation, y compris sur un pod déjà en cours d’exécution). Ce
dernier mode a un coût réel : chaque ajustement provoque une
recréation du pod, avec l’interruption que cela implique, à ne pas
activer sans avoir vérifié qu’elle est tolérable.
Pourquoi il ne remplace pas le HPA
Le VPA et le HPA agissent sur des axes différents et se marchent sur
les pieds s’ils ciblent la même métrique en même temps : le HPA ajoute
des replicas quand la charge par pod dépasse une cible calculée à
partir de la request CPU, tandis que le VPA modifie cette request
elle-même ; chacun peut invalider la base de calcul de l’autre. En
pratique, on utilise le VPA en mode Off pour dimensionner les
requests une fois avec de vraies données, puis on laisse le HPA gérer
le nombre de replicas sur cette base stabilisée.