Retour à la leçon
Mission

Mission : garantir qu'une panne de node ne coupe plus jamais la majorité du service

Forcer une répartition résiliente des Pods sur des nodes différents, ajouter un PodDisruptionBudget adapté, et comprendre précisément ce qu'il protège ou non.

Contexte

L'API api-deployment tourne avec 6 replicas dans le namespace production, sans aucune règle d'anti-affinité. Un soir, le node qui héberge par hasard 4 de ces 6 Pods tombe en panne matérielle : Kubernetes avait placé la majorité des replicas sur la même machine, sans que personne ne l'ait explicitement décidé. Le service survit de justesse avec seulement 2 Pods restants, au bord de la surcharge. Il faut transformer cette résilience accidentelle en résilience garantie par configuration.