Retour à la leçonMission
Mission : le monitoring qui surveille le monitoring
Concevoir une architecture Prometheus/Alertmanager résiliente à la panne d'une seule instance, sans déplacer le SPOF ailleurs.
Contexte
Le seul serveur Prometheus de l'entreprise vient de tomber en panne matérielle pendant deux heures. Pendant ce temps, un incident réel sur payment-api n'a été détecté par personne. L'équipe veut désormais une architecture qui survit à la panne d'un seul composant, sans sur-ingénierie inutile pour une infrastructure encore modeste (un seul datacenter).