Retour à la leçon
Mission

Mission : le monitoring qui surveille le monitoring

Concevoir une architecture Prometheus/Alertmanager résiliente à la panne d'une seule instance, sans déplacer le SPOF ailleurs.

Contexte

Le seul serveur Prometheus de l'entreprise vient de tomber en panne matérielle pendant deux heures. Pendant ce temps, un incident réel sur payment-api n'a été détecté par personne. L'équipe veut désormais une architecture qui survit à la panne d'un seul composant, sans sur-ingénierie inutile pour une infrastructure encore modeste (un seul datacenter).