31 lines
1.5 KiB
YAML
31 lines
1.5 KiB
YAML
|
|
---
|
||
|
|
# Supervision derivee du role. Voir docs/supervision-conception.md.
|
||
|
|
#
|
||
|
|
# CE QUE `client_sante` RAPPORTE DEJA : les unites systemd EN ECHEC de la machine. C'est
|
||
|
|
# la base, et elle ne suffit pas ici.
|
||
|
|
#
|
||
|
|
# UNE WEBAPP NE TOMBE PRESQUE JAMAIS EN « FAILED ». Elle se coince. Le processus vit,
|
||
|
|
# systemd la voit `active (running)`, le port est ouvert — et plus une requete n'aboutit :
|
||
|
|
# une boucle d'evenements bloquee, un verrou SQLite jamais relache, un pool d'attente
|
||
|
|
# sature. Pour systemd tout va bien ; pour l'utilisateur, le site ne repond plus.
|
||
|
|
#
|
||
|
|
# C'est pourquoi la sonde ne se contente pas de l'etat de l'unite : elle FRAPPE l'app.
|
||
|
|
#
|
||
|
|
# CE QU'ELLE MESURE, ET OU. Les apps ecoutent en `127.0.0.1:<port>`, derriere un nginx
|
||
|
|
# local, lui-meme derriere l'edge. La sonde frappe le port de l'APP — le maillon le plus
|
||
|
|
# profond. Si elle est verte et que le site ne repond pas, la panne est dans nginx ou a
|
||
|
|
# l'edge, et on l'a appris sans chercher.
|
||
|
|
#
|
||
|
|
# UNE SEULE SONDE POUR TOUTES LES APPS : une seule CAUSE D'ACTION, aller voir cet
|
||
|
|
# hebergeur. Elle nomme celle qui manque.
|
||
|
|
#
|
||
|
|
# TTL de 5400 s pour un porteur qui passe aux 15 min : trois passages manques avant la
|
||
|
|
# peremption. Le silence alerte autant que l'echec.
|
||
|
|
sondes:
|
||
|
|
- nom: apps-servies
|
||
|
|
ttl: 5400
|
||
|
|
raison: 'Chacune des webapps declarees repond-elle encore ? Une app ne tombe presque
|
||
|
|
jamais en « failed » — elle se coince : le processus vit, systemd la dit active, le
|
||
|
|
port est ouvert, et plus une requete n''aboutit. Le rapport d''unites en echec ne
|
||
|
|
verra jamais ca.'
|