--- # Supervision derivee du role. Voir docs/supervision-conception.md. # # CE QUE `client_sante` RAPPORTE DEJA : les unites systemd EN ECHEC de la machine. C'est # la base, et elle ne suffit pas ici. # # UNE WEBAPP NE TOMBE PRESQUE JAMAIS EN « FAILED ». Elle se coince. Le processus vit, # systemd la voit `active (running)`, le port est ouvert — et plus une requete n'aboutit : # une boucle d'evenements bloquee, un verrou SQLite jamais relache, un pool d'attente # sature. Pour systemd tout va bien ; pour l'utilisateur, le site ne repond plus. # # C'est pourquoi la sonde ne se contente pas de l'etat de l'unite : elle FRAPPE l'app. # # CE QU'ELLE MESURE, ET OU. Les apps ecoutent en `127.0.0.1:`, derriere un nginx # local, lui-meme derriere l'edge. La sonde frappe le port de l'APP — le maillon le plus # profond. Si elle est verte et que le site ne repond pas, la panne est dans nginx ou a # l'edge, et on l'a appris sans chercher. # # UNE SEULE SONDE POUR TOUTES LES APPS : une seule CAUSE D'ACTION, aller voir cet # hebergeur. Elle nomme celle qui manque. # # TTL de 5400 s pour un porteur qui passe aux 15 min : trois passages manques avant la # peremption. Le silence alerte autant que l'echec. sondes: - nom: apps-servies ttl: 5400 raison: 'Chacune des webapps declarees repond-elle encore ? Une app ne tombe presque jamais en « failed » — elle se coince : le processus vit, systemd la dit active, le port est ouvert, et plus une requete n''aboutit. Le rapport d''unites en echec ne verra jamais ca.' # SUR LE DORSAL DEPUIS LE 2026-09-29 : c'est lui qui porte les sites ; le frontal les relaie. - nom: sites-servis ttl: 5400 raison: 'Chacun des sites statiques declares se sert-il encore ? Le contenu vient d''un depot git : une branche renommee, un sous-dossier deplace ou un clone vide laissent nginx parfaitement vert avec un site perime, vide, ou en 404. Seul un GET sur le `server_name` de chaque site le dit.'