Set-OPS-Public/roles/client_sante
Daniel Allaire c6a7150c60 les depots tiers passent par le cache, et le tenant n a plus le sien
Deux mouvements d une seule doctrine : le site fournit tout ce dont un
tenant a besoin pour venir au monde.

1. LES DEPOTS TIERS. Grafana, Icinga, Smallstep et Collabora ne publient
qu en HTTPS ; apt-cacher-ng ne relaie pas un tunnel, et le socle pose donc
Acquire::https::Proxy DIRECT. Chaque machine sortait elle-meme sur
Internet. Le cache declare desormais un Remap par fournisseur, et chaque
role demande en {{ ..._depot_schema }}:// - http des qu un cache est
declare, https sinon. Le TLS n est rompu nulle part : il est TERMINE au
cache, qui est notre machine, et l integrite vient des signatures.

  avant : 4 fournisseurs en HTTPS direct, 14 machines sortant seules
  apres : 0 source en HTTPS direct, 0 erreur apt sur 14 machines

Trois lecons. Le remap appartient au cache qui SORT : pose sur un cache
chaine, il tente le HTTPS a travers son amont et rend 503. apt_repository
AJOUTE au lieu de remplacer, donc l ancienne ligne https sortait toujours.
Et la liste des fournisseurs ne se devine pas - j en avais trois, l audit
en a revele un quatrieme.

2. LE CACHE DU TENANT. Sa ligne portait son propre retrait depuis toujours
- service MUTUALISABLE, un ecosysteme au premier age peut pointer sur celui
de son hote. Retiree. Ce qu on perd, dit franchement : plus de trafic
inter-zone et plus de charge sur site-cache-01, contre un service de moins
a poser, superviser et reproduire.

3. UN ROLE QU ON RETIRE DOIT DEFAIRE CE QU IL A FAIT. Le retrait a montre
que rien ne nettoie derriere. Le fichier apt visait un cache eteint en
ecrasant le plancher qui fonctionnait - le defaut deja paye a quinze
machines. Et les sondes du cache restaient, le porteur poussant pour des
services qu Icinga ne definit plus (404). Le socle retire le premier,
client_sante derive les sondes attendues et retire les orphelines.

P65 refuse tout role visant un depot relaye en https ecrit en dur. Sa
limite est dite : elle empeche une regression sur ce qui est connu, elle ne
decouvre pas l inconnu.

Mesure : Icinga 87 OK sur 96, prouver 65 OK, lint 0 defaut.

Reste, et c est dit : apt-cacher-ng tourne toujours sur forge-01 que plus
aucun plan ne declare.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01Crgis8CxCWkAGFA1ecBz3q
2026-09-10 14:53:48 -04:00
..
defaults sondes : le contrat ETAIT celui de Nagios, sans le savoir 2026-09-09 22:14:30 -04:00
handlers supervision : systemctl --failed entre dans Icinga (role client_sante) 2026-09-09 20:32:08 -04:00
meta supervision : systemctl --failed entre dans Icinga (role client_sante) 2026-09-09 20:32:08 -04:00
tasks les depots tiers passent par le cache, et le tenant n a plus le sien 2026-09-10 14:53:48 -04:00
templates sondes : le contrat ETAIT celui de Nagios, sans le savoir 2026-09-09 22:14:30 -04:00
README.md client_sante : retrait d une garde qui ne pouvait pas se declencher 2026-09-09 21:06:08 -04:00

client_sante

Le nœud rapporte à Icinga ses unités systemd en échec, par résultat passif.

Pourquoi

Trouvé le 2026-09-09 : openipmi.service échouait à chaque démarrage sur les quatorze machines de Chezlepro depuis le 2026-09-02. systemctl --failed rendait pourtant zéro partout — non parce qu'elles allaient bien, mais parce qu'aucune n'avait redémarré depuis. Six jours et vingt heures pour la première. Il a fallu qu'un humain redémarre une machine pour que le défaut existe aux yeux de quelqu'un.

Un contrôle qui ne peut échouer qu'au démarrage ne mesure rien tant que rien ne démarre.

Et le dégât n'est pas cosmétique : une unité en échec permanent use le seul signal qui devrait alerter. Le jour où une vraie unité tombe, le compte passe de 1 à 2 et personne ne fait la différence.

Passif, et à durée de vie

Un contrôle actif ne voit pas la machine muette : si elle ne répond plus, la sonde échoue et on met ça sur le compte du réseau. Ici c'est le nœud qui parle, et le ttl de son envoi fait la fraîcheur — sans nouvelle, Icinga périme le service tout seul. Le silence alerte autant que l'échec, et le silence est précisément ce qui n'a alerté personne.

Le minuteur déclenche au démarrage (OnBootSec=2min) autant que périodiquement : les échecs de cette famille naissent au boot, et attendre le premier quart d'heure laisserait une fenêtre pendant laquelle la machine est en panne et le tableau au vert.

Tolérances

client_sante_unites_tolerees nomme les unités acceptées une par une, jamais un motif large : un filtre qui cache une unité en cache d'autres, et on ne s'en aperçoit que le jour où l'on cherche pourquoi rien n'a alerté. Le défaut est la liste vide — une unité en échec est soit un vrai problème, soit du bruit à retirer ; dans les deux cas il faut agir.

Ce dont il dépend

Un hôte serveur_icinga dans l'écosystème, le secret vault_icinga_api_depot, et le flux TCP 5665 vers lui — déclaré des deux côtés. Le côté serveur (roles/serveur_icinga/meta/flux.yml) nomme le pair serveur_debian, pas client_sante : la frontière ne résout que les rôles que les machines portent au plan, et une intégration universelle n'y figure pas puisqu'elle est dérivée. L'oubli s'est payé le 2026-09-09 — déploiement à 7/7, et cinq rapports sur sept en TimeoutError.

Le rôle n'a pas de branche « et s'il n'y a pas de supervision ». Il n'en a pas besoin : instancier ne pose une intégration universelle que si son serveur existe, donc le groupe client_sante est absent d'un écosystème sans Icinga. À la place, un assert qui peut échouer, et qui dit lequel des deux manque.