journal : premiere reconstruction sans arret ; parefeu par la sonde connectivite (135 s / 94 s)

Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com>
This commit is contained in:
Daniel Allaire 2026-09-30 23:08:41 -04:00
parent 8603ec4c19
commit 209730b62a

View file

@ -1,5 +1,42 @@
# CHANGELOG — Set-OPS # CHANGELOG — Set-OPS
## 2026-09-30 (55) — Première reconstruction sans un seul arrêt ; le pare-feu jugé par une sonde à la minute
**Chezlepro, quatrième reconstruction, lancée par l'exploitant** (`reconstruire-locataire`,
détachée) : 8 étapes sur 8, **aucun arrêt**, 60 min, les 7 jeux d'état restaurés. Première
reconstruction de bout en bout sans aucune intervention. Sur ces 60 min, 20 pour l'étape
`parefeu` — « vraiment trop de temps », dit l'exploitant, qui propose des sondes de
connectivité rapportant à Icinga chaque minute.
**La sonde `connectivite`** (déclarée par `serveur_durci`, déposée par `nftables_baseline`) :
chaque VM teste chaque minute les flux SORTANTS que le registre lui promet. La liste est
écrite par `make flux` à côté de chaque `.nft`, depuis les MÊMES règles résolues
(`flux-genere/<hôte>.connectivite.json`). La cause est mesurée, pas supposée (2026-09-30,
depuis `web-frontal-01`) : rejet Proxmox = `EHOSTUNREACH` → COUPÉ ; `drop` nftables =
délai → COUPÉ ; port autorisé où rien n'écoute = `ECONNREFUSED` → information (pas une
coupure). Elle signale aussi les connexions entrantes établies que les règles ne couvrent
pas. Contrôle négatif : une liste imposée (flux bloqué, port fermé, flux ouvert) → COUPÉ,
code 2, chaque cause nommée.
**Le porteur à la minute** : `client_sante` joue `sondes-minute/` chaque minute (`ttl` 3 min),
hors du répertoire au quart d'heure — sinon le `ttl` de 90 min masquerait le silence. Même
script, mode `minute`. Icinga accepte une `fraicheur:` par sonde ; P64 reconnaît
`sondes-minute/`.
**L'étape `parefeu`** (`eprouver_parefeu.py --flotte --sondes`, utilisée par
`reconstruire-locataire` et `parefeu-*-flotte`) : refus si un flux est DÉJÀ coupé, activation
des 13 VM d'un coup, attente des rapports postérieurs, seul ce qui change compte. Mesuré :
**Technolibre 135 s, Chezlepro 94 s** (au lieu de ~20 min), 0 critique apparu. La matrice VM
par VM reste pour le diagnostic (`--hote`).
**Deux défauts de la sonde vus au premier déploiement, corrigés** : une machine qui se parle
par sa propre adresse (Loki sur `obs-01`) se déclarait « hors des règles » ; deux flux
déclarés sans service (`infra-edge-01 → mon-01:8080`, `→ ops-01:8090` : interfaces liées en
local derrière la passerelle SSO) étaient un avertissement permanent — ce sont désormais des
informations nommées. **Reste** : retirer ces deux déclarations obsolètes du registre ;
générer et déployer la sonde au SITE (ses listes ne sont pas encore générées — un
`serveur_icinga` du site redéployé l'attendrait en rouge).
## 2026-09-30 (54) — Chezlepro au bout ; Technolibre arrêtée par un verrou dpkg ## 2026-09-30 (54) — Chezlepro au bout ; Technolibre arrêtée par un verrou dpkg
**Chezlepro** (lancée par l'exploitant, reprise `DEPUIS=parefeu` après (53)) : pare-feu 13/13 **Chezlepro** (lancée par l'exploitant, reprise `DEPUIS=parefeu` après (53)) : pare-feu 13/13