Set-OPS-Public/roles/client_metrique
Daniel Allaire f4bb40c4f2 metriques : le client installait un pilote IPMI qui echoue a chaque demarrage
LE REDEMARRAGE A TENU. obs-01 a redemarre avec son disque cloud-init
RETIRE de Proxmox — sans paquet et sans source de donnees — et elle est
revenue avec son adresse, sa passerelle et son resolveur. Le retrait de
cloud-init est desormais prouve par un demarrage reel.

ET IL A REVELE AUTRE CHOSE. Une unite en echec : openipmi.service. La
chaine est prometheus-node-exporter -> recommande collectors -> recommande
ipmitool -> recommande openipmi. Trois recommandations en cascade,
raisonnables sur du metal. Dans une VM il n y a pas de BMC et le script d
init echoue a chaque demarrage.

LE POINT N EST PAS LE PAQUET, C EST POURQUOI PERSONNE NE L AVAIT VU.
openipmi datait du 2026-09-02. systemctl --failed rendait pourtant ZERO
sur les quatorze machines — non parce qu elles allaient bien, mais parce
qu aucune n avait REDEMARRE depuis. Six jours et vingt heures pour obs-01.
Un controle qui ne peut echouer qu au demarrage ne mesure rien tant que
rien ne demarre.

Le degat n est pas cosmetique : une unite en echec permanent use le seul
signal qui devrait alerter. Le jour ou une vraie unite tombe, --failed
rend 2 au lieu de 1, et personne ne fait la difference.

CORRECTION A LA SOURCE ET CONDITIONNELLE. client_metrique retire ipmitool
et openipmi, mais SEULEMENT dans une VM (virtualization_role == guest) :
sur du metal le collecteur IPMI est legitime. Ils ne sont que RECOMMANDES,
donc les retirer n emporte pas les collectors, qui servent. Un handler
efface l etat failed que le retrait ne nettoie pas.

Applique aux quatorze : ipmi=0, collectors=1, node_exporter=active,
echecs=0. Second passage : zero changement sur zero hote.

RESTE OUVERT : rien dans le harnais ne regarde systemctl --failed sur la
flotte. Ce defaut a ete trouve parce qu un humain a redemarre une machine.

make prouver : CONFORME, 63 OK, 0 echec, 0 saute.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01Crgis8CxCWkAGFA1ecBz3q
2026-09-09 16:20:32 -04:00
..
defaults metriques : le client installait un pilote IPMI qui echoue a chaque demarrage 2026-09-09 16:20:32 -04:00
handlers metriques : le client installait un pilote IPMI qui echoue a chaque demarrage 2026-09-09 16:20:32 -04:00
meta site : quatre zones d'autorite, et l'ordre inscrit dans les integrations 2026-08-25 17:31:07 -04:00
tasks metriques : le client installait un pilote IPMI qui echoue a chaque demarrage 2026-09-09 16:20:32 -04:00
templates metriques : node_exporter mourait a chaque renouvellement de certificat 2026-08-09 14:14:16 -04:00
README.md Set-OPS — moteur d'ecosystemes numeriques souverains (Alliance Boreale) 2026-06-24 20:17:46 -04:00

client_metrique

Intégration cliente métriques : installe node_exporter sur la VM pour qu'elle soit collectée par serveur_prometheus.

Rôle

  • Installe prometheus-node-exporter (paquet Debian).
  • Configure l'adresse d'écoute (:9100 par défaut).
  • Active et démarre le service.

Boucle complète

  1. On ajoute une VM au groupe client_metrique et on l'active.
  2. Ce rôle y installe node_exporter (:9100).
  3. serveur_prometheus dérive automatiquement la cible depuis l'inventaire (hôtes actifs de client_metrique) et la scrape.

Aucun edit manuel côté Prometheus.

Variables

Variable Défaut Rôle
client_metrique_adresse_ecoute :9100 --web.listen-address

Prérequis

  • Dépendance client_metrique requiert serveur_prometheus actif (déjà dans docs/dependances-groupes.yml).
  • Accès du serveur Prometheus au port 9100 (segmentation réseau / nftables).