LE REDEMARRAGE A TENU. obs-01 a redemarre avec son disque cloud-init RETIRE de Proxmox — sans paquet et sans source de donnees — et elle est revenue avec son adresse, sa passerelle et son resolveur. Le retrait de cloud-init est desormais prouve par un demarrage reel. ET IL A REVELE AUTRE CHOSE. Une unite en echec : openipmi.service. La chaine est prometheus-node-exporter -> recommande collectors -> recommande ipmitool -> recommande openipmi. Trois recommandations en cascade, raisonnables sur du metal. Dans une VM il n y a pas de BMC et le script d init echoue a chaque demarrage. LE POINT N EST PAS LE PAQUET, C EST POURQUOI PERSONNE NE L AVAIT VU. openipmi datait du 2026-09-02. systemctl --failed rendait pourtant ZERO sur les quatorze machines — non parce qu elles allaient bien, mais parce qu aucune n avait REDEMARRE depuis. Six jours et vingt heures pour obs-01. Un controle qui ne peut echouer qu au demarrage ne mesure rien tant que rien ne demarre. Le degat n est pas cosmetique : une unite en echec permanent use le seul signal qui devrait alerter. Le jour ou une vraie unite tombe, --failed rend 2 au lieu de 1, et personne ne fait la difference. CORRECTION A LA SOURCE ET CONDITIONNELLE. client_metrique retire ipmitool et openipmi, mais SEULEMENT dans une VM (virtualization_role == guest) : sur du metal le collecteur IPMI est legitime. Ils ne sont que RECOMMANDES, donc les retirer n emporte pas les collectors, qui servent. Un handler efface l etat failed que le retrait ne nettoie pas. Applique aux quatorze : ipmi=0, collectors=1, node_exporter=active, echecs=0. Second passage : zero changement sur zero hote. RESTE OUVERT : rien dans le harnais ne regarde systemctl --failed sur la flotte. Ce defaut a ete trouve parce qu un humain a redemarre une machine. make prouver : CONFORME, 63 OK, 0 echec, 0 saute. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Crgis8CxCWkAGFA1ecBz3q
44 lines
2.2 KiB
YAML
44 lines
2.2 KiB
YAML
---
|
|
client_metrique_paquets:
|
|
- prometheus-node-exporter
|
|
|
|
# LE MATERIEL QUI N'EXISTE PAS DANS UNE VM (mesure du 2026-09-09 sur `obs-01`).
|
|
#
|
|
# `prometheus-node-exporter` RECOMMANDE `prometheus-node-exporter-collectors`, qui
|
|
# RECOMMANDE `ipmitool`, qui RECOMMANDE `openipmi`. Trois recommandations en cascade,
|
|
# chacune raisonnable sur du metal — et la derniere installe un script d'init qui tente
|
|
# de charger le pilote IPMI a CHAQUE demarrage. Dans une VM il n'y a pas de BMC :
|
|
#
|
|
# openipmi[655]: Starting ipmi drivers ipmi failed!
|
|
# systemd[1]: Failed to start openipmi.service
|
|
#
|
|
# CE QUI REND CE DEFAUT INSTRUCTIF : il datait du 2026-09-02, et personne ne l'avait vu.
|
|
# `systemctl --failed` rendait ZERO sur les quatorze machines — non parce qu'elles
|
|
# allaient bien, mais parce qu'aucune n'avait REDEMARRE depuis. Six jours et vingt heures
|
|
# pour `obs-01`. Un controle qui ne peut echouer qu'au demarrage ne mesure rien tant que
|
|
# rien ne demarre.
|
|
#
|
|
# Une unite en echec permanent n'est pas qu'inesthetique : elle use le seul signal qui
|
|
# devrait alerter. Le jour ou une VRAIE unite tombera, `systemctl --failed` rendra « 2 »
|
|
# au lieu de « 1 », et personne ne fera la difference.
|
|
#
|
|
# ON NE RETIRE QUE DANS UNE VM. Sur du metal, le collecteur IPMI est legitime — c'est
|
|
# meme la raison de la recommandation. Le role s'appuie donc sur ce qu'Ansible SAIT de la
|
|
# machine, pas sur une supposition.
|
|
client_metrique_paquets_sans_objet_en_vm:
|
|
- openipmi
|
|
- ipmitool
|
|
|
|
client_metrique_service: "prometheus-node-exporter"
|
|
|
|
# Adresse d'ecoute de node_exporter. Par defaut toutes les interfaces ; la
|
|
# segmentation reseau (VLAN / nftables) restreint l'acces au serveur Prometheus.
|
|
client_metrique_adresse_ecoute: ":9100"
|
|
|
|
# --- TLS (zero-confiance) : node_exporter sert en HTTPS avec le cert step_ca ---
|
|
# Requiert client_pki sur le noeud. Prometheus scrape alors en https + verifie.
|
|
client_metrique_tls_actif: false
|
|
client_metrique_tls_dir: "/etc/prometheus-node-exporter/tls"
|
|
client_metrique_web_config: "/etc/prometheus-node-exporter/web-config.yml"
|
|
client_metrique_tls_source_cert: "/etc/step/certs/{{ ansible_fqdn | default(ansible_hostname) }}.crt"
|
|
client_metrique_tls_source_cle: "/etc/step/certs/{{ ansible_fqdn | default(ansible_hostname) }}.key"
|