Set-OPS-Public/roles/client_metrique/tasks/main.yml
Daniel Allaire f4bb40c4f2 metriques : le client installait un pilote IPMI qui echoue a chaque demarrage
LE REDEMARRAGE A TENU. obs-01 a redemarre avec son disque cloud-init
RETIRE de Proxmox — sans paquet et sans source de donnees — et elle est
revenue avec son adresse, sa passerelle et son resolveur. Le retrait de
cloud-init est desormais prouve par un demarrage reel.

ET IL A REVELE AUTRE CHOSE. Une unite en echec : openipmi.service. La
chaine est prometheus-node-exporter -> recommande collectors -> recommande
ipmitool -> recommande openipmi. Trois recommandations en cascade,
raisonnables sur du metal. Dans une VM il n y a pas de BMC et le script d
init echoue a chaque demarrage.

LE POINT N EST PAS LE PAQUET, C EST POURQUOI PERSONNE NE L AVAIT VU.
openipmi datait du 2026-09-02. systemctl --failed rendait pourtant ZERO
sur les quatorze machines — non parce qu elles allaient bien, mais parce
qu aucune n avait REDEMARRE depuis. Six jours et vingt heures pour obs-01.
Un controle qui ne peut echouer qu au demarrage ne mesure rien tant que
rien ne demarre.

Le degat n est pas cosmetique : une unite en echec permanent use le seul
signal qui devrait alerter. Le jour ou une vraie unite tombe, --failed
rend 2 au lieu de 1, et personne ne fait la difference.

CORRECTION A LA SOURCE ET CONDITIONNELLE. client_metrique retire ipmitool
et openipmi, mais SEULEMENT dans une VM (virtualization_role == guest) :
sur du metal le collecteur IPMI est legitime. Ils ne sont que RECOMMANDES,
donc les retirer n emporte pas les collectors, qui servent. Un handler
efface l etat failed que le retrait ne nettoie pas.

Applique aux quatorze : ipmi=0, collectors=1, node_exporter=active,
echecs=0. Second passage : zero changement sur zero hote.

RESTE OUVERT : rien dans le harnais ne regarde systemctl --failed sur la
flotte. Ce defaut a ete trouve parce qu un humain a redemarre une machine.

make prouver : CONFORME, 63 OK, 0 echec, 0 saute.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01Crgis8CxCWkAGFA1ecBz3q
2026-09-09 16:20:32 -04:00

123 lines
4 KiB
YAML

---
- name: Installer node_exporter
ansible.builtin.apt:
name: "{{ client_metrique_paquets }}"
state: present
update_cache: true
cache_valid_time: 3600
# Retire APRES l'installation, et pas avant : c'est elle qui les fait venir, en cascade
# de recommandations. `ipmitool` et `openipmi` ne sont que RECOMMANDES — les retirer
# n'emporte donc pas `prometheus-node-exporter-collectors`, dont les collecteurs
# textfile, eux, servent.
- name: Retirer le materiel qui ne peut pas exister dans une VM (IPMI)
ansible.builtin.apt:
name: "{{ client_metrique_paquets_sans_objet_en_vm }}"
state: absent
purge: true
autoremove: false
when: ansible_facts.virtualization_role | default('') == 'guest'
# Retirer le paquet n'efface pas l'ECHEC deja enregistre : systemd garde l'unite en
# `failed` jusqu'au prochain demarrage. Sur une flotte qui ne redemarre pas, ca
# voudrait dire des semaines de `systemctl --failed` non vide pour une unite qui
# n'existe plus — exactement le bruit qu'on vient de supprimer, conserve par
# inadvertance.
notify: Effacer l etat d echec des unites retirees
# --- TLS : synchroniser le cert step_ca AVANT d'activer --web.config.file ---
- name: TLS — repertoire des certificats (prometheus)
ansible.builtin.file:
path: "{{ client_metrique_tls_dir }}"
state: directory
owner: prometheus
group: prometheus
mode: "0700"
when: client_metrique_tls_actif | bool
- name: TLS — script de synchronisation du certificat
ansible.builtin.template:
src: setops-node-exporter-cert-sync.sh.j2
dest: /usr/local/sbin/setops-node-exporter-cert-sync
owner: root
group: root
mode: "0755"
when: client_metrique_tls_actif | bool
- name: TLS — unites de synchronisation (service + path)
ansible.builtin.template:
src: "{{ item.s }}"
dest: "{{ item.d }}"
owner: root
group: root
mode: "0644"
loop:
- { s: "setops-node-exporter-cert-sync.service.j2", d: "/etc/systemd/system/setops-node-exporter-cert-sync.service" }
- { s: "setops-node-exporter-cert-sync.path.j2", d: "/etc/systemd/system/setops-node-exporter-cert-sync.path" }
loop_control:
label: "{{ item.d | basename }}"
when: client_metrique_tls_actif | bool
- name: TLS — activer la surveillance du certificat (path)
ansible.builtin.systemd:
name: setops-node-exporter-cert-sync.path
enabled: true
state: started
daemon_reload: true
when:
- client_metrique_tls_actif | bool
- not ansible_check_mode
- name: TLS — synchroniser le certificat maintenant
ansible.builtin.command: /usr/local/sbin/setops-node-exporter-cert-sync
changed_when: false
when:
- client_metrique_tls_actif | bool
- not ansible_check_mode
- name: TLS — deployer la web-config de node_exporter
ansible.builtin.template:
src: web-config.yml.j2
dest: "{{ client_metrique_web_config }}"
owner: root
group: prometheus
mode: "0640"
when: client_metrique_tls_actif | bool
notify: Redemarrer node_exporter
- name: TLS — verifier la presence du certificat synchronise
ansible.builtin.stat:
path: "{{ client_metrique_tls_dir }}/{{ item }}"
register: client_metrique_tls_stat
loop:
- node.crt
- node.key
when:
- client_metrique_tls_actif | bool
- not ansible_check_mode
- name: TLS — garde-fou, ne pas activer sans certificat en place
ansible.builtin.assert:
that:
- item.stat.exists
fail_msg: "Cert node_exporter absent ({{ item.item }}) — TLS non active."
loop: "{{ client_metrique_tls_stat.results | default([]) }}"
loop_control:
label: "{{ item.item }}"
when:
- client_metrique_tls_actif | bool
- not ansible_check_mode
- name: Definir les arguments de node_exporter (adresse d'ecoute)
ansible.builtin.template:
src: default-node-exporter.j2
dest: /etc/default/prometheus-node-exporter
owner: root
group: root
mode: "0644"
notify: Redemarrer node_exporter
- name: Activer et demarrer node_exporter
ansible.builtin.systemd:
name: "{{ client_metrique_service }}"
enabled: true
state: started