D-87 disait que l hebergeur n a pas le droit de voir les journaux de ses
locataires. La decision avait une face cachee : a force de refuser de voir
ceux des autres, le site s etait prive des siens. Ses sept machines
n expediaient nulle part.
Il prend donc sa propre pile : prometheus, loki et grafana sur site-mon-01,
sans aucun lien avec ceux d un tenant. L exemption qui bloquait portait sa
propre condition de levee, ecrite cinq jours plus tot dans le plan.
Grafana au site n a pas de SSO, et le role l ignorait : il reclamait l IdP
avant de regarder s il en voulait un. L interrupteur existait, il n etait
pas honore. Le role refuse desormais SSO eteint ET formulaire local eteint
- la combinaison deploie un Grafana en sante ou personne ne peut entrer -
et le reglage du formulaire sort du if du SSO, ou il disparaissait en
laissant le defaut amont decider en silence.
Deux manques se cachaient l un l autre dans le devis de la frontiere, et
Prometheus voyait 1 cible sur 7 :
- le devis derivait les groupes d une machine du site de applications.yml
seul, et ne voyait donc aucune integration universelle - alors que
client_metrique ouvre un port d ecoute ;
- une sortie vers un role du site visait !SETOPS_INTERNES, qui exclut
precisement la machine nommee. Le devis autorisait a expedier les
journaux du site a n importe quel Loki du monde, et a nul autre endroit
qu a celui-la. Neuf flux dans ce cas.
Et deux declarations justes ne font qu une regle : appliquer_opnsense pose
tout en direction: in (D-61).
Les deux agents se supervisent enfin eux-memes. La sonde des journaux ne
demande pas si Alloy tourne, elle lit ce qu il a du JETER. Elle a fait ses
preuves le jour meme : Alloy actif, /-/ready a 200, et cinquante lignes
perdues sur six machines.
Mesure : metriques 7/7 vert, journaux 1/7 - les six autres attendent la
regle de frontiere, et le disent. prouver 64 OK, ansible-lint 0 defaut.
Reste a la main de l exploitant : make frontiere-appliquer CONFIRMER=true,
et le secret vault_grafana_admin a deposer dans underlay.vault.yml.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01Crgis8CxCWkAGFA1ecBz3q
69 lines
3.3 KiB
YAML
69 lines
3.3 KiB
YAML
---
|
|
client_metrique_paquets:
|
|
- prometheus-node-exporter
|
|
|
|
# LE MATERIEL QUI N'EXISTE PAS DANS UNE VM (mesure du 2026-09-09 sur `obs-01`).
|
|
#
|
|
# `prometheus-node-exporter` RECOMMANDE `prometheus-node-exporter-collectors`, qui
|
|
# RECOMMANDE `ipmitool`, qui RECOMMANDE `openipmi`. Trois recommandations en cascade,
|
|
# chacune raisonnable sur du metal — et la derniere installe un script d'init qui tente
|
|
# de charger le pilote IPMI a CHAQUE demarrage. Dans une VM il n'y a pas de BMC :
|
|
#
|
|
# openipmi[655]: Starting ipmi drivers ipmi failed!
|
|
# systemd[1]: Failed to start openipmi.service
|
|
#
|
|
# CE QUI REND CE DEFAUT INSTRUCTIF : il datait du 2026-09-02, et personne ne l'avait vu.
|
|
# `systemctl --failed` rendait ZERO sur les quatorze machines — non parce qu'elles
|
|
# allaient bien, mais parce qu'aucune n'avait REDEMARRE depuis. Six jours et vingt heures
|
|
# pour `obs-01`. Un controle qui ne peut echouer qu'au demarrage ne mesure rien tant que
|
|
# rien ne demarre.
|
|
#
|
|
# Une unite en echec permanent n'est pas qu'inesthetique : elle use le seul signal qui
|
|
# devrait alerter. Le jour ou une VRAIE unite tombera, `systemctl --failed` rendra « 2 »
|
|
# au lieu de « 1 », et personne ne fera la difference.
|
|
#
|
|
# ON NE RETIRE QUE DANS UNE VM. Sur du metal, le collecteur IPMI est legitime — c'est
|
|
# meme la raison de la recommandation. Le role s'appuie donc sur ce qu'Ansible SAIT de la
|
|
# machine, pas sur une supposition.
|
|
client_metrique_paquets_sans_objet_en_vm:
|
|
- openipmi
|
|
- ipmitool
|
|
|
|
client_metrique_service: "prometheus-node-exporter"
|
|
|
|
# Adresse d'ecoute de node_exporter. Par defaut toutes les interfaces ; la
|
|
# segmentation reseau (VLAN / nftables) restreint l'acces au serveur Prometheus.
|
|
client_metrique_adresse_ecoute: ":9100"
|
|
|
|
# --- TLS (zero-confiance) : node_exporter sert en HTTPS avec le cert step_ca ---
|
|
# Requiert client_pki sur le noeud. Prometheus scrape alors en https + verifie.
|
|
client_metrique_tls_actif: false
|
|
client_metrique_tls_dir: "/etc/prometheus-node-exporter/tls"
|
|
client_metrique_web_config: "/etc/prometheus-node-exporter/web-config.yml"
|
|
client_metrique_tls_source_cert: "/etc/step/certs/{{ ansible_fqdn | default(ansible_hostname) }}.crt"
|
|
client_metrique_tls_source_cle: "/etc/step/certs/{{ ansible_fqdn | default(ansible_hostname) }}.key"
|
|
|
|
# --- Sonde de supervision (voir meta/supervision.yml) ---
|
|
# L'ENDROIT QUE PROMETHEUS INTERROGE, vu depuis la machine elle-meme. Le port se derive
|
|
# de l'adresse d'ecoute declaree : ecrire `9100` ici le ferait mentir le jour ou on la
|
|
# change, et une sonde qui vise le mauvais port rapporte une panne qui n'existe pas.
|
|
client_metrique_sonde_schema: "{{ 'https' if client_metrique_tls_actif | bool else 'http' }}"
|
|
client_metrique_sonde_port: "{{ client_metrique_adresse_ecoute | regex_replace('^.*:', '') }}"
|
|
client_metrique_sonde_url: >-
|
|
{{ client_metrique_sonde_schema }}://127.0.0.1:{{ client_metrique_sonde_port }}/metrics
|
|
|
|
# LES COLLECTEURS QUI CHERCHENT DU MATERIEL ABSENT D'UNE VM (mesure du 2026-09-10 : les
|
|
# dix memes echouent sur les sept machines du site). Leur echec n'est pas une panne, et
|
|
# une sonde rouge partout est une sonde qu'on cesse de lire. Sur du METAL, vider cette
|
|
# liste : `mdadm` ou `bonding` qui tombe y voudrait dire quelque chose.
|
|
client_metrique_collecteurs_sans_objet:
|
|
- bonding
|
|
- fibrechannel
|
|
- infiniband
|
|
- ipvs
|
|
- mdadm
|
|
- nfs
|
|
- nfsd
|
|
- pressure
|
|
- tapestats
|
|
- zfs
|