Aucune metrique de SERVICE n etait collectee — seulement du systeme. Le crochet serveur_prometheus_cibles_supplementaires existait, documente, et personne ne le remplissait. Le pendant de meta/supervision.yml et son contraire : une sonde rend un verdict avec un TTL, un exportateur expose une serie. Est-ce casse, contre depuis quand et vers ou. Le critere des panneaux : une serie a sa place si elle PRECEDE un verdict ou si elle n en aura JAMAIS. Le taux de succes du cache n en aura jamais — quand les donnees depassent shared_buffers, rien ne casse et tout devient lent. Compte en lecture seule (pg_monitor), et flux en clair avec sa dette inscrite. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Crgis8CxCWkAGFA1ecBz3q |
||
|---|---|---|
| .. | ||
| defaults | ||
| handlers | ||
| meta | ||
| tasks | ||
| templates | ||
| README.md | ||
serveur_prometheus
Collecte de métriques Prometheus (paquet Debian), plateforme d'observabilité.
Rôle
- Installe
prometheus. - Déploie
/etc/prometheus/prometheus.yml: jobprometheus(soi-même) + jobnodedont les cibles sont dérivées de l'inventaire (hôtes actifs declient_metrique→node_exportersur:9100). - Rétention via
/etc/default/prometheus(--storage.tsdb.retention.time). promtool check configavant rechargement (handlerValider et recharger prometheus).
Cibles dérivées de l'inventaire
Comme la zone DNS, la liste de scrape se construit toute seule : ajouter un hôte au
groupe client_metrique et l'activer suffit à le faire scraper. Aucun edit manuel.
Variables principales
| Variable | Défaut | Rôle |
|---|---|---|
serveur_prometheus_intervalle |
15s |
scrape_interval |
serveur_prometheus_retention |
15d |
Rétention TSDB |
serveur_prometheus_groupe_metriques |
client_metrique |
Groupe source des cibles |
serveur_prometheus_port_node |
9100 |
Port node_exporter |
serveur_prometheus_cibles_supplementaires |
[] |
Jobs additionnels libres |
Intégration
- Côté VM :
node_exporterest installé par le futur rôleclient_metrique. serveur_grafanaconsommera Prometheus comme datasource.
Hors périmètre
- Alerting (Alertmanager), règles d'alerte, fédération — phases dédiées.