Set-OPS-Public/wiki/Supervision-et-impact.md
Daniel Allaire 53e2f78148 vigie : la console de supervision porte enfin un nom de fonction
icinga.<tenant>.internal devient vigie.<tenant>.internal, sur les trois
locataires a la fois. Le mot avait ete ecarte pour Grafana precisement parce
qu il connote la guette du danger : c est le metier d Icinga.

Quatrieme recopie du meme FQDN a tomber : serveur_oauth2_proxy_redirect_url
etait posee a la main dans les group_vars de chaque instance. Elle derive
maintenant de serveur_oauth2_proxy_hostname. Le repli reste vide et non
fabrique : l assertion doit refuser un deploiement sans exposition, pas
inventer un nom que personne ne resout.

Deploye et VERIFIE sur Chezlepro : le SSO renvoie sur vigie, le certificat
servi porte observatoire et vigie et plus aucun ancien nom. Deployer nginx
pose le vhost mais laisse le SAN en arriere — c est client_pki qui reemet.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01Crgis8CxCWkAGFA1ecBz3q
2026-09-10 21:05:47 -04:00

65 lines
2.8 KiB
Markdown

# Supervision & impact
> **Unité d'apprentissage.** Moule : ① concept → ② Set-OPS → ③ transférable → ④ à toi de jouer.
---
## ① Le concept *(générique)*
**Observabilité** (métriques/logs) = **passive** : on regarde des données. **Supervision** =
**active** : le système **fait des tests** (« le port 443 répond-il ? le disque est-il plein ? »),
tient un **état** (OK / WARNING / CRITICAL) et **alerte** quand ça se dégrade.
Distinction utile : Grafana te *montre* des tendances ; un moteur de supervision *décide* qu'un
service est en panne et *prévient*. Complémentaires, pas interchangeables.
**Modélisation d'impact métier** (BPM) : agréger des checks techniques en **services de haut
niveau**. « Le service *Courriel* est-il sain ? » = (Postfix **ET** Dovecot **ET** l'annuaire).
On raisonne en **impact**, pas en cases isolées.
---
## ② Comment Set-OPS le fait
La pile Icinga, en trois étages :
| Étage | Pièce | Rôle |
|---|---|---|
| **Moteur** | `serveur_icinga` (icinga2 + IcingaDB) | exécute les **checks**, tient l'**état**, alerte. |
| **UI** | `serveur_icingaweb2` | l'interface (états, acquittements, downtimes), **au SSO**. |
| **Impact** | module **BPM** | des **processus métier** qui roulent la santé de plusieurs checks en un état. |
Ce que Grafana ne fait **pas** : le BPM. « Grafana peut-il remplacer le BPM ? » → **non** : l'un
*visualise des mesures*, l'autre *modélise l'impact métier*. On veut **les deux**.
---
## ③ Pourquoi c'est transférable
| Set-OPS | Équivalents ailleurs |
|---|---|
| Icinga | Nagios · Zabbix · Checkmk · Sensu |
| checks actifs + alerting | modèle **universel** de la supervision |
| BPM / impact | *business service monitoring* (concept répandu) |
Tu as appris **supervision active vs observabilité passive, l'état, l'alerting, l'impact** — pas
« Icinga ».
---
## ④ À toi de jouer
1. **Ouvre Icinga Web 2** (`https://vigie.chezlepro.internal`, via le SSO) : la liste des hôtes
et services **supervisés**, avec leur **état** (vert/jaune/rouge).
2. **Vois l'impact.** Menu *Business Processes* → « **Supervision Chezlepro** » : un processus qui
**agrège** des checks (load, procs, ping…) en un état roulé. C'est l'impact, pas une case.
3. **Casse & répare.** Provoque l'échec d'un check (ex. arrête un service surveillé) : l'état passe
**CRITICAL**, et le **processus BPM** qui en dépend **rougit** (l'impact remonte). Répare : tout
reverdit. Tu *sens* la différence entre *mesurer* et *superviser/alerter*.
---
## Pour aller plus loin *(dépôt)*
- Rôles : `roles/serveur_icinga` (moteur), `roles/serveur_icingaweb2` (UI + module BPM).
- SSO devant Icinga Web : `roles/serveur_oauth2_proxy` (passerelle) — unité **Identité & SSO**.
- Complément visuel : unité **Métriques & journaux** (Grafana).