Set-OPS-Public/wiki/Supervision-et-impact.md
Daniel Allaire 716be304c5 wiki : 10 unités restantes (Communication, Données, Observabilité, Socle & méthode)
Complète les 14 unités d'apprentissage au moule à 4 temps : Reverse-proxy,
Courriel, Bases de données, Cache, Métriques & journaux, Supervision & impact,
Virtualisation, Sécurité & durcissement, Infra as Code & idempotence,
Liaisons (bindings, avec l'analogie NetScaler). Navigation complétée.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-07-04 15:33:17 -04:00

2.8 KiB

Supervision & impact

Unité d'apprentissage. Moule : ① concept → ② Set-OPS → ③ transférable → ④ à toi de jouer.


① Le concept (générique)

Observabilité (métriques/logs) = passive : on regarde des données. Supervision = active : le système fait des tests (« le port 443 répond-il ? le disque est-il plein ? »), tient un état (OK / WARNING / CRITICAL) et alerte quand ça se dégrade.

Distinction utile : Grafana te montre des tendances ; un moteur de supervision décide qu'un service est en panne et prévient. Complémentaires, pas interchangeables.

Modélisation d'impact métier (BPM) : agréger des checks techniques en services de haut niveau. « Le service Courriel est-il sain ? » = (Postfix ET Dovecot ET l'annuaire). On raisonne en impact, pas en cases isolées.


② Comment Set-OPS le fait

La pile Icinga, en trois étages :

Étage Pièce Rôle
Moteur serveur_icinga (icinga2 + IcingaDB) exécute les checks, tient l'état, alerte.
UI serveur_icingaweb2 l'interface (états, acquittements, downtimes), au SSO.
Impact module BPM des processus métier qui roulent la santé de plusieurs checks en un état.

Ce que Grafana ne fait pas : le BPM. « Grafana peut-il remplacer le BPM ? » → non : l'un visualise des mesures, l'autre modélise l'impact métier. On veut les deux.


③ Pourquoi c'est transférable

Set-OPS Équivalents ailleurs
Icinga Nagios · Zabbix · Checkmk · Sensu
checks actifs + alerting modèle universel de la supervision
BPM / impact business service monitoring (concept répandu)

Tu as appris supervision active vs observabilité passive, l'état, l'alerting, l'impact — pas « Icinga ».


④ À toi de jouer

  1. Ouvre Icinga Web 2 (https://icinga.lab.chezlepro.internal, via le SSO) : la liste des hôtes et services supervisés, avec leur état (vert/jaune/rouge).
  2. Vois l'impact. Menu Business Processes → « Supervision Chezlepro » : un processus qui agrège des checks (load, procs, ping…) en un état roulé. C'est l'impact, pas une case.
  3. Casse & répare. Provoque l'échec d'un check (ex. arrête un service surveillé) : l'état passe CRITICAL, et le processus BPM qui en dépend rougit (l'impact remonte). Répare : tout reverdit. Tu sens la différence entre mesurer et superviser/alerter.

Pour aller plus loin (dépôt)

  • Rôles : roles/serveur_icinga (moteur), roles/serveur_icingaweb2 (UI + module BPM).
  • SSO devant Icinga Web : roles/serveur_oauth2_proxy (passerelle) — unité Identité & SSO.
  • Complément visuel : unité Métriques & journaux (Grafana).