On n allume pas la lumiere une fois la maison finie. L observabilite et le moteur de supervision etaient deployes APRES presque tout ce qu ils surveillent. Une reconstruction depuis zero est pourtant le moment ou l on a le plus besoin de voir, et c etait le seul moment ou l on ne voyait rien. 4. observabilite postgresql, prometheus, loki, grafana, icinga 5. agents_supervision client_metrique, client_journal, client_sante DEPLACER LES SERVEURS SANS LES AGENTS N AURAIT RIEN CHANGE : ce sont les agents qui rapportent, et ils etaient en derniere couche. Les deux couches vont donc ensemble. Des la couche 5, chaque hote expedie ses metriques, ses journaux et l etat de ses unites — tout ce qui se deploie ensuite est mesure pendant qu on le construit. COUT : serveur_postgresql monte aussi (icinga l exige, il n exige rien). C est le seul entrainement. RESTE TARD A DESSEIN : icingaweb2 et oauth2_proxy reclament LDAP et Keycloak. C est la CONSOLE, pas la mesure. CE QUI REND CE DEPLACEMENT POSSIBLE : le DNS reste en couche 6, donc apres la supervision, alors qu icinga joint sa base par un NOM. Ca tient grace au plancher /etc/hosts pose des la couche 1 — 34 entrees, verifie. C est exactement ce pour quoi il existe. LIMITE : les notifications dependent de client_smtp, encore en derniere couche. Pendant une reconstruction, l etat est mesure et consultable, mais rien ne part par courriel avant la fin. ET : l ordre est VALIDE, pas EPROUVE. P08 accepte, le graphe accepte, site.yml regenere passe le syntax-check sur 782 lignes de plan. La seule preuve reelle d un ordre de reconstruction, c est une reconstruction. make prouver : CONFORME, 64 OK, 0 echec, 0 saute. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Crgis8CxCWkAGFA1ecBz3q
123 lines
5.7 KiB
YAML
123 lines
5.7 KiB
YAML
---
|
|
# Couches de déploiement — l'ordre de reconstruction de l'écosystème.
|
|
#
|
|
# Registre central (comme docs/dependances-groupes.yml). L'orchestrateur
|
|
# (scripts/orchestrer.py → make site) trie les groupes déployables par COUCHE
|
|
# (clé primaire, ordre ci-dessous), puis AFFINE l'ordre INTRA-couche avec le
|
|
# graphe des dépendances (dependances-groupes.yml, ex. dovecot avant postfix).
|
|
#
|
|
# Règle : chaque groupe déployable (= un playbooks/groupes/<groupe>.yml
|
|
# opérationnel) DOIT figurer dans exactement une couche. Le générateur refuse
|
|
# sinon (garde anti-dérive : un nouveau rôle non classé casse la génération).
|
|
#
|
|
# Règle de cohérence : un prérequis (dependances-groupes.yml) doit vivre dans
|
|
# une couche <= celle du groupe qui en dépend. Une arête « en arrière » (un
|
|
# groupe qui requiert un groupe d'une couche PLUS TARDIVE) = mauvaise
|
|
# classification → le générateur refuse.
|
|
#
|
|
# L'ordre des couches ci-dessous EST l'ordre de déploiement.
|
|
couches:
|
|
- nom: socle
|
|
raison: "Base du système : /etc/hosts (résolution interne au bootstrap), paquets, durcissement. Tout en dépend."
|
|
groupes:
|
|
- serveur_debian
|
|
- serveur_durci
|
|
|
|
- nom: pki_racine
|
|
raison: "L'autorité de certification interne (step_ca) : la racine de confiance de tous les flux TLS est-ouest."
|
|
groupes:
|
|
- serveur_step_ca
|
|
|
|
- nom: pki_client
|
|
raison: "Émission des certificats et pose de la racine (root_ca 0644) sur chaque nœud. Prérequis de TOUT service qui sert ou vérifie du TLS."
|
|
groupes:
|
|
- client_pki
|
|
|
|
- nom: observabilite
|
|
raison: >-
|
|
VOIR AVANT DE CONSTRUIRE. La mesure vient juste après la PKI, donc avant tout ce
|
|
qu'elle devra surveiller — et non après, comme si l'on n'allumait la lumière qu'une
|
|
fois la maison finie. Une reconstruction depuis zéro est précisément le moment où
|
|
l'on a le plus besoin de voir ce qui se passe : chaque rôle déployé ensuite l'est
|
|
sous l'œil de la supervision, et une unité qui casse se voit à la minute plutôt qu'à
|
|
la fin. `obs` ne dépend de rien ; `serveur_icinga` n'exige que PostgreSQL, qui
|
|
n'exige rien lui-même. Ce qui reste plus tard, c'est la CONSOLE (`icingaweb2`,
|
|
`oauth2_proxy`), qui demande LDAP et Keycloak — l'interface humaine peut attendre,
|
|
la mesure non.
|
|
groupes:
|
|
- serveur_postgresql
|
|
- serveur_prometheus
|
|
- serveur_loki
|
|
- serveur_grafana
|
|
- serveur_icinga
|
|
|
|
- nom: agents_supervision
|
|
raison: >-
|
|
Les agents qui FONT voir, poses juste apres leurs serveurs. Deplacer la supervision
|
|
en amont sans eux n'aurait rien change : ce sont eux qui rapportent. Des cette
|
|
couche, chaque hote expedie ses metriques, ses journaux, et l'etat de ses unites
|
|
systemd — donc tout ce qui se deploie apres est mesure pendant qu'on le construit.
|
|
groupes:
|
|
- client_metrique
|
|
- client_journal
|
|
- client_sante
|
|
|
|
- nom: services
|
|
raison: "Les services d'infrastructure dont dépendent les applications : bases, annuaire, DNS, cache, métriques, journaux, edge, courriel."
|
|
groupes:
|
|
- serveur_openldap
|
|
- serveur_powerdns
|
|
# Le resolveur du tenant vient APRES son autoritatif : il le prend en stub-zone,
|
|
# et sa validation exige que la zone souveraine reponde deja.
|
|
- serveur_resolveur
|
|
- serveur_redis
|
|
- serveur_nginx
|
|
- serveur_rspamd
|
|
- serveur_dovecot
|
|
- serveur_postfix
|
|
- serveur_backup
|
|
# La source d'artefacts vient AVANT ceux qui installent des paquets — c'est tout
|
|
# son objet. Placee plus tard, elle serait remplie apres avoir servi.
|
|
- serveur_artefacts
|
|
# LA RACINE DE LA CHAINE DE CACHES, et elle appartient au SITE, pas au tenant :
|
|
# VM du tenant -> cache du tenant -> cache du SITE -> Debian
|
|
# Classee ici pour que son ordre soit dit, mais elle ne se deploie pas dans le meme
|
|
# mouvement : elle vit dans l'underlay de l'hebergeur et se joint par
|
|
# `scripts/site_inventaire.py`. Un tenant ne la deploie jamais — il la CONSOMME.
|
|
- serveur_cache_site
|
|
# La forge du genome, meme nature : elle vit dans l'underlay de
|
|
# l'hebergeur et un tenant la CONSOMME sans jamais la deployer.
|
|
- serveur_forge_site
|
|
# Le resolveur du site, meme nature : prete aux locataires pendant leur jeunesse.
|
|
- serveur_resolveur_site
|
|
# Le depot de sauvegarde du site, meme nature : il recoit l'etat des locataires.
|
|
- serveur_backup_site
|
|
- nom: apps
|
|
raison: "Les applications métier, qui consomment les services (base, SSO, courriel, edge)."
|
|
groupes:
|
|
- serveur_keycloak
|
|
- serveur_oauth2_proxy
|
|
- serveur_forgejo
|
|
- serveur_icingaweb2
|
|
- serveur_collabora
|
|
- serveur_nextcloud
|
|
- serveur_web_frontal
|
|
- serveur_web_dorsal
|
|
# Le poste d'exploitation vient APRES la forge : il clone le genome depuis
|
|
# elle. Le placer plus tot le laisserait sans source.
|
|
- serveur_ops
|
|
# Le runner de TENANT vient APRES le poste : il suppose les depots clones et le lien
|
|
# `instance` pose. Il n'ajoute qu'un pouvoir -- celui de CONFIGURER cet ecosysteme,
|
|
# par sa voute deposee chiffree.
|
|
- serveur_ops_tenant
|
|
# Le runner de SITE vient APRES le runner de tenant : il suppose les depots
|
|
# clones. Il n'ajoute qu'un pouvoir -- celui de materialiser sur la fabric.
|
|
- serveur_ops_site
|
|
|
|
- nom: agents
|
|
raison: "Les intégrations clientes qui expédient vers les services centraux (métriques, journaux, courriel, sauvegardes, résolution locale). Déployées en dernier, quand leurs cibles sont debout."
|
|
groupes:
|
|
- client_smtp
|
|
- client_backup
|
|
- client_resolveur
|
|
- client_artefacts
|