Set-OPS-Public/roles/client_unbound/handlers/main.yml
Daniel Allaire 0de5294a20 client_unbound : survivre a la perte de connexion sans la masquer
Le deploiement s'interrompait autour du redemarrage d'Unbound (« banner
exchange »), et Ansible abandonnait alors TOUTES les couches suivantes de
l'hote — alors qu'il repondait de nouveau une minute plus tard.

Ma premiere explication etait fausse et je l'ai verifiee avant de coder :
sshd -T dit usedns no, il n'y a pas de resolution inverse. Et la cause reste
INCONNUE — j'avais ecrase le journal du deploiement rate en relancant. Faute
de methode, pas de raisonnement.

Ce que le depot sait de ce symptome est deja dans le Makefile : a travers la
frontiere le TCP s'etablit par proxy SYN, et l'echec se lit « banner exchange »
meme quand l'hote n'est pas la. Le message accuse SSH pour un probleme
d'accessibilite.

Corrige sans pretendre connaitre la cause : ignore_unreachable sur le handler,
puis wait_for_connection qui EXIGE le retour (180 s). Si l'hote ne revient
pas, la tache suivante echoue franchement — on ne masque rien.

Regle pour moi : ne plus ecraser le journal d'un echec avant de l'avoir lu.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-09 11:55:41 -04:00

18 lines
935 B
YAML

---
# `ignore_unreachable` : le redemarrage a deja fait perdre la connexion en cours de
# deploiement — « Connection timed out during banner exchange », le 2026-08-09 sur
# web-dorsal-01. La CAUSE n'est pas etablie : `usedns no` ecarte la resolution inverse
# de sshd, et le journal du deploiement rate a ete ecrase avant d'etre lu. Ce que le
# depot sait deja de ce symptome (Makefile, `_attendre-hote`) : a travers la frontiere,
# le TCP s'etablit par proxy SYN et l'echec se lit ainsi meme quand l'hote n'est
# simplement pas la.
#
# On ne masque donc pas une panne : une perte ICI n'abandonne plus les couches
# suivantes, et `wait_for_connection` exige que l'hote revienne pour de bon. S'il ne
# revient pas, la tache suivante echoue — franchement.
- name: Redémarrer unbound
ansible.builtin.systemd:
name: "{{ client_unbound_service }}"
state: restarted
when: not ansible_check_mode
ignore_unreachable: true