QUESTIONS & RÉPONSES La collection de Solve DSI - Yann-Eric Devars
← Revenir aux réponses

Que faut-il savoir sur « Troisième période (30 minutes par exemple) : période qualification, hypothèses, premières décisions » ?

Extrait de Gestion des incidents

À ce stade de la gestion de l’incident, la war room a dépassé la simple collecte de symptômes pour formaliser un ensemble d’hypothèses plausibles, structurées et hiérarchisées selon leur probabilité et leur impact potentiel.

Un premier diagramme de causes à effets est élaboré, reliant chaque symptôme observé à des hypothèses concrètes.

Ce diagramme n’est pas figé : il sert de support de travail pour visualiser les enchaînements possibles, identifier les points de convergence, les zones d’incertitude et surtout, prioriser les actions à mener.

Chaque branche du diagramme est alimentée par des faits issus des logs, des métriques, des traces réseau ou applicatives, permettant d’éviter les biais de confirmation et de ne pas s’égarer dans des conjectures trop larges.

Le leader technique, garant de la rigueur méthodologique, demande alors la réalisation de tests de progression ciblés, visant à valider ou invalider rapidement les hypothèses principales.

Il s’agit par exemple de rejouer un parcours utilisateur pour observer à quel moment la défaillance se manifeste, de tracer une requête bout en bout pour détecter où la latence ou l’erreur s’introduit, de vérifier l’intégrité d’un référentiel de données pour exclure un problème de corruption ou de synchronisation, ou encore d’observer le comportement d’une file saturée afin de déterminer si le goulet d’étranglement est applicatif, systémique ou lié à une ressource externe.

Ces tests sont documentés, leurs résultats partagés en temps réel avec l’ensemble des parties prenantes techniques, et chaque constat alimente ou modifie le diagramme de problèmes.

Parallèlement, l’Incident Manager, qui conserve une vision transverse de l’incident, statue sur l’opportunité d’escalader le dossier au niveau supérieur si les critères de gravité sont atteints.

Cette décision d’escalade s’appuie sur des critères précis : extension du périmètre impacté (plusieurs services ou clients majeurs), caractère irréversible ou risquant de le devenir, contraintes réglementaires ou contractuelles, ou encore incapacité à restaurer un service minimum dans les délais acceptables.

L’IM veille à ce que l’ensemble des parties prenantes soient informées de la situation et que les responsabilités soient clairement identifiées.

En parallèle, le propriétaire du processus métier affecté prépare les options de continuité d’activité.

Il élabore des scénarios de contournement tels que le passage en mode dégradé (maintien des fonctionnalités critiques, suspension temporaire des traitements non essentiels), la priorisation de certains clients ou flux stratégiques, ou encore la suspension temporaire de certaines opérations pour préserver la cohérence des données ou éviter d’aggraver la situation.

Chaque option est évaluée en termes d’impact client, de risques juridiques ou financiers, et de capacité à être maintenue dans le temps.

Le comité de crise décide ensuite des mesures de confinement de niveau 2 : il s’agit de segmenter le réseau pour limiter la propagation d’un incident, de geler certains traitements batch pour éviter la propagation d’erreurs en masse, voire d’isoler temporairement des environnements ou des composants suspects.

Ces mesures sont toujours réversibles et documentées, avec un plan de retour à la normale préparé en amont.

Simultanément, les premiers messages internes sont rédigés et diffusés, afin d’informer les équipes concernées des actions en cours, des restrictions temporaires, et de la marche à suivre pour signaler tout symptôme anormal.

Toutes les décisions prises à ce stade sont tracées de manière rigoureuse, avec mention explicite du responsable (“A” de la matrice RACI), de l’objectif poursuivi et du critère de succès attendu.

Cette traçabilité garantit la transparence, la capacité d’audit a posteriori, et évite les confusions de responsabilité en cas d’évolution de la situation.

Grâce à cette démarche structurée, l’incident sort progressivement de l’opacité : les équipes savent précisément ce qu’elles cherchent, pourquoi elles mènent telle ou telle action, et sur quels critères elles baseront la levée ou l’ajustement des mesures de crise.

Cette clarté d’intention et de méthode renforce la confiance des équipes, accélère la résolution de l’incident et limite le risque de dérive ou d’escalade incontrôlée.