¿Qué es la comunicación de incidencias?
La comunicación de incidencias cuenta a los afectados qué ocurre durante una caída. Se distingue de la respuesta, que hace el arreglo técnico.
¿Qué es la comunicación de incidencias?
La comunicación de incidencias es la práctica de contar a las personas afectadas por una caída qué está pasando, mientras aún está pasando. Se distingue de la respuesta a incidencias, que es el trabajo técnico de detectar, contener y arreglar el problema. La respuesta restaura el servicio; la comunicación atiende a todos los que esperan.
Ambas corren en paralelo y compiten por la misma atención, y por eso la comunicación suele ser la que se queda atrás. Un equipo metido en una conmutación de base de datos no tiende a parar para escribir una actualización, y es justo entonces cuando los clientes más la quieren.
El ciclo de vida de una actualización
La mayoría de la comunicación de incidencias sigue una secuencia reconocida, y usar las etiquetas estándar ayuda porque el lector ya sabe qué significan:
- Investigando - sabes que algo va mal y estás averiguando qué.
- Identificado - conoces la causa y hay un arreglo en marcha.
- Monitorizando - el arreglo está aplicado y observas si se sostiene.
- Resuelto - el servicio vuelve a comportarse con normalidad.
Cada actualización se añade a la misma incidencia en lugar de publicarse como una nueva, para que después pueda leerse todo en orden.
Qué hace útil una actualización
- Describe el impacto en términos de cliente. "Los inicios de sesión fallan" es mejor que "auth-service devuelve 500".
- Di lo que sabes y lo que no. "Aún no conocemos la causa" es una actualización legítima y mejor que el silencio.
- Comprométete con la próxima actualización, no con el arreglo. Puedes controlar cuándo vuelves a publicar; rara vez cuándo llega la solución.
- Publica pronto la primera. Una actualización escueta a los diez minutos gana a una detallada a los noventa.
- Ni culpar ni minimizar. Ambas cosas cuestan confianza, en direcciones opuestas.
Dónde se publica
El lugar habitual es una página de estado, alojada aparte del servicio para que sobreviva a la caída. Las suscripciones por correo llevan las novedades a quien le importa sin pedirle que vigile una página, y muchos equipos replican el mismo texto en chat y redes en lugar de escribir versiones distintas para cada canal.
Después de la incidencia
Una vez resuelta, el registro de la incidencia permanece publicado. Ese historial es parte de lo que hace creíble a una página de estado: muestra un equipo que informa de sus fallos en vez de borrarlos en silencio. Para lo relevante suele seguir un postmortem, pero sirve a un propósito y a un público distintos de las actualizaciones escritas durante el suceso.
LoadFocus admite el ciclo completo de incidencias con suscriptores por correo en sus páginas de estado, incluidas incidencias creadas automáticamente a partir de los resultados de los monitores.
Términos relacionados
- ¿Qué es la API de tiempo de navegación?
- Real User Monitoring (RUM): Definición, Tools, Ejemplos
- ¿Qué es el mantenimiento programado?
- ¿Qué es la API de temporización del servidor?
- ¿Qué es Synthetic Monitoring? Definición, Tipos, Comparación RUM
- ¿Qué es la API de rendimiento web?
- ¿Qué es una página de estado? Definición y usos
- ¿Qué es el monitoreo de API?
Herramientas LoadFocus relacionadas
Lleva este concepto a la práctica con LoadFocus, la misma plataforma que potencia todo lo que acabas de leer.