La resiliencia operativa requiere más que planes de recuperación

0
La-resiliencia-operativa-requiere-mas-que-planes-de-recuperacion.jpg

Las juntas directivas y los reguladores esperan que las organizaciones demuestren control durante una disrupción, no sólo después de que termina. Sin embargo, muchas empresas todavía tratan la resiliencia como un conjunto de salvaguardas en lugar de una capacidad operativa en tiempo real.

Cumplir con esta expectativa requiere más que saber que los sistemas están disponibles. Los líderes necesitan visibilidad completa y en tiempo real de cómo se comportan los servicios, las aplicaciones y las dependencias a medida que cambian las condiciones. Esto permite a los equipos identificar el alcance de una interrupción, validar las decisiones de contención a medida que se toman y proporcionar evidencia de que los servicios críticos permanecen bajo control. Este enfoque redefine la resiliencia operativa según la forma en que la organización puede comprender, gestionar y explicar los eventos a medida que se desarrollan, no solo con qué rapidez se recupera.

Considere un aumento repentino en el tráfico que comienza a sobrecargar una aplicación orientada al cliente durante las horas pico, provocando una degradación del rendimiento en múltiples regiones. Las preguntas surgen de inmediato. El problema podría ser una restricción de capacidad, una dependencia de terceros o un ataque de denegación de servicio distribuido (DDoS). La falta de claridad puede llevar a decisiones difíciles sobre si los datos de los clientes están en riesgo y a quién se debe notificar.

Cuando la visibilidad está fragmentada entre herramientas y equipos separados, estos problemas pueden provocar retrasos e incluso desacuerdos. Los equipos de operaciones pueden ver un problema de rendimiento, mientras que los equipos de seguridad pueden sospechar de actividad maliciosa, lo que genera interpretaciones contradictorias del mismo evento.

Relacionados:  Kaspersky permitió a Cleopatra Hospitals Group detectar incidentes cibernéticos graves un 75% más rápido

Alternativamente, con una observabilidad integrada en tiempo real, los patrones de tráfico se pueden evaluar a medida que evolucionan, proporcionando una fuente compartida de evidencia operativa. Los servicios afectados se identifican más rápidamente y los equipos pueden determinar si las medidas de mitigación están produciendo el resultado previsto.

Resiliencia a nivel de junta directiva

La resiliencia operativa ya no se mide solo por la velocidad de la recuperación, sino también por la forma en que las empresas pueden demostrar control, preparación y toma de decisiones durante las interrupciones.

Las juntas directivas y los reguladores querrán evidencia de que el incidente fue contenido, que los controles funcionaron según lo previsto y que la evidencia respalda el cronograma de recuperación. También querrán saber qué riesgos se introdujeron o mitigaron durante la respuesta.

La resiliencia basada en evidencia genera confianza con reguladores, socios, clientes y juntas directivas. También permite a una organización demostrar no sólo que se recuperó, sino también cómo mantuvo el control durante la interrupción.

Incorporar la resiliencia operativa a la observabilidad a nivel de interacción

La resiliencia a menudo se enmarca en términos de objetivos de recuperación, redundancia y conmutación por error. Estas capacidades siguen siendo esenciales, pero todas dependen de la capacidad de una organización para comprender lo que sucede en su entorno digital a medida que cambian las condiciones. Cuando esto falla, no es porque los equipos carezcan de habilidades o compromiso, sino porque no comparten una visión completa y confiable del comportamiento del sistema. Los registros, métricas, eventos y seguimientos pueden proporcionar señales valiosas, pero aun así dejan a los equipos conciliando cuentas desconectadas del mismo incidente. Una base compartida construida a partir de la actividad observada de la red puede ayudar a cerrar esta brecha.

Relacionados:  Reseña de la película Sibe: por qué vale la pena ver la nueva película de Bimbo Ademoye

Cuatro prácticas distinguen a los operadores resilientes de los reactivos:

  • Cobertura sobre conveniencia: Las empresas resilientes diseñan una cobertura fiable de extremo a extremo. Cuando aumenta la latencia o el tráfico, pueden identificar inmediatamente si el problema se origina internamente, una dependencia o una actividad maliciosa, sin debatir en qué herramienta confiar.
  • Evidencia unificada de seguridad y rendimiento: Los equipos resilientes correlacionan anomalías de desempeño e indicadores de amenazas a nivel de interacción, en lugar de analizar señales separadas y conciliarlas más tarde. Por ejemplo, un aumento en el número de inicios de sesión fallidos y un aumento en la latencia de la base de datos se consideran un patrón, no dos incidentes.
  • Prueba directa a nivel de interacción: Las empresas resilientes dan prioridad a la evidencia derivada directamente de las comunicaciones del sistema. Esto podría incluir cómo se comportaron realmente los servicios, qué dependencias se invocaron y cómo cambió el tráfico bajo presión. Las decisiones no se basan en inferencias, sino en el comportamiento verificado del sistema.
  • Visibilidad diseñada para velocidad ejecutiva: Los paneles ejecutivos se basan en la misma evidencia subyacente que los sistemas técnicos, lo que permite a los líderes evaluar el alcance, el impacto y la contención con confianza.

Las empresas que desarrollan resiliencia basándose en la observabilidad a nivel de interacción en tiempo real pueden validar las decisiones a medida que ocurren, en lugar de defenderlas después del hecho.

La observabilidad como ventaja operativa

La observabilidad a nivel de interacción mejora más que la respuesta a incidentes. También puede fortalecer el desempeño operativo diario. El análisis de la causa raíz se vuelve más rápido porque los equipos pueden rastrear las interacciones de servicios verificadas en lugar de teorizar.

Relacionados:  Trabajo remoto y profesional africano: ¿libertad o nueva exploración?

Las acciones se pueden medir a medida que ocurren, lo que permite a los equipos determinar si bloquear el tráfico, aislar servicios o agregar capacidad está teniendo el efecto deseado.

Las organizaciones que continúan midiendo la seguridad principalmente por la cantidad de ataques bloqueados corren el riesgo de descuidar el objetivo más amplio. La resiliencia operativa hoy requiere más que planes de prevención y recuperación. Requiere la capacidad de mantener los servicios críticos confiables, disponibles y recuperables mientras un ataque o interrupción aún está en curso.

La observabilidad es una base fundamental para una resiliencia confiable. Las organizaciones pueden pasar de explicar la disrupción a posteriori a demostrar el control en el momento.

Source link

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *