
Un punto único de fallo ( SPOF , por sus siglas en inglés) es una parte de un sistema que, de fallar , impediría el funcionamiento de todo el sistema . [ 1 ] El término punto único de fallo implica que no existe una opción de respaldo o redundancia que permita que el sistema continúe funcionando sin él. Los SPOF son indeseables en cualquier sistema que aspire a una alta disponibilidad o fiabilidad , ya sea una práctica empresarial, una aplicación de software u otro sistema industrial. Si existe un SPOF en un sistema, este produce una interrupción potencial que resulta sustancialmente más perjudicial que un error en cualquier otra parte del sistema.
Descripción general
Los sistemas pueden hacerse más robustos añadiendo redundancia en todos los posibles puntos únicos de fallo (SPOF). La redundancia puede lograrse en varios niveles.
La evaluación de un posible SPOF implica identificar los componentes críticos de un sistema complejo que provocarían una falla total del sistema en caso de mal funcionamiento . [ 2 ] Los sistemas altamente confiables no deberían depender de ningún componente individual de este tipo.
Por ejemplo, el dueño de una pequeña empresa de cuidado de árboles podría tener solo una trituradora de madera . Si la trituradora se avería, es posible que no pueda completar el trabajo actual y tenga que cancelar los trabajos futuros hasta que consiga una de repuesto. El dueño podría prepararse para esto de varias maneras. Podría tener repuestos listos para reparar la trituradora, en caso de que falle. A un nivel superior, podría tener una segunda trituradora que pueda llevar al lugar de trabajo. Finalmente, en el nivel más alto, podría tener suficiente equipo disponible para reemplazar todo en el lugar de trabajo en caso de múltiples fallas.
Posibles puntos únicos de fallo en una configuración simple
Utilizar la redundancia para evitar algunos puntos únicos de fallo.
Sistema completamente redundante sin SPOF (nota: se supone que el generador y las fuentes de la red tienen una capacidad nominal N cada uno, cada UPS tiene una capacidad nominal N, y "A/C" y "Eléctrico" son en sí mismos sistemas completamente tolerantes a fallas).
Computación
Un sistema informático tolerante a fallos puede lograrse a nivel de componentes internos, a nivel de sistema (varias máquinas) o a nivel de sitio (replicación).
Normalmente, se implementa un balanceador de carga para garantizar la alta disponibilidad de un clúster de servidores a nivel de sistema. [ 3 ] En un clúster de servidores de alta disponibilidad, cada servidor individual puede lograr redundancia interna de componentes mediante el uso de múltiples fuentes de alimentación, discos duros y otros componentes. La redundancia a nivel de sistema se puede obtener con servidores de reserva listos para asumir el trabajo de otro servidor en caso de fallo.
Dado que un centro de datos suele ser un centro de soporte para otras operaciones, como la lógica de negocio, representa un posible punto único de fallo (SPOF) en sí mismo. Por lo tanto, a nivel de sitio, todo el clúster puede replicarse en otra ubicación, donde se puede acceder a él en caso de que la ubicación principal no esté disponible. Esto se suele abordar como parte de un programa de recuperación ante desastres de TI . Si bien anteriormente la solución a este SPOF era la duplicación física de clústeres, la alta demanda de esta duplicación llevó a muchas empresas a externalizarla a terceros mediante la computación en la nube . Sin embargo, algunos expertos argumentan que hacerlo simplemente traslada el SPOF e incluso puede aumentar la probabilidad de un fallo o un ciberataque . [ 4 ]
Paul Baran y Donald Davies desarrollaron la conmutación de paquetes , un componente clave de las redes de comunicaciones tolerantes a fallos. Estas redes , como ARPANET e Internet , están diseñadas para no tener un único punto de fallo. Múltiples rutas entre dos puntos cualesquiera de la red permiten que estos sigan comunicándose entre sí, sorteando los daños los paquetes , incluso tras el fallo de una ruta o un nodo intermedio.
Ingeniería de software
En ingeniería de software , un cuello de botella se produce cuando la capacidad de una aplicación o un sistema informático está limitada por un único componente. Este cuello de botella presenta el menor rendimiento de toda la ruta de la transacción. Un ejemplo común es cuando un lenguaje de programación utilizado permite el procesamiento paralelo , pero un fragmento de código determinado ejecuta varios procesos independientes de forma secuencial en lugar de simultánea.
Ingeniería de rendimiento
La identificación de cuellos de botella (a veces conocidos como puntos críticos , secciones del código que se ejecutan con mayor frecuencia, es decir, las que tienen el mayor número de ejecuciones) se denomina análisis de rendimiento . La reducción de estos cuellos de botella se suele lograr con la ayuda de herramientas especializadas, conocidas como analizadores de rendimiento o perfiladores. El objetivo es conseguir que esas secciones específicas del código se ejecuten lo más rápido posible para mejorar la eficiencia algorítmica general .
Seguridad informática
Una vulnerabilidad o un fallo de seguridad en un solo componente puede comprometer todo el sistema. Una de las mayores preocupaciones en seguridad informática es intentar eliminar los SPOF sin sacrificar demasiado la comodidad del usuario. Con la invención y popularización de Internet , varios sistemas se conectaron al mundo exterior a través de numerosas conexiones difíciles de proteger. [ 4 ] Si bien las empresas han desarrollado varias soluciones para esto, la forma más común de SPOF en sistemas complejos tiende a seguir siendo el error del usuario , ya sea por un manejo incorrecto accidental por parte de un operador o por interferencia externa a través de ataques de phishing . [ 5 ]
Otros campos
El concepto de punto único de fallo también se ha aplicado a campos ajenos a la ingeniería, la informática y las redes, como la gestión de la cadena de suministro corporativa [ 6 ] y la gestión del transporte. [ 7 ]
Las estructuras de diseño que crean puntos únicos de fallo incluyen cuellos de botella y circuitos en serie (a diferencia de los circuitos en paralelo ).
En el transporte, algunos ejemplos recientes destacados de la aplicación del concepto incluyen el puente del río Nipigon en Canadá, donde una falla parcial del puente en enero de 2016 interrumpió por completo el tráfico rodado entre el este y el oeste de Canadá durante varios días porque está ubicado a lo largo de una parte de la autopista Transcanadiense donde no hay una ruta de desvío alternativa para los vehículos; [ 8 ] y el puente ferroviario del río Norwalk en Norwalk , Connecticut , un antiguo puente giratorio que a veces se atasca al abrirse o cerrarse, interrumpiendo el tráfico ferroviario en la línea del Corredor Noreste . [ 7 ]
El concepto de punto único de fallo también se ha aplicado al campo de la inteligencia y a los procesos de inteligencia . Edward Snowden habló de los peligros de ser lo que describió como "el punto único de fallo": el único depositario de información. [ 9 ]
Sistemas de soporte vital
Un componente de un sistema de soporte vital que constituyera un único punto de fallo tendría que ser extremadamente fiable.
Véase también
Conceptos
- Factor autobús : concepto en la gestión de riesgos
- Fallo en cascada : riesgo sistémico de fallo
- Efecto dominó : efecto acumulativo que se produce cuando un evento desencadena una cadena de otros eventos.
- Ley de Lusser : Ley del producto de probabilidad de los componentes de una serie.
- Redundancia : Duplicación de componentes críticos para aumentar la fiabilidad de un sistema.
- Acuerdo de nivel de servicio : compromiso oficial entre un proveedor de servicios y un cliente.
Aplicaciones
- Interruptor de hombre muerto : dispositivo que reacciona ante la pérdida del operador.
- Tuerca de Jesús : término coloquial para la tuerca de sujeción del rotor principal de algunos helicópteros.
- Interruptor de apagado : mecanismo de seguridad para apagar rápidamente un sistema.
- Ingeniería de confiabilidad : Subdisciplina de la ingeniería de sistemas que enfatiza la fiabilidad.
- Ingeniería de seguridad – Disciplina de ingeniería
En la literatura
- Talón de Aquiles : Debilidad crítica que puede conducir a la caída a pesar de la fuerza general.
- Hamartia – El error del protagonista en la teoría dramática griega
Referencias
- ↑ 1: Diseño de redes LAN a gran escala – Página 31, K. Dooley, O'Reilly, 2002
- ↑ Ulbrich, Peter, et al. "Eliminación de puntos únicos de fallo en la redundancia basada en software." Novena Conferencia Europea de Computación Confiable de 2012. IEEE, 2012.
- ↑ Bezek, Andraz y Matjaz Gams. "Comparación de un sistema de balanceo de carga tradicional y uno multiagente". Computing and Informatics 25.1 (2006): 17-42.
- 1 2 Lever, Kirsty E., Madjid Merabti y Kashif Kifayat. «Puntos únicos de fallo en sistemas de sistemas». 14.º Simposio Anual de Posgrado sobre la Convergencia de las Telecomunicaciones, las Redes y la Radiodifusión (PGNet) . Vol. 183. 2013.
- ↑ Alkhalil, Zainab; Hewage, Chaminda; Nawaf, Liqaa; Khan, Imtiaz (2021-03-09). " Ataques de phishing: un estudio exhaustivo reciente y una nueva anatomía" . Frontiers in Computer Science . 3. doi : 10.3389/fcomp.2021.563060 . ISSN 2624-9898 .
- ↑ Gary S. Lynch (7 de octubre de 2009). Punto único de fallo: Las 10 leyes esenciales de la gestión de riesgos en la cadena de suministro . Wiley. ISBN 978-0-470-42496-4.
- 1 2 "Crucial, centenario y a veces atascado: el puente de Connecticut es clave para el corredor noreste" . Radio Pública de Connecticut , 8 de agosto de 2017.
- ↑ "El puente sobre el río Nipigon y otros cuellos de botella en la ruta transcanadiense" . Global News , 11 de enero de 2016.
- ↑ "Edward Snowden: la verdadera historia detrás de sus filtraciones de la NSA" . Telegraph.co.uk . Archivado del original el 12 de enero de 2022. Consultado el 13 de diciembre de 2016 .
- Fallos de ingeniería
- Ingeniería de sistemas
- Ingeniería de confiabilidad
- Sistemas informáticos tolerantes a fallos
- Arquitectura de red