En ingeniería de sistemas , la confiabilidad es una medida de la disponibilidad , fiabilidad , mantenibilidad y, en algunos casos, otras características de un sistema, como durabilidad , seguridad y protección . [ 1 ] En computación en tiempo real , la confiabilidad es la capacidad de proporcionar servicios confiables dentro de un período de tiempo. [ 2 ] Las garantías del servicio deben mantenerse incluso cuando el sistema está sujeto a ataques o fallas naturales.
La Comisión Electrotécnica Internacional (IEC), a través de su Comité Técnico TC 56, desarrolla y mantiene estándares internacionales que proporcionan métodos y herramientas sistemáticas para la evaluación y gestión de la fiabilidad de equipos, servicios y sistemas a lo largo de su ciclo de vida. El Grupo de Trabajo 10.4 de la IFIP [ 3 ] sobre "Computación Confiable y Tolerancia a Fallos" participa en la síntesis del progreso de la comunidad técnica en este campo y organiza dos talleres anuales para difundir los resultados.
La fiabilidad se puede desglosar en tres elementos:
- Atributos : una forma de evaluar la fiabilidad de un sistema.
- Amenazas : comprensión de los factores que pueden afectar la fiabilidad de un sistema.
- Medios : maneras de aumentar la fiabilidad de un sistema.
Historia
Algunas fuentes afirman que la palabra se acuñó en la década de 1910 en la publicidad impresa de automóviles de Dodge Brothers. Sin embargo, el término es anterior a ese período, ya que el Diccionario Oxford de la Lengua Inglesa registra su primer uso en 1901.
A medida que el interés en la tolerancia a fallos y la fiabilidad de los sistemas aumentó en las décadas de 1960 y 1970, la fiabilidad pasó a ser una medida de [x], ya que las medidas de fiabilidad comenzaron a abarcar medidas adicionales como la seguridad y la integridad. [ 4 ] A principios de la década de 1980, Jean-Claude Laprie eligió así la fiabilidad como término para englobar los estudios de tolerancia a fallos y fiabilidad de los sistemas sin la extensión del significado inherente a la fiabilidad . [ 5 ]
El campo de la confiabilidad ha evolucionado desde sus inicios hasta convertirse en un campo de investigación activo a nivel internacional, impulsado por una serie de conferencias internacionales destacadas, en particular la Conferencia Internacional sobre Sistemas y Redes Confiables , el Simposio Internacional sobre Sistemas Distribuidos Confiables y el Simposio Internacional sobre Ingeniería de Confiabilidad de Software .
Tradicionalmente, la confiabilidad de un sistema incorpora disponibilidad , fiabilidad y mantenibilidad , pero desde la década de 1980, la seguridad y la protección se han añadido a las medidas de confiabilidad. [ 6 ]
Elementos de confiabilidad
Atributos

Los atributos son cualidades de un sistema. Estos pueden evaluarse para determinar su fiabilidad general mediante medidas cualitativas o cuantitativas . Avizienis et al. [1] definen los siguientes atributos de fiabilidad:
- Disponibilidad : preparación para el servicio correcto
- Fiabilidad : continuidad de un servicio correcto.
- Seguridad : ausencia de consecuencias catastróficas para el/los usuario/s y el medio ambiente.
- Integridad : ausencia de alteración indebida del sistema.
- Mantenibilidad : facilidad de mantenimiento (reparación).
Como sugieren estas definiciones, solo la disponibilidad y la fiabilidad son cuantificables mediante mediciones directas, mientras que otras son más subjetivas. Por ejemplo, la seguridad no se puede medir directamente con métricas, sino que es una evaluación subjetiva que requiere información basada en el juicio humano para determinar el nivel de confianza, mientras que la fiabilidad se puede medir en función de los fallos a lo largo del tiempo.
La confidencialidad , es decir, la ausencia de divulgación no autorizada de información, también se utiliza al hablar de seguridad. La seguridad es un compuesto de confidencialidad , integridad y disponibilidad . A veces, la seguridad se clasifica como un atributo [ 7 ] , pero la perspectiva actual es agruparla con la fiabilidad y tratar la fiabilidad como un término compuesto denominado fiabilidad y seguridad [ 2 ] .
En la práctica, la aplicación de medidas de seguridad a los dispositivos de un sistema generalmente mejora la fiabilidad al limitar el número de errores de origen externo.
Amenazas
Las amenazas son elementos que pueden afectar a un sistema y provocar una disminución de su fiabilidad. Hay tres términos principales que deben entenderse claramente:
- Fallo: Un fallo (que históricamente se denomina habitualmente error) es un defecto en un sistema. La presencia de un fallo en un sistema puede o no provocar una avería. Por ejemplo, aunque un sistema contenga un fallo, sus condiciones de entrada y estado pueden impedir que este fallo se ejecute y produzca un error; por lo tanto, ese fallo en particular nunca se manifiesta como una avería.
- Error: Un error es una discrepancia entre el comportamiento previsto de un sistema y su comportamiento real dentro de sus límites. Los errores ocurren durante la ejecución cuando alguna parte del sistema entra en un estado inesperado debido a la activación de una falla. Dado que los errores se generan a partir de estados no válidos, son difíciles de observar sin mecanismos especiales, como depuradores o registros de depuración.
- Fallo: Un fallo es un momento en el que un sistema muestra un comportamiento contrario a sus especificaciones. Un error no necesariamente causa un fallo; por ejemplo, un sistema puede generar una excepción, pero esta puede ser capturada y gestionada mediante técnicas de tolerancia a fallos, de modo que el funcionamiento general del sistema se ajuste a las especificaciones.
Los fallos se registran en el límite del sistema. Básicamente, son errores que se han propagado hasta el límite del sistema y se han vuelto observables. Los fallos, errores y averías operan según un mecanismo. Este mecanismo se conoce a veces como cadena de fallo-error-avería. [ 8 ] Por regla general, un fallo, al activarse, puede provocar un error (que es un estado inválido) y el estado inválido generado por un error puede provocar otro error o una avería (que es una desviación observable del comportamiento especificado en el límite del sistema). [ 9 ]
Una vez que se activa una falla, se crea un error. Un error puede comportarse de manera similar a una falla, ya que puede generar condiciones de error adicionales; por lo tanto, un error puede propagarse varias veces dentro de los límites del sistema sin causar una falla observable. Si un error se propaga fuera de los límites del sistema, se dice que ocurre una falla. Una falla es básicamente el punto en el que se puede decir que un servicio no cumple con sus especificaciones. Dado que los datos de salida de un servicio pueden alimentar a otro, una falla en un servicio puede propagarse a otro como una falla, de modo que se puede formar una cadena de la forma: Falla que lleva a Error que lleva a Falla que lleva a Error, etc.
Medio
Dado que se comprende el mecanismo de una cadena de fallos y errores, es posible construir medios para romper estas cadenas y, por lo tanto, aumentar la fiabilidad de un sistema. Hasta el momento se han identificado cuatro medios:
- Prevención
- Eliminación
- Pronóstico
- Tolerancia
La prevención de fallos se ocupa de evitar que se introduzcan fallos en un sistema. Esto se puede lograr mediante el uso de metodologías de desarrollo y buenas técnicas de implementación.
La eliminación de fallos se puede subdividir en dos subcategorías: eliminación durante el desarrollo y eliminación durante el uso. La eliminación durante el desarrollo requiere verificación para detectar y corregir fallos antes de que el sistema entre en producción. Una vez que los sistemas están en producción, se necesita un sistema para registrar los fallos y corregirlos mediante un ciclo de mantenimiento.
La predicción de fallos pronostica fallos probables para que puedan eliminarse o sus efectos puedan evitarse. [ 10 ] [ 11 ]
La tolerancia a fallos se refiere a la implementación de mecanismos que permitan que un sistema siga prestando el servicio requerido en presencia de fallos, aunque dicho servicio se encuentre en un nivel degradado.
Los medios de confiabilidad tienen como objetivo reducir la cantidad de fallas que se hacen visibles para los usuarios finales de un sistema.
Persistencia
Según cómo aparecen o persisten las fallas, se clasifican de la siguiente manera:
- Transitorios: Aparecen sin causa aparente y desaparecen de nuevo sin causa aparente.
- Intermitentes: Aparecen varias veces, posiblemente sin un patrón discernible, y desaparecen por sí solas.
- Permanentes: Una vez que aparecen, no se resuelven por sí solas.
Fiabilidad de los sistemas de información y capacidad de supervivencia.
Algunos trabajos sobre confiabilidad [ 12 ] utilizan sistemas de información estructurados , por ejemplo con SOA , para introducir el atributo de supervivencia , teniendo así en cuenta los servicios degradados que un sistema de información mantiene o reanuda después de una falla no enmascarable.
La flexibilidad de los marcos actuales anima a los arquitectos de sistemas a habilitar mecanismos de reconfiguración que reorienten los recursos disponibles y seguros para dar soporte a los servicios más críticos, en lugar de sobredimensionarlos para construir un sistema a prueba de fallos.
Con la generalización de los sistemas de información en red, se introdujo la accesibilidad para dar mayor importancia a la experiencia de los usuarios.
Para tener en cuenta el nivel de rendimiento, la medición de la capacidad de rendimiento se define como "cuantificar qué tan bien se desempeña el sistema objeto en presencia de fallas durante un período de tiempo específico". [ 13 ]
Véase también
- Conferencia Internacional sobre Sistemas y Redes Confiables – Conferencia sobre redes informáticas
- Inyección de fallos : prueba del comportamiento de los sistemas informáticos bajo condiciones de estrés inusuales.
- Tolerancia a fallos : resiliencia de los sistemas ante fallos o errores de los componentes.
- Métodos formales – Especificaciones de programas matemáticos
- Lista de atributos de calidad del sistema : requisitos no funcionales para la evaluación del sistema.
- RAMS – Caracterización de ingeniería de un producto o sistemaPáginas que muestran breves descripciones de destinos de redireccionamiento
- Ingeniería de confiabilidad : Subdisciplina de la ingeniería de sistemas que enfatiza la fiabilidad.
- Ingeniería de seguridad – Disciplina de ingeniería
Lecturas adicionales
Papeles
- Wilfredo Torres-Pomales: Tolerancia a fallos de software: Un tutorial , 2002
- Stefano Porcarelli, Marco Castaldi, Felicita Di Giandomenico, Andrea Bondavalli , Paola Inverardi Un enfoque para gestionar la reconfiguración en sistemas distribuidos tolerantes a fallos
Conferencias
- Simposio Internacional sobre Sistemas y Redes Confiables (DSN): [ 14 ] Conferencia principal de la comunidad, que se celebra anualmente desde 1970.
- Simposio Internacional sobre Sistemas Distribuidos Confiables (SRDS): [ 15 ] Su 40.ª edición se celebrará en 2021.
Conferencias con enfoque más regional:
- Simposio Latinoamericano sobre Computación Confiable (LADC): Su décima edición tendrá lugar en 2021.
- Simposio Internacional de la Cuenca del Pacífico sobre Computación Confiable (PRDC): Su 25ª edición tendrá lugar en 2021.
Revistas
- IEEE Transactions on Dependable and Secure Computing (TDSC) es la revista insignia que se encuentra bajo la supervisión del Comité Técnico de Computación Tolerante a Fallos (TCFTC) del IEEE.
- Prognostics Journal es una revista de acceso abierto que proporciona un foro internacional para la publicación electrónica de artículos de investigación original y experiencia industrial en todas las áreas de confiabilidad y pronóstico de sistemas.
- Revista Internacional de Sistemas Críticos Basados en Computadoras
Libros
- JC Laprie, Fiabilidad: Conceptos básicos y terminología , Springer-Verlag, 1992. ISBN 0-387-82296-8
- Daniel P. Siewiorek, Robert S. Swarz, Sistemas informáticos fiables: diseño y evaluación , AK Peters/CRC Press, 1998. ISBN 978-1568810928
Proyectos de investigación
- DESERC , Confiabilidad y Seguridad mediante Reconfigurabilidad Mejorada , proyecto integrado FP6 /IST 2006-2008
- NODOS , Red en Sistemas Confiables
- ESFORS, Foro Europeo de Seguridad para Servicios Web, Software y Sistemas , acción de coordinación FP6/IST
- HIDENETS ( Redes y servicios basados en IP de alta fiabilidad) , proyecto objetivo del FP6/IST (2006-2008).
- Red de Excelencia RESIST FP6/IST 2006–2007
- RODIN: Entorno de desarrollo abierto y riguroso para sistemas complejos. Proyecto financiado por el VI Programa Marco (FP6) e Instituto de Ciencia e Innovación (IST) entre 2004 y 2007.
- SERENITY: Ingeniería de sistemas para la seguridad y la fiabilidad , proyecto integrado FP6/IST 2006-2008.
- Arquitectura de Supervivencia Willow y STILT , Sistema para la Intervención contra el Terrorismo y el Trabajo en Equipo a Gran Escala 2002–2004
- ANIKETOS Archivado el 2 de diciembre de 2019 en Wayback Machine Composición de servicios confiable y seguro , proyecto integrado FP7/IST 2010–2014
Referencias
- ^ IEC, Electropedia del 192 Confiabilidad , http://www.electropedia.org , seleccione 192 Confiabilidad, vea 192-01-22 Confiabilidad.
- ^ a b A. Avizienis, J.-C. Laprie, Brian Randell y C. Landwehr, " Conceptos básicos y taxonomía de la computación confiable y segura ", IEEE Transactions on Dependable and Secure Computing, vol. 1, pp. 11-33, 2004.
- ^ "Sistemas y redes confiables" . www.dependability.org . Consultado el 8 de junio de 2021 .
- ^ Brian Randell , "Fiabilidad del software: una visión personal", en las Actas del 25º Simposio Internacional sobre Computación Tolerante a Fallos (FTCS-25), California, EE. UU., págs. 35-41, junio de 1995.
- ^ JC Laprie. "Computación confiable y tolerancia a fallas: conceptos y terminología", en Actas del 15.º Simposio Internacional IEEE sobre Computación Tolerante a Fallas, 1985.
- ^ A. Avizienis, J.-C. Laprie y Brian Randell : Conceptos fundamentales de fiabilidad . Informe de investigación n.º 1145, Lydford g DrAAS-CNRS , abril de 2001.
- ^ I. Sommerville, Ingeniería de Software: Addison-Wesley, 2004.
- ^ A. Avizienis, V. Magnus U, JC Laprie y Brian Randell , "Conceptos fundamentales de confiabilidad", presentado en ISW-2000, Cambridge, MA, 2000.
- ^ Moradi, Mehrdad; Van Acker, Bert; Vanherpen, Ken; Denil, Joachim (2019). "Inyección de fallos híbrida implementada en modelos para Simulink (demostraciones de herramientas)" . En Chamberlain, Roger; Taha, Walid; Törngren, Martin (eds.). Sistemas ciberfísicos. Diseño basado en modelos . Lecture Notes in Computer Science. Vol. 11615. Cham: Springer International Publishing. pp. 71–90 . doi : 10.1007/978-3-030-23703-5_4 . ISBN 978-3-030-23703-5. S2CID 195769468 .
- ^ "Optimización de la inyección de fallos en la cosimulación FMI mediante partición de sensibilidad | Actas de la Conferencia de Simulación de Verano de 2019" . dl.acm.org : 1–12 . 22 de julio de 2019. Consultado el 15 de junio de 2020 .
- ^ Moradi, Mehrdad, Bentley James Oakes, Mustafa Saraoglu, Andrey Morozov, Klaus Janschek y Joachim Denil. "Explorando el espacio de parámetros de fallas usando inyección de fallas basada en aprendizaje por refuerzo." (2020).
- ^ John C. Knight, Elisabeth A. Strunk, Kevin J. Sullivan: Hacia una definición rigurosa de la supervivencia de los sistemas de información. Archivado el 29/10/2006 en Wayback Machine.
- ^ John F. Meyer, William H. Sanders Especificación y construcción de modelos de rendimiento
- ^ "DSN 2022" . dsn2022.github.io . Consultado el 1 de agosto de 2021 .
- ^ "SRDS-2021" . srds-conference.org . Consultado el 1 de agosto de 2021 .
- Terminología informática
- Seguridad
- Ingeniería de seguridad
- Seguridad
- Métodos formales
- Calidad