Una falla intermitente , a menudo denominada simplemente "intermitente" (o, coloquialmente, "interfallo" ), es un mal funcionamiento de un dispositivo o sistema que se produce a intervalos, generalmente irregulares, en un dispositivo o sistema que funciona con normalidad en otros momentos. Las fallas intermitentes son comunes en todas las ramas de la tecnología , incluido el software informático . Una falla intermitente se debe a varios factores contribuyentes, algunos de los cuales pueden ser prácticamente aleatorios , que ocurren simultáneamente. Cuanto más complejo sea el sistema o mecanismo involucrado, mayor será la probabilidad de una falla intermitente.
Las fallas intermitentes no son fácilmente repetibles debido a sus complejos patrones de comportamiento. A veces también se las denomina fallas "blandas", ya que no se manifiestan constantemente y desaparecen de forma impredecible. En cambio, las fallas "duras" son permanentes y ocurren durante un período de tiempo (o a veces son instantáneas). Tienen un sitio de falla específico (ubicación de la falla), un modo (cómo se manifiesta la falla) y un mecanismo, y no existe una recuperación impredecible para el sistema averiado. Dado que las fallas intermitentes no son fácilmente repetibles, es más difícil realizar un análisis de fallas para ellas, comprender sus causas raíz o aislar su sitio de falla que para las fallas permanentes. [ 1 ]
Las fallas intermitentes pueden ser la causa de que no se encuentre ninguna falla (NFF, por sus siglas en inglés) en productos y sistemas electrónicos. NFF implica que se produjo o se informó de una falla durante el uso del producto. El producto fue analizado o probado para confirmar la falla, pero no se pudo encontrar ninguna. Un ejemplo común del fenómeno NFF ocurre cuando su computadora se bloquea. Claramente, se ha producido una falla. Sin embargo, si se reinicia la computadora, a menudo vuelve a funcionar. El impacto de NFF y las fallas intermitentes puede ser profundo. Debido a sus características, los fabricantes pueden asumir una o varias causas en lugar de invertir tiempo y dinero en determinar la causa raíz. Por ejemplo, un proveedor de discos duros afirmó que los NFF no eran fallas y permitió que todos los productos NFF se devolvieran. Posteriormente, se determinó que estos productos tenían una tasa de devolución significativamente mayor, lo que sugiere que la condición NFF era en realidad el resultado de fallas intermitentes en el producto. El resultado fue un aumento en los costos de mantenimiento, una menor disponibilidad de los equipos, mayores inconvenientes para los clientes, una disminución de la confianza de los clientes, daños a la reputación de la empresa y, en algunos casos, posibles riesgos para la seguridad. [ 2 ]
Un ejemplo sencillo de una causa efectivamente aleatoria en un sistema físico es una conexión eléctrica límite en el cableado o un componente de un circuito , donde ( causa 1 , la causa que debe identificarse y rectificarse) dos conductores pueden tocarse sujetos a ( causa 2 , que no necesita identificarse) un pequeño cambio en la temperatura, vibración , orientación, voltaje , etc. (A veces esto se describe como una "conexión intermitente" en lugar de una "falla"). En el software de computadora, un programa puede ( causa 1 ) no inicializar una variable que debe ser inicialmente cero; si el programa se ejecuta en circunstancias tales que la memoria está casi siempre vacía antes de que comience, funcionará mal en las raras ocasiones en que ( causa 2 ) la memoria donde se almacena la variable sea distinta de cero de antemano.
Las fallas intermitentes son notoriamente difíciles de identificar y reparar ( solucionar problemas ) porque cada factor no las causa por sí solo, por lo que solo se pueden identificar mientras la falla está ocurriendo. La persona capaz de identificar y resolver el problema rara vez es el operador habitual. Debido a que el momento en que ocurre la falla es impredecible, y tanto el tiempo de inactividad del dispositivo o sistema como el tiempo de los ingenieros generan costos , la falla a menudo se tolera, a menos que sea demasiado frecuente, a menos que cause problemas o peligros inaceptables. Por ejemplo, algunas fallas intermitentes en equipos críticos, como los de soporte vital médico , podrían resultar en la muerte de un paciente o, en aeronáutica, provocar la cancelación de un vuelo o, en algunos casos, un accidente.
Técnicas de resolución de problemas
Algunas técnicas para resolver fallas intermitentes son:
- El registro automático de los parámetros relevantes durante un tiempo suficientemente prolongado para que se manifieste el fallo puede ser de gran ayuda; los valores de los parámetros en el momento del fallo pueden identificar la causa para que se puedan tomar las medidas correctivas adecuadas.
- Modificar las condiciones de funcionamiento mientras persiste la falla para comprobar si esta desaparece temporalmente o cambia. Por ejemplo, golpear los componentes, enfriarlos con un spray refrigerante o calentarlos. Un golpe en el gabinete también puede solucionar temporalmente la falla.
- Mantener una base de datos de fallas similares que se hayan resuelto en equipos idénticos o similares [ 3 ].
- Cambios preventivos, sin intentar identificar la falla. Por ejemplo, los condensadores electrolíticos sometidos a altas corrientes de rizado pueden cambiarse de forma rutinaria, sin molestarse en diagnosticar la falla. Los conectores pueden desconectarse y volverse a conectar. A veces, esto es una medida desesperada; se cambian las cosas hasta que la falla desaparece, con la esperanza de que se resuelva realmente en lugar de permanecer latente.
- En sistemas eléctricos y de cableado, se pueden utilizar técnicas de reflectometría en el dominio del tiempo : se envían pulsos a través del cableado eléctrico y se examinan los pulsos reflejados para detectar anomalías, por ejemplo, fugas intermitentes durante las tensiones de la operación de aeronaves; esto solo se puede hacer para un canal de prueba a la vez y generalmente se limita a fallas intermitentes de más de 100 milisegundos. [ 4 ]
- En sistemas complejos de múltiples canales, donde la falla o fallas pueden estar en una interconexión, el método ideal para encontrar una falla intermitente es poder monitorear, detectar y aislar todos los canales o rutas eléctricas de forma continua y simultánea. Esta metodología permite que el sistema bajo prueba se beneficie de una cobertura de prueba continua y completa mientras se realiza cualquier estrés ambiental del sistema. Este tipo de prueba no se puede realizar con tecnología de escaneo, sino que requiere algún tipo de red neuronal electrónica que pueda realizar estas pruebas sin necesidad de escaneo ni promediado digital; este régimen de prueba está cubierto por la norma MIL-PRF-32516 del Departamento de Defensa , publicada en marzo de 2015, y exige que la tecnología de prueba opere en la categoría Clase 1 para combatir eficazmente las fallas intermitentes. [ 5 ]
- Tres metodologías principales para mitigar el comportamiento intermitente en circuitos integrados son el retardo dinámico de instrucciones, el escalado de frecuencia del núcleo y la migración de hilos . Cuando el procesador tarda más de lo esperado en ejecutar un proceso, se producen retardos y violaciones de temporización. Este fallo puede evitarse mediante técnicas como el retardo dinámico de instrucciones. Este es un tipo de algoritmo que calcula las prioridades de planificación durante la ejecución del sistema. El objetivo es responder dinámicamente a las condiciones cambiantes y formar una configuración optimizada y autosostenible. Otro enfoque para mitigar el retardo es el escalado de frecuencia del núcleo, que reduce el rendimiento de la CPU a una frecuencia menor cuando se necesita menos y la aumenta a una frecuencia mayor cuando se necesita más. La migración de hilos es otra técnica utilizada para superar fallos intermitentes. Un hilo es un conjunto ordenado de instrucciones que le indica a una computadora exactamente qué hacer. Cuando un hilo específico encuentra fallos, el contenido del hilo dentro del núcleo de la computadora defectuoso se transfiere a otro hilo dentro de un núcleo inactivo, donde se aborda y resuelve el problema. [ 1 ]
Referencias
- 1 2 Bakhshi, Roozbeh; Kunche, Surya; Pecht, Michael (2014-02-18). "Fallos intermitentes en hardware y software". Journal of Electronic Packaging . 136 (1): 011014. doi : 10.1115/1.4026639 . ISSN 1043-7398 .
- ↑ Qi, H.; Ganesan, S.; Pecht, M. (mayo de 2008). "Fallos intermitentes y sin causa aparente en productos electrónicos". Microelectronics Reliability . 48 (5): 663– 674. Bibcode : 2008MiRe...48..663Q . doi : 10.1016/j.microrel.2008.02.003 .
- ↑ Ejemplo de una falla intermitente de TV en una base de datos "Highlandelectrix PANASONI.TV" . Archivado del original el 13 de abril de 2009. Recuperado el 19 de julio de 2010 .: "CHASIS Z3T - NO ARRANCA - INTERMITENTE. D1124 (5.1V) FUGA DE ZENER"
- ↑ "Reflectometría de dominio temporal de espectro ensanchado para la localización de fallas intermitentes. Enlace obsoleto archivado el 1 de mayo de 2010 en archive.today " Furse, Cynthia ; Smith, Paul; IEEE SENSORS JOURNAL, VOL. 5, NO. 6, DICIEMBRE DE 2005"
- ↑ "¿No se encontró ningún fallo, la prueba se realizó correctamente, no se puede reproducir o no se encontró ningún fallo? - Hacia una taxonomía estandarizada""Samir Khan, Paul Phillips, Chris Hockley, Ian Jennions"
Enlaces externos
- Un análisis sobre la depuración de software.
- Preguntas frecuentes de Sci.electronics.repair, consulte la sección "Solución de problemas intermitentes".
- Depuración
- Mantenimiento