Articulo de referencia

factor de valores atípicos locales

En la detección de anomalías , el factor de valores atípicos locales ( LOF ) es un algoritmo propuesto por Markus M. Breunig, Hans-Peter Kriegel , Raymond T. Ng y Jörg Sander en...

En la detección de anomalías , el factor de valores atípicos locales ( LOF ) es un algoritmo propuesto por Markus M. Breunig, Hans-Peter Kriegel , Raymond T. Ng y Jörg Sander en 2000 para encontrar puntos de datos anómalos midiendo la desviación local de un punto de datos dado con respecto a sus vecinos. [ 1 ]

LOF comparte algunos conceptos con DBSCAN y OPTICS , como los conceptos de "distancia central" y "distancia de alcanzabilidad", que se utilizan para la estimación de la densidad local. [ 2 ]

Idea básica

Idea básica de LOF: comparar la densidad local de un punto con las densidades de sus vecinos. A tiene una densidad mucho menor que sus vecinos.

El factor de valores atípicos locales se basa en el concepto de densidad local, donde la localidad viene dada por los k vecinos más cercanos, cuya distancia se utiliza para estimar la densidad. Al comparar la densidad local de un objeto con las densidades locales de sus vecinos, se pueden identificar regiones de densidad similar y puntos que tienen una densidad sustancialmente menor que la de sus vecinos. Estos se consideran valores atípicos .

La densidad local se estima mediante la distancia típica a la que se puede "alcanzar" un punto desde sus vecinos. La definición de "distancia de alcanzabilidad" utilizada en LOF es una medida adicional para producir resultados más estables dentro de los clústeres. La "distancia de alcanzabilidad" utilizada por LOF tiene algunos detalles sutiles que a menudo se encuentran incorrectos en fuentes secundarias, por ejemplo, en el libro de texto de Ethem Alpaydin. [ 3 ]

Definición formal

Dejark-distancia(A){\displaystyle k{\text{-distancia}}(A)}sea ​​la distancia del objeto A al k -ésimo vecino más cercano. Nótese que el conjunto de los k vecinos más cercanos incluye todos los objetos a esta distancia, que en caso de empate puede ser más de k objetos. Denotamos el conjunto de los k vecinos más cercanos comonortek(A){\displaystyle N_{k}(A)}.

Ilustración de la distancia de alcanzabilidad. Los objetos B y C tienen la misma distancia de alcanzabilidad ( k=3 ), mientras que D no es un vecino más cercano k .

Esta distancia se utiliza para definir lo que se denomina distancia de alcanzabilidad :

distancia de accesibilidadk(A,B)=máximo{k-distancia(B),d(A,B)}{\displaystyle {\text{distancia de alcance}}_{k}(A,B)=\max\{k{\text{-distancia}}(B),d(A,B)\}}

En otras palabras, la distancia de alcanzabilidad de un objeto A desde B es la distancia real entre los dos objetos, pero al menos lak-distancia{\displaystyle k{\text{-distance}}}de B. Los objetos que pertenecen a los k vecinos más cercanos de B (el "núcleo" de B , véase el análisis de clúster DBSCAN ) se consideran igualmente distantes. La razón de esto es reducir las fluctuaciones estadísticas entre todos los puntos A cercanos a B , donde aumentar el valor de k aumenta el efecto de suavizado. [ 1 ] Nótese que esto no es una distancia en la definición matemática, ya que no es simétrica. (Si bien es un error común [ 4 ] usar siempre lak-distancia(A){\displaystyle k{\text{-distance}}(A)}, esto produce un método ligeramente diferente, denominado Simplified-LOF [ 4 ] )

La densidad de accesibilidad local de un objeto A se define por

señork(A):=|nortek(A)|Bnortek(A)distancia de accesibilidadk(A,B){\displaystyle {\text{lrd}}_{k}(A):={\frac {|N_{k}(A)|}{\sum _{B\in N_{k}(A)}{\text{reachability-distance}}_{k}(A,B)}}}

que es el inverso de la distancia de alcanzabilidad promedio del objeto A desde sus vecinos. Tenga en cuenta que no es la alcanzabilidad promedio de los vecinos desde A (que por definición sería lak-distancia(A){\displaystyle k{\text{-distance}}(A)}), pero la distancia a la que se puede "alcanzar" A desde sus vecinos. Con puntos duplicados, este valor puede volverse infinito.

Luego, las densidades de accesibilidad local se comparan con las de los vecinos utilizando

LOFk(A):=1|nortek(A)|Bnortek(A)señork(B)señork(A)=1|nortek(A)|señork(A)Bnortek(A)señork(B){\displaystyle {\text{LOF}}_{k}(A):={\frac {1}{|N_{k}(A)|}}\sum _{B\in N_{k}(A)}{\frac {{\text{lrd}}_{k}(B)}{{\text{lrd}}_{k}(A)}}={\frac {1}{|N_{k}(A)|\cdot {\text{lrd}}_{k}(A)}}\sum _{B\in N_{k}(A)}{\text{lrd}}_{k}(B)}

que es la densidad de accesibilidad local promedio de los vecinos dividida por la densidad de accesibilidad local del propio objeto. Un valor aproximado de 1 indica que el objeto es comparable a sus vecinos (y, por lo tanto, no es un valor atípico). Un valor inferior a 1 indica una región más densa (que sería un valor atípico), mientras que valores significativamente mayores que 1 indican valores atípicos.

LOFk(A)1{\displaystyle {\text{LOF}}_{k}(A)\sim 1}significa Densidad similar a la de los vecinos,

LOFk(A)<1{\displaystyle {\text{LOF}}_{k}(A)<1}significa mayor densidad que los vecinos (Inlier),

LOFk(A)>1{\displaystyle {\text{LOF}}_{k}(A)>1}significa menor densidad que los vecinos (valor atípico).

Ventajas

Puntuaciones LOF visualizadas por ELKI . Si bien el grupo superior derecho tiene una densidad comparable a la de los valores atípicos cercanos al grupo inferior izquierdo, estos se detectan correctamente.

Gracias a su enfoque local, LOF puede identificar valores atípicos en un conjunto de datos que no lo serían en otra área del mismo. Por ejemplo, un punto situado a una distancia "pequeña" de un clúster muy denso es un valor atípico, mientras que un punto dentro de un clúster disperso podría presentar distancias similares a sus vecinos.

Si bien la intuición geométrica de LOF solo es aplicable a espacios vectoriales de baja dimensión, el algoritmo puede aplicarse en cualquier contexto donde se pueda definir una función de disimilitud. Se ha demostrado experimentalmente que funciona muy bien en numerosas configuraciones, superando a menudo a sus competidores, por ejemplo, en la detección de intrusiones en redes [ 5 ] y en datos de referencia de clasificación procesados ​​[ 6 ] .

La familia de métodos LOF se puede generalizar fácilmente y luego aplicar a otros problemas, como la detección de valores atípicos en datos geográficos, secuencias de vídeo o redes de autoría. [ 4 ]

Desventajas y extensiones

Los valores resultantes son cocientes y difíciles de interpretar. Un valor de 1 o incluso menor indica un punto atípico claro, pero no existe una regla definida para determinar cuándo un punto es un valor atípico. En un conjunto de datos, un valor de 1,1 puede ser ya un valor atípico; en otro conjunto de datos y parametrización (con fuertes fluctuaciones locales), un valor de 2 aún podría ser un punto atípico. Estas diferencias también pueden ocurrir dentro de un mismo conjunto de datos debido a la localidad del método. Existen extensiones de LOF que intentan mejorar LOF en estos aspectos:

  • Feature Bagging para la detección de valores atípicos [ 7 ] ejecuta LOF en múltiples proyecciones y combina los resultados para mejorar la calidad de la detección en altas dimensiones. Este es el primer enfoque de aprendizaje de conjuntos para la detección de valores atípicos; para otras variantes, consulte la referencia [ 8 ] .
  • La probabilidad de valores atípicos locales (LoOP) [ 9 ] es un método derivado de LOF pero que utiliza estadísticas locales económicas para ser menos sensible a la elección del parámetro k . Además, los valores resultantes se escalan a un rango de valores de [0:1] .
  • Interpretación y unificación de puntuaciones atípicas [ 10 ] propone una normalización de las puntuaciones atípicas de LOF al intervalo [0:1] utilizando escalamiento estadístico para aumentar la usabilidad y puede considerarse una versión mejorada de las ideas de LoOP.
  • En la evaluación de clasificaciones y puntuaciones de valores atípicos [ 11 ] se proponen métodos para medir la similitud y la diversidad de métodos para construir conjuntos avanzados de detección de valores atípicos utilizando variantes de LOF y otros algoritmos, y para mejorar el enfoque de Feature Bagging analizado anteriormente.
  • La detección de valores atípicos locales reconsiderada: una visión generalizada de la localidad con aplicaciones a la detección de valores atípicos espaciales, de vídeo y de red [ 4 ] analiza el patrón general en varios métodos de detección de valores atípicos locales (incluidos, por ejemplo, LOF, una versión simplificada de LOF y LoOP) y lo abstrae en un marco general. Este marco se aplica, por ejemplo, a la detección de valores atípicos en datos geográficos, secuencias de vídeo y redes de autoría.

Referencias

  1. 1 2 Breunig, MM; Kriegel, H.-P. ; Ng, RT; Sander, J. (2000). LOF: Identificación de valores atípicos locales basados ​​en la densidad (PDF) . Actas de la Conferencia Internacional ACM SIGMOD de 2000 sobre Gestión de Datos . SIGMOD . págs. 93–104 . doi : 10.1145/335191.335388 . ISBN  1-58113-217-4.
  2. Breunig, MM; Kriegel, H.-P. ; Ng, RT; Sander, JR (1999). "OPTICS-OF: Identificación de valores atípicos locales" (PDF) . Principios de minería de datos y descubrimiento de conocimiento . Notas de clase en informática. Vol. 1704. págs. 262–270 . doi : 10.1007/978-3-540-48247-5_28 . ISBN   978-3-540-66490-1.
  3. Alpaydin, Ethem (2020). Introducción al aprendizaje automático (Cuarta ed.). Cambridge, Massachusetts. ISBN  978-0-262-04379-3OCLC 1108782604 {{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  4. 1 2 3 4 Schubert, E.; Zimek, A.; Kriegel, H. -P. (2012). "Detección de valores atípicos locales reconsiderada: Una visión generalizada de la localidad con aplicaciones a la detección de valores atípicos espaciales, de vídeo y de red". Data Mining and Knowledge Discovery . 28 : 190– 237. doi : 10.1007/s10618-012-0300-z . S2CID 19036098 . 
  5. Lazarevic, A.; Ozgur, A.; Ertoz, L.; Srivastava, J.; Kumar, V. (2003). "Estudio comparativo de esquemas de detección de anomalías en la detección de intrusiones en redes" (PDF) . Actas de la Conferencia Internacional SIAM de 2003 sobre Minería de Datos . págs. 25–36 . doi : 10.1137/1.9781611972733.3 . ISBN  978-0-89871-545-3Archivado del original (PDF) el 17 de julio de 2013. Consultado el 14 de mayo de 2010 .
  6. Campos, Guilherme O.; Zimek, Arthur; Sander, Jörg; Campello, Ricardo JGB; Micenková, Barbora; Schubert, Erich; Assent, Ira; Houle, Michael E. (2016). "Sobre la evaluación de la detección de valores atípicos no supervisada: medidas, conjuntos de datos y un estudio empírico". Data Mining and Knowledge Discovery . 30 (4): 891– 927. doi : 10.1007/s10618-015-0444-8 . ISSN 1384-5810 . S2CID 1952214 .  
  7. Lazarevic, A.; Kumar, V. (2005). "Feature bagging for outlier detection". Actas de la undécima conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento en minería de datos . pp. 157–166 . doi : 10.1145/1081870.1081891 . ISBN  159593135X. S2CID 2054204 . 
  8. Zimek, A.; Campello, RJGB; Sander, JR (2014). "Conjuntos para la detección no supervisada de valores atípicos". Boletín informativo de ACM SIGKDD Explorations . 15 : 11–22 . doi : 10.1145/2594473.2594476 . S2CID 8065347 . 
  9. Kriegel, H.-P .; Kröger, P.; Schubert, E.; Zimek, A. (2009). "LoOP: Probabilidades de valores atípicos locales". Actas de la 18.ª conferencia ACM sobre gestión de información y conocimiento (PDF) . CIKM '09. págs. 1649–1652 . doi : 10.1145/1645953.1646195 . ISBN  978-1-60558-512-3.
  10. Kriegel, HP ; Kröger, P.; Schubert, E.; Zimek, A. (2011). Interpretación y unificación de puntuaciones de valores atípicos . Actas de la Conferencia Internacional SIAM de Minería de Datos de 2011. págs. 13–24 . CiteSeerX 10.1.1.232.2719 . doi : 10.1137/1.9781611972818.2 . ISBN   978-0-89871-992-5.
  11. Schubert, E.; Wojdanowski, R.; Zimek, A.; Kriegel, HP (2012). Sobre la evaluación de clasificaciones y puntuaciones de valores atípicos . Actas de la Conferencia Internacional SIAM de Minería de Datos de 2012. págs. 1047–1058 . CiteSeerX 10.1.1.300.7205 . doi : 10.1137/1.9781611972825.90 . ISBN   978-1-61197-232-0.