Articulo de referencia

Entropía aproximada

En estadística , la entropía aproximada ( ApEn ) es una técnica utilizada para cuantificar la regularidad y la imprevisibilidad de las fluctuaciones en datos de series temporale...

En estadística , la entropía aproximada ( ApEn ) es una técnica utilizada para cuantificar la regularidad y la imprevisibilidad de las fluctuaciones en datos de series temporales . [ 1 ] Por ejemplo, consideremos dos series de datos:

Serie A: (0, 1, 0, 1, 0, 1, 0, 1, 0, 1, 0, 1, 0, 1, 0, 1, ...), que alterna 0 y 1.
Serie B: (0, 1, 0, 0, 1, 0, 1, 0, 0, 1, 1, 1, 1, 0, 0, 1, ...), que tienen un valor de 0 o 1, elegidos al azar, cada uno con una probabilidad de 1/2.

Las estadísticas de momentos , como la media y la varianza , no permiten distinguir entre estas dos series. Tampoco las estadísticas de orden de rango . Sin embargo, la serie A es perfectamente regular: saber que un término tiene el valor de 1 permite predecir con certeza que el siguiente término tendrá el valor de 0. En cambio, la serie B tiene valores aleatorios: saber que un término tiene el valor de 1 no proporciona ninguna información sobre el valor que tendrá el siguiente término.

La regularidad se medía originalmente mediante estadísticas de regularidad exactas, que se han centrado principalmente en diversas medidas de entropía. [ 1 ] Sin embargo, el cálculo preciso de la entropía requiere grandes cantidades de datos, y los resultados se verán muy influenciados por el ruido del sistema, [ 2 ] por lo que no es práctico aplicar estos métodos a datos experimentales. ApEn fue propuesto por primera vez (con otro nombre) por Aviad Cohen e Itamar Procaccia , [ 3 ] como un algoritmo aproximado para calcular una estadística de regularidad exacta, la entropía de Kolmogorov-Sinai , y posteriormente popularizado por Steve M. Pincus . ApEn se utilizó inicialmente para analizar dinámicas caóticas y datos médicos, como la frecuencia cardíaca, [ 1 ] y posteriormente extendió sus aplicaciones a las finanzas , [ 4 ] la fisiología , [ 5 ] la ingeniería de factores humanos , [ 6 ] y las ciencias climáticas. [ 7 ]

Algoritmo

Se encuentra disponible un tutorial completo paso a paso con una explicación de los fundamentos teóricos de la entropía aproximada. [ 8 ] El algoritmo es:

Paso 1
Supongamos una serie temporal de datos.(1),(2),,(norte){\displaystyle u(1),u(2),\ldots ,u(N)}Estos sonnorte{\displaystyle N}Valores de datos brutos obtenidos a partir de mediciones realizadas a intervalos de tiempo iguales.
Paso 2
DejarmetroZ+{\displaystyle m\in \mathbb {Z} ^{+}}sea ​​un entero positivo , conmetronorte{\displaystyle m\leq N}, que representa la longitud de una secuencia de datos (esencialmente una ventana ) .rR+{\displaystyle r\in \mathbb {R} ^{+}}Sea un número real positivo , que especifica un nivel de filtrado .norte=nortemetro+1{\displaystyle n=N-m+1}.
Paso 3
Definirincógnita(i)=[(i),(i+1),,(i+metro1)]{\displaystyle \mathbf {x} (i)={\big [}u(i),u(i+1),\ldots ,u(i+m-1){\big ]}}para cadai{\displaystyle i}dónde1inorte{\displaystyle 1\leq i\leq n}. En otras palabras,incógnita(i){\displaystyle \mathbf {x} (i)}es unmetro{\displaystyle m}Vector de dimensión que contiene la secuencia de datos que comienza con(i){\displaystyle u(i)}. Definir la distancia entre dos vectoresincógnita(i){\displaystyle \mathbf {x} (i)}yincógnita(j){\displaystyle \mathbf {x} (j)}como el máximo de las distancias entre sus componentes respectivas, dadas por
d[incógnita(i),incógnita(j)]=máximok(|incógnita(i)kincógnita(j)k|)=máximok(|(i+k1)(j+k1)|){\displaystyle {\begin{aligned}d[\mathbf {x} (i),\mathbf {x} (j)]&=\max _{k}{\big (}|\mathbf {x} (i)_{k}-\mathbf {x} (j)_{k}|{\big )}\\&=\max _{k}{\big (}|u(i+k-1)-u(j+k-1)|{\big )}\\\end{aligned}}}
para1kmetro{\displaystyle 1\leq k\leq m}.
Paso 4
Defina un recuentodoimetro{\displaystyle C_{i}^{m}}como
doimetro(r)=(número de j de tal manera que d[incógnita(i),incógnita(j)]r)norte{\displaystyle C_{i}^{m}(r)={({\text{número de }}j{\text{ tales que }}d[\mathbf {x} (i),\mathbf {x} (j)]\leq r) \over n}}
para cadai{\displaystyle i}dónde1i,jnorte{\displaystyle 1\leq i,j\leq n}. Tenga en cuenta que desdej{\displaystyle j}toma todos los valores entre 1 ynorte{\displaystyle n}, el partido se contará cuandoj=i{\displaystyle j=i}(es decir, cuando la subsecuencia de prueba,incógnita(j){\displaystyle \mathbf {x} (j)}, se compara consigo mismo,incógnita(i){\displaystyle \mathbf {x} (i)}).
Paso 5
Definir
ϕmetro(r)=1nortei=1norteregistro(doimetro(r)){\displaystyle \phi ^{m}(r)={1 \over n}\sum _{i=1}^{n}\log(C_{i}^{m}(r))}
dónderegistro{\displaystyle \log }es el logaritmo natural , y para un fijometro{\displaystyle m},r{\displaystyle r}, ynorte{\displaystyle n}como se establece en el paso 2.
Paso 6
Definir entropía aproximada (Apagminorte{\displaystyle \mathrm {ApEn} }) como
Apagminorte(metro,r,norte)()=ϕmetro(r)ϕmetro+1(r){\displaystyle \mathrm {ApEn} (m,r,N)(u)=\phi ^{m}(r)-\phi ^{m+1}(r)}
Selección de parámetros
Normalmente, eligemetro=2{\displaystyle m=2}ometro=3{\displaystyle m=3}, mientrasr{\displaystyle r}Depende en gran medida de la aplicación.

Una implementación en Physionet, [ 9 ] que se basa en Pincus, [ 2 ] utilizad[incógnita(i),incógnita(j)]<r{\displaystyle d[\mathbf {x} (i),\mathbf {x} (j)]<r}en lugar ded[incógnita(i),incógnita(j)]r{\displaystyle d[\mathbf {x} (i),\mathbf {x} (j)]\leq r}en el paso 4. Si bien esto puede ser un problema en el caso de ejemplos construidos artificialmente, en la práctica no suele serlo.

Ejemplo

Ilustración de la secuencia de frecuencia cardíaca

Consideremos una secuencia denorte=51{\displaystyle N=51}muestras de frecuencia cardíaca espaciadas uniformemente en el tiempo:

 Snorte={85,80,89,85,80,89,}{\displaystyle \ S_{N}=\{85,80,89,85,80,89,\ldots \}}

Nótese que la secuencia es periódica con un período de 3. Elegimosmetro=2{\displaystyle m=2}yr=3{\displaystyle r=3}(los valores demetro{\displaystyle m}yr{\displaystyle r}puede variar sin afectar el resultado).

Formar una secuencia de vectores:

incógnita(1)=[(1) (2)]=[85 80]incógnita(2)=[(2) (3)]=[80 89]incógnita(3)=[(3) (4)]=[89 85]incógnita(4)=[(4) (5)]=[85 80]  {\displaystyle {\begin{aligned}\mathbf {x} (1)&=[u(1)\ u(2)]=[85\ 80]\\\mathbf {x} (2)&=[u(2)\ u(3)]=[80\ 89]\\\mathbf {x} (3)&=[u(3)\ u(4)]=[89\ 85]\\\mathbf {x} (4)&=[u(4)\ u(5)]=[85\ 80]\\&\ \ \vdots \end{aligned}}}

La distancia se calcula repetidamente de la siguiente manera. En el primer cálculo,

 d[incógnita(1),incógnita(1)]=máximok|incógnita(1)kincógnita(1)k|=0{\displaystyle \ d[\mathbf {x} (1),\mathbf {x} (1)]=\max _{k}|\mathbf {x} (1)_{k}-\mathbf {x} (1)_{k}|=0}lo cual es menor quer{\displaystyle r}.

En el segundo cálculo, observe que|(2)(3)|>|(1)(2)|{\displaystyle |u(2)-u(3)|>|u(1)-u(2)|}, entonces

 d[incógnita(1),incógnita(2)]=máximok|incógnita(1)kincógnita(2)k|=|(2)(3)|=9{\displaystyle \ d[\mathbf {x} (1),\mathbf {x} (2)]=\max _{k}|\mathbf {x} (1)_{k}-\mathbf {x} (2)_{k}|=|u(2)-u(3)|=9}que es mayor quer{\displaystyle r}.

Similarmente,

d[incógnita(1),incógnita(3)]=|(2)(4)|=5>rd[incógnita(1),incógnita(4)]=|(1)(4)|=|(2)(5)|=0<rd[incógnita(1),incógnita(j)]={\displaystyle {\begin{aligned}d[\mathbf {x} (1)&,\mathbf {x} (3)]=|u(2)-u(4)|=5>r\\d[\mathbf {x} (1)&,\mathbf {x} (4)]=|u(1)-u(4)|=|u(2)-u(5)|=0<r\\&\vdots \\d[\mathbf {x} (1)&,\mathbf {x} (j)]=\cdots \\&\vdots \\\end{aligned}}}

El resultado es un total de 17 términos.incógnita(j){\displaystyle \mathbf {x} (j)}de tal manera qued[incógnita(1),incógnita(j)]r{\displaystyle d[\mathbf {x} (1),\mathbf {x} (j)]\leq r}Estos incluyenincógnita(1),incógnita(4),incógnita(7),,incógnita(49){\displaystyle \mathbf {x} (1),\mathbf {x} (4),\mathbf {x} (7),\ldots ,\mathbf {x} (49)}En estos casos,doimetro(r){\displaystyle C_{i}^{m}(r)}es

 do12(3)=1750{\displaystyle \ C_{1}^{2}(3)={\frac {17}{50}}}
 do22(3)=1750{\displaystyle \ C_{2}^{2}(3)={\frac {17}{50}}}
 do32(3)=1650{\displaystyle \ C_{3}^{2}(3)={\frac {16}{50}}}
 do42(3)=1750 {\displaystyle \ C_{4}^{2}(3)={\frac {17}{50}}\ \cdots }

Nota en el paso 4,1inorte{\displaystyle 1\leq i\leq n}paraincógnita(i){\displaystyle \mathbf {x} (i)}. Entonces los términosincógnita(j){\displaystyle \mathbf {x} (j)}de tal manera qued[incógnita(3),incógnita(j)]r{\displaystyle d[\mathbf {x} (3),\mathbf {x} (j)]\leq r}incluirincógnita(3),incógnita(6),incógnita(9),,incógnita(48){\displaystyle \mathbf {x} (3),\mathbf {x} (6),\mathbf {x} (9),\ldots ,\mathbf {x} (48)}y el número total es 16.

Al final de estos cálculos, tenemos

ϕ2(3)=150i=150registro(doi2(3))1.0982{\displaystyle \phi ^{2}(3)={1 \over 50}\sum _{i=1}^{50}\log(C_{i}^{2}(3))\approx -1.0982}

Luego repetimos los pasos anteriores parametro=3{\displaystyle m=3}Primero, forme una secuencia de vectores:

incógnita(1)=[(1) (2) (3)]=[85 80 89]incógnita(2)=[(2) (3) (4)]=[80 89 85]incógnita(3)=[(3) (4) (5)]=[89 85 80]incógnita(4)=[(4) (5) (6)]=[85 80 89]  {\displaystyle {\begin{aligned}\mathbf {x} (1)&=[u(1)\ u(2)\ u(3)]=[85\ 80\ 89]\\\mathbf {x} (2)&=[u(2)\ u(3)\ u(4)]=[80\ 89\ 85]\\\mathbf {x} (3)&=[u(3)\ u(4)\ u(5)]=[89\ 85\ 80]\\\mathbf {x} (4)&=[u(4)\ u(5)\ u(6)]=[85\ 80\ 89]\\&\ \ \vdots \end{aligned}}}

Calculando las distancias entre vectoresincógnita(i),incógnita(j),1i49{\displaystyle \mathbf {x} (i),\mathbf {x} (j),1\leq i\leq 49}, encontramos que los vectores que satisfacen el nivel de filtrado tienen la siguiente característica:

d[incógnita(i),incógnita(i+3)]=0<r{\displaystyle d[\mathbf {x} (i),\mathbf {x} (i+3)]=0<r}

Por lo tanto,

 do13(3)=1749{\displaystyle \ C_{1}^{3}(3)={\frac {17}{49}}}
 do23(3)=1649{\displaystyle \ C_{2}^{3}(3)={\frac {16}{49}}}
 do33(3)=1649{\displaystyle \ C_{3}^{3}(3)={\frac {16}{49}}}
 do43(3)=1749 {\displaystyle \ C_{4}^{3}(3)={\frac {17}{49}}\ \cdots }

Al final de estos cálculos, tenemos

ϕ3(3)=149i=149registro(doi3(3))1.0982{\displaystyle \phi ^{3}(3)={1 \over 49}\sum _{i=1}^{49}\log(C_{i}^{3}(3))\approx -1.0982}

Finalmente,

Apagminorte=ϕ2(3)ϕ3(3)0,000010997{\displaystyle \mathrm {ApEn} =\phi ^{2}(3)-\phi ^{3}(3)\approx 0.000010997}

El valor es muy pequeño, lo que implica que la secuencia es regular y predecible, lo cual es consistente con la observación.

Implementación en Python

importar matemáticasdef approx_entropy ( time_series , run_length , filter_level ) -> float : """  Entropía aproximada >>> import random  >>> regularmente = [85, 80, 89] * 17  >>> print(f"{approx_entropy(regularmente, 2, 3):e}")  1.099654e-05  >>> aleatoriamente = [random.choice([85, 80, 89]) for _ in range(17*3)]  >>> 0.8 < approx_entropy(aleatoriamente, 2, 3) < 1  True  """def _maxdist ( x_i , x_j ): return max ( abs ( ua - va ) for ua , va in zip ( x_i , x_j ))def _phi ( m ): n = len ( time_series ) - m + 1 x = [ [ time_series [ j ] for j in range ( i , i + m )] for i in range ( n ) ] counts = [ sum ( 1 for x_j in x if _maxdist ( x_i , x_j ) <= filter_level ) / n for x_i in x ] return sum ( math . log ( c ) for c in counts ) / nreturn abs ( _phi ( run_length + 1 ) - _phi ( run_length ))if __name__ == "__main__" : import doctestdoctest.testmod ( )

Implementación en MATLAB

  • Entropía aproximada rápida de MatLab Central
  • entropía aproximada

Interpretación

La presencia de patrones repetitivos de fluctuación en una serie temporal la hace más predecible que una serie temporal en la que tales patrones están ausentes. ApEn refleja la probabilidad de que patrones de observaciones similares no sean seguidos por observaciones similares adicionales . [ 10 ] Una serie temporal que contiene muchos patrones repetitivos tiene un ApEn relativamente pequeño; un proceso menos predecible tiene un ApEn más alto. En la predicción, la entropía aproximada también se ha discutido como un diagnóstico de la predictibilidad o pronosticabilidad de las series temporales. [ 11 ] [ 12 ]

Ventajas

Las ventajas de ApEn incluyen: [ 2 ]

  • Menor demanda computacional. ApEn puede diseñarse para funcionar con pequeñas muestras de datos (norte<50{\displaystyle N<50}puntos) y se pueden aplicar en tiempo real.
  • Menor influencia del ruido. Si los datos son ruidosos, la medida ApEn se puede comparar con el nivel de ruido en los datos para determinar qué calidad de información verdadera puede estar presente en ellos.

Limitaciones

El algoritmo ApEn cuenta cada secuencia como si coincidiera consigo misma para evitar la ocurrencia deregistro(0){\displaystyle \log(0)}en los cálculos. Este paso podría introducir sesgos en ApEn, lo que hace que ApEn tenga dos propiedades deficientes en la práctica: [ 13 ]

  1. ApEn depende en gran medida de la longitud del registro y es uniformemente inferior a lo esperado para registros cortos.
  2. Carece de consistencia relativa. Es decir, si el ApEn de un conjunto de datos es mayor que el de otro, debería seguir siendo mayor para todas las condiciones analizadas, pero no lo hace.

Aplicaciones

ApEn se ha aplicado para clasificar la electroencefalografía (EEG) en enfermedades psiquiátricas, como la esquizofrenia, [ 14 ] la epilepsia , [ 15 ] y la adicción. [ 16 ]

Véase también

Referencias

  1. 1 2 3 Pincus, SM; Gladstone, IM; Ehrenkranz, RA (1991). "Una estadística de regularidad para el análisis de datos médicos". Journal of Clinical Monitoring and Computing . 7 (4): 335– 345. doi : 10.1007/BF01619355 . PMID 1744678 . S2CID 23455856 .  
  2. 1 2 3 Pincus, SM (1991). "Entropía aproximada como medida de la complejidad del sistema" . Actas de la Academia Nacional de Ciencias . 88 ( 6): 2297– 2301. Bibcode : 1991PNAS...88.2297P . doi : 10.1073/pnas.88.6.2297 . PMC 51218. PMID 11607165 .  
  3. Cohen, A.; Procaccia, I. (1985). "Cálculo de la entropía de Kolmogorov a partir de señales temporales de sistemas dinámicos disipativos y conservativos". Physical Review A. 28 ( 3): 2591(R). Bibcode : 1985PhRvA..31.1872C . doi : 10.1103/PhysRevA.31.1872 . PMID 9895695 . 
  4. Pincus, SM; Kalman, EK (2004). "Irregularidad, volatilidad, riesgo y series temporales del mercado financiero" . Actas de la Academia Nacional de Ciencias . 101 (38): 13709– 13714. Bibcode : 2004PNAS..10113709P . doi : 10.1073/pnas.0405168101 . PMC 518821. PMID 15358860 .  
  5. Pincus, SM; Goldberger, AL (1994). "Análisis de series temporales fisiológicas: ¿qué cuantifica la regularidad?". The American Journal of Physiology . 266 (4): 1643– 1656. doi : 10.1152/ajpheart.1994.266.4.H1643 . PMID 8184944 . S2CID 362684 .  
  6. McKinley, RA; McIntire, LK; Schmidt, R; Repperger, DW; Caldwell, JA (2011). "Evaluación de las métricas oculares como detector de fatiga". Factores humanos . 53 (4): 403– 414. doi : 10.1177/0018720811411297 . PMID 21901937. S2CID 109251681 .  
  7. Delgado-Bonal, Alfonso; Marshak, Alexander; Yang, Yuekui; Holdaway, Daniel (22 de enero de 2020). " Análisis de los cambios en la complejidad del clima en las últimas cuatro décadas utilizando datos de radiación de MERRA-2" . Scientific Reports . 10 (1): 922. Bibcode : 2020NatSR..10..922D . doi : 10.1038/s41598-020-57917-8 . ISSN 2045-2322 . PMC 6976651. PMID 31969616 .   
  8. Delgado-Bonal, Alfonso; Marshak, Alexander (junio de 2019). "Entropía aproximada y entropía de muestra: un tutorial completo" . Entropy . 21 ( 6): 541. Bibcode : 2019Entrp..21..541D . doi : 10.3390/e21060541 . PMC 7515030. PMID 33267255 .  
  9. "PhysioNet" . Archivado del original el 18 de junio de 2012. Consultado el 4 de julio de 2012 .
  10. Ho, KK; Moody, GB; Peng, CK; Mietus, JE; Larson, MG; Levy, D; Goldberger, AL (1997). "Predicción de la supervivencia en sujetos con insuficiencia cardíaca, tanto casos como controles, mediante el uso de métodos totalmente automatizados para derivar índices no lineales y convencionales de la dinámica de la frecuencia cardíaca". Circulation . 96 (3): 842– 848. doi : 10.1161/01.cir.96.3.842 . PMID 9264491 . 
  11. Pincus, Steven M. (1991). "Entropía aproximada como medida de la complejidad del sistema" . Actas de la Academia Nacional de Ciencias . 88 (6): 2297– 2301. doi : 10.1073/pnas.88.6.2297 . PMC 51218 . 
  12. Catt, Peter M. (2009). "Pronosticabilidad: Perspectivas desde la física, la descomposición gráfica y la teoría de la información". Foresight: The International Journal of Applied Forecasting (13): 24– 33.
  13. Richman, JS; Moorman, JR (2000). "Análisis de series temporales fisiológicas mediante entropía aproximada y entropía de muestra". American Journal of Physiology. Heart and Circulatory Physiology . 278 (6): 2039– 2049. doi : 10.1152/ajpheart.2000.278.6.H2039 . PMID 10843903 . S2CID 2389971 .  
  14. Sabeti, Malihe (2009). "Medidas de entropía y complejidad para la clasificación de señales EEG de participantes esquizofrénicos y de control". Inteligencia Artificial en Medicina . 47 (3): 263– 274. doi : 10.1016/j.artmed.2009.03.003 . PMID 19403281 . 
  15. Yuan, Qi (2011). "Clasificación de EEG epiléptico basada en máquina de aprendizaje extremo y características no lineales". Epilepsy Research . 96 ( 1–2 ): 29–38 . doi : 10.1016/j.eplepsyres.2011.04.013 . PMID 21616643. S2CID 41730913 .  
  16. Yun, Kyongsik (2012). "Disminución de la complejidad cortical en consumidores de metanfetamina". Psychiatry Research: Neuroimaging . 201 (3): 226– 32. doi : 10.1016/j.pscychresns.2011.07.009 . PMID 22445216. S2CID 30670300 .