En estadística , la entropía aproximada ( ApEn ) es una técnica utilizada para cuantificar la regularidad y la imprevisibilidad de las fluctuaciones en datos de series temporales . [ 1 ] Por ejemplo, consideremos dos series de datos:
- Serie A: (0, 1, 0, 1, 0, 1, 0, 1, 0, 1, 0, 1, 0, 1, 0, 1, ...), que alterna 0 y 1.
- Serie B: (0, 1, 0, 0, 1, 0, 1, 0, 0, 1, 1, 1, 1, 0, 0, 1, ...), que tienen un valor de 0 o 1, elegidos al azar, cada uno con una probabilidad de 1/2.
Las estadísticas de momentos , como la media y la varianza , no permiten distinguir entre estas dos series. Tampoco las estadísticas de orden de rango . Sin embargo, la serie A es perfectamente regular: saber que un término tiene el valor de 1 permite predecir con certeza que el siguiente término tendrá el valor de 0. En cambio, la serie B tiene valores aleatorios: saber que un término tiene el valor de 1 no proporciona ninguna información sobre el valor que tendrá el siguiente término.
La regularidad se medía originalmente mediante estadísticas de regularidad exactas, que se han centrado principalmente en diversas medidas de entropía. [ 1 ] Sin embargo, el cálculo preciso de la entropía requiere grandes cantidades de datos, y los resultados se verán muy influenciados por el ruido del sistema, [ 2 ] por lo que no es práctico aplicar estos métodos a datos experimentales. ApEn fue propuesto por primera vez (con otro nombre) por Aviad Cohen e Itamar Procaccia , [ 3 ] como un algoritmo aproximado para calcular una estadística de regularidad exacta, la entropía de Kolmogorov-Sinai , y posteriormente popularizado por Steve M. Pincus . ApEn se utilizó inicialmente para analizar dinámicas caóticas y datos médicos, como la frecuencia cardíaca, [ 1 ] y posteriormente extendió sus aplicaciones a las finanzas , [ 4 ] la fisiología , [ 5 ] la ingeniería de factores humanos , [ 6 ] y las ciencias climáticas. [ 7 ]
Algoritmo
Se encuentra disponible un tutorial completo paso a paso con una explicación de los fundamentos teóricos de la entropía aproximada. [ 8 ] El algoritmo es:
- Paso 1
- Supongamos una serie temporal de datos.Estos sonValores de datos brutos obtenidos a partir de mediciones realizadas a intervalos de tiempo iguales.
- Paso 2
- Dejarsea un entero positivo , con, que representa la longitud de una secuencia de datos (esencialmente una ventana ) .Sea un número real positivo , que especifica un nivel de filtrado ..
- Paso 3
- Definirpara cadadónde. En otras palabras,es unVector de dimensión que contiene la secuencia de datos que comienza con. Definir la distancia entre dos vectoresycomo el máximo de las distancias entre sus componentes respectivas, dadas por
- para.
- Paso 4
- Defina un recuentocomo
- para cadadónde. Tenga en cuenta que desdetoma todos los valores entre 1 y, el partido se contará cuando(es decir, cuando la subsecuencia de prueba,, se compara consigo mismo,).
- Paso 5
- Definir
- dóndees el logaritmo natural , y para un fijo,, ycomo se establece en el paso 2.
- Paso 6
- Definir entropía aproximada () como
- Selección de parámetros
- Normalmente, eligeo, mientrasDepende en gran medida de la aplicación.
Una implementación en Physionet, [ 9 ] que se basa en Pincus, [ 2 ] utilizaen lugar deen el paso 4. Si bien esto puede ser un problema en el caso de ejemplos construidos artificialmente, en la práctica no suele serlo.
Ejemplo

Consideremos una secuencia demuestras de frecuencia cardíaca espaciadas uniformemente en el tiempo:
Nótese que la secuencia es periódica con un período de 3. Elegimosy(los valores deypuede variar sin afectar el resultado).
Formar una secuencia de vectores:
La distancia se calcula repetidamente de la siguiente manera. En el primer cálculo,
- lo cual es menor que.
En el segundo cálculo, observe que, entonces
- que es mayor que.
Similarmente,
El resultado es un total de 17 términos.de tal manera queEstos incluyenEn estos casos,es
Nota en el paso 4,para. Entonces los términosde tal manera queincluiry el número total es 16.
Al final de estos cálculos, tenemos
Luego repetimos los pasos anteriores paraPrimero, forme una secuencia de vectores:
Calculando las distancias entre vectores, encontramos que los vectores que satisfacen el nivel de filtrado tienen la siguiente característica:
Por lo tanto,
Al final de estos cálculos, tenemos
Finalmente,
El valor es muy pequeño, lo que implica que la secuencia es regular y predecible, lo cual es consistente con la observación.
Implementación en Python
importar matemáticasdef approx_entropy ( time_series , run_length , filter_level ) -> float : """ Entropía aproximada >>> import random >>> regularmente = [85, 80, 89] * 17 >>> print(f"{approx_entropy(regularmente, 2, 3):e}") 1.099654e-05 >>> aleatoriamente = [random.choice([85, 80, 89]) for _ in range(17*3)] >>> 0.8 < approx_entropy(aleatoriamente, 2, 3) < 1 True """def _maxdist ( x_i , x_j ): return max ( abs ( ua - va ) for ua , va in zip ( x_i , x_j ))def _phi ( m ): n = len ( time_series ) - m + 1 x = [ [ time_series [ j ] for j in range ( i , i + m )] for i in range ( n ) ] counts = [ sum ( 1 for x_j in x if _maxdist ( x_i , x_j ) <= filter_level ) / n for x_i in x ] return sum ( math . log ( c ) for c in counts ) / nreturn abs ( _phi ( run_length + 1 ) - _phi ( run_length ))if __name__ == "__main__" : import doctestdoctest.testmod ( )Implementación en MATLAB
- Entropía aproximada rápida de MatLab Central
- entropía aproximada
Interpretación
La presencia de patrones repetitivos de fluctuación en una serie temporal la hace más predecible que una serie temporal en la que tales patrones están ausentes. ApEn refleja la probabilidad de que patrones de observaciones similares no sean seguidos por observaciones similares adicionales . [ 10 ] Una serie temporal que contiene muchos patrones repetitivos tiene un ApEn relativamente pequeño; un proceso menos predecible tiene un ApEn más alto. En la predicción, la entropía aproximada también se ha discutido como un diagnóstico de la predictibilidad o pronosticabilidad de las series temporales. [ 11 ] [ 12 ]
Ventajas
Las ventajas de ApEn incluyen: [ 2 ]
- Menor demanda computacional. ApEn puede diseñarse para funcionar con pequeñas muestras de datos (puntos) y se pueden aplicar en tiempo real.
- Menor influencia del ruido. Si los datos son ruidosos, la medida ApEn se puede comparar con el nivel de ruido en los datos para determinar qué calidad de información verdadera puede estar presente en ellos.
Limitaciones
El algoritmo ApEn cuenta cada secuencia como si coincidiera consigo misma para evitar la ocurrencia deen los cálculos. Este paso podría introducir sesgos en ApEn, lo que hace que ApEn tenga dos propiedades deficientes en la práctica: [ 13 ]
- ApEn depende en gran medida de la longitud del registro y es uniformemente inferior a lo esperado para registros cortos.
- Carece de consistencia relativa. Es decir, si el ApEn de un conjunto de datos es mayor que el de otro, debería seguir siendo mayor para todas las condiciones analizadas, pero no lo hace.
Aplicaciones
ApEn se ha aplicado para clasificar la electroencefalografía (EEG) en enfermedades psiquiátricas, como la esquizofrenia, [ 14 ] la epilepsia , [ 15 ] y la adicción. [ 16 ]
Véase también
Referencias
- 1 2 3 Pincus, SM; Gladstone, IM; Ehrenkranz, RA (1991). "Una estadística de regularidad para el análisis de datos médicos". Journal of Clinical Monitoring and Computing . 7 (4): 335– 345. doi : 10.1007/BF01619355 . PMID 1744678 . S2CID 23455856 .
- 1 2 3 Pincus, SM (1991). "Entropía aproximada como medida de la complejidad del sistema" . Actas de la Academia Nacional de Ciencias . 88 ( 6): 2297– 2301. Bibcode : 1991PNAS...88.2297P . doi : 10.1073/pnas.88.6.2297 . PMC 51218. PMID 11607165 .
- ↑ Cohen, A.; Procaccia, I. (1985). "Cálculo de la entropía de Kolmogorov a partir de señales temporales de sistemas dinámicos disipativos y conservativos". Physical Review A. 28 ( 3): 2591(R). Bibcode : 1985PhRvA..31.1872C . doi : 10.1103/PhysRevA.31.1872 . PMID 9895695 .
- ↑ Pincus, SM; Kalman, EK (2004). "Irregularidad, volatilidad, riesgo y series temporales del mercado financiero" . Actas de la Academia Nacional de Ciencias . 101 (38): 13709– 13714. Bibcode : 2004PNAS..10113709P . doi : 10.1073/pnas.0405168101 . PMC 518821. PMID 15358860 .
- ↑ Pincus, SM; Goldberger, AL (1994). "Análisis de series temporales fisiológicas: ¿qué cuantifica la regularidad?". The American Journal of Physiology . 266 (4): 1643– 1656. doi : 10.1152/ajpheart.1994.266.4.H1643 . PMID 8184944 . S2CID 362684 .
- ↑ McKinley, RA; McIntire, LK; Schmidt, R; Repperger, DW; Caldwell, JA (2011). "Evaluación de las métricas oculares como detector de fatiga". Factores humanos . 53 (4): 403– 414. doi : 10.1177/0018720811411297 . PMID 21901937. S2CID 109251681 .
- ↑ Delgado-Bonal, Alfonso; Marshak, Alexander; Yang, Yuekui; Holdaway, Daniel (22 de enero de 2020). " Análisis de los cambios en la complejidad del clima en las últimas cuatro décadas utilizando datos de radiación de MERRA-2" . Scientific Reports . 10 (1): 922. Bibcode : 2020NatSR..10..922D . doi : 10.1038/s41598-020-57917-8 . ISSN 2045-2322 . PMC 6976651. PMID 31969616 .
- ↑ Delgado-Bonal, Alfonso; Marshak, Alexander (junio de 2019). "Entropía aproximada y entropía de muestra: un tutorial completo" . Entropy . 21 ( 6): 541. Bibcode : 2019Entrp..21..541D . doi : 10.3390/e21060541 . PMC 7515030. PMID 33267255 .
- ↑ "PhysioNet" . Archivado del original el 18 de junio de 2012. Consultado el 4 de julio de 2012 .
- ↑ Ho, KK; Moody, GB; Peng, CK; Mietus, JE; Larson, MG; Levy, D; Goldberger, AL (1997). "Predicción de la supervivencia en sujetos con insuficiencia cardíaca, tanto casos como controles, mediante el uso de métodos totalmente automatizados para derivar índices no lineales y convencionales de la dinámica de la frecuencia cardíaca". Circulation . 96 (3): 842– 848. doi : 10.1161/01.cir.96.3.842 . PMID 9264491 .
- ↑ Pincus, Steven M. (1991). "Entropía aproximada como medida de la complejidad del sistema" . Actas de la Academia Nacional de Ciencias . 88 (6): 2297– 2301. doi : 10.1073/pnas.88.6.2297 . PMC 51218 .
- ↑ Catt, Peter M. (2009). "Pronosticabilidad: Perspectivas desde la física, la descomposición gráfica y la teoría de la información". Foresight: The International Journal of Applied Forecasting (13): 24– 33.
- ↑ Richman, JS; Moorman, JR (2000). "Análisis de series temporales fisiológicas mediante entropía aproximada y entropía de muestra". American Journal of Physiology. Heart and Circulatory Physiology . 278 (6): 2039– 2049. doi : 10.1152/ajpheart.2000.278.6.H2039 . PMID 10843903 . S2CID 2389971 .
- ↑ Sabeti, Malihe (2009). "Medidas de entropía y complejidad para la clasificación de señales EEG de participantes esquizofrénicos y de control". Inteligencia Artificial en Medicina . 47 (3): 263– 274. doi : 10.1016/j.artmed.2009.03.003 . PMID 19403281 .
- ↑ Yuan, Qi (2011). "Clasificación de EEG epiléptico basada en máquina de aprendizaje extremo y características no lineales". Epilepsy Research . 96 ( 1–2 ): 29–38 . doi : 10.1016/j.eplepsyres.2011.04.013 . PMID 21616643. S2CID 41730913 .
- ↑ Yun, Kyongsik (2012). "Disminución de la complejidad cortical en consumidores de metanfetamina". Psychiatry Research: Neuroimaging . 201 (3): 226– 32. doi : 10.1016/j.pscychresns.2011.07.009 . PMID 22445216. S2CID 30670300 .
- Series temporales
- Entropía e información