Articulo de referencia

Método del cuello de botella de la información

El método del cuello de botella de la información es una técnica de la teoría de la información introducida por Naftali Tishby , Fernando C. Pereira y William Bialek . [ 1 ] Est...

El método del cuello de botella de la información es una técnica de la teoría de la información introducida por Naftali Tishby , Fernando C. Pereira y William Bialek . [ 1 ] Está diseñado para encontrar el mejor equilibrio entre precisión y complejidad ( compresión ) al resumir (por ejemplo, agrupar ) una variable aleatoria X , dada una distribución de probabilidad conjunta p(X,Y) entre X y una variable relevante observada Y , y se describe a sí mismo como un marco sorprendentemente rico para analizar diversos problemas en el procesamiento de señales y el aprendizaje . [ 1 ]

Entre sus aplicaciones se incluyen la agrupación distribucional y la reducción de dimensionalidad , y más recientemente se ha propuesto como fundamento teórico para el aprendizaje profundo . Generaliza la noción clásica de estadística suficiente mínima , desde la estadística paramétrica hasta distribuciones arbitrarias, no necesariamente de forma exponencial. Lo hace relajando la condición de suficiencia para capturar una fracción de la información mutua con la variable relevante Y.

El cuello de botella de la información también puede verse como un problema de distorsión de la tasa , con una función de distorsión que mide qué tan bien se predice Y a partir de una representación comprimida T en comparación con su predicción directa a partir de X. Esta interpretación proporciona un algoritmo iterativo general para resolver la compensación del cuello de botella de la información y calcular la curva de información a partir de la distribución p(X,Y) .

Sea la representación comprimida dada por una variable aleatoria.T{\displaystyle T}El algoritmo minimiza el siguiente funcional con respecto a la distribución condicional.pag(t|incógnita){\displaystyle p(t|x)}:

infpag(t|incógnita)(I(incógnita;T)βI(T;Y)),{\displaystyle \inf _{p(t|x)}\,\,{\Big (}I(X;T)-\beta I(T;Y){\Big )},}

dóndeI(incógnita;T){\displaystyle I(X;T)}yI(T;Y){\displaystyle I(T;Y)}son la información mutua deincógnita{\displaystyle X}yT{\displaystyle T}y deT{\displaystyle T}yY{\displaystyle Y}, respectivamente, yβ{\displaystyle \beta }es un multiplicador de Lagrange .

Teoría del aprendizaje para el aprendizaje profundo

Se ha demostrado matemáticamente que controlar el cuello de botella de información es una forma de controlar el error de generalización en el aprendizaje profundo. [ 2 ] Es decir, se ha demostrado que el error de generalización escala comoO~(I(incógnita,T)+1norte){\displaystyle {\tilde {O}}\left({\sqrt {\frac {I(X,T)+1}{n}}}\right)}dóndenorte{\displaystyle n}es el número de muestras de entrenamiento,incógnita{\displaystyle X}es la entrada a una red neuronal profunda, yT{\displaystyle T}es la salida de una capa oculta. Este límite de generalización escala con el grado de cuello de botella de información, a diferencia de los otros límites de generalización que escalan con el número de parámetros, la dimensión VC , la complejidad de Rademacher , la estabilidad o la robustez.

transiciones de fase

Teoría de la información del aprendizaje profundo

La teoría del cuello de botella de la información se utiliza recientemente para estudiar las redes neuronales profundas (DNN). [ 3 ] Considereincógnita{\displaystyle X}yY{\displaystyle Y}respectivamente como las capas de entrada y salida de una DNN, y dejemosT{\displaystyle T}ser cualquier capa oculta de la red. Shwartz-Ziv y Tishby propusieron el cuello de botella de información que expresa la compensación entre las medidas de información mutua.I(incógnita,T){\displaystyle I(X,T)}yI(T,Y){\displaystyle I(T,Y)}. En este caso,I(incógnita,T){\displaystyle I(X,T)}yI(T,Y){\displaystyle I(T,Y)}cuantifican respectivamente la cantidad de información que la capa oculta contiene sobre la entrada y la salida. Conjeturaron que el proceso de entrenamiento de una DNN consta de dos fases separadas; 1) una fase de ajuste inicial en la queI(T,Y){\displaystyle I(T,Y)}aumenta, y 2) una fase de compresión posterior en la queI(incógnita,T){\displaystyle I(X,T)}disminuye. Saxe et al. en [ 4 ] rebatieron la afirmación de Shwartz-Ziv y Tishby, [ 3 ] afirmando que este fenómeno de compresión en DNN no es exhaustivo y depende de la función de activación particular . En particular, afirmaron que la compresión no ocurre con funciones de activación ReLU. Shwartz-Ziv y Tishby cuestionaron estas afirmaciones, argumentando que Saxe et al. no habían observado compresión debido a estimaciones débiles de la información mutua. Por otro lado, recientemente Goldfeld et al. han argumentado que la compresión observada es resultado de fenómenos geométricos, y no de fenómenos de la teoría de la información, [ 5 ] una visión que también se ha compartido en. [ 6 ]

cuello de botella variacional

cuello de botella gaussiano

El cuello de botella gaussiano, [ 7 ] es decir, la aplicación del enfoque del cuello de botella de información a variables gaussianas, conduce a soluciones relacionadas con el análisis de correlación canónica . Supongamos queincógnita,Y{\displaystyle X,Y\,}son conjuntamente vectores normales multivariados de media cero con covarianzasΣincógnitaincógnita,ΣYY{\displaystyle \Sigma _{XX},\,\,\Sigma _{YY}}yT{\displaystyle T\,}es una versión comprimida deincógnita{\displaystyle X\,}que debe mantener un valor determinado de información mutua conY{\displaystyle Y\,}Se puede demostrar que el óptimoT{\displaystyle T\,}es un vector normal que consiste en combinaciones lineales de los elementos deincógnita,T=Aincógnita{\displaystyle X,\,\,T=AX\,}donde matrizA{\displaystyle A\,}tiene filas ortogonales.

La matriz de proyecciónA{\displaystyle A\,}de hecho contieneMETRO{\displaystyle M\,}filas seleccionadas de los autovectores izquierdos ponderados de la descomposición en valores singulares de la matriz (generalmente asimétrica)

Ω=Σincógnita|YΣincógnitaincógnita1=IΣincógnitaYΣYY1ΣincógnitaYTΣincógnitaincógnita1.{\displaystyle \Omega =\Sigma _{X|Y}\Sigma _{XX}^{-1}=I-\Sigma _{XY}\Sigma _{YY}^{-1}\Sigma _{XY}^{T}\Sigma _{XX}^{-1}.\,}

Defina la descomposición en valores singulares.

Ω=UΛVT con Λ=Diag(λ1λ2λnorte){\displaystyle \Omega =U\Lambda V^{T}{\text{ with }}\Lambda =\operatorname {Diag} {\big (}\lambda _{1}\leq \lambda _{2}\cdots \lambda _{N}{\big )}\,}

y los valores críticos

βido=λi<1(1λi)1.{\displaystyle \beta _{i}^{C}{\underset {\lambda _{i}<1}{=}}(1-\lambda _{i})^{-1}.\,}

entonces el númeroMETRO{\displaystyle M\,}de autovectores activos en la proyección, u orden de aproximación, viene dado por

βMETRO1do<ββMETROdo{\displaystyle \beta _{M-1}^{C}<\beta \leq \beta _{M}^{C}}

Y finalmente lo conseguimos

A=[w1U1,,wMETROUMETRO]T{\displaystyle A=[w_{1}U_{1},\dots ,w_{M}U_{M}]^{T}}

En el que los pesos vienen dados por

wi=(β(1λi)1)/λiri{\displaystyle w_{i}={\sqrt {\left(\beta (1-\lambda _{i})-1\right)/\lambda _{i}r_{i}}}}

dónderi=UiTΣincógnitaincógnitaUi.{\displaystyle r_{i}=U_{i}^{T}\Sigma _{XX}U_{i}.\,}

La aplicación del cuello de botella de información gaussiano a series temporales (procesos) produce soluciones relacionadas con la codificación predictiva óptima . Este procedimiento es formalmente equivalente al análisis lineal de características lentas. [ 8 ]

Las estructuras temporales óptimas en sistemas dinámicos lineales pueden revelarse en el llamado cuello de botella de información pasado-futuro, una aplicación del método del cuello de botella a datos muestreados no gaussianos. [ 9 ] El concepto, tal como lo tratan Creutzig, Tishby et al., no está exento de complicaciones, ya que el ejercicio consta de dos fases independientes: primero, la estimación de las densidades de probabilidad parentales desconocidas de las cuales se extraen las muestras de datos y, segundo, el uso de estas densidades dentro del marco teórico de la información del cuello de botella.

Estimación de densidad

Dado que el método del cuello de botella se formula en términos probabilísticos en lugar de estadísticos, la densidad de probabilidad subyacente en los puntos de muestreoincógnita=incógnitai{\displaystyle X={x_{i}}\,}debe estimarse. Este es un problema bien conocido con múltiples soluciones descritas por Silverman . [ 10 ] En el método actual, las probabilidades de muestra conjuntas se encuentran mediante el uso de un método de matriz de transición de Markov y esto tiene cierta sinergia matemática con el método del cuello de botella en sí.

La métrica de distancia que aumenta arbitrariamenteF{\displaystyle f\,}entre todos los pares de muestras y la matriz de distancias esdi,j=F(|incógnitaiincógnitaj|){\displaystyle d_{i,j}=f{\Big (}{\Big |}x_{i}-x_{j}{\Big |}{\Big )}}. Luego, probabilidades de transición entre pares de muestrasPAGi,j=exp(λdi,j){\displaystyle P_{i,j}=\exp(-\lambda d_{i,j})\,}para algunosλ>0{\displaystyle \lambda >0\,}debe calcularse. Tratando las muestras como estados y una versión normalizada dePAG{\displaystyle P\,}como una matriz de probabilidad de transición de estado de Markov, el vector de probabilidades de los 'estados' despuést{\displaystyle t\,}pasos, condicionados al estado inicialpag(0){\displaystyle p(0)\,}, espag(t)=PAGtpag(0){\displaystyle p(t)=P^{t}p(0)\,}El vector de probabilidad de equilibriopag(){\displaystyle p(\infty )\,}dado, de la forma habitual, por el vector propio dominante de la matrizPAG{\displaystyle P\,}que es independiente del vector de inicializaciónpag(0){\displaystyle p(0)\,}Este método de transición de Markov establece una probabilidad en los puntos de muestreo que, según se afirma, es proporcional a las densidades de probabilidad en esos puntos.

Otras interpretaciones del uso de los valores propios de la matriz de distanciasd{\displaystyle d\,}se discuten en Density Estimation for Statistics and Data Analysis de Silverman . [ 10 ]

Clústeres

En el siguiente ejemplo de agrupamiento suave, el vector de referenciaY{\displaystyle Y\,}contiene categorías de muestra y la probabilidad conjuntapag(incógnita,Y){\displaystyle p(X,Y)\,}Se supone conocido. Un cúmulo suavedok{\displaystyle c_{k}\,}se define por su distribución de probabilidad sobre las muestras de datosincógnitai:pag(dok|incógnitai){\displaystyle x_{i}:\,\,\,p(c_{k}|x_{i})}Tishby et al. presentaron [ 1 ] el siguiente conjunto iterativo de ecuaciones para determinar los clústeres, que en última instancia son una generalización del algoritmo de Blahut-Arimoto , desarrollado en la teoría de distorsión de tasas . La aplicación de este tipo de algoritmo en redes neuronales parece tener su origen en argumentos de entropía que surgen en la aplicación de distribuciones de Gibbs en el recocido determinista. [ 11 ] [ 12 ]

{pag(do|incógnita)=Kpag(do)exp(βDKL[pag(y|incógnita)||pag(y|do)])pag(y|do)=incógnitapag(y|incógnita)pag(do|incógnita)pag(incógnita)/pag(do)pag(do)=incógnitapag(do|incógnita)pag(incógnita){\displaystyle {\begin{cases}p(c|x)=Kp(c)\exp {\Big (}-\beta \,D^{KL}{\Big [}p(y|x)\,||\,p(y|c){\Big ]}{\Big )}\\p(y|c)=\textstyle \sum _{x}p(y|x)p(c|x)p(x){\big /}p(c)\\p(c)=\textstyle \sum _{x}p(c|x)p(x)\\\end{cases}}}

La función de cada línea de la iteración se expande como

Línea 1: Este es un conjunto de probabilidades condicionales con valores matriciales.

Ai,j=pag(doi|incógnitaj)=Kpag(doi)exp(βDKL[pag(y|incógnitaj)||pag(y|doi)]){\displaystyle A_{i,j}=p(c_{i}|x_{j})=Kp(c_{i})\exp {\Big (}-\beta \,D^{KL}{\Big [}p(y|x_{j})\,||\,p(y|c_{i}){\Big ]}{\Big )}}

La divergencia de Kullback-LeiblerDKL{\displaystyle D^{KL}\,}entre elY{\displaystyle Y\,}vectores generados por los datos de muestraincógnita{\displaystyle x\,}y aquellos generados por su proxy de información reducidado{\displaystyle c\,}Se aplica para evaluar la fidelidad del vector comprimido con respecto a los datos de referencia (o categóricos).Y{\displaystyle Y\,}de acuerdo con la ecuación fundamental del cuello de botella.DKL(a||b){\displaystyle D^{KL}(a||b)\,}es la divergencia de Kullback-Leibler entre distribucionesa,b{\displaystyle a,b\,}

DKL(a||b)=ipag(ai)registro(pag(ai)pag(bi)){\displaystyle D^{KL}(a||b)=\sum _{i}p(a_{i})\log {\Big (}{\frac {p(a_{i})}{p(b_{i})}}{\Big )}}

yK{\displaystyle K\,}es una normalización escalar. La ponderación mediante el exponente negativo de la distancia implica que las probabilidades de clúster previas se ponderan a la baja en la línea 1 cuando la divergencia de Kullback-Leibler es grande, por lo que los clústeres exitosos aumentan su probabilidad mientras que los no exitosos disminuyen.

Línea 2: Segundo conjunto de probabilidades condicionales con valores matriciales. Por definición

pag(yi|dok)=jpag(yi|incógnitaj)pag(incógnitaj|dok)=jpag(yi|incógnitaj)pag(incógnitaj,dok)/pag(dok)=jpag(yi|incógnitaj)pag(dok|incógnitaj)pag(incógnitaj)/pag(dok){\displaystyle {\begin{aligned}p(y_{i}|c_{k})&=\sum _{j}p(y_{i}|x_{j})p(x_{j}|c_{k})\\&=\sum _{j}p(y_{i}|x_{j})p(x_{j},c_{k}){\big /}p(c_{k})\\&=\sum _{j}p(y_{i}|x_{j})p(c_{k}|x_{j})p(x_{j}){\big /}p(c_{k})\\\end{aligned}}}

donde las identidades de Bayespag(a,b)=pag(a|b)pag(b)=pag(b|a)pag(a){\displaystyle p(a,b)=p(a|b)p(b)=p(b|a)p(a)\,}se utilizan.

Línea 3: esta línea encuentra la distribución marginal de los clústeres.do{\displaystyle c\,}

pag(doi)=jpag(doi,incógnitaj)=jpag(doi|incógnitaj)pag(incógnitaj){\displaystyle {\begin{aligned}p(c_{i})&=\sum _{j}p(c_{i},x_{j})&=\sum _{j}p(c_{i}|x_{j})p(x_{j})\end{aligned}}}

Este es un resultado estándar.

Otros datos de entrada para el algoritmo son la distribución marginal de la muestra.pag(incógnita){\displaystyle p(x)\,}que ya ha sido determinado por el vector propio dominante dePAG{\displaystyle P\,}y la función de divergencia de Kullback-Leibler con valores matriciales

Di,jKL=DKL[pag(y|incógnitaj)||pag(y|doi)]){\displaystyle D_{i,j}^{KL}=D^{KL}{\Big [}p(y|x_{j})\,||\,p(y|c_{i}){\Big ]}{\Big )}}

derivado de los espaciamientos de las muestras y las probabilidades de transición.

La matrizpag(yi|doj){\displaystyle p(y_{i}|c_{j})\,}puede inicializarse aleatoriamente o con una suposición razonable, mientras que la matrizpag(doi|incógnitaj){\displaystyle p(c_{i}|x_{j})\,}No necesita valores previos. Aunque el algoritmo converge, pueden existir múltiples mínimos que deberán resolverse. [ 13 ]

Definición de los contornos de decisión

Para categorizar una nueva muestraincógnita{\displaystyle x'\,}externo al conjunto de entrenamientoincógnita{\displaystyle X\,}, la métrica de distancia anterior encuentra las probabilidades de transición entreincógnita{\displaystyle x'\,}y todas las muestras enincógnita:{\displaystyle X:\,\,},pag~(incógnitai)=pag(incógnitai|incógnita)=Kexp(λF(|incógnitaiincógnita|)){\displaystyle {\tilde {p}}(x_{i})=p(x_{i}|x')=\mathrm {K} \exp {\Big (}-\lambda f{\big (}{\Big |}x_{i}-x'{\Big |}{\big )}{\Big )}}conK{\displaystyle \mathrm {K} \,}una normalización. En segundo lugar, aplique las dos últimas líneas del algoritmo de 3 líneas para obtener las probabilidades de clúster y de categoría condicional.

pag~(doi)=pag(doi|incógnita)=jpag(doi|incógnitaj)pag(incógnitaj|incógnita)=jpag(doi|incógnitaj)pag~(incógnitaj)pag(yi|doj)=kpag(yi|incógnitak)pag(doj|incógnitak)pag(incógnitak|incógnita)/pag(doj|incógnita)=kpag(yi|incógnitak)pag(doj|incógnitak)pag~(incógnitak)/pag~(doj){\displaystyle {\begin{aligned}&{\tilde {p}}(c_{i})=p(c_{i}|x')=\sum _{j}p(c_{i}|x_{j})p(x_{j}|x')=\sum _{j}p(c_{i}|x_{j}){\tilde {p}}(x_{j})\\&p(y_{i}|c_{j})=\sum _{k}p(y_{i}|x_{k})p(c_{j}|x_{k})p(x_{k}|x')/p(c_{j}|x')=\sum _{k}p(y_{i}|x_{k})p(c_{j}|x_{k}){\tilde {p}}(x_{k})/{\tilde {p}}(c_{j})\\\end{aligned}}}

Finalmente

pag(yi|incógnita)=jpag(yi|doj)pag(doj|incógnita))=jpag(yi|doj)pag~(doj){\displaystyle p(y_{i}|x')=\sum _{j}p(y_{i}|c_{j})p(c_{j}|x'))=\sum _{j}p(y_{i}|c_{j}){\tilde {p}}(c_{j})\,}

Parámetroβ{\displaystyle \beta \,}debe mantenerse bajo estrecha supervisión ya que, a medida que aumenta desde cero, un número creciente de características, en el espacio de probabilidad de la categoría , se enfocan en ciertos umbrales críticos.

Un ejemplo

El siguiente caso examina la agrupación en un multiplicador de cuatro cuadrantes con entradas aleatorias.,v{\displaystyle u,v\,}y dos categorías de resultados,±1{\displaystyle \pm 1\,}, generado pory=firmar(v){\displaystyle y=\operatorname {sign} (uv)\,}Esta función tiene dos grupos espacialmente separados para cada categoría y, por lo tanto, demuestra que el método puede manejar este tipo de distribuciones.

Se toman 20 muestras, distribuidas uniformemente en la plaza.[1,1]2{\displaystyle [-1,1]^{2}\,}El número de clústeres utilizados más allá del número de categorías, dos en este caso, tiene poco efecto en el rendimiento y los resultados se muestran para dos clústeres utilizando parámetrosλ=3,β=2.5{\displaystyle \lambda =3,\,\beta =2.5}.

La función de distancia esdi,j=|incógnitaiincógnitaj|2{\displaystyle d_{i,j}={\Big |}x_{i}-x_{j}{\Big |}^{2}}dóndeincógnitai=(i,vi)T{\displaystyle x_{i}=(u_{i},v_{i})^{T}\,}mientras que la distribución condicionalpag(y|incógnita){\displaystyle p(y|x)\,}es una matriz de 2  × 20 

PAGr(yi=1)=1 si firmar(ivi)=1PAGr(yi=1)=1 si firmar(ivi)=1{\displaystyle {\begin{aligned}&Pr(y_{i}=1)=1{\text{ if }}\operatorname {sign} (u_{i}v_{i})=1\,\\&Pr(y_{i}=-1)=1{\text{ if }}\operatorname {sign} (u_{i}v_{i})=-1\,\end{aligned}}}

y cero en ningún otro lugar.

La suma en la línea 2 incorpora solo dos valores que representan los valores de entrenamiento de +1 o 1, pero no obstante funciona bien. La figura muestra las ubicaciones de las veinte muestras con '0' representando Y = 1 y 'x' representando Y = 1. Se muestra el contorno en el nivel de razón de verosimilitud unitaria,

L=Pr(1)Pr(1)=1{\displaystyle L={\frac {\Pr(1)}{\Pr(-1)}}=1}

como una nueva muestraincógnita{\displaystyle x'\,}se escanea sobre el cuadrado. Teóricamente, el contorno debería alinearse con el=0{\displaystyle u=0\,}yv=0{\displaystyle v=0\,}coordenadas, pero para un número tan pequeño de muestras, en cambio, han seguido las agrupaciones espurias de los puntos de muestra.

contornos de decisión

Analogías entre redes neuronales y lógica difusa

Este algoritmo es algo análogo a una red neuronal con una sola capa oculta. Los nodos internos están representados por los clústeres.doj{\displaystyle c_{j}\,}y la primera y la segunda capa de pesos de la red son las probabilidades condicionalespag(doj|incógnitai){\displaystyle p(c_{j}|x_{i})\,}ypag(yk|doj){\displaystyle p(y_{k}|c_{j})\,}respectivamente. Sin embargo, a diferencia de una red neuronal estándar, el algoritmo se basa completamente en probabilidades como entradas en lugar de los valores de muestra en sí, mientras que los valores internos y de salida son distribuciones de densidad de probabilidad condicionales . Las funciones no lineales se encapsulan en la métrica de distancia.F(.){\displaystyle f(.)\,}(o funciones de influencia/funciones de base radial ) y probabilidades de transición en lugar de funciones sigmoide .

El algoritmo de tres líneas de Blahut-Arimoto converge rápidamente, a menudo en decenas de iteraciones, y variandoβ{\displaystyle \beta \,},λ{\displaystyle \lambda \,}yF{\displaystyle f\,}y la cardinalidad de los clústeres, se pueden lograr varios niveles de enfoque en las características.

Definición de agrupamiento suave estadísticopag(doi|incógnitaj){\displaystyle p(c_{i}|x_{j})\,}tiene cierta superposición con el concepto de pertenencia difusa verbal de la lógica difusa .

Extensiones

Una extensión interesante es el caso del cuello de botella de información con información lateral. [ 14 ] Aquí se maximiza la información sobre una variable objetivo y se minimiza sobre otra, aprendiendo una representación que es informativa sobre aspectos seleccionados de los datos. Formalmente

minpag(t|incógnita)I(incógnita;T)β+I(T;Y+)+βI(T;Y){\displaystyle \min _{p(t|x)}\,\,I(X;T)-\beta ^{+}I(T;Y^{+})+\beta ^{-}I(T;Y^{-})}

Bibliografía

  • Weiss, Y. (1999), "Segmentación mediante vectores propios: una visión unificadora", Actas de la Conferencia Internacional IEEE sobre Visión por Computadora (PDF) , págs. 975–982 
  • P. Harremoës y N. Tishby «El cuello de botella de la información revisitado o cómo elegir una buena medida de distorsión». En las actas del Simposio Internacional sobre Teoría de la Información (ISIT) 2007.

Referencias

  1. 1 2 3 Tishby, Naftali ; Pereira, Fernando C.; Bialek, William (septiembre de 1999). El método del cuello de botella de la información (PDF) . La 37.ª Conferencia anual de Allerton sobre comunicación, control y computación. págs. 368–377 . 
  2. Kenji Kawaguchi, Zhun Deng, Xu Ji, Jiaoyang Huang. "¿Cómo ayuda el cuello de botella de la información al aprendizaje profundo?" Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático, PMLR 202:16049-16096, 2023.
  3. 1 2 Shwartz-Ziv, Ravid; Tishby, Naftali (2017). "Abriendo la caja negra de las redes neuronales profundas a través de la información". arXiv : 1703.00810 [ cs.LG ].
  4. Andrew M, Saxe; et al. (2018). "Sobre la teoría del cuello de botella de información del aprendizaje profundo" . ICLR 2018 Conference Blind Submission . 2019 (12): 124020. Bibcode : 2019JSMTE..12.4020S . doi : 10.1088/1742-5468/ab3985 . S2CID 49584497 .  
  5. Goldfeld, Ziv; et al. (2019). "Estimación del flujo de información en redes neuronales profundas" . Icml 2019 : 2299–2308 . arXiv : 1810.05728 . 
  6. Geiger, Bernhard C. (2022). "Sobre los análisis del plano de información de los clasificadores de redes neuronales: una revisión". IEEE Transactions on Neural Networks and Learning Systems . 33 (12): 7039– 7051. arXiv : 2003.09671 . Bibcode : 2022ITNNL..33.7039G . doi : 10.1109/TNNLS.2021.3089037 . PMID 34191733. S2CID 214611728 .  
  7. Chechik, Gal; Globerson, Amir; Tishby, Naftali; Weiss, Yair (1 de enero de 2005). Dayan, Peter (ed.). "Cuello de botella de información para variables gaussianas" (PDF) . Journal of Machine Learning Research (6) (publicado el 1 de mayo de 2005): 165–188 .
  8. Creutzig, Felix ; Sprekeler, Henning (17 de diciembre de 2007). "Codificación predictiva y el principio de lentitud: un enfoque basado en la teoría de la información". Neural Computation . 20 (4): 1026–1041 . CiteSeerX 10.1.1.169.6917 . doi : 10.1162/neco.2008.01-07-455 . ISSN 0899-7667 . PMID 18085988. S2CID 2138951 .    
  9. Creutzig, Felix; Globerson, Amir; Tishby, Naftali (27 de abril de 2009). "Cuello de botella de información pasado-futuro en sistemas dinámicos". Physical Review E. 79 ( 4) 041925. Bibcode : 2009PhRvE..79d1925C . doi : 10.1103/PhysRevE.79.041925 . PMID 19518274 . 
  10. 1 2 Silverman, Bernie (1986). Estimación de densidad para estadística y análisis de datos . Monografías sobre estadística y probabilidad aplicada. Chapman & Hall. Bibcode : 1986desd.book.....S . ISBN 978-0-412-24620-3.
  11. Slonim, Noam; Tishby, Naftali (1 de enero de 2000). "Agrupación de documentos mediante clústeres de palabras a través del método del cuello de botella de la información". Actas de la 23.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información . SIGIR '00. Nueva York, NY, EE. UU.: ACM. págs. 208–215 . CiteSeerX 10.1.1.21.3062 . doi : 10.1145/345508.345578 . ISBN   978-1-58113-226-7. S2CID 1373541 . 
  12. DJ Miller, AV Rao, K. Rose, A. Gersho: "Un algoritmo de aprendizaje basado en la teoría de la información para la clasificación de redes neuronales". NIPS 1995: págs. 591–597
  13. Tishby, Naftali ; Slonim, N. Agrupamiento de datos mediante relajación markoviana y el método del cuello de botella de información (PDF) . Neural Information Processing Systems (NIPS) 2000. pp. 640–646 . 
  14. Chechik, Gal; Tishby, Naftali (2002). "Extracción de estructuras relevantes con información lateral" (PDF) . Avances en sistemas de procesamiento de información neuronal : 857–864 .