Articulo de referencia

Inferencia algorítmica

La inferencia algorítmica reúne los nuevos avances en los métodos de inferencia estadística, posibilitados por los potentes dispositivos informáticos ampliamente disponibles par...

La inferencia algorítmica reúne los nuevos avances en los métodos de inferencia estadística, posibilitados por los potentes dispositivos informáticos ampliamente disponibles para cualquier analista de datos. Los pilares fundamentales de este campo son la teoría del aprendizaje computacional , la computación granular , la bioinformática y, desde hace mucho tiempo, la probabilidad estructural ( Fraser, 1966 ) . El enfoque principal se centra en los algoritmos que calculan las estadísticas que sustentan el estudio de un fenómeno aleatorio, junto con la cantidad de datos que deben procesar para producir resultados fiables. Esto desplaza el interés de los matemáticos del estudio de las leyes de distribución a las propiedades funcionales de las estadísticas , y el interés de los informáticos de los algoritmos para procesar datos a la información que procesan.

El problema de inferencia paramétrica de Fisher

En lo que respecta a la identificación de los parámetros de una ley de distribución, el lector experimentado recordará las largas disputas de mediados del siglo XX sobre la interpretación de su variabilidad en términos de distribución fiducial ( Fisher 1956 ) , probabilidades estructurales ( Fraser 1966 ) , probabilidades a priori/a posteriori ( Ramsey 1925 ) , etc. Desde una perspectiva epistemológica , esto conllevó una disputa paralela sobre la naturaleza de la probabilidad : ¿es una característica física de los fenómenos que se describe mediante variables aleatorias o una forma de sintetizar datos sobre un fenómeno? Optando por lo segundo, Fisher define una ley de distribución fiducial de los parámetros de una variable aleatoria dada, que deduce de una muestra de sus especificaciones. Con esta ley calcula, por ejemplo, «la probabilidad de que μ (media de una variable gaussiana ) sea menor que cualquier valor asignado, o la probabilidad de que se encuentre entre cualquier valor asignado, o, en resumen, su distribución de probabilidad, a la luz de la muestra observada».

La solución clásica

Fisher luchó arduamente para defender la diferencia y superioridad de su noción de distribución de parámetros en comparación con nociones análogas, como la distribución posterior de Bayes , la probabilidad constructiva de Fraser y los intervalos de confianza de Neyman . Durante medio siglo, los intervalos de confianza de Neyman prevalecieron para todos los propósitos prácticos, atribuyendo su validez a la naturaleza fenomenológica de la probabilidad. Desde esta perspectiva, cuando se trabaja con una variable gaussiana, su media μ está fijada por las características físicas del fenómeno que se observa, donde las observaciones son operadores aleatorios, por lo que los valores observados son especificaciones de una muestra aleatoria . Debido a su aleatoriedad, se pueden calcular a partir de la muestra intervalos específicos que contienen la μ fija con una probabilidad dada que se denota como confianza .

Ejemplo

Sea X una variable gaussiana [ 1 ] con parámetrosμ{\displaystyle \mu }yσ2{\displaystyle \sigma ^{2}}y{incógnita1,,incógnitametro}{\displaystyle \{X_{1},\ldots ,X_{m}\}}una muestra extraída de ella. Trabajar con estadística

Sμ=i=1metroincógnitai{\displaystyle S_{\mu }=\sum _{i=1}^{m}X_{i}}

y

Sσ2=i=1metro(incógnitaiincógnita¯)2, dónde incógnita¯=Sμmetro{\displaystyle S_{\sigma ^{2}}=\sum _{i=1}^{m}(X_{i}-{\overline {X}})^{2},{\text{ donde }}{\overline {X}}={\frac {S_{\mu }}{m}}}

es la media de la muestra, reconocemos que

T=SμmetroμSσ2metro1metro=incógnita¯μSσ2/(metro(metro1)){\displaystyle T={\frac {S_{\mu }-m\mu }{\sqrt {S_{\sigma ^{2}}}}}{\sqrt {\frac {m-1}{m}}}={\frac {{\overline {X}}-\mu }{\sqrt {S_{\sigma ^{2}}/(m(m-1))}}}}

sigue una distribución t de Student ( Wilks 1962 ) con parámetro (grados de libertad) m  1, de modo que

FT(t)=Γ(metro/2)Γ((metro1)/2)1π(metro1)(1+t2metro1)metro/2.{\displaystyle f_{T}(t)={\frac {\Gamma (m/2)}{\Gamma ((m-1)/2)}}{\frac {1}{\sqrt {\pi (m-1)}}}\left(1+{\frac {t^{2}}{m-1}}\right)^{m/2}.}

Medir T entre dos cuantiles e invertir su expresión en función deμ{\displaystyle \mu }usted obtiene intervalos de confianza paraμ{\displaystyle \mu }.

Con la especificación de muestra:

incógnita={7.14,6.3,3.9,6.46,0,2,2,94,4.14,4.69,6.02,1,58}{\displaystyle \mathbf {x} =\{7.14,6.3,3.9,6.46,0.2,2.94,4.14,4.69,6.02,1.58\}}

teniendo un tamaño m = 10, calculas las estadísticassμ=43,37{\displaystyle s_{\mu}=43,37}ysσ2=46.07{\displaystyle s_{\sigma ^{2}}=46.07}y obtener un intervalo de confianza de 0,90 paraμ{\displaystyle \mu }con extremos (3,03,  5,65).

Inferir funciones con la ayuda de una computadora

Desde una perspectiva de modelado, toda la disputa parece un dilema del huevo y la gallina: o bien datos fijos desde el principio y distribución de probabilidad de sus propiedades como consecuencia, o bien propiedades fijas desde el principio y distribución de probabilidad de los datos observados como corolario. La solución clásica tiene una ventaja y una desventaja. La primera era apreciada particularmente cuando todavía se hacían cálculos con papel y lápiz. En sí misma, la tarea de calcular un intervalo de confianza de Neyman para el parámetro fijo θ es difícil: no se conoce θ, pero se busca disponer a su alrededor un intervalo con una probabilidad de fallo posiblemente muy baja. La solución analítica es válida para un número muy limitado de casos teóricos. Por el contrario, una gran variedad de instancias pueden resolverse rápidamente de forma aproximada mediante el teorema del límite central en términos de intervalo de confianza alrededor de una distribución gaussiana; esa es la ventaja. La desventaja es que el teorema del límite central es aplicable cuando el tamaño de la muestra es suficientemente grande. Por lo tanto, es cada vez menos aplicable con la muestra involucrada en instancias de inferencia modernas. El problema no radica en el tamaño de la muestra en sí. Más bien, este tamaño no es suficientemente grande debido a la complejidad del problema de inferencia.

Con la disponibilidad de grandes recursos informáticos, los científicos reorientaron su enfoque de la inferencia de parámetros aislados a la inferencia de funciones complejas, es decir, conjuntos de parámetros altamente anidados que identifican funciones. En estos casos, hablamos del aprendizaje de funciones (por ejemplo, en términos de regresión , sistemas neurodifusos o aprendizaje computacional ) a partir de muestras altamente informativas. Un primer efecto de tener una estructura compleja que vincula los datos es la reducción del número de grados de libertad de la muestra , es decir, la eliminación de una parte de los puntos de la muestra, de modo que el tamaño efectivo de la muestra a considerar en el teorema del límite central es demasiado pequeño. Centrándonos en el tamaño de la muestra que garantiza un error de aprendizaje limitado con un nivel de confianza dado , la consecuencia es que el límite inferior de este tamaño aumenta con índices de complejidad como la dimensión VC o el detalle de la clase a la que pertenece la función que queremos aprender.

Ejemplo

Una muestra de 1000 bits independientes es suficiente para garantizar un error absoluto de como máximo 0,081 en la estimación del parámetro p de la variable de Bernoulli subyacente con una confianza de al menos 0,99. El mismo tamaño no puede garantizar un umbral inferior a 0,088 con la misma confianza de 0,99 cuando el error se identifica con la probabilidad de que un hombre de 20 años que vive en Nueva York no se ajuste a los rangos de altura, peso y cintura observados en 1000 habitantes de la Gran Manzana. La falta de precisión se produce porque tanto la dimensión VC como el detalle de la clase de paralelepípedos, entre los que se encuentra el observado en los rangos de los 1000 habitantes, son iguales a 6.

El problema de inversión general resuelve la cuestión de Fisher.

Con muestras insuficientemente grandes, el enfoque de muestra fija con propiedades aleatorias sugiere procedimientos de inferencia en tres pasos:

  1. Mecanismo de muestreo . Consta de un par.(Z,gramoθ){\displaystyle (Z,g_{\boldsymbol {\theta }})}donde la semilla Z es una variable aleatoria sin parámetros desconocidos, mientras que la función explicativagramoθ{\displaystyle g_{\boldsymbol {\theta }}}es una función que mapea muestras de Z a muestras de la variable aleatoria X que nos interesa. El vector de parámetrosθ{\displaystyle {\boldsymbol {\theta }}}es una especificación del parámetro aleatorioΘ{\displaystyle \mathbf {\Theta } }Sus componentes son los parámetros de la ley de distribución X. El Teorema de la Transformación Integral garantiza la existencia de dicho mecanismo para cada X (escalar o vectorial) cuando la semilla coincide con la variable aleatoria U distribuida uniformemente en[0,1]{\displaystyle [0,1]}.

    Ejemplo  : Para X que sigue una distribución de Pareto con parámetros a y k , es decir

    Fincógnita(incógnita)=(1kincógnitaa)I[k,)(incógnita),{\displaystyle F_{X}(x)=\left(1-{\frac {k}{x}}^{a}\right)I_{[k,\infty )}(x),} un mecanismo de muestreo(U,gramo(a,k)){\displaystyle (U,g_{(a,k)})}para X con semilla U se lee: gramo(a,k)()=k(1)1a,{\displaystyle g_{(a,k)}(u)=k(1-u)^{-{\frac {1}{a}}},}

    o, equivalentemente,gramo(a,k)()=k1/a.{\displaystyle g_{(a,k)}(u)=ku^{-1/a}.}
  2. Ecuación maestra . La conexión real entre el modelo y los datos observados se expresa en términos de un conjunto de relaciones entre las estadísticas de los datos y los parámetros desconocidos que surgen como corolario de los mecanismos de muestreo. Llamamos a estas relacionesecuaciones maestras. El enfoque gira en torno a la estadística.s=h(incógnita1,,incógnitametro)=h(gramoθ(z1),,gramoθ(zmetro)){\displaystyle s=h(x_{1},\ldots ,x_{m})=h(g_{\boldsymbol {\theta }}(z_{1}),\ldots ,g_{\boldsymbol {\theta }}(z_{m}))}La forma general de una ecuación maestra es: s=ρ(θ;z1,,zmetro).{\displaystyle s=\rho ({\boldsymbol {\theta }};z_{1},\ldots ,z_{m}).} Con estas relaciones podemos inspeccionar los valores de los parámetros que podrían haber generado una muestra con la estadística observada a partir de una configuración particular de las semillas que representan la semilla de la muestra. Por lo tanto, a la población de semillas de muestra le corresponde una población de parámetros. Para asegurar que esta población tenga propiedades limpias, basta con extraer aleatoriamente los valores de las semillas e incluir estadísticas suficientes o, simplemente, estadísticas bien comportadas con respecto a los parámetros, en las ecuaciones maestras. Por ejemplo, la estadísticas1=i=1metroregistroincógnitai{\textstyle s_{1}=\sum _{i=1}^{m}\log x_{i}}ys2=mini=1,,metro{incógnitai}{\textstyle s_{2}=\min _{i=1,\ldots ,m}\{x_{i}\}}demostrar ser suficiente para los parámetros a y k de una variable aleatoria de Pareto X. Gracias al mecanismo de muestreo (forma equivalente del)gramo(a,k){\displaystyle g_{(a,k)}}podemos leerlos como s1=metroregistrok+1ai=1metroregistroi{\displaystyle s_{1}=m\log k+{\frac {1}{a}}\sum _{i=1}^{m}\log u_{i}}s2=mini=1,,metro{ki1a},{\displaystyle s_{2}=\min _{i=1,\ldots ,m}\{ku_{i}^{-{\frac {1}{a}}}\},} respectivamente.
  3. Población de parámetros . Una vez fijado un conjunto de ecuaciones maestras, puede asignar semillas de muestra a parámetros, ya sea numéricamente mediante un remuestreo poblacional o analíticamente mediante un argumento de torsión . Por lo tanto, a partir de una población de semillas, se obtiene una población de parámetros.

    Ejemplo. A partir de la ecuación maestra anterior podemos extraer un par de parámetros,(a,k){\displaystyle (a,k)}, compatible con la muestra observada resolviendo el siguiente sistema de ecuaciones:

    a=registroimetroregistromin{i}s1metroregistros2.{\displaystyle a={\frac {\sum \log u_{i}-m\log \min\{u_{i}\}}{s_{1}-m\log s_{2}}}.}k=exp(as1registroimetroa){\displaystyle k=\exp \left({\frac {as_{1}-\sum \log u_{i}}{ma}}\right)}

    dóndes1{\displaystyle s_{1}}ys2{\displaystyle s_{2}}son las estadísticas observadas y1,,metro{\displaystyle u_{1},\ldots ,u_{m}}un conjunto de semillas uniformes. Al transferir a los parámetros la probabilidad (densidad) que afecta a las semillas, se obtiene la ley de distribución de los parámetros aleatorios A y K compatible con las estadísticas observadas.

    La compatibilidad denota parámetros de poblaciones compatibles, es decir, de poblaciones que podrían haber generado una muestra que diera lugar a las estadísticas observadas. Esta noción se puede formalizar de la siguiente manera:

Definición

Para una variable aleatoria y una muestra extraída de ella,Una distribución compatible es una distribución que tiene el mismo mecanismo de muestreo.METROincógnita=(Z,gramoθ){\displaystyle {\mathcal {M}}_{X}=(Z,g_{\boldsymbol {\theta }})}de X con un valorθ{\displaystyle {\boldsymbol {\theta }}}del parámetro aleatorioΘ{\displaystyle \mathbf {\Theta } }derivado de una ecuación maestra basada en una estadística s bien comportada .

Ejemplo

Función de distribución acumulativa empírica conjunta de parámetros(A,K){\displaystyle (A,K)}de una variable aleatoria de Pareto.
Función de distribución acumulativa de la media M de una variable aleatoria gaussiana.

Puede encontrar la ley de distribución de los parámetros de Pareto A  y K  como un ejemplo de implementación del método bootstrap de población  , como se muestra en la figura de la izquierda.

Al implementar el método del argumento de torsión  , se obtiene la ley de distribución.FMETRO(μ){\displaystyle F_{M}(\mu )} de la media M  de una variable gaussiana X  sobre la base de la estadísticasMETRO=i=1metroincógnitai{\textstyle s_{M}=\sum _{i=1}^{m}x_{i}} cuandoΣ2{\displaystyle \Sigma ^{2}} se sabe que es igual aσ2{\displaystyle \sigma ^{2}} ( Apoloni, Malchiodi y Gaito 2006 ) . Su expresión es:

FMETRO(μ)=Φ(metroμsMETROσmetro),{\displaystyle F_{M}(\mu )=\Phi {\left({\frac {m\mu -s_{M}}{\sigma {\sqrt {m}}}}\right)},}

mostrado en la figura de la derecha, dondeΦ{\displaystyle \Phi }es la función de distribución acumulativa de una distribución normal estándar .

Extremos superior (curva púrpura) e inferior (curva azul) de un intervalo de confianza del 90% de la media M de una variable aleatoria gaussiana para un valor fijoσ{\displaystyle \sigma }y diferentes valores del estadístico s m .

Calcular un intervalo de confianza  para M  dada su función de distribución es sencillo: solo necesitamos encontrar dos cuantiles (por ejemploδ/2{\displaystyle \delta /2} y1δ/2{\displaystyle 1-\delta /2} cuantiles en caso de que estemos interesados ​​en un intervalo de confianza de nivel δ simétrico en las probabilidades de la cola) como se indica a la izquierda en el diagrama que muestra el comportamiento de los dos límites para diferentes valores del estadístico s m .

El talón de Aquiles del enfoque de Fisher reside en la distribución conjunta de más de un parámetro, por ejemplo, la media y la varianza de una distribución gaussiana. Por el contrario, con el último enfoque (y los métodos mencionados anteriormente: bootstrap de población y argumento de torsión ) podemos aprender la distribución conjunta de muchos parámetros. Por ejemplo, centrándonos en la distribución de dos o más parámetros, en las figuras siguientes informamos de dos regiones de confianza donde la función a aprender cae con una confianza del 90%. La primera se refiere a la probabilidad con la que una máquina de vectores de soporte extendida atribuye una etiqueta binaria 1 a los puntos de la(incógnita,y){\displaystyle (x,y)}plano. Las dos superficies se dibujan a partir de un conjunto de puntos de muestra etiquetados según una ley de distribución específica ( Apolloni et al. 2008 ) . Esta última se refiere a la región de confianza de la tasa de riesgo de recurrencia del cáncer de mama calculada a partir de una muestra censurada ( Apolloni, Malchiodi y Gaito 2006 ) .

Notas

  1. Por defecto, las letras mayúsculas (como U , X ) denotarán variables aleatorias y las letras minúsculas ( u , x ) sus especificaciones correspondientes.

Referencias

  • Fraser, DAS (1966), "Probabilidad estructural y generalización", Biometrika , 53 (1/2): 1–9 , doi : 10.2307/2334048 , JSTOR 2334048 . 
  • Fisher, MA (1956), Métodos estadísticos e inferencia científica , Edimburgo y Londres: Oliver and Boyd
  • Apolloni, B.; Malchiodi, D.; Gaito, S. (2006), Inferencia algorítmica en aprendizaje automático , Serie internacional sobre inteligencia avanzada, vol.  5 (2.ª  ed.), Adelaida: Magill, Advanced Knowledge International
  • Apolloni, B.; Bassis, S.; Malchiodi, D.; Witold, P. (2008), El enigma de la computación granular , Estudios en inteligencia computacional, vol.  138, Berlín: Springer, ISBN 9783540798637
  • Ramsey, FP (1925), "Los fundamentos de las matemáticas", Actas de la Sociedad Matemática de Londres : 338–384 , doi : 10.1112/plms/s2-25.1.338 .
  • Wilks, SS (1962), Estadística matemática , Publicaciones Wiley en estadística, Nueva York: John Wiley