La inferencia algorítmica reúne los nuevos avances en los métodos de inferencia estadística, posibilitados por los potentes dispositivos informáticos ampliamente disponibles para cualquier analista de datos. Los pilares fundamentales de este campo son la teoría del aprendizaje computacional , la computación granular , la bioinformática y, desde hace mucho tiempo, la probabilidad estructural ( Fraser, 1966 ) . El enfoque principal se centra en los algoritmos que calculan las estadísticas que sustentan el estudio de un fenómeno aleatorio, junto con la cantidad de datos que deben procesar para producir resultados fiables. Esto desplaza el interés de los matemáticos del estudio de las leyes de distribución a las propiedades funcionales de las estadísticas , y el interés de los informáticos de los algoritmos para procesar datos a la información que procesan.
El problema de inferencia paramétrica de Fisher
En lo que respecta a la identificación de los parámetros de una ley de distribución, el lector experimentado recordará las largas disputas de mediados del siglo XX sobre la interpretación de su variabilidad en términos de distribución fiducial ( Fisher 1956 ) , probabilidades estructurales ( Fraser 1966 ) , probabilidades a priori/a posteriori ( Ramsey 1925 ) , etc. Desde una perspectiva epistemológica , esto conllevó una disputa paralela sobre la naturaleza de la probabilidad : ¿es una característica física de los fenómenos que se describe mediante variables aleatorias o una forma de sintetizar datos sobre un fenómeno? Optando por lo segundo, Fisher define una ley de distribución fiducial de los parámetros de una variable aleatoria dada, que deduce de una muestra de sus especificaciones. Con esta ley calcula, por ejemplo, «la probabilidad de que μ (media de una variable gaussiana ) sea menor que cualquier valor asignado, o la probabilidad de que se encuentre entre cualquier valor asignado, o, en resumen, su distribución de probabilidad, a la luz de la muestra observada».
La solución clásica
Fisher luchó arduamente para defender la diferencia y superioridad de su noción de distribución de parámetros en comparación con nociones análogas, como la distribución posterior de Bayes , la probabilidad constructiva de Fraser y los intervalos de confianza de Neyman . Durante medio siglo, los intervalos de confianza de Neyman prevalecieron para todos los propósitos prácticos, atribuyendo su validez a la naturaleza fenomenológica de la probabilidad. Desde esta perspectiva, cuando se trabaja con una variable gaussiana, su media μ está fijada por las características físicas del fenómeno que se observa, donde las observaciones son operadores aleatorios, por lo que los valores observados son especificaciones de una muestra aleatoria . Debido a su aleatoriedad, se pueden calcular a partir de la muestra intervalos específicos que contienen la μ fija con una probabilidad dada que se denota como confianza .
Ejemplo
Sea X una variable gaussiana [ 1 ] con parámetrosyyuna muestra extraída de ella. Trabajar con estadística
y
es la media de la muestra, reconocemos que
sigue una distribución t de Student ( Wilks 1962 ) con parámetro (grados de libertad) m − 1, de modo que
Medir T entre dos cuantiles e invertir su expresión en función deusted obtiene intervalos de confianza para.
Con la especificación de muestra:
teniendo un tamaño m = 10, calculas las estadísticasyy obtener un intervalo de confianza de 0,90 paracon extremos (3,03, 5,65).
Inferir funciones con la ayuda de una computadora
Desde una perspectiva de modelado, toda la disputa parece un dilema del huevo y la gallina: o bien datos fijos desde el principio y distribución de probabilidad de sus propiedades como consecuencia, o bien propiedades fijas desde el principio y distribución de probabilidad de los datos observados como corolario. La solución clásica tiene una ventaja y una desventaja. La primera era apreciada particularmente cuando todavía se hacían cálculos con papel y lápiz. En sí misma, la tarea de calcular un intervalo de confianza de Neyman para el parámetro fijo θ es difícil: no se conoce θ, pero se busca disponer a su alrededor un intervalo con una probabilidad de fallo posiblemente muy baja. La solución analítica es válida para un número muy limitado de casos teóricos. Por el contrario, una gran variedad de instancias pueden resolverse rápidamente de forma aproximada mediante el teorema del límite central en términos de intervalo de confianza alrededor de una distribución gaussiana; esa es la ventaja. La desventaja es que el teorema del límite central es aplicable cuando el tamaño de la muestra es suficientemente grande. Por lo tanto, es cada vez menos aplicable con la muestra involucrada en instancias de inferencia modernas. El problema no radica en el tamaño de la muestra en sí. Más bien, este tamaño no es suficientemente grande debido a la complejidad del problema de inferencia.
Con la disponibilidad de grandes recursos informáticos, los científicos reorientaron su enfoque de la inferencia de parámetros aislados a la inferencia de funciones complejas, es decir, conjuntos de parámetros altamente anidados que identifican funciones. En estos casos, hablamos del aprendizaje de funciones (por ejemplo, en términos de regresión , sistemas neurodifusos o aprendizaje computacional ) a partir de muestras altamente informativas. Un primer efecto de tener una estructura compleja que vincula los datos es la reducción del número de grados de libertad de la muestra , es decir, la eliminación de una parte de los puntos de la muestra, de modo que el tamaño efectivo de la muestra a considerar en el teorema del límite central es demasiado pequeño. Centrándonos en el tamaño de la muestra que garantiza un error de aprendizaje limitado con un nivel de confianza dado , la consecuencia es que el límite inferior de este tamaño aumenta con índices de complejidad como la dimensión VC o el detalle de la clase a la que pertenece la función que queremos aprender.
Ejemplo
Una muestra de 1000 bits independientes es suficiente para garantizar un error absoluto de como máximo 0,081 en la estimación del parámetro p de la variable de Bernoulli subyacente con una confianza de al menos 0,99. El mismo tamaño no puede garantizar un umbral inferior a 0,088 con la misma confianza de 0,99 cuando el error se identifica con la probabilidad de que un hombre de 20 años que vive en Nueva York no se ajuste a los rangos de altura, peso y cintura observados en 1000 habitantes de la Gran Manzana. La falta de precisión se produce porque tanto la dimensión VC como el detalle de la clase de paralelepípedos, entre los que se encuentra el observado en los rangos de los 1000 habitantes, son iguales a 6.
El problema de inversión general resuelve la cuestión de Fisher.
Con muestras insuficientemente grandes, el enfoque de muestra fija con propiedades aleatorias sugiere procedimientos de inferencia en tres pasos:
- Mecanismo de muestreo . Consta de un par.donde la semilla Z es una variable aleatoria sin parámetros desconocidos, mientras que la función explicativaes una función que mapea muestras de Z a muestras de la variable aleatoria X que nos interesa. El vector de parámetroses una especificación del parámetro aleatorioSus componentes son los parámetros de la ley de distribución X. El Teorema de la Transformación Integral garantiza la existencia de dicho mecanismo para cada X (escalar o vectorial) cuando la semilla coincide con la variable aleatoria U distribuida uniformemente en.
Ejemplo : Para X que sigue una distribución de Pareto con parámetros a y k , es decir
un mecanismo de muestreopara X con semilla U se lee:
o, equivalentemente, - Ecuación maestra . La conexión real entre el modelo y los datos observados se expresa en términos de un conjunto de relaciones entre las estadísticas de los datos y los parámetros desconocidos que surgen como corolario de los mecanismos de muestreo. Llamamos a estas relacionesecuaciones maestras. El enfoque gira en torno a la estadística.La forma general de una ecuación maestra es: Con estas relaciones podemos inspeccionar los valores de los parámetros que podrían haber generado una muestra con la estadística observada a partir de una configuración particular de las semillas que representan la semilla de la muestra. Por lo tanto, a la población de semillas de muestra le corresponde una población de parámetros. Para asegurar que esta población tenga propiedades limpias, basta con extraer aleatoriamente los valores de las semillas e incluir estadísticas suficientes o, simplemente, estadísticas bien comportadas con respecto a los parámetros, en las ecuaciones maestras. Por ejemplo, la estadísticaydemostrar ser suficiente para los parámetros a y k de una variable aleatoria de Pareto X. Gracias al mecanismo de muestreo (forma equivalente del)podemos leerlos como respectivamente.
- Población de parámetros . Una vez fijado un conjunto de ecuaciones maestras, puede asignar semillas de muestra a parámetros, ya sea numéricamente mediante un remuestreo poblacional o analíticamente mediante un argumento de torsión . Por lo tanto, a partir de una población de semillas, se obtiene una población de parámetros.
Ejemplo. A partir de la ecuación maestra anterior podemos extraer un par de parámetros,, compatible con la muestra observada resolviendo el siguiente sistema de ecuaciones:
dóndeyson las estadísticas observadas yun conjunto de semillas uniformes. Al transferir a los parámetros la probabilidad (densidad) que afecta a las semillas, se obtiene la ley de distribución de los parámetros aleatorios A y K compatible con las estadísticas observadas.
La compatibilidad denota parámetros de poblaciones compatibles, es decir, de poblaciones que podrían haber generado una muestra que diera lugar a las estadísticas observadas. Esta noción se puede formalizar de la siguiente manera:
Definición
Para una variable aleatoria y una muestra extraída de ella,Una distribución compatible es una distribución que tiene el mismo mecanismo de muestreo.de X con un valordel parámetro aleatorioderivado de una ecuación maestra basada en una estadística s bien comportada .
Ejemplo


Puede encontrar la ley de distribución de los parámetros de Pareto A y K como un ejemplo de implementación del método bootstrap de población , como se muestra en la figura de la izquierda.
Al implementar el método del argumento de torsión , se obtiene la ley de distribución. de la media M de una variable gaussiana X sobre la base de la estadística cuando se sabe que es igual a ( Apoloni, Malchiodi y Gaito 2006 ) . Su expresión es:
mostrado en la figura de la derecha, dondees la función de distribución acumulativa de una distribución normal estándar .

Calcular un intervalo de confianza para M dada su función de distribución es sencillo: solo necesitamos encontrar dos cuantiles (por ejemplo y cuantiles en caso de que estemos interesados en un intervalo de confianza de nivel δ simétrico en las probabilidades de la cola) como se indica a la izquierda en el diagrama que muestra el comportamiento de los dos límites para diferentes valores del estadístico s m .
El talón de Aquiles del enfoque de Fisher reside en la distribución conjunta de más de un parámetro, por ejemplo, la media y la varianza de una distribución gaussiana. Por el contrario, con el último enfoque (y los métodos mencionados anteriormente: bootstrap de población y argumento de torsión ) podemos aprender la distribución conjunta de muchos parámetros. Por ejemplo, centrándonos en la distribución de dos o más parámetros, en las figuras siguientes informamos de dos regiones de confianza donde la función a aprender cae con una confianza del 90%. La primera se refiere a la probabilidad con la que una máquina de vectores de soporte extendida atribuye una etiqueta binaria 1 a los puntos de laplano. Las dos superficies se dibujan a partir de un conjunto de puntos de muestra etiquetados según una ley de distribución específica ( Apolloni et al. 2008 ) . Esta última se refiere a la región de confianza de la tasa de riesgo de recurrencia del cáncer de mama calculada a partir de una muestra censurada ( Apolloni, Malchiodi y Gaito 2006 ) .
Notas
- ↑ Por defecto, las letras mayúsculas (como U , X ) denotarán variables aleatorias y las letras minúsculas ( u , x ) sus especificaciones correspondientes.
Referencias
- Fraser, DAS (1966), "Probabilidad estructural y generalización", Biometrika , 53 (1/2): 1–9 , doi : 10.2307/2334048 , JSTOR 2334048 .
- Fisher, MA (1956), Métodos estadísticos e inferencia científica , Edimburgo y Londres: Oliver and Boyd
- Apolloni, B.; Malchiodi, D.; Gaito, S. (2006), Inferencia algorítmica en aprendizaje automático , Serie internacional sobre inteligencia avanzada, vol. 5 (2.ª ed.), Adelaida: Magill,
Advanced Knowledge International
- Apolloni, B.; Bassis, S.; Malchiodi, D.; Witold, P. (2008), El enigma de la computación granular , Estudios en inteligencia computacional, vol. 138, Berlín: Springer, ISBN 9783540798637
- Ramsey, FP (1925), "Los fundamentos de las matemáticas", Actas de la Sociedad Matemática de Londres : 338–384 , doi : 10.1112/plms/s2-25.1.338 .
- Wilks, SS (1962), Estadística matemática , Publicaciones Wiley en estadística, Nueva York: John Wiley
- Inferencia algorítmica
- Aprendizaje automático