Articulo de referencia

Modelo estadístico

Un modelo estadístico es un modelo matemático que incorpora un conjunto de supuestos estadísticos sobre la generación de datos de muestra (y datos similares de una población may...

Un modelo estadístico es un modelo matemático que incorpora un conjunto de supuestos estadísticos sobre la generación de datos de muestra (y datos similares de una población mayor ). Un modelo estadístico representa, a menudo de forma considerablemente idealizada, el proceso de generación de datos . [ 1 ] Cuando se hace referencia específicamente a probabilidades , el término correspondiente es modelo probabilístico . Todas las pruebas de hipótesis estadísticas y todos los estimadores estadísticos se derivan a través de modelos estadísticos. En términos más generales, los modelos estadísticos forman parte de los fundamentos de la inferencia estadística . Un modelo estadístico se especifica generalmente como una relación matemática entre una o más variables aleatorias y otras variables no aleatorias. Como tal, un modelo estadístico es "una representación formal de una teoría" ( Herman Adèr citando a Kenneth Bollen ). [ 2 ]

Introducción

De manera informal, un modelo estadístico puede considerarse como una suposición estadística (o un conjunto de suposiciones estadísticas) con una propiedad determinada: que dicha suposición nos permite calcular la probabilidad de cualquier evento . Como ejemplo, consideremos un par de dados comunes de seis caras . Estudiaremos dos suposiciones estadísticas diferentes sobre los dados.

La primera suposición estadística es la siguiente: para cada uno de los dados, la probabilidad de que salga cada cara (1, 2, 3, 4, 5 y 6) es 1/6 . A partir de esta suposición, podemos calcular la probabilidad de que ambos dados muestren un 5: 1/6 × 1/6 = 1/36 . De forma más general , podemos calcular la probabilidad de cualquier evento: por ejemplo , (1 y 2 ) , ( 3 y 3 ) o (5 y 6). La suposición estadística alternativa es la siguiente: para cada uno de los dados, la probabilidad de que salga la cara 5 es 1/8 ( debido a que los dados están trucados ) . Partiendo de esa premisa, podemos calcular la probabilidad de que ambos dados muestren un 5: 1/8 × 1/8 = 1/64 . Sin embargo , no podemos calcular la probabilidad de ningún otro evento no trivial, ya que se desconocen las probabilidades de las demás caras .

La primera suposición estadística constituye un modelo estadístico, ya que, solo con ella, podemos calcular la probabilidad de cualquier evento. La suposición estadística alternativa no constituye un modelo estadístico, ya que, solo con ella, no podemos calcular la probabilidad de todos los eventos. En el ejemplo anterior, con la primera suposición, calcular la probabilidad de un evento es sencillo. Sin embargo, en otros ejemplos, el cálculo puede ser difícil o incluso impracticable (por ejemplo, podría requerir millones de años de computación). Para que una suposición constituya un modelo estadístico, dicha dificultad es aceptable: no es necesario que el cálculo sea practicable, sino teóricamente posible.

Definición formal

En términos matemáticos, un modelo estadístico es un par (S,PAG{\displaystyle S,{\mathcal {P}}}), dóndeS{\displaystyle S}es el conjunto de observaciones posibles, es decir, el espacio muestral , yPAG{\displaystyle {\mathcal {P}}}es un conjunto de distribuciones de probabilidad sobreS{\displaystyle S}. [ 3 ] El conjuntoPAG{\displaystyle {\mathcal {P}}}representa todos los modelos que se consideran posibles. Este conjunto suele estar parametrizado:PAG={Fθ:θΘ}{\displaystyle {\mathcal {P}}=\{F_{\theta }:\theta \in \Theta \}}. El conjuntoΘ{\displaystyle \Theta }define los parámetros del modelo. Si una parametrización es tal que distintos valores de los parámetros dan lugar a distintas distribuciones, es decirFθ1=Fθ2θ1=θ2{\ Displaystyle F _ {\ theta _ {1}} = F _ {\ theta _ {2}} \ Rightarrow \ theta _ {1} = \ theta _ {2}}(en otras palabras, el mapeo es inyectivo ), se dice que es identificable . [ 3 ]

En algunos casos, el modelo puede ser más complejo.

  • En estadística bayesiana , el modelo se extiende añadiendo una distribución de probabilidad sobre el espacio de parámetros.Θ{\displaystyle \Theta }.
  • Un modelo estadístico a veces puede distinguir dos conjuntos de distribuciones de probabilidad. El primer conjuntoQ={Fθ:θΘ}{\displaystyle {\mathcal {Q}}=\{F_{\theta }:\theta \in \Theta \}}es el conjunto de modelos considerados para la inferencia. El segundo conjuntoPAG={Fλ:λΛ}{\displaystyle {\mathcal {P}}=\{F_{\lambda}:\lambda \in \Lambda \}}es el conjunto de modelos que podrían haber generado los datos que es mucho mayor queQ{\displaystyle {\mathcal {Q}}}Estos modelos estadísticos son fundamentales para comprobar que un procedimiento determinado es robusto , es decir, que no produce errores catastróficos cuando sus supuestos sobre los datos son incorrectos.

Un ejemplo

Supongamos que tenemos una población de niños, con edades distribuidas uniformemente . La altura de un niño estará relacionada estocásticamente con la edad: por ejemplo, si sabemos que un niño tiene 7 años, esto influye en la probabilidad de que mida 1,5 metros. Podríamos formalizar esa relación en un modelo de regresión lineal , como este: altura i  = b 0  + b 1 edad i  + ε i , donde b 0 es la intersección, b 1 es un parámetro por el que se multiplica la edad para obtener una predicción de la altura, ε i es el término de error e i identifica al niño. Esto implica que la altura se predice mediante la edad, con cierto margen de error.

Un modelo admisible debe ser consistente con todos los puntos de datos. Por lo tanto, una línea recta (altura i  = b 0  + b 1 edad i ) no puede ser admisible para un modelo de los datos, a menos que se ajuste exactamente a todos los puntos de datos, es decir, que todos los puntos de datos se encuentren perfectamente sobre la línea. El término de error, ε i , debe incluirse en la ecuación, de modo que el modelo sea consistente con todos los puntos de datos. Para realizar inferencia estadística , primero necesitaríamos asumir algunas distribuciones de probabilidad para ε i . Por ejemplo, podríamos asumir que las distribuciones de ε i son gaussianas i.i.d. , con media cero. En este caso, el modelo tendría 3 parámetros: b 0 , b 1 y la varianza de la distribución gaussiana. Podemos especificar formalmente el modelo en la forma (S,PAG{\displaystyle S,{\mathcal {P}}}) de la siguiente manera. El espacio muestral,S{\displaystyle S}, de nuestro modelo comprende el conjunto de todos los pares posibles (edad, altura). Cada valor posible deθ{\displaystyle \theta } = ( b 0 , b 1 , σ 2 ) determina una distribución enS{\displaystyle S}; denotemos que la distribución porFθ{\displaystyle F_{\theta }}. SiΘ{\displaystyle \Theta }es el conjunto de todos los valores posibles deθ{\displaystyle \theta }, entoncesPAG={Fθ:θΘ}{\displaystyle {\mathcal {P}}=\{F_{\theta }:\theta \in \Theta \}}(La parametrización es identificable y fácil de comprobar).

En este ejemplo, el modelo se determina mediante (1) la especificaciónS{\displaystyle S}y (2) hacer algunas suposiciones relevantes paraPAG{\displaystyle {\mathcal {P}}}Hay dos supuestos: que la altura se puede aproximar mediante una función lineal de la edad; que los errores en la aproximación se distribuyen como gaussianas independientes e idénticamente distribuidas. Los supuestos son suficientes para especificarPAG{\displaystyle {\mathcal {P}}}—como están obligados a hacerlo.

Observaciones generales

Un modelo estadístico es una clase especial de modelo matemático . Lo que distingue a un modelo estadístico de otros modelos matemáticos es que es no determinista . Así, en un modelo estadístico especificado mediante ecuaciones matemáticas, algunas variables no tienen valores específicos, sino distribuciones de probabilidad; es decir, algunas variables son estocásticas . En el ejemplo anterior sobre la altura de los niños, ε es una variable estocástica; sin ella, el modelo sería determinista. Los modelos estadísticos se utilizan a menudo incluso cuando el proceso generador de datos que se modela es determinista. Por ejemplo, el lanzamiento de una moneda es, en principio, un proceso determinista; sin embargo, se suele modelar como estocástico (mediante un proceso de Bernoulli ). Elegir un modelo estadístico apropiado para representar un proceso generador de datos determinado a veces es extremadamente difícil y puede requerir el conocimiento tanto del proceso como de los análisis estadísticos pertinentes. En este sentido, el estadístico Sir David Cox ha dicho: «La forma en que se realiza la traducción del problema del tema al modelo estadístico suele ser la parte más crítica de un análisis». [ 4 ]

 Según Konishi y Kitagawa , un modelo estadístico tiene tres propósitos : [ 5 ]

  1. Predicciones
  2. Extracción de información
  3. Descripción de estructuras estocásticas

Esos tres propósitos son esencialmente los mismos que los tres propósitos indicados por Friendly  y Meyer: predicción, estimación y descripción. [ 6 ]

Dimensión de un modelo

Supongamos que tenemos un modelo estadístico (S,PAG{\displaystyle S,{\mathcal {P}}}) conPAG={Fθ:θΘ}{\displaystyle {\mathcal {P}}=\{F_{\theta }:\theta \in \Theta \}}En notación, escribimos queΘRk{\displaystyle \Theta \subseteq \mathbb {R} ^{k}}donde k es un entero positivo (R{\displaystyle \mathbb {R} }denota los números reales ; en principio, se pueden usar otros conjuntos). Aquí, k se llama la dimensión del modelo. Se dice que el modelo es paramétrico siΘ{\displaystyle \Theta }tiene dimensión finita. Por ejemplo, si suponemos que los datos provienen de una distribución gaussiana univariada , entonces estamos suponiendo que

PAG={Fμ,σ(incógnita)12πσexp((incógnitaμ)22σ2):μR,σ>0}{\displaystyle {\mathcal {P}}=\left\{F_{\mu ,\sigma }(x)\equiv {\frac {1}{{\sqrt {2\pi }}\sigma }}\exp \left(-{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}\right):\mu \in \mathbb {R} ,\sigma >0\right\}}.

En este ejemplo, la dimensión k es igual a 2. Como otro ejemplo, supongamos que los datos consisten en puntos ( x , y ) que se distribuyen según una línea recta con residuos gaussianos independientes e idénticamente distribuidos (con media cero): esto conduce al mismo modelo estadístico que se utilizó en el ejemplo con las alturas de los niños. La dimensión del modelo estadístico es 3: la intersección de la línea, la pendiente de la línea y la varianza de la distribución de los residuos. (Nótese que el conjunto de todas las líneas posibles tiene dimensión 2, aunque geométricamente una línea tiene dimensión 1).

Aunque formalmenteθΘ{\displaystyle \theta \in \Theta }es un único parámetro que tiene dimensión k , a veces se considera que comprende k parámetros separados. Por ejemplo, con la distribución gaussiana univariada,θ{\displaystyle \theta }formalmente es un único parámetro con dimensión 2, pero a menudo se considera que comprende 2 parámetros separados: la media y la desviación estándar. Un modelo estadístico es no paramétrico si el conjunto de parámetrosΘ{\displaystyle \Theta }es de dimensión infinita. Un modelo estadístico es semiparamétrico si tiene parámetros de dimensión finita e infinita. Formalmente, si k es la dimensión deΘ{\displaystyle \Theta }y n es el número de muestras, tanto los modelos semiparamétricos como los no paramétricos tienenk{\displaystyle k\rightarrow \infty }comonorte{\displaystyle n\rightarrow \infty }. Sik/norte0{\displaystyle k/n\rightarrow 0}comonorte{\displaystyle n\rightarrow \infty }En ese caso, el modelo es semiparamétrico; de lo contrario, el modelo es no paramétrico.

Los modelos paramétricos son, con diferencia, los modelos estadísticos más utilizados. En cuanto a los modelos semiparamétricos y no paramétricos, Sir David Cox afirmó: «Estos suelen implicar menos supuestos sobre la estructura y la forma de la distribución, pero generalmente contienen supuestos sólidos sobre las independencias». [ 7 ]

Modelos anidados

Dos modelos estadísticos están anidados si el primer modelo puede transformarse en el segundo imponiendo restricciones a los parámetros del primero. Por ejemplo, el conjunto de todas las distribuciones gaussianas contiene, anidado dentro de él, el conjunto de distribuciones gaussianas de media cero: restringimos la media en el conjunto de todas las distribuciones gaussianas para obtener las distribuciones de media cero. Como segundo ejemplo, el modelo cuadrático

y  = segundo 0  + segundo 1 x  + segundo 2 x 2  + ε,  ε  ~ 𝒩(0, σ 2 )

tiene, anidado dentro de él, el modelo lineal

y  = b 0  + b 1 x  + ε,  ε  ~ 𝒩(0, σ 2 )

—restringimos el parámetro b 2 para que sea igual a 0.

En ambos ejemplos, el primer modelo tiene una dimensión mayor que el segundo (en el primer ejemplo, el modelo de media cero tiene dimensión  1). Esto suele ser así, pero no siempre. Un ejemplo donde tienen la misma dimensión es el conjunto de distribuciones gaussianas de media positiva, que se encuentra anidado dentro del conjunto de todas las distribuciones gaussianas; ambos tienen dimensión 2.

Comparación de modelos

La comparación de modelos estadísticos es fundamental para gran parte de la inferencia estadística . Konishi y Kitagawa (2008 , p. 75) afirman: «La mayoría de los problemas en inferencia estadística pueden considerarse problemas relacionados con el modelado estadístico. Suelen formularse como comparaciones de varios modelos estadísticos». Los criterios comunes para comparar modelos incluyen: , factor de Bayes , criterio de información de Akaike y la prueba de razón de verosimilitud junto con su generalización, la verosimilitud relativa . 

Otra forma de comparar dos modelos estadísticos es a través de la noción de deficiencia introducida por Lucien Le Cam . [ 8 ]

Véase también

Notas

  1. Cox 2006 , pág. 178 
  2. Adèr 2008 , pág. 280 
  3. 1 2 McCullagh 2002
  4. Cox 2006 , pág. 197 
  5. ^ Konishi y Kitagawa 2008 , §1.1
  6. Friendly & Meyer 2016 , §11.6
  7. Cox 2006 , pág. 2 
  8. Le Cam, Lucien (1964). "Suficiencia y suficiencia aproximada" . Anales de Estadística Matemática . 35 (4). Instituto de Estadística Matemática : 1429. doi : 10.1214/aoms/1177700372 .

Referencias

  • Adèr, HJ (2008), "Modelado", en Adèr, HJ; Mellenbergh, GJ (eds.), Asesoramiento sobre métodos de investigación: una guía para consultores , Huizen, Países Bajos: Johannes van Kessel Publishing, pp . 271–304 .
  • Burnham, KP; Anderson, DR (2002), Selección de modelos e inferencia multimodelos (2.ª  ed.), Springer-Verlag.
  • Cox, DR (2006), Principios de inferencia estadística , Cambridge University Press , doi : 10.1017/CBO9780511813559 , ISBN 978-0-521-86673-6.
  • Friendly, M .; Meyer, D. (2016), Análisis de datos discretos con R , Chapman & Hall.
  • Konishi, S.; Kitagawa, G. (2008), Criterios de información y modelado estadístico , Springer.
  • McCullagh, P. (2002), "¿Qué es un modelo estadístico?" (PDF) , Annals of Statistics , 30 (5): 1225– 1310, doi : 10.1214/aos/1035844977.

Lecturas adicionales