Articulo de referencia

Regla de decisión aleatoria

En la teoría de la decisión estadística , una regla de decisión aleatoria o mixta asocia probabilidades con reglas de decisión deterministas. En problemas de decisión finitos, l...

En la teoría de la decisión estadística , una regla de decisión aleatoria o mixta asocia probabilidades con reglas de decisión deterministas. En problemas de decisión finitos, las reglas de decisión aleatorias definen un conjunto de riesgo , que es la envoltura convexa de los puntos de riesgo de las reglas de decisión no aleatorias.

Como siempre existen alternativas no aleatorias a las reglas bayesianas aleatorias, la aleatorización no es necesaria en la estadística bayesiana , aunque la teoría estadística frecuentista a veces requiere el uso de reglas aleatorias para satisfacer condiciones de optimalidad como minimax , sobre todo al derivar intervalos de confianza y pruebas de hipótesis sobre distribuciones de probabilidad discretas .

Una prueba estadística que utiliza una regla de decisión aleatoria se denomina prueba aleatoria .

Definición e interpretación

DejarD={d1,d2...,dh}{\displaystyle {\mathcal {D}}=\{d_{1},d_{2}....,d_{h}\}}ser un conjunto de reglas de decisión no aleatorias con probabilidades asociadaspag1,pag2,...,pagh{\displaystyle p_{1},p_{2},...,p_{h}}Luego, la regla de decisión aleatoriad{\displaystyle d^{*}}se define comoi=1hpagidi{\displaystyle \sum _{i=1}^{h}p_{i}d_{i}}y su función de riesgo asociadaR(θ,d){\displaystyle R(\theta ,d^{*})}esi=1hpagiR(θ,di){\displaystyle \sum _{i=1}^{h}p_{i}R(\theta ,d_{i})}. [ 1 ] Esta regla puede tratarse como un experimento aleatorio en el que las reglas de decisiónd1,...,dhD{\displaystyle d_{1},...,d_{h}\in {\mathcal {D}}}se seleccionan con probabilidadespag1,...pagh{\displaystyle p_{1},...p_{h}}respectivamente. [ 2 ]

Alternativamente, una regla de decisión aleatoria puede asignar probabilidades directamente a los elementos del espacio de acciones.A{\displaystyle {\mathcal {A}}}para cada miembro del espacio muestral . Más formalmente,d(incógnita,A){\displaystyle d^{*}(x,A)}denota la probabilidad de que una acciónaA{\displaystyle a\in {\mathcal {A}}}Se elige. Bajo este enfoque, su función de pérdida también se define directamente como:AAd(incógnita,A)L(θ,A)dA{\displaystyle \int _{A\in {\mathcal {A}}}d^{*}(x,A)L(\theta ,A)dA}. [ 3 ]

La introducción de reglas de decisión aleatorias crea así un espacio de decisión más amplio del que el estadístico puede elegir su decisión. Como las reglas de decisión no aleatorias son un caso especial de reglas de decisión aleatorias donde una decisión o acción tiene probabilidad 1, el espacio de decisión originalD{\displaystyle {\mathcal {D}}}es un subconjunto propio del nuevo espacio de decisiónD{\displaystyle {\mathcal {D}}^{*}}. [ 4 ]

Selección de reglas de decisión aleatorias

Los puntos extremos del conjunto de riesgos, representados por círculos vacíos, corresponden a reglas de decisión no aleatorias, mientras que las líneas gruesas representan las reglas de decisión admisibles.

Al igual que con las reglas de decisión no aleatorias, las reglas de decisión aleatorias pueden satisfacer propiedades favorables como la admisibilidad, la minimaxidad y la bayesiana. Esto se ilustrará en el caso de un problema de decisión finito, es decir, un problema donde el espacio de parámetros es un conjunto finito de, por ejemplo,k{\displaystyle k}elementos. El conjunto de riesgos, de ahora en adelante denominadoS{\displaystyle {\mathcal {S}}}, es el conjunto de todos los vectores en los que cada entrada es el valor de la función de riesgo asociada a una regla de decisión aleatoria bajo un cierto parámetro: contiene todos los vectores de la forma(R(θ1,d),...R(θk,d)),dD{\displaystyle (R(\theta _{1},d^{*}),...R(\theta _{k},d^{*})),d^{*}\in {\mathcal {D}}^{*}}. Nótese que, por definición de la regla de decisión aleatoria, el conjunto de riesgos es la envoltura convexa de los riesgos.(R(θ1,d),...R(θk,d)),dD{\displaystyle (R(\theta _{1},d),...R(\theta _{k},d)),d\in {\mathcal {D}}}. [ 5 ]

En el caso en que el espacio de parámetros tenga solo dos elementosθ1{\displaystyle \theta _{1}}yθ2{\displaystyle \theta _{2}}, esto constituye un subconjunto deR2{\displaystyle \mathbb {R} ^{2}}, de modo que pueda dibujarse con respecto a los ejes de coordenadasR1{\displaystyle R_{1}}yR2{\displaystyle R_{2}}correspondientes a los riesgos enθ1{\displaystyle \theta _{1}}yθ2{\displaystyle \theta _{2}}respectivamente. [ 6 ] Un ejemplo se muestra a la derecha.

Admisibilidad

Una regla de decisión admisible es aquella que no está dominada por ninguna otra regla de decisión, es decir, no existe ninguna regla de decisión que tenga un riesgo igual o menor para todos los parámetros y un riesgo estrictamente menor para algún parámetro. En un problema de decisión finito, el punto de riesgo de una regla de decisión admisible tiene coordenadas x o y menores que todos los demás puntos de riesgo o, más formalmente, es el conjunto de reglas con puntos de riesgo de la forma(a,b){\displaystyle (a,b)}de tal manera que{(R1,R2):R1a,R2b}S=(a,b){\displaystyle \{(R_{1},R_{2}):R_{1}\leq a,R_{2}\leq b\}\cap {\mathcal {S}}=(a,b)}. Por lo tanto, el lado izquierdo del límite inferior del conjunto de riesgo es el conjunto de reglas de decisión admisibles. [ 6 ] [ 7 ]

Minimax

Una regla de Bayes minimax es aquella que minimiza el riesgo supremo.sorberθΘR(θ,d){\displaystyle \sup _{\theta \in \Theta }R(\theta ,d^{*})}entre todas las reglas de decisión enD{\displaystyle {\mathcal {D}}^{*}}. A veces, una regla de decisión aleatoria puede tener un mejor desempeño que todas las demás reglas de decisión no aleatorias en este sentido. [ 1 ]

En un problema de decisión finito con dos parámetros posibles, la regla minimax se puede encontrar considerando la familia de cuadrados.Q(do)={(R1,R2):0R1do,0R2do}{\displaystyle Q(c)=\{(R_{1},R_{2}):0\leq R_{1}\leq c,0\leq R_{2}\leq c\}}. [ 8 ] El valor dedo{\displaystyle c}para el más pequeño de esos cuadrados que tocaS{\displaystyle {\mathcal {S}}}es el riesgo minimax y el punto o puntos correspondientes en el conjunto de riesgo es la regla minimax.

Si el conjunto de riesgos interseca la líneaR1=R2{\displaystyle R_{1}=R_{2}}, entonces la regla de decisión admisible que se encuentra en la línea es minimax. SiR2>R1{\displaystyle R_{2}>R_{1}}oR1>R2{\displaystyle R_{1}>R_{2}}Si se cumple para cada punto del conjunto de riesgo, la regla minimax puede ser un punto extremo (es decir, una regla de decisión no aleatoria) o una línea que conecta dos puntos extremos (reglas de decisión no aleatorias). [ 9 ] [ 6 ]

Bayes

Una regla de Bayes aleatoria es aquella que tiene riesgo de Bayes ínfimo.r(π,d){\displaystyle r(\pi ,d^{*})}entre todas las reglas de decisión. En el caso especial en que el espacio de parámetros tiene dos elementos, la líneaπ1R1+(1π1)R2=do{\displaystyle \pi _{1}R_{1}+(1-\pi _{1})R_{2}=c}, dóndeπ1{\displaystyle \pi _{1}}yπ2{\displaystyle \pi _{2}}denotan las probabilidades previas deθ1{\displaystyle \theta _{1}}yθ2{\displaystyle \theta _{2}}respectivamente, es una familia de puntos con riesgo de Bayesdo{\displaystyle c}Por lo tanto, el riesgo mínimo de Bayes para el problema de decisión es el más pequeño.do{\displaystyle c}de tal manera que la línea toque el conjunto de riesgo. [ 10 ] [ 11 ] Esta línea puede tocar solo un punto extremo del conjunto de riesgo, es decir, corresponder a una regla de decisión no aleatoria, o superponerse con un lado completo del conjunto de riesgo, es decir, corresponder a dos reglas de decisión no aleatorias y reglas de decisión aleatorias que combinan ambas. Esto se ilustra con las tres situaciones siguientes:

Como diferentes distribuciones a priori dan lugar a diferentes pendientes, el conjunto de todas las reglas que son bayesianas con respecto a alguna distribución a priori es el mismo que el conjunto de reglas admisibles. [ 12 ]

Nótese que no es posible ninguna situación en la que no exista una regla de Bayes no aleatoria pero sí una regla de Bayes aleatoria. La existencia de una regla de Bayes aleatoria implica la existencia de una regla de Bayes no aleatoria. Esto también es cierto en el caso general, incluso con un espacio de parámetros infinito, un riesgo de Bayes infinito e independientemente de si se puede alcanzar el riesgo de Bayes ínfimo. [ 3 ] [ 12 ] Esto respalda la noción intuitiva de que el estadístico no necesita utilizar la aleatorización para llegar a decisiones estadísticas. [ 4 ]

En la práctica

Como las reglas bayesianas aleatorias siempre tienen alternativas no aleatorias, son innecesarias en la estadística bayesiana . Sin embargo, en la estadística frecuentista, las reglas aleatorias son teóricamente necesarias en ciertas situaciones, [ 13 ] y se consideraron útiles en la práctica cuando se inventaron: Egon Pearson predijo que «no encontrarían una fuerte objeción». [ 14 ] Sin embargo, pocos estadísticos las implementan en la actualidad. [ 14 ] [ 15 ]

Prueba aleatoria

Las pruebas aleatorias no deben confundirse con las pruebas de permutación . [ 16 ]

En la formulación habitual de la prueba de razón de verosimilitud , la hipótesis nula se rechaza siempre que la razón de verosimilitudΛ{\displaystyle \Lambda }es menor que alguna constanteK{\displaystyle K}y se acepta en otros casos. Sin embargo, esto a veces resulta problemático cuandoΛ{\displaystyle \Lambda }es discreto bajo la hipótesis nula, cuandoΛ=K{\displaystyle \Lambda =K}es posible.

Una solución consiste en definir una función de prueba.ϕ(incógnita){\displaystyle \phi (x)}, cuyo valor es la probabilidad con la que se acepta la hipótesis nula: [ 17 ] [ 18 ]

ϕ(incógnita)={1 si Λ>Kpag(incógnita) si Λ=K0 si Λ<K{\displaystyle \phi (x)=\left\{{\begin{array}{l}1&{\text{ if }}\Lambda >K\\p(x)&{\text{ if }}\Lambda =K\\0&{\text{ if }}\Lambda <K\end{array}}\right.}

Esto puede interpretarse como lanzar una moneda trucada con una probabilidadpag(incógnita){\displaystyle p(x)}de cabezas que regresan cuandoΛ=k{\displaystyle \Lambda =k}y rechazar la hipótesis nula si sale cara. [ 15 ]

Una forma generalizada del lema de Neyman-Pearson establece que esta prueba tiene la máxima potencia entre todas las pruebas con el mismo nivel de significancia.α{\displaystyle \alpha }que tal prueba debe existir para cualquier nivel de significanciaα{\displaystyle \alpha }y que la prueba es única en situaciones normales. [ 17 ]

Como ejemplo, consideremos el caso en que la distribución subyacente es de Bernoulli con probabilidadpag{\displaystyle p}y nos gustaría probar la hipótesis nulapagλ{\displaystyle p\leq \lambda }en contra de la hipótesis alternativapag>λ{\displaystyle p>\lambda }Es natural elegir algunosk{\displaystyle k}de tal manera quePAG(pag^>k|H0)=α{\displaystyle P({\hat {p}}>k|H_{0})=\alpha }y rechazar el valor nulo siempre quepag^>k{\displaystyle {\hat {p}}>k}, dóndepag^{\displaystyle {\hat {p}}}es el estadístico de prueba . Sin embargo, para tener en cuenta los casos en los quepag^=k{\displaystyle {\hat {p}}=k}, definimos la función de prueba:

ϕ(incógnita)={1 si pag^>kγ si pag^=k0 si pag^<k{\displaystyle \phi (x)=\left\{{\begin{array}{l}1&{\text{ if }}{\hat {p}}>k\\\gamma &{\text{ if }}{\hat {p}}=k\\0&{\text{ if }}{\hat {p}}<k\end{array}}\right.}

dóndeγ{\displaystyle \gamma }se elige de tal manera quePAG(pag^>k|H0)+γPAG(pag^=k|H0)=α{\displaystyle P({\hat {p}}>k|H_{0})+\gamma P({\hat {p}}=k|H_{0})=\alpha }.

Intervalos de confianza aleatorios

Un problema análogo surge en la construcción de intervalos de confianza. Por ejemplo, el intervalo de Clopper-Pearson siempre es conservador debido a la naturaleza discreta de la distribución binomial . Una alternativa es encontrar los límites superior e inferior del intervalo de confianza.U{\displaystyle U}yL{\displaystyle L}resolviendo las siguientes ecuaciones: [ 14 ]

{PAGr(pag^<k|pag=U)+γPAG(pag^=k|pag=U)=α/2PAGr(pag^>k|pag=L)+γPAG(pag^=k|pag=L)=α/2{\displaystyle \left\{{\begin{array}{l}Pr({\hat {p}}<k|p=U)+\gamma P({\hat {p}}=k|p=U)&=\alpha /2\\Pr({\hat {p}}>k|p=L)+\gamma P({\hat {p}}=k|p=L)&=\alpha /2\end{array}}\right.}

dóndeγ{\displaystyle \gamma }es una variable aleatoria uniforme en (0, 1).

Véase también

Notas a pie de página

  1. 1 2 Young y Smith, pág. 11
  2. Bickel y Doksum, pág. 28
  3. 1 2 Parmigiani, pág. 132
  4. 1 2 DeGroot, págs. 128-129
  5. Bickel y Doksum, pág. 29
  6. 1 2 3 Young y Smith, pág. 12
  7. Bickel y Doksum, pág. 32
  8. Bickel y Doksum, pág. 30
  9. Young y Smith, págs. 14-16
  10. Young y Smith, pág. 13
  11. Bickel y Doksum, págs. 29–30
  12. 1 2 Bickel y Doksum, pág. 31
  13. Robert, pág. 66
  14. 1 2 3 Agresti y Gottard, p.367
  15. 1 2 Bickel y Doksum, pág. 224
  16. Onghena, Patrick (30 de octubre de 2017), "¿Pruebas de aleatorización o pruebas de permutación? Una aclaración histórica y terminológica" , en Berger, Vance W. (ed.), Randomization, Masking, and Allocation Concealment (1.ª  ed.), Boca Raton, FL: Chapman and Hall/CRC, pp. 209–228 , doi : 10.1201/9781315305110-14 , ISBN  978-1-315-30511-0, consultado el 8 de octubre de 2021
  17. 1 2 Young y Smith, pág. 68
  18. Robert, pág. 243

Bibliografía

  • Agresti, Alan; Gottard, Anna (2005). "Comentario: Intervalos de confianza aleatorios y el enfoque Mid-P" (PDF) . Statistical Science . 5 (4): 367– 371. doi : 10.1214/088342305000000403 .
  • Bickel, Peter J.; Doksum, Kjell A. (2001). Estadística matemática  : ideas básicas y temas selectos (2.ª  ed.). Upper Saddle River, NJ: Prentice-Hall. ISBN 978-0138503635.
  • DeGroot, Morris H. (2004). Decisiones estadísticas óptimas . Hoboken, NJ: Wiley-Interscience. ISBN 978-0471680291.
  • Parmigiani, Giovanni; Inoue, Lurdes YT (2009). Teoría de la decisión  : principios y enfoques . Chichester, West Sussex: John Wiley and Sons. ISBN 9780470746684.
  • Robert, Christian P (2007). La elección bayesiana  : de los fundamentos de la teoría de la decisión a la implementación computacional . Nueva York: Springer. ISBN 9780387715988.
  • Young, GA; Smith, RL (2005). Fundamentos de inferencia estadística . Cambridge: Cambridge University Press. ISBN 9780521548663.