Articulo de referencia

estadística no paramétrica

La estadística no paramétrica es un tipo de análisis estadístico que requiere un mínimo de supuestos sobre la distribución subyacente de los datos estudiados. A menudo, estos mo...

La estadística no paramétrica es un tipo de análisis estadístico que requiere un mínimo de supuestos sobre la distribución subyacente de los datos estudiados. A menudo, estos modelos son de dimensión infinita, en lugar de dimensión finita, como en la estadística paramétrica . [ 1 ] La estadística no paramétrica puede utilizarse para estadística descriptiva o inferencia estadística . Las pruebas no paramétricas se utilizan con frecuencia cuando los supuestos de las pruebas paramétricas se incumplen claramente. [ 2 ]

Definiciones

El término "estadística no paramétrica" ​​se ha definido de forma imprecisa, entre otras, de las dos maneras siguientes:

El primer significado de no paramétrico implica técnicas que no dependen de datos que pertenezcan a ninguna familia paramétrica particular de distribuciones de probabilidad. Estas incluyen, entre otras:

  • Métodos que no dependen de la distribución , que no se basan en suposiciones de que los datos se extraen de una familia paramétrica determinada de distribuciones de probabilidad .
  • Estadísticas definidas como una función de una muestra, sin dependencia de un parámetro .

Un ejemplo son las estadísticas de orden , que se basan en la clasificación ordinal de las observaciones.

La discusión que sigue está tomada de la Teoría Avanzada de la Estadística de Kendall . [ 3 ]

Las hipótesis estadísticas se refieren al comportamiento de variables aleatorias observables... Por ejemplo, la hipótesis (a) de que una distribución normal tiene una media y una varianza especificadas es estadística; también lo es la hipótesis (b) de que tiene una media dada pero una varianza no especificada; también lo es la hipótesis (c) de que una distribución es de forma normal con media y varianza no especificadas; finalmente, también lo es la hipótesis (d) de que dos distribuciones continuas no especificadas son idénticas.

Se habrá notado que en los ejemplos (a) y (b) se tomó que la distribución subyacente a las observaciones era de una forma determinada (la normal) y la hipótesis se refería enteramente al valor de uno o ambos de sus parámetros. Dicha hipótesis, por razones obvias, se denomina paramétrica .

La hipótesis (c) era de naturaleza diferente, ya que no se especifican valores de parámetros en su enunciado; podríamos denominarla razonablemente no paramétrica . La hipótesis (d) también es no paramétrica, pero, además, ni siquiera especifica la forma subyacente de la distribución y ahora puede denominarse razonablemente libre de distribución . A pesar de estas distinciones, la literatura estadística suele aplicar la etiqueta de "no paramétrico" a procedimientos de prueba que acabamos de denominar "libres de distribución", perdiendo así una clasificación útil.

El segundo significado de no paramétrico se refiere a técnicas que no presuponen que la estructura de un modelo sea fija. Por lo general, el modelo aumenta de tamaño para adaptarse a la complejidad de los datos. En estas técnicas, se suele asumir que las variables individuales pertenecen a distribuciones paramétricas, y también se hacen suposiciones sobre los tipos de asociaciones entre variables. Estas técnicas incluyen, entre otras:

  • La regresión no paramétrica es un tipo de modelado en el que la estructura de la relación entre variables se trata de forma no paramétrica, pero donde, no obstante, pueden existir supuestos paramétricos sobre la distribución de los residuos del modelo.
  • modelos bayesianos jerárquicos no paramétricos , como los modelos basados ​​en el proceso de Dirichlet , que permiten que el número de variables latentes crezca según sea necesario para ajustarse a los datos, pero donde las variables individuales siguen distribuciones paramétricas e incluso el proceso que controla la tasa de crecimiento de las variables latentes sigue una distribución paramétrica.

Aplicaciones y propósito

Los métodos no paramétricos se utilizan ampliamente para estudiar poblaciones con un orden jerarquizado (como las reseñas de películas que reciben de una a cinco estrellas). El uso de métodos no paramétricos puede ser necesario cuando los datos tienen una clasificación pero carecen de una interpretación numérica clara , como al evaluar preferencias . En términos de niveles de medición , los métodos no paramétricos dan como resultado datos ordinales .

Dado que los métodos no paramétricos requieren menos supuestos, su aplicabilidad es mucho más general que la de los métodos paramétricos correspondientes. En particular, pueden aplicarse en situaciones donde se conoce menos sobre la aplicación en cuestión. Además, debido a que dependen de menos supuestos, los métodos no paramétricos son más robustos .

Los métodos no paramétricos a veces se consideran más sencillos de usar y más robustos que los paramétricos, incluso cuando se justifican los supuestos de estos últimos . Esto se debe a su naturaleza más general, que puede hacerlos menos propensos a un uso indebido y a malentendidos. Los métodos no paramétricos pueden considerarse una opción conservadora, ya que funcionan incluso cuando no se cumplen sus supuestos, mientras que los métodos paramétricos pueden producir resultados engañosos cuando estos se incumplen.

La mayor aplicabilidad y robustez de las pruebas no paramétricas conlleva un inconveniente: en los casos en que se cumplen los supuestos de una prueba paramétrica, las pruebas no paramétricas tienen menor potencia estadística . En otras palabras, puede ser necesario un tamaño de muestra mayor para llegar a conclusiones con el mismo grado de confianza.

Modelos no paramétricos

Los modelos no paramétricos se diferencian de los paramétricos en que su estructura no se especifica a priori, sino que se determina a partir de los datos. El término "no paramétrico" no implica que dichos modelos carezcan por completo de parámetros, sino que el número y la naturaleza de estos son flexibles y no están predeterminados.

pruebas no paramétricas

Los métodos estadísticos inferenciales no paramétricos (o libres de distribución ) son procedimientos matemáticos para la prueba de hipótesis estadísticas que, a diferencia de la estadística paramétrica , no hacen suposiciones sobre las distribuciones de probabilidad de las variables que se evalúan. Las pruebas más utilizadas incluyen:

Estadística matemática

En estadística matemática , los modelos no paramétricos se consideran modelos que no dependen de una suposición paramétrica de la distribución de datos desconocida (en problemas de estimación de densidad ) o de la función de regresión (en problemas de regresión ). Mientras que el objetivo de cualquier modelo paramétrico es la estimación de un número finito de parámetros.θ1,,θpagR{\displaystyle \theta _{1},\dots ,\theta _{p}\in \mathbb {R} }Los modelos no paramétricos buscan estimar directamente la distribución de datos/función de regresión. [ 5 ] [ 6 ]

Sin embargo, para el análisis matemático, los enfoques paramétricos y no paramétricos se ajustan al mismo contexto: Suponiendo que la función que se va a estimar (distribución de datos o función de regresión) pertenece a un conjunto de funciones parametrizadas por un conjuntoΘ{\displaystyle \Theta }, uno busca una función (medible)Tnorte:incógnitanorteΘ{\displaystyle T_{n}:{\mathcal {X}}^{n}\to \Theta }que estima el parámetro "verdadero" basándose en puntos de datosincógnita1,,incógnitanorteincógnita{\displaystyle x_{1},\dots ,x_{n}\in {\mathcal {X}}}La diferencia clave entre los enfoques paramétricos y no paramétricos es que en los primerosΘRd{\displaystyle \Theta \subset \mathbb {R} ^{d}}para algunosdnorte{\displaystyle d\in \mathbb {N} }, mientras que en el últimoΘ{\displaystyle \Theta }es típicamente el conjunto de posibles funciones objetivo en sí mismo, por ejemplo, el conjunto de funciones continuas o funciones diferenciables .

Las cuestiones relevantes en este campo se refieren a la construcción de estimadores razonables, la consistencia , las tasas de convergencia y su optimalidad, y la estimación adaptativa. [ 7 ]

Consistencia

Como en la estadística paramétrica , una propiedad deseable para un estimadorFnorte^{\displaystyle {\sombrero {f_{n}}}}es que converge a la función objetivoF{\displaystyle f}como el tamaño de la muestranorte{\displaystyle n}tiende a infinito, es decir, el error de aproximación converge a cero. Por lo general, la aproximación se mide en términos deL2{\displaystyle L^{2}}-distancia de norma entreFnorte^{\displaystyle {\sombrero {f_{n}}}}yF{\displaystyle f}Dado que el estimador es una función de los datos extraídos aleatoriamenteincógnita=(incógnita1,,incógnitanorte){\displaystyle X=(X_{1},\dots ,X_{n})}La aproximación también es una variable aleatoria, por lo que distinguimos dos modos de convergencia diferentes:

Consistencia débil:límitenortemi[Fnorte^(incógnita)FL22]=0{\displaystyle \lim _{n\to \infty }\mathbb {E} [\lVert {\hat {f_{n}}}(X)-f\rVert _{L^{2}}^{2}]=0}.

Gran consistencia:límitenorteFnorte^(incógnita)FL22=0{\displaystyle \lim _{n\to \infty }\lVert {\hat {f_{n}}}(X)-f\rVert _{L^{2}}^{2}=0}casi con seguridad .

Si un estimador es consistente para todos los números de cuadrado integrableF{\displaystyle f}, entonces se le llama universalmente consistente . [ 8 ]

Muchos estimadores no paramétricos comunes son débilmente universalmente consistentes bajo una elección adecuada de hiperparámetros del modelo, por ejemplo, el estimador de Nadarya-Watson , los kNN y ciertos estimadores polinomiales locales . [ 9 ]

Tasas de convergencia óptimas minimax

Un tema central en el análisis estadístico de los estimadores no paramétricos es su velocidad de convergencia hacia la función objetivo verdadera.F{\displaystyle f} and whether the speed is optimal, i.e., the convergence is as fast as possible. The most common way to measure the speed of convergence of an estimator is the minimax convergence rate, which considers the expected loss of the estimator in the worst case scenario. Under certain assumptions on the smoothness of f{\displaystyle f}, one can show that there is a minimal convergence rates that no estimator can undercut, and so any estimator achieving this minimal rate is called optimal.

Mathematically speaking, the target function f{\displaystyle f} is assumed to belong to some class of functions H{\displaystyle {\mathcal {H}}}, called the hypothesis class, inducing a distribution Pf{\displaystyle \mathbb {P} _{f}} on X{\displaystyle {\mathcal {X}}}, and the approximation quality of an estimator fn^:XnH{\displaystyle {\hat {f_{n}}}:{\mathcal {X}}^{n}\to {\mathcal {H}}} is measured by some function L:H×H[0,){\displaystyle L:{\mathcal {H}}\times {\mathcal {H}}\to [0,\infty )}. The minimax convergence rate of fn^{\displaystyle {\sombrero {f_{n}}}} is a sequence (ψn)nN{\displaystyle (\psi _{n})_{n\in \mathbb {N} }} of real numbers for which it holdslim supn1ψnsupfHEf[L(f,fn^(X1,,Xn))]<,lim infn1ψnsupfHEf[L(f,fn^(X1,,Xn))]>0,{\displaystyle {\begin{aligned}\limsup _{n\to \infty }{\frac {1}{\psi _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {f_{n}}}(X_{1},\dots ,X_{n}){\big )}{\big ]}&<\infty ,\\\liminf _{n\to \infty }{\frac {1}{\psi _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {f_{n}}}(X_{1},\dots ,X_{n}){\big )}{\big ]}&>0,\end{aligned}}}where Ef[]{\displaystyle \mathbb {E} _{f}[\cdot ]} indicates that the random variables X1,,Xn{\displaystyle X_{1},\dots ,X_{n}}, which draw the data points, have distribution Pf{\displaystyle \mathbb {P} _{f}}.

A universal lower bound on estimation for a hypothesis class H{\displaystyle {\mathcal {H}}} is a sequence (ψn)nN{\displaystyle (\psi _{n})_{n\in \mathbb {N} }} for which it holdslim supn1ψninfρn^supfHEf[L(f,ρ^n(X1,,Xn))]<,lim infn1ψninfρn^supfHEf[L(f,ρ^n(X1,,Xn))]>0,{\displaystyle {\begin{aligned}\limsup _{n\to \infty }{\frac {1}{\psi _{n}}}\inf _{\hat {\rho _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {\rho }}_{n}(X_{1},\dots ,X_{n}){\big )}{\big ]}&<\infty ,\\\liminf _{n\to \infty }{\frac {1}{\psi _{n}}}\inf _{\hat {\rho _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {\rho }}_{n}(X_{1},\dots ,X_{n}){\big )}{\big ]}&>0,\end{aligned}}}where the infima are taken over all possible estimators ρ^n{\displaystyle {\hat {\rho }}_{n}} (that is, measurable functions) based on n{\displaystyle n} observations.

The detailed analysis of nonparametric estimators then separates into the estimation of probability densities and regressions functions.

Density estimation

The setting of density estimation typically involves a normed space of functions (F,){\displaystyle ({\mathcal {F}},\lVert \cdot \rVert )}, a subset of density functions H={fF:f0,Xf(x)dx=1,f1}{\displaystyle {\mathcal {H}}=\{f\in {\mathcal {F}}:f\geq 0,\int _{\mathcal {X}}f(x)dx=1,\lVert f\rVert \leq 1\}} and independent random variables X1,,XnXRd{\displaystyle X_{1},\dots ,X_{n}\in {\mathcal {X}}\subset \mathbb {R} ^{d}} distributed according to the measure with density fH{\displaystyle f\in {\mathcal {H}}}, which generates the data.

Minimax lower bounds are known for different pairs of function classes F{\displaystyle {\mathcal {F}}} and comparison metrics L{\displaystyle L}. Common choices for F{\displaystyle {\mathcal {F}}} are:

  • F=Cα(X),α>0{\displaystyle {\mathcal {F}}=C^{\alpha }({\mathcal {X}}),\alpha >0}: The space of α{\displaystyle \lfloor \alpha \rfloor }-times differentiable functions with the highest derivative being (αα){\displaystyle (\alpha -\lfloor \alpha \rfloor )}-Hölder-smooth.
  • F=Hs(X)=Ws,2(X),s>0{\displaystyle {\mathcal {F}}=H^{s}({\mathcal {X}})=W^{s,2}({\mathcal {X}}),s>0}: The space of Sobolev-smooth functions with square-integrable weak derivatives.
  • F=Bp,qs(X),s>0,p,q(0,]{\displaystyle {\mathcal {F}}=B_{p,q}^{s}({\mathcal {X}}),s>0,p,q\in (0,\infty ]}: The space of Besov-smooth functions.

In fact, the Hölder spaces and the Sobolev spaces are special cases of some Besov spaces, namely Cα(X)=B,α(X){\displaystyle C^{\alpha }({\mathcal {X}})=B_{\infty ,\infty }^{\alpha }({\mathcal {X}})} for αZ{\displaystyle \alpha \notin \mathbb {Z} } and Hs(X)=B2,2s(X){\displaystyle H^{s}({\mathcal {X}})=B_{2,2}^{s}({\mathcal {X}})}.[10] Thus, it often suffices to derive lower bounds under Besov-smoothness assumptions.

Common choices for L{\displaystyle L} are:

  • L(f,g)=(f(x0)g(x0))2,x0X{\displaystyle L(f,g)=(f(x_{0})-g(x_{0}))^{2},x_{0}\in {\mathcal {X}}}: The pointwise squared error (MSE).
  • L(f,g)=fgL2(X)2{\displaystyle L(f,g)=\lVert f-g\rVert _{L^{2}({\mathcal {X}})}^{2}}: The Mean Integrated Square Error (MISE).
  • L(f,g)=fgL(X){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{\infty }({\mathcal {X}})}}: The supremum-norm-distance.
  • L(f,g)=KL(PfPg){\displaystyle L(f,g)=\mathrm {KL} (\mathbb {P} _{f}\lVert \mathbb {P} _{g})}: The Kullback-Leibler divergence of the distributions induced by f{\displaystyle f} and g{\displaystyle g}.
  • L(f,g)=TV(Pf,Pg){\displaystyle L(f,g)=\mathrm {TV} (\mathbb {P} _{f},\mathbb {P} _{g})}: The total variation distance of the distributions induced by f{\displaystyle f} and g{\displaystyle g}.
  • L(f,g)=Wβ(Pf,Pg),β1{\displaystyle L(f,g)=W_{\beta }(\mathbb {P} _{f},\mathbb {P} _{g}),\beta \geq 1}: The Wasserstein-β{\displaystyle \beta } distance of the distributions induced by f{\displaystyle f} and g{\displaystyle g}.

By Scheffé's theorem, the total variation distance TV(Pf,Pg){\displaystyle \mathrm {TV} (\mathbb {P} _{f},\mathbb {P} _{g})} is equivalent to the L1{\displaystyle L^{1}}-distance of f{\displaystyle f} and g{\displaystyle g}.

The lower bound of the MISE is sometimes compared to the Cramér–Rao bound from parametric statistics, which is a lower bound for the mean-squared error of regular unbiased estimators of a parameter θ{\displaystyle \theta }:supθΘE[θθ^n2]n1supθΘtr(I(θ)1)=const.,supfBp,qs(X)E[ffn^L2(X)2]cn2s/(2s+d),{\displaystyle {\begin{aligned}\sup _{\theta \in \Theta }\mathbb {E} &[\lVert \theta -{\hat {\theta }}_{n}\rVert ^{2}]\geq n^{-1}\underbrace {\sup _{\theta \in \Theta }\mathrm {tr} (I(\theta )^{-1})} _{=const.},\\\sup _{f\in B_{p,q}^{s}({\mathcal {X}})}\mathbb {E} &[\lVert f-{\hat {f_{n}}}\rVert _{L^{2}({\mathcal {X}})}^{2}]\geq cn^{-2s/(2s+d)},\end{aligned}}}where I(θ){\displaystyle I(\theta )} is the Fisher information of the parametric model and c>0{\displaystyle c>0} is some constant. The nonparametric rate is thus slower than the parametric rate n1{\displaystyle n^{-1}}, especially in large dimensions, and approaches the parametric rate as the smoothness of the density tends to infinity.

Kernel density estimators, for instance, achieve the lower bound w.r.t. the MISE under a Sobolev hypothesis class under an appropriate bandwidth choice and is thus minimax optimal.[14] More recently, also score-based generative models have been shown to achieve minimax convergence rates in total variation and in Wasserstein-1 distance for Bp,qs([0,1]d){\displaystyle B_{p,q}^{s}([0,1]^{d})}-smooth distributions, s>(1/p1/2)+{\displaystyle s>(1/p-1/2)_{+}}, that are bounded away from zero from below.[15]

Regression

In the regression setting, the data arises in pairs (X1,Y1),,(Xn,Yn){\displaystyle (X_{1},Y_{1}),\dots ,(X_{n},Y_{n})}. Assuming that the data is independent and identically distributed, and E[|Y1|]<{\displaystyle \mathbb {E} [|Y_{1}|]<\infty }, one can always writeYi=f(Xi)+εi,{\displaystyle Y_{i}=f(X_{i})+\varepsilon _{i},}with f(x)=E[Y1X1=x]{\displaystyle f(x)=\mathbb {E} [Y_{1}\mid X_{1}=x]} being the regression function to be estimated and a noise variable εi{\displaystyle \varepsilon _{i}} fulfilling E[εi]=0{\displaystyle \mathbb {E} [\varepsilon _{i}]=0} and E[ε2]=σ2>0{\displaystyle \mathbb {E} [\varepsilon ^{2}]=\sigma ^{2}>0}. Typically, the independent variables Xi{\displaystyle X_{i}} are assumed to have values in the unit cube [0,1]d{\displaystyle [0,1]^{d}} and to be either deterministic points on a grid (deterministic design) or uniformly distributed (random design). Thus, X=[0,1]d×R{\displaystyle {\mathcal {X}}=[0,1]^{d}\times \mathbb {R} }.

The above setting applies to binary classification as well. In that case, the observations take only two values, say 0 and 1, such that f(x)=E[1{Y1=1}X=x]=P(Y1=1X=x){\displaystyle f(x)=\mathbb {E} [\mathbb {1} _{\{Y_{1}=1\}}\mid X=x]=\mathbb {P} (Y_{1}=1\mid X=x)} and given an estimator fn^{\displaystyle {\hat {f_{n}}}} of f{\displaystyle f}, the classifiers are assumed to have the form C(x)=1[1/2,1](fn^(x)){\displaystyle C(x)=\mathbb {1} _{[1/2,1]}({\hat {f_{n}}}(x))}, that is, they classify a point as 1 if the estimated probability of Y=1{\displaystyle Y=1} is greater than 1/2{\displaystyle 1/2} (and 0 otherwise). Indeed, many classification methods are of that form, for example logistic regression, linear discriminant analysis, quadratic discriminant analysis, and k-nearest-neighbors, and support vector machines.

Then, for the statistical analysis, the hypothesis class is of the form H={fF:f1}{\displaystyle {\mathcal {H}}=\{f\in {\mathcal {F}}:\lVert f\rVert \leq 1\}} for some normed space of functions (F,){\displaystyle ({\mathcal {F}},\lVert \cdot \rVert )} and expectations Ef{\displaystyle \mathbb {E} _{f}} are taken with respect to the joint distribution of X{\displaystyle X} and Y{\displaystyle Y} (or just Y{\displaystyle Y} if the Xi{\displaystyle X_{i}} are deterministic).

In nonparametric regression, the hypothesis class necessarily requires some strong assumptions on the regression function, otherwise, the minimax lower bound can be arbitrarily slow. For example, if F=L([0,1]){\displaystyle {\mathcal {F}}=L^{\infty }([0,1])}, that is, the set of bounded functions, then for any estimator fn^{\displaystyle {\hat {f_{n}}}}y cualquier secuencia cero(ψnorte)nortenorte{\displaystyle (\psi _{n})_{n\in \mathbb {N} }}, existeFH{\displaystyle f\in {\mathcal {H}}}de tal manera que [ 16 ]

límite superiornortemi[FFnorte^L2([0,1])2]ψnorte1.{\displaystyle \limsup _{n\to \infty }{\frac {\mathbb {E} [\lVert f-{\hat {f_{n}}}\rVert _{L^{2}([0,1])}^{2}]}{\psi _{n}}}\geq 1.}

Por lo tanto, las opciones comunes paraF{\displaystyle {\mathcal {F}}}son:

  • F=doα([0,1]d),α>0{\displaystyle {\mathcal {F}}=C^{\alpha }([0,1]^{d}),\alpha >0}: El espacio deα{\displaystyle \lfloor \alpha \rfloor }-veces funciones diferenciables con la derivada más alta siendo(αα){\displaystyle (\alpha -\lfloor \alpha \rfloor )}- Sostener - suave.
  • F=Wk,q([0,1]d),knorte,q>d{\displaystyle {\mathcal {F}}=W^{k,q}([0,1]^{d}),k\in \mathbb {N} ,q>d}: El espacio de funciones suaves de Sobolev conLq{\displaystyle L^{q}}-derivadas débiles integrables .

Opciones comunes paraL{\displaystyle L}son:

  • L(F,gramo)=(F(incógnita0)gramo(incógnita0))2,incógnita0[0,1]d{\displaystyle L(f,g)=(f(x_{0})-g(x_{0}))^{2},x_{0}\in [0,1]^{d}}: El error cuadrático medio (ECM) puntual.
  • L(F,gramo)=FgramoLpag([0,1]d),pag[1,){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{p}([0,1]^{d})},p\in [1,\infty )}: Elpag{\displaystyle p}norma -ésima.
  • L(F,gramo)=FgramoL([0,1]d){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{\infty }([0,1]^{d})}}: La distancia de norma suprema .

Bajo ciertas suposiciones técnicas, se conocen los siguientes límites inferiores.

Algunos estimadores polinomiales locales son óptimos minimax con respecto al MSE,L2{\displaystyle L^{2}}yL{\displaystyle L^{\infty }}bajoH=doα([0,1]d){\displaystyle {\mathcal {H}}=C^{\alpha }([0,1]^{d})}para arbitrarioα>0{\displaystyle \alpha >0}cuando el ancho de banda es de ordenO(norte12α+d){\displaystyle {\mathcal {O}}(n^{-{\frac {1}{2\alpha +d}}})}. [ 21 ] Los kNN también son óptimos minimax con respecto al MSE bajoH=do2([0,1]d){\displaystyle {\mathcal {H}}=C^{2}([0,1]^{d})}y con respectoL2{\displaystyle L^{2}}bajoH=do1([0,1]d){\displaystyle {\mathcal {H}}=C^{1}([0,1]^{d})}cuando el número de vecinos considerados es de ordenO(norte1d+4){\displaystyle {\mathcal {O}}(n^{\frac {1}{d+4}})}yO(norte1d+2){\displaystyle {\mathcal {O}}(n^{\frac {1}{d+2}})}respectivamente. [ 22 ]

Adaptabilidad

La elección de los hiperparámetros del modelo (por ejemplo, el ancho de banda para los métodos de núcleo o el número de vecinos para kNN) necesarios para lograr la tasa de convergencia óptima generalmente depende del parámetro de suavidad de la función objetivo desconocida, lo que significa que, en la práctica, sin una estimación adecuada de los hiperparámetros, los métodos mencionados anteriormente no son óptimos.

En cambio, interesan los métodos que logran las tasas de convergencia óptimas minimax no solo para un parámetro de suavidad específico, sino para diferentes valores. Sea la clase de hipótesis de la formaH=β>0Hβ{\displaystyle {\mathcal {H}}=\bigcup _{\beta >0}{\mathcal {H}}_{\beta }}(Por ejemploHβ=doβ([0,1]d){\displaystyle {\mathcal {H}}_{\beta }=C^{\beta }([0,1]^{d})}oHβ=Hβ([0,1]d){\displaystyle {\mathcal {H}}_{\beta }=H^{\beta }([0,1]^{d})}) y dejaψnorteβ{\displaystyle \psi _{n}^{\beta }}ser tasa de convergencia óptima enHβ{\displaystyle {\mathcal {H}}_{\beta }}. Luego, una familia de estimadores(Fnorte^)nortenorte{\displaystyle ({\hat {f_{n}}})_{n\in \mathbb {N} }}Se denomina adaptativo en el sentido minimax , si existe una constantedo(β){\displaystyle C(\beta )}dependiendo únicamente deβ{\displaystyle \beta }de tal manera que [ 23 ]

sorberFHβmi[L(Fnorte^,F)]do(β)ψnorteβ,β>0,nortenorte.{\displaystyle \sup _{f\in {\mathcal {H}}_{\beta }}\mathbb {E} [L({\hat {f_{n}}},f)]\leq C(\beta )\psi _{n}^{\beta },\quad \forall \beta >0,\quad \forall n\in \mathbb {N} .}

En otras palabras, se requiere un estimador adaptativo para lograr la tasa de convergencia minimax en todas las clases de hipótesis.Hβ{\displaystyle {\mathcal {H}}_{\beta }}pero sin tomar el parámetro desconocidoβ{\displaystyle \beta }como argumento. Los estimadores adaptativos a menudo se implementan tomando estimadores que son óptimos minimax para una familia de clases de hipótesis y estimando los hiperparámetros a través de un procedimiento de nivel superior, como la validación cruzada , o mediante penalización de complejidad. [ 24 ]

Historia

Las primeras estadísticas no paramétricas incluyen la mediana (siglo XIII o anterior, utilizada en la estimación por Edward Wright , 1599; véase Mediana §  Historia ) y la prueba de signos de John Arbuthnot (1710) para analizar la proporción de sexos humanos al nacer (véase Prueba de signos §  Historia ). [ 25 ] [ 26 ]

Véase también

Notas

  1. "Estadística no paramétrica en su totalidad" . Springer Texts in Statistics . 2006. doi : 10.1007/0-387-30623-4 . ISBN 978-0-387-25145-5.
  2. Pearce, J; Derrick, B (2019). "Pruebas preliminares: ¿El diablo de la estadística?" . Reinvention: An International Journal of Undergraduate Research . 12 (2). doi : 10.31273/reinvention.v12i2.339 .
  3. Stuart A., Ord JK, Arnold S. (1999), Teoría avanzada de la estadística de Kendall: Volumen 2A—Inferencia clásica y el modelo lineal , sexta edición, §20.2–20.3 ( Arnold ).
  4. Adikaram, KKLB; Hussein, MA; Effenberger, M.; Becker, T. (16 de noviembre de 2015). "Identificación de ajuste lineal universal: un método independiente de datos, valores atípicos y modelo de distribución de ruido y libre de imputación de datos faltantes o eliminados" . PLOS ONE . 10 (11) e0141486. ​​Bibcode : 2015PLoSO..1041486A . doi : 10.1371 / journal.pone.0141486 . ​​ISSN 1932-6203 . PMC 4646355. PMID 26571035 .   
  5. Györfi y otros. 2002 , pág. 9-12.
  6. Tsybakov 2009 , pág. 1.
  7. Tsybakov 2009 , pág. vii.
  8. Györfi y otros. 2002 , pág. 13.
  9. Györfi y otros. 2002 , pág. 72, 81, 88.
  10. ^ Triebel, Hans (1983). Teoría de los espacios funcionales . Monografías en matemáticas. Birkhäuser Verlag. ISBN 9783764313814.
  11. 1 2 Yang, Yuhong; Barron, Andrew (1999). "Determinación teórica de la información de las tasas de convergencia minimax" . Annals of Statistics . 27 (5): 1564– 1599.
  12. Niles-Weed, Jonathan; Berthet, Quentin (2022). "Estimación minimax de densidades suaves en la distancia de Wasserstein" . Annals of Statistics . 50 (3): 1519–1540 .
  13. Boyd, David W.; Steele, J. Michael (1978). "Límites inferiores para las tasas de estimación de densidad no paramétrica". Annals of Statistics . 6 (4): 932– 934.
  14. Tsybakov 2009 , pág. 15.
  15. Oko, Kazusato; Akiyama, Shunta; Suzuki, Taiji (2023). "Los modelos de difusión son estimadores de distribución óptimos minimax" . Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático . 202 : 26517–26582 .
  16. Györfi y otros. 2002 , pág. 32.
  17. Tsybakov 2009 , pág. 95, 132.
  18. Tsybakov 2009 , pág. 107.
  19. 1 2 3 4 Nemirovski, Arkadi (2000). Temas de estadística no paramétrica . págs. 5–31 . 
  20. Tsybakov 2009 , págs. 110, 132.
  21. Tsybakov 2009 , págs. 40, 44.
  22. Györfi y otros. 2002 , págs. 93–96.
  23. Tsybakov 2009 , pág. 180.
  24. Györfi y otros. 2002 , pág. 14-15, 26-28.
  25. Conover, WJ (1999), "Capítulo 3.4: La prueba de signos", Estadística no paramétrica práctica (Tercera ed.), Wiley, págs. 157–176 , ISBN   0-471-16068-7
  26. Sprent, P. (1989), Métodos estadísticos no paramétricos aplicados (Segunda edición), Chapman & Hall, ISBN  0-412-44980-3

Referencias generales

  • Bagdonavicius, V., Kruopis, J., Nikulin, MS (2011). "Pruebas no paramétricas para datos completos", ISTE & WILEY: Londres y Hoboken. ISBN 978-1-84821-269-5.
  • Corder, GW; Foreman, DI (2014). Estadística no paramétrica: un enfoque paso a paso . Wiley. ISBN 978-1-118-84031-3.
  • Gibbons, Jean Dickinson ; Chakraborti, Subhabrata (2003). Inferencia estadística no paramétrica , 4.ª ed. CRC Press. ISBN 0-8247-4052-1.
  • Györfi, László; Kohler, Michael; Krzyzak, Adán; Paseo, Harro (2002). Una teoría de la regresión no paramétrica sin distribución . Saltador. ISBN 0-387-95441-4.
  • Hettmansperger, TP; McKean, JW (1998). Métodos estadísticos no paramétricos robustos . Biblioteca de estadística de Kendall. Vol.  5. Londres: Edward Arnold . ISBN 0-340-54937-8MR 1604954 .​ también ISBN 0-471-19479-4.
  • Hollander M., Wolfe DA, Chicken E. (2014). Métodos estadísticos no paramétricos , John Wiley & Sons.
  • Sheskin, David J. (2003) Manual de procedimientos estadísticos paramétricos y no paramétricos . CRC Press. ISBN 1-58488-440-1
  • Tsybakov, Alexandre B. (2009). Introducción a la estimación no paramétrica . Springer. ISBN 978-0-387-79051-0.
  • Wasserman, Larry (2007). Estadística no paramétrica completa , Springer. ISBN 0-387-25145-6.