La estadística no paramétrica es un tipo de análisis estadístico que requiere un mínimo de supuestos sobre la distribución subyacente de los datos estudiados. A menudo, estos modelos son de dimensión infinita, en lugar de dimensión finita, como en la estadística paramétrica . [ 1 ] La estadística no paramétrica puede utilizarse para estadística descriptiva o inferencia estadística . Las pruebas no paramétricas se utilizan con frecuencia cuando los supuestos de las pruebas paramétricas se incumplen claramente. [ 2 ]
Definiciones
El término "estadística no paramétrica" se ha definido de forma imprecisa, entre otras, de las dos maneras siguientes:
El primer significado de no paramétrico implica técnicas que no dependen de datos que pertenezcan a ninguna familia paramétrica particular de distribuciones de probabilidad. Estas incluyen, entre otras:
- Métodos que no dependen de la distribución , que no se basan en suposiciones de que los datos se extraen de una familia paramétrica determinada de distribuciones de probabilidad .
- Estadísticas definidas como una función de una muestra, sin dependencia de un parámetro .
Un ejemplo son las estadísticas de orden , que se basan en la clasificación ordinal de las observaciones.
La discusión que sigue está tomada de la Teoría Avanzada de la Estadística de Kendall . [ 3 ]
Las hipótesis estadísticas se refieren al comportamiento de variables aleatorias observables... Por ejemplo, la hipótesis (a) de que una distribución normal tiene una media y una varianza especificadas es estadística; también lo es la hipótesis (b) de que tiene una media dada pero una varianza no especificada; también lo es la hipótesis (c) de que una distribución es de forma normal con media y varianza no especificadas; finalmente, también lo es la hipótesis (d) de que dos distribuciones continuas no especificadas son idénticas.
Se habrá notado que en los ejemplos (a) y (b) se tomó que la distribución subyacente a las observaciones era de una forma determinada (la normal) y la hipótesis se refería enteramente al valor de uno o ambos de sus parámetros. Dicha hipótesis, por razones obvias, se denomina paramétrica .
La hipótesis (c) era de naturaleza diferente, ya que no se especifican valores de parámetros en su enunciado; podríamos denominarla razonablemente no paramétrica . La hipótesis (d) también es no paramétrica, pero, además, ni siquiera especifica la forma subyacente de la distribución y ahora puede denominarse razonablemente libre de distribución . A pesar de estas distinciones, la literatura estadística suele aplicar la etiqueta de "no paramétrico" a procedimientos de prueba que acabamos de denominar "libres de distribución", perdiendo así una clasificación útil.
El segundo significado de no paramétrico se refiere a técnicas que no presuponen que la estructura de un modelo sea fija. Por lo general, el modelo aumenta de tamaño para adaptarse a la complejidad de los datos. En estas técnicas, se suele asumir que las variables individuales pertenecen a distribuciones paramétricas, y también se hacen suposiciones sobre los tipos de asociaciones entre variables. Estas técnicas incluyen, entre otras:
- La regresión no paramétrica es un tipo de modelado en el que la estructura de la relación entre variables se trata de forma no paramétrica, pero donde, no obstante, pueden existir supuestos paramétricos sobre la distribución de los residuos del modelo.
- modelos bayesianos jerárquicos no paramétricos , como los modelos basados en el proceso de Dirichlet , que permiten que el número de variables latentes crezca según sea necesario para ajustarse a los datos, pero donde las variables individuales siguen distribuciones paramétricas e incluso el proceso que controla la tasa de crecimiento de las variables latentes sigue una distribución paramétrica.
Aplicaciones y propósito
Los métodos no paramétricos se utilizan ampliamente para estudiar poblaciones con un orden jerarquizado (como las reseñas de películas que reciben de una a cinco estrellas). El uso de métodos no paramétricos puede ser necesario cuando los datos tienen una clasificación pero carecen de una interpretación numérica clara , como al evaluar preferencias . En términos de niveles de medición , los métodos no paramétricos dan como resultado datos ordinales .
Dado que los métodos no paramétricos requieren menos supuestos, su aplicabilidad es mucho más general que la de los métodos paramétricos correspondientes. En particular, pueden aplicarse en situaciones donde se conoce menos sobre la aplicación en cuestión. Además, debido a que dependen de menos supuestos, los métodos no paramétricos son más robustos .
Los métodos no paramétricos a veces se consideran más sencillos de usar y más robustos que los paramétricos, incluso cuando se justifican los supuestos de estos últimos . Esto se debe a su naturaleza más general, que puede hacerlos menos propensos a un uso indebido y a malentendidos. Los métodos no paramétricos pueden considerarse una opción conservadora, ya que funcionan incluso cuando no se cumplen sus supuestos, mientras que los métodos paramétricos pueden producir resultados engañosos cuando estos se incumplen.
La mayor aplicabilidad y robustez de las pruebas no paramétricas conlleva un inconveniente: en los casos en que se cumplen los supuestos de una prueba paramétrica, las pruebas no paramétricas tienen menor potencia estadística . En otras palabras, puede ser necesario un tamaño de muestra mayor para llegar a conclusiones con el mismo grado de confianza.
Modelos no paramétricos
Los modelos no paramétricos se diferencian de los paramétricos en que su estructura no se especifica a priori, sino que se determina a partir de los datos. El término "no paramétrico" no implica que dichos modelos carezcan por completo de parámetros, sino que el número y la naturaleza de estos son flexibles y no están predeterminados.
- Histograma : una estimación no paramétrica simple de una distribución de probabilidad.
- Estimación de densidad de kernel : método para estimar una distribución de probabilidad, a menudo basado en promedios locales.
- Splines de suavizado : método de regresión basado en splines .
- Análisis de envolvente de datos : proporciona coeficientes de eficiencia similares a los obtenidos mediante análisis multivariante sin ninguna suposición sobre la distribución.
- k-vecinos más cercanos (kNN) : clasifica la instancia no vista en función de los k puntos del conjunto de entrenamiento que están más cerca de ella.
- Máquina de vectores de soporte (con núcleo gaussiano): un clasificador no paramétrico de amplio margen.
- Método de los momentos : estimador para un único valor, como la media o la varianza de una distribución.
pruebas no paramétricas
Los métodos estadísticos inferenciales no paramétricos (o libres de distribución ) son procedimientos matemáticos para la prueba de hipótesis estadísticas que, a diferencia de la estadística paramétrica , no hacen suposiciones sobre las distribuciones de probabilidad de las variables que se evalúan. Las pruebas más utilizadas incluyen:
- Análisis de similitudes
- Prueba de Anderson-Darling : comprueba si una muestra se ha extraído de una distribución determinada.
- Métodos de remuestreo estadístico : estiman la precisión/distribución muestral de un estadístico.
- Prueba de chi-cuadrado
- Cochran's Q: tests whether k treatments in randomized block designs with 0/1 outcomes have identical effects
- Cohen's kappa: measures inter-rater agreement for categorical items
- Friedman two-way analysis of variance (Repeated Measures) by ranks: tests whether k treatments in randomized block designs have identical effects
- Empirical likelihood
- Kaplan–Meier: estimates the survival function from lifetime data, modeling censoring
- Kendall's tau: measures statistical dependence between two variables
- Kendall's W: a measure between 0 and 1 of inter-rater agreement.
- Kolmogorov–Smirnov test: tests whether a sample is drawn from a given distribution, or whether two samples are drawn from the same distribution.
- Kruskal–Wallis one-way analysis of variance by ranks: tests whether > 2 independent samples are drawn from the same distribution.
- Kuiper's test: tests whether a sample is drawn from a given distribution, sensitive to cyclic variations such as day of the week.
- Logrank test: compares survival distributions of two right-skewed, censored samples.
- Mann–Whitney U or Wilcoxon rank sum test: tests whether two samples are drawn from the same distribution, as compared to a given alternative hypothesis.
- McNemar's test: tests whether, in 2 × 2 contingency tables with a dichotomous trait and matched pairs of subjects, row and column marginal frequencies are equal.
- Median test: tests whether two samples are drawn from distributions with equal medians.
- Pitman's permutation test: a statistical significance test that yields exact p values by examining all possible rearrangements of labels.
- Rank products: detects differentially expressed genes in replicated microarray experiments.
- Siegel–Tukey test: tests for differences in scale between two groups.
- Sign test: tests whether matched pair samples are drawn from distributions with equal medians.
- Spearman's rank correlation coefficient: measures statistical dependence between two variables using a monotonic function.
- Squared ranks test: tests equality of variances in two or more samples.
- Tukey–Duckworth test: tests equality of two distributions by using ranks.
- Wald–Wolfowitz runs test: tests whether the elements of a sequence are mutually independent/random.
- Wilcoxon signed-rank test: tests whether matched pair samples are drawn from populations with different mean ranks.
- Identificación de ajuste lineal universal: un método independiente de los datos, los valores atípicos y el modelo de distribución de ruido, y libre de la imputación de datos faltantes o eliminados. [ 4 ]
Estadística matemática
En estadística matemática , los modelos no paramétricos se consideran modelos que no dependen de una suposición paramétrica de la distribución de datos desconocida (en problemas de estimación de densidad ) o de la función de regresión (en problemas de regresión ). Mientras que el objetivo de cualquier modelo paramétrico es la estimación de un número finito de parámetros.Los modelos no paramétricos buscan estimar directamente la distribución de datos/función de regresión. [ 5 ] [ 6 ]
Sin embargo, para el análisis matemático, los enfoques paramétricos y no paramétricos se ajustan al mismo contexto: Suponiendo que la función que se va a estimar (distribución de datos o función de regresión) pertenece a un conjunto de funciones parametrizadas por un conjunto, uno busca una función (medible)que estima el parámetro "verdadero" basándose en puntos de datosLa diferencia clave entre los enfoques paramétricos y no paramétricos es que en los primerospara algunos, mientras que en el últimoes típicamente el conjunto de posibles funciones objetivo en sí mismo, por ejemplo, el conjunto de funciones continuas o funciones diferenciables .
Las cuestiones relevantes en este campo se refieren a la construcción de estimadores razonables, la consistencia , las tasas de convergencia y su optimalidad, y la estimación adaptativa. [ 7 ]
Consistencia
Como en la estadística paramétrica , una propiedad deseable para un estimadores que converge a la función objetivocomo el tamaño de la muestratiende a infinito, es decir, el error de aproximación converge a cero. Por lo general, la aproximación se mide en términos de-distancia de norma entreyDado que el estimador es una función de los datos extraídos aleatoriamenteLa aproximación también es una variable aleatoria, por lo que distinguimos dos modos de convergencia diferentes:
Consistencia débil:.
Gran consistencia:casi con seguridad .
Si un estimador es consistente para todos los números de cuadrado integrable, entonces se le llama universalmente consistente . [ 8 ]
Muchos estimadores no paramétricos comunes son débilmente universalmente consistentes bajo una elección adecuada de hiperparámetros del modelo, por ejemplo, el estimador de Nadarya-Watson , los kNN y ciertos estimadores polinomiales locales . [ 9 ]
Tasas de convergencia óptimas minimax
Un tema central en el análisis estadístico de los estimadores no paramétricos es su velocidad de convergencia hacia la función objetivo verdadera. and whether the speed is optimal, i.e., the convergence is as fast as possible. The most common way to measure the speed of convergence of an estimator is the minimax convergence rate, which considers the expected loss of the estimator in the worst case scenario. Under certain assumptions on the smoothness of , one can show that there is a minimal convergence rates that no estimator can undercut, and so any estimator achieving this minimal rate is called optimal.
Mathematically speaking, the target function is assumed to belong to some class of functions , called the hypothesis class, inducing a distribution on , and the approximation quality of an estimator is measured by some function . The minimax convergence rate of is a sequence of real numbers for which it holdswhere indicates that the random variables , which draw the data points, have distribution .
A universal lower bound on estimation for a hypothesis class is a sequence for which it holdswhere the infima are taken over all possible estimators (that is, measurable functions) based on observations.
The detailed analysis of nonparametric estimators then separates into the estimation of probability densities and regressions functions.
Density estimation
The setting of density estimation typically involves a normed space of functions , a subset of density functions and independent random variables distributed according to the measure with density , which generates the data.
Minimax lower bounds are known for different pairs of function classes and comparison metrics . Common choices for are:
- : The space of -times differentiable functions with the highest derivative being -Hölder-smooth.
- : The space of Sobolev-smooth functions with square-integrable weak derivatives.
- : The space of Besov-smooth functions.
In fact, the Hölder spaces and the Sobolev spaces are special cases of some Besov spaces, namely for and .[10] Thus, it often suffices to derive lower bounds under Besov-smoothness assumptions.
Common choices for are:
- : The pointwise squared error (MSE).
- : The Mean Integrated Square Error (MISE).
- : The supremum-norm-distance.
- : The Kullback-Leibler divergence of the distributions induced by and .
- : The total variation distance of the distributions induced by and .
- : The Wasserstein- distance of the distributions induced by and .
By Scheffé's theorem, the total variation distance is equivalent to the -distance of and .
The lower bound of the MISE is sometimes compared to the Cramér–Rao bound from parametric statistics, which is a lower bound for the mean-squared error of regular unbiased estimators of a parameter :where is the Fisher information of the parametric model and is some constant. The nonparametric rate is thus slower than the parametric rate , especially in large dimensions, and approaches the parametric rate as the smoothness of the density tends to infinity.
Kernel density estimators, for instance, achieve the lower bound w.r.t. the MISE under a Sobolev hypothesis class under an appropriate bandwidth choice and is thus minimax optimal.[14] More recently, also score-based generative models have been shown to achieve minimax convergence rates in total variation and in Wasserstein-1 distance for -smooth distributions, , that are bounded away from zero from below.[15]
Regression
In the regression setting, the data arises in pairs . Assuming that the data is independent and identically distributed, and , one can always writewith being the regression function to be estimated and a noise variable fulfilling and . Typically, the independent variables are assumed to have values in the unit cube and to be either deterministic points on a grid (deterministic design) or uniformly distributed (random design). Thus, .
The above setting applies to binary classification as well. In that case, the observations take only two values, say 0 and 1, such that and given an estimator of , the classifiers are assumed to have the form , that is, they classify a point as 1 if the estimated probability of is greater than (and 0 otherwise). Indeed, many classification methods are of that form, for example logistic regression, linear discriminant analysis, quadratic discriminant analysis, and k-nearest-neighbors, and support vector machines.
Then, for the statistical analysis, the hypothesis class is of the form for some normed space of functions and expectations are taken with respect to the joint distribution of and (or just if the are deterministic).
In nonparametric regression, the hypothesis class necessarily requires some strong assumptions on the regression function, otherwise, the minimax lower bound can be arbitrarily slow. For example, if , that is, the set of bounded functions, then for any estimator y cualquier secuencia cero, existede tal manera que [ 16 ]
Por lo tanto, las opciones comunes parason:
- : El espacio de-veces funciones diferenciables con la derivada más alta siendo- Sostener - suave.
- : El espacio de funciones suaves de Sobolev con-derivadas débiles integrables .
Opciones comunes parason:
- : El error cuadrático medio (ECM) puntual.
- : Elnorma -ésima.
- : La distancia de norma suprema .
Bajo ciertas suposiciones técnicas, se conocen los siguientes límites inferiores.
Algunos estimadores polinomiales locales son óptimos minimax con respecto al MSE,ybajopara arbitrariocuando el ancho de banda es de orden. [ 21 ] Los kNN también son óptimos minimax con respecto al MSE bajoy con respectobajocuando el número de vecinos considerados es de ordenyrespectivamente. [ 22 ]
Adaptabilidad
La elección de los hiperparámetros del modelo (por ejemplo, el ancho de banda para los métodos de núcleo o el número de vecinos para kNN) necesarios para lograr la tasa de convergencia óptima generalmente depende del parámetro de suavidad de la función objetivo desconocida, lo que significa que, en la práctica, sin una estimación adecuada de los hiperparámetros, los métodos mencionados anteriormente no son óptimos.
En cambio, interesan los métodos que logran las tasas de convergencia óptimas minimax no solo para un parámetro de suavidad específico, sino para diferentes valores. Sea la clase de hipótesis de la forma(Por ejemploo) y dejaser tasa de convergencia óptima en. Luego, una familia de estimadoresSe denomina adaptativo en el sentido minimax , si existe una constantedependiendo únicamente dede tal manera que [ 23 ]
En otras palabras, se requiere un estimador adaptativo para lograr la tasa de convergencia minimax en todas las clases de hipótesis.pero sin tomar el parámetro desconocidocomo argumento. Los estimadores adaptativos a menudo se implementan tomando estimadores que son óptimos minimax para una familia de clases de hipótesis y estimando los hiperparámetros a través de un procedimiento de nivel superior, como la validación cruzada , o mediante penalización de complejidad. [ 24 ]
Historia
Las primeras estadísticas no paramétricas incluyen la mediana (siglo XIII o anterior, utilizada en la estimación por Edward Wright , 1599; véase Mediana § Historia ) y la prueba de signos de John Arbuthnot (1710) para analizar la proporción de sexos humanos al nacer (véase Prueba de signos § Historia ). [ 25 ] [ 26 ]
Véase también
Notas
- ↑ "Estadística no paramétrica en su totalidad" . Springer Texts in Statistics . 2006. doi : 10.1007/0-387-30623-4 . ISBN 978-0-387-25145-5.
- ↑ Pearce, J; Derrick, B (2019). "Pruebas preliminares: ¿El diablo de la estadística?" . Reinvention: An International Journal of Undergraduate Research . 12 (2). doi : 10.31273/reinvention.v12i2.339 .
- ↑ Stuart A., Ord JK, Arnold S. (1999), Teoría avanzada de la estadística de Kendall: Volumen 2A—Inferencia clásica y el modelo lineal , sexta edición, §20.2–20.3 ( Arnold ).
- ↑ Adikaram, KKLB; Hussein, MA; Effenberger, M.; Becker, T. (16 de noviembre de 2015). "Identificación de ajuste lineal universal: un método independiente de datos, valores atípicos y modelo de distribución de ruido y libre de imputación de datos faltantes o eliminados" . PLOS ONE . 10 (11) e0141486. Bibcode : 2015PLoSO..1041486A . doi : 10.1371 / journal.pone.0141486 . ISSN 1932-6203 . PMC 4646355. PMID 26571035 .
- ↑ Györfi y otros. 2002 , pág. 9-12.
- ↑ Tsybakov 2009 , pág. 1.
- ↑ Tsybakov 2009 , pág. vii.
- ↑ Györfi y otros. 2002 , pág. 13.
- ↑ Györfi y otros. 2002 , pág. 72, 81, 88.
- ^ Triebel, Hans (1983). Teoría de los espacios funcionales . Monografías en matemáticas. Birkhäuser Verlag. ISBN 9783764313814.
- 1 2 Yang, Yuhong; Barron, Andrew (1999). "Determinación teórica de la información de las tasas de convergencia minimax" . Annals of Statistics . 27 (5): 1564– 1599.
- ↑ Niles-Weed, Jonathan; Berthet, Quentin (2022). "Estimación minimax de densidades suaves en la distancia de Wasserstein" . Annals of Statistics . 50 (3): 1519–1540 .
- ↑ Boyd, David W.; Steele, J. Michael (1978). "Límites inferiores para las tasas de estimación de densidad no paramétrica". Annals of Statistics . 6 (4): 932– 934.
- ↑ Tsybakov 2009 , pág. 15.
- ↑ Oko, Kazusato; Akiyama, Shunta; Suzuki, Taiji (2023). "Los modelos de difusión son estimadores de distribución óptimos minimax" . Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático . 202 : 26517–26582 .
- ↑ Györfi y otros. 2002 , pág. 32.
- ↑ Tsybakov 2009 , pág. 95, 132.
- ↑ Tsybakov 2009 , pág. 107.
- 1 2 3 4 Nemirovski, Arkadi (2000). Temas de estadística no paramétrica . págs. 5–31 .
- ↑ Tsybakov 2009 , págs. 110, 132.
- ↑ Tsybakov 2009 , págs. 40, 44.
- ↑ Györfi y otros. 2002 , págs. 93–96.
- ↑ Tsybakov 2009 , pág. 180.
- ↑ Györfi y otros. 2002 , pág. 14-15, 26-28.
- ↑ Conover, WJ (1999), "Capítulo 3.4: La prueba de signos", Estadística no paramétrica práctica (Tercera ed.), Wiley, págs. 157–176 , ISBN 0-471-16068-7
- ↑ Sprent, P. (1989), Métodos estadísticos no paramétricos aplicados (Segunda edición), Chapman & Hall, ISBN 0-412-44980-3
Referencias generales
- Bagdonavicius, V., Kruopis, J., Nikulin, MS (2011). "Pruebas no paramétricas para datos completos", ISTE & WILEY: Londres y Hoboken. ISBN 978-1-84821-269-5.
- Corder, GW; Foreman, DI (2014). Estadística no paramétrica: un enfoque paso a paso . Wiley. ISBN 978-1-118-84031-3.
- Gibbons, Jean Dickinson ; Chakraborti, Subhabrata (2003). Inferencia estadística no paramétrica , 4.ª ed. CRC Press. ISBN 0-8247-4052-1.
- Györfi, László; Kohler, Michael; Krzyzak, Adán; Paseo, Harro (2002). Una teoría de la regresión no paramétrica sin distribución . Saltador. ISBN 0-387-95441-4.
- Hettmansperger, TP; McKean, JW (1998). Métodos estadísticos no paramétricos robustos . Biblioteca de estadística de Kendall. Vol. 5. Londres: Edward Arnold . ISBN 0-340-54937-8MR 1604954 . también ISBN 0-471-19479-4.
- Hollander M., Wolfe DA, Chicken E. (2014). Métodos estadísticos no paramétricos , John Wiley & Sons.
- Sheskin, David J. (2003) Manual de procedimientos estadísticos paramétricos y no paramétricos . CRC Press. ISBN 1-58488-440-1
- Tsybakov, Alexandre B. (2009). Introducción a la estimación no paramétrica . Springer. ISBN 978-0-387-79051-0.
- Wasserman, Larry (2007). Estadística no paramétrica completa , Springer. ISBN 0-387-25145-6.
- estadística no paramétrica
- Inferencia estadística
- Estadísticas sólidas
- Métodos matemáticos y cuantitativos (economía)