
La estadística matemática es la aplicación de la teoría de la probabilidad y otros conceptos matemáticos a la estadística , a diferencia de las técnicas para recopilar datos estadísticos. [ 1 ] Las técnicas matemáticas específicas que se utilizan comúnmente en estadística incluyen el análisis matemático , el álgebra lineal , el análisis estocástico , las ecuaciones diferenciales y la teoría de la medida . [ 2 ] [ 3 ]
Introducción
La recopilación de datos estadísticos se centra en la planificación de estudios, especialmente en el diseño de experimentos aleatorios y en la planificación de encuestas mediante muestreo aleatorio . El análisis inicial de los datos suele seguir el protocolo de estudio especificado antes de su realización. Los datos de un estudio también pueden analizarse para considerar hipótesis secundarias inspiradas en los resultados iniciales o para sugerir nuevos estudios. Un análisis secundario de los datos de un estudio planificado utiliza herramientas de análisis de datos , y el proceso para llevarlo a cabo es estadística matemática.
El análisis de datos se divide en:
- Estadística descriptiva : la parte de la estadística que describe los datos, es decir, resume los datos y sus propiedades típicas.
- estadística inferencial : la parte de la estadística que extrae conclusiones a partir de datos (utilizando algún modelo para los datos): por ejemplo, la estadística inferencial implica seleccionar un modelo para los datos, comprobar si los datos cumplen las condiciones de un modelo particular y cuantificar la incertidumbre involucrada (por ejemplo, utilizando intervalos de confianza ).
Si bien las herramientas de análisis de datos funcionan mejor con datos de estudios aleatorios, también se aplican a otros tipos de datos. Por ejemplo, a partir de experimentos naturales y estudios observacionales , en cuyo caso la inferencia depende del modelo elegido por el estadístico y, por lo tanto, es subjetiva. [ 4 ] [ 5 ]
Temas
Los siguientes son algunos de los temas importantes en estadística matemática: [ 6 ] [ 7 ]
Distribuciones de probabilidad
Una distribución de probabilidad es una función que asigna una probabilidad a cada subconjunto medible de los posibles resultados de un experimento aleatorio , una encuesta o un procedimiento de inferencia estadística . Ejemplos de esto se encuentran en experimentos cuyo espacio muestral no es numérico, donde la distribución sería una distribución categórica ; experimentos cuyo espacio muestral está codificado por variables aleatorias discretas , donde la distribución puede especificarse mediante una función de masa de probabilidad ; y experimentos con espacios muestrales codificados por variables aleatorias continuas, donde la distribución puede especificarse mediante una función de densidad de probabilidad . Los experimentos más complejos, como aquellos que involucran procesos estocásticos definidos en tiempo continuo , pueden requerir el uso de medidas de probabilidad más generales .
Una distribución de probabilidad puede ser univariada o multivariada . Una distribución univariada proporciona las probabilidades de que una única variable aleatoria tome diversos valores alternativos; una distribución multivariada (una distribución de probabilidad conjunta ) proporciona las probabilidades de que un vector aleatorio —un conjunto de dos o más variables aleatorias— tome diversas combinaciones de valores. Entre las distribuciones de probabilidad univariadas importantes y comunes se incluyen la distribución binomial , la distribución hipergeométrica y la distribución normal . La distribución normal multivariada es una distribución multivariada común.
Distribuciones especiales
- Distribución normal , la distribución continua más común.
- Distribución de Bernoulli , para el resultado de un único ensayo de Bernoulli (por ejemplo, éxito/fracaso, sí/no).
- Distribución binomial , para el número de "sucesos positivos" (por ejemplo, éxitos, votos afirmativos, etc.) dado un número total fijo de sucesos independientes.
- Distribución binomial negativa , para observaciones de tipo binomial pero donde la cantidad de interés es el número de fallos antes de que ocurra un número determinado de éxitos.
- Distribución geométrica , para observaciones de tipo binomial pero donde la cantidad de interés es el número de fallos antes del primer éxito; un caso especial de la distribución binomial negativa, donde el número de éxitos es uno.
- Distribución uniforme discreta , para un conjunto finito de valores (por ejemplo, el resultado de un dado justo).
- Distribución uniforme continua , para valores distribuidos de forma continua.
- Distribución de Poisson , para el número de ocurrencias de un evento de tipo Poisson en un período de tiempo determinado.
- Distribución exponencial , para el tiempo antes de que ocurra el siguiente evento de tipo Poisson.
- Distribución gamma , para el tiempo anterior a que ocurran los siguientes k eventos de tipo Poisson.
- Distribución chi-cuadrado , la distribución de una suma de variables normales estándar al cuadrado; útil, por ejemplo, para la inferencia sobre la varianza muestral de muestras con distribución normal (véase prueba chi-cuadrado ).
- Distribución t de Student , la distribución de la razón entre una variable normal estándar y la raíz cuadrada de una variable chi cuadrada escalada; útil para la inferencia sobre la media de muestras con distribución normal y varianza desconocida (véase Prueba t de Student ).
- Distribución beta , para una única probabilidad (número real entre 0 y 1); conjugada a la distribución de Bernoulli y a la distribución binomial.
Inferencia estadística
La inferencia estadística es el proceso de extraer conclusiones a partir de datos sujetos a variación aleatoria, por ejemplo, errores de observación o variación muestral. [ 8 ] Los requisitos iniciales de un sistema de procedimientos de inferencia e inducción son que produzca respuestas razonables al aplicarse a situaciones bien definidas y que sea lo suficientemente general como para aplicarse a diversas situaciones. La estadística inferencial se utiliza para contrastar hipótesis y realizar estimaciones a partir de datos de muestra. Mientras que la estadística descriptiva describe una muestra, la estadística inferencial infiere predicciones sobre una población mayor que la que representa la muestra.
El resultado de la inferencia estadística puede ser una respuesta a la pregunta "¿qué se debe hacer a continuación?", donde esto podría implicar una decisión sobre la realización de experimentos o encuestas adicionales, o sobre la obtención de una conclusión antes de implementar alguna política organizacional o gubernamental. En general, la inferencia estadística formula proposiciones sobre poblaciones, utilizando datos extraídos de la población de interés mediante algún tipo de muestreo aleatorio. De manera más general, los datos sobre un proceso aleatorio se obtienen a partir de su comportamiento observado durante un período de tiempo finito. Dado un parámetro o hipótesis sobre el cual se desea realizar una inferencia, la inferencia estadística suele utilizar:
- un modelo estadístico del proceso aleatorio que se supone que genera los datos, que se conoce cuando se ha utilizado la aleatorización, y
- una realización particular del proceso aleatorio; es decir, un conjunto de datos.
Regresión
En estadística , el análisis de regresión es un proceso estadístico para estimar las relaciones entre variables. Incluye diversas formas de modelar y analizar varias variables, centrándose en la relación entre una variable dependiente y una o más variables independientes . Más específicamente, el análisis de regresión ayuda a comprender cómo cambia el valor típico de la variable dependiente (o "variable criterio") cuando se varía cualquiera de las variables independientes, mientras que las demás se mantienen fijas. Generalmente, el análisis de regresión estima la esperanza condicional de la variable dependiente dadas las variables independientes; es decir, el valor promedio de la variable dependiente cuando las variables independientes son fijas. Con menos frecuencia, se centra en un cuantil u otro parámetro de localización de la distribución condicional de la variable dependiente dadas las variables independientes. En todos los casos, el objetivo de la estimación es una función de las variables independientes denominada función de regresión . En el análisis de regresión, también es de interés caracterizar la variación de la variable dependiente alrededor de la función de regresión, que puede describirse mediante una distribución de probabilidad .
Se han desarrollado numerosas técnicas para realizar análisis de regresión. Los métodos más conocidos, como la regresión lineal , son paramétricos , ya que la función de regresión se define en términos de un número finito de parámetros desconocidos que se estiman a partir de los datos (por ejemplo, mediante mínimos cuadrados ordinarios ). La regresión no paramétrica se refiere a técnicas que permiten que la función de regresión pertenezca a un conjunto específico de funciones , que pueden ser de dimensión infinita .
estadística no paramétrica
La estadística no paramétrica se basa en valores calculados a partir de datos sin utilizar familias parametrizadas de distribuciones de probabilidad . Incluye tanto estadística descriptiva como inferencial . Los parámetros típicos son la esperanza matemática, la varianza, etc. A diferencia de la estadística paramétrica , la estadística no paramétrica no presupone ninguna distribución de probabilidad para las variables evaluadas. [ 9 ]
Los métodos no paramétricos se utilizan ampliamente para estudiar poblaciones que adoptan un orden jerárquico (como las reseñas de películas con una a cuatro estrellas). El uso de métodos no paramétricos puede ser necesario cuando los datos tienen una clasificación pero carecen de una interpretación numérica clara, como al evaluar preferencias . En términos de niveles de medición , los métodos no paramétricos dan como resultado datos ordinales.
Dado que los métodos no paramétricos requieren menos supuestos, su aplicabilidad es mucho más amplia que la de los métodos paramétricos correspondientes. En particular, pueden aplicarse en situaciones donde se conoce menos sobre la aplicación en cuestión. Además, debido a que dependen de menos supuestos, los métodos no paramétricos son más robustos .
Una desventaja de los métodos no paramétricos es que, al no depender de supuestos, generalmente son menos potentes que sus contrapartes paramétricas. [ 10 ] Las pruebas no paramétricas de baja potencia son problemáticas porque un uso común de estos métodos es cuando una muestra tiene un tamaño de muestra pequeño. [ 10 ] Muchos métodos paramétricos han demostrado ser las pruebas más potentes a través de métodos como el lema de Neyman-Pearson y la prueba de razón de verosimilitud .
Otra justificación para el uso de métodos no paramétricos es su simplicidad. En ciertos casos, incluso cuando el uso de métodos paramétricos está justificado, los métodos no paramétricos pueden ser más fáciles de usar. Debido a esta simplicidad y a su mayor robustez, algunos estadísticos consideran que los métodos no paramétricos ofrecen menos margen para un uso incorrecto y malentendidos.
Estadística, matemáticas y estadística matemática
La estadística matemática es una rama fundamental de la estadística . Los teóricos estadísticos estudian y mejoran los procedimientos estadísticos mediante las matemáticas, y la investigación estadística suele plantear cuestiones matemáticas.
Matemáticos y estadísticos como Gauss , Laplace y C.S. Peirce utilizaron la teoría de la decisión con distribuciones de probabilidad y funciones de pérdida (o funciones de utilidad ). El enfoque de la teoría de la decisión para la inferencia estadística fue revitalizado por Abraham Wald y sus sucesores [ 11 ] [ 12 ] [ 13 ] [ 14 ] [ 15 ] [ 16 ] [ 17 ] y hace un uso extensivo de la computación científica , el análisis y la optimización ; para el diseño de experimentos , los estadísticos utilizan álgebra y combinatoria . Pero si bien la práctica estadística a menudo se basa en la probabilidad y la teoría de la decisión , su aplicación puede ser controvertida [ 5 ].
Véase también
Referencias
- ↑ Shao, Jun (3 de febrero de 2008). Estadística matemática . Springer Science & Business Media. ISBN 978-0-387-21718-5.
- ↑ Kannan, D.; Lakshmikantham, V., eds. (2002). Manual de análisis estocástico y aplicaciones . Nueva York: M. Dekker. ISBN 0824706609.
- ↑ Schervish, Mark J. (1995). Teoría de la estadística (2.ª ed. corregida ). Nueva York: Springer. ISBN 0387945466.
- ↑ Freedman, DA (2005) Modelos estadísticos: Teoría y práctica , Cambridge University Press. ISBN 978-0-521-67105-7
- 1 2 Freedman, David A. (2010). Collier, David; Sekhon, Jasjeet S.; Stark, Philp B. (eds.). Modelos estadísticos e inferencia causal: un diálogo con las ciencias sociales . Cambridge University Press. ISBN 978-0-521-12390-7.
- ↑ Hogg, RV, A. Craig y JW McKean. "Introducción a la estadística matemática." (2005).
- ↑ Larsen, Richard J. y Marx, Morris L. "Introducción a la estadística matemática y sus aplicaciones" (2012). Prentice Hall.
- ↑ Upton, G., Cook, I. (2008) Oxford Dictionary of Statistics , OUP. ISBN 978-0-19-954145-4
- ↑ "Métodos no paramétricos de investigación" . Universidad Carnegie Mellon . Archivado del original el 31 de agosto de 2022. Consultado el 30 de agosto de 2022 .
- 1 2 "Pruebas no paramétricas" . sphweb.bumc.bu.edu . Consultado el 31 de agosto de 2022 .
- ↑ Wald, Abraham (1947). Análisis secuencial . Nueva York: John Wiley and Sons. ISBN 0-471-91806-7Véase
la reimpresión de Dover, 2004: ISBN 0-486-43912-7
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - ↑ Wald, Abraham (1950). Funciones de decisión estadística . John Wiley and Sons, Nueva York.
- ↑ Lehmann, Erich (1997). Prueba de hipótesis estadísticas (2.ª ed.). ISBN 0-387-94919-4.
- ↑ Lehmann, Erich ; Cassella, George (1998). Teoría de la estimación puntual (2.ª ed.). ISBN 0-387-98502-6.
- ↑ Bickel, Peter J. ; Doksum, Kjell A. (2001). Estadística matemática: temas básicos y selectos . Vol. 1 (Segunda edición (reimpresión actualizada 2007) ). Pearson Prentice-Hall.
- ↑ Le Cam, Lucien (1986). Métodos asintóticos en la teoría de la decisión estadística . Springer-Verlag. ISBN 0-387-96307-3.
- ↑ Liese, Friedrich y Miescke, Klaus-J. (2008). Teoría estadística de la decisión: estimación, prueba y selección . Springer.
Lecturas adicionales
- Borovkov, AA (1999). Estadística matemática . CRC Press. ISBN 90-5699-018-7
- Laboratorios Virtuales de Probabilidad y Estadística (Universidad de Alabama-Huntsville)
- StatiBot , sistema experto interactivo en línea sobre pruebas estadísticas.
- Ray, Manohar; Sharma, Har Swarup (1966). Estadística Matemática . Ram Prasad e hijos.ISBN 978-9383385188
- Teoría estadística
- Ciencias actuariales