Articulo de referencia

proporción de la población

En estadística , una proporción de la población , generalmente denotada por PAG {\displaystyle P} o la letra griega π {\displaystyle \pi } [ 1 ] es un parámetro que describe un ...

En estadística , una proporción de la población , generalmente denotada porPAG{\displaystyle P}o la letra griegaπ{\displaystyle \pi }[ 1 ] es un parámetro que describe un valor porcentual asociado a una población . Se puede realizar un censo para determinar el valor real de un parámetro poblacional, pero a menudo no es práctico debido a sus costos y al tiempo que consume. Por ejemplo, el censo de Estados Unidos de 2010 mostró que el 83,7 % de la población estadounidense no se identificó como hispana o latina ; el valor de 0,837 es una proporción poblacional. En general, la proporción poblacional y otros parámetros poblacionales son desconocidos.

Una proporción poblacional se estima generalmente a través de una estadística de muestra insesgada obtenida de un estudio observacional o experimento , lo que da como resultado una proporción muestral , generalmente denotada porpag^{\displaystyle {\hat {p}}}y en algunos libros de texto porpag{\displaystyle p}. [ 2 ] [ 3 ] Por ejemplo, la Conferencia Nacional de Alfabetización Tecnológica realizó una encuesta nacional a 2000 adultos para determinar el porcentaje de adultos que son analfabetos económicos; el estudio mostró que 1440 de los 2000 adultos encuestados no entendían qué es un producto interno bruto . [ 4 ] El valor del 72 % (o 1440/2000) es una proporción de la muestra.

Definición matemática

Una ilustración de diagrama de Venn de un conjuntoR{\displaystyle R}y su subconjuntoS{\displaystyle S}. La proporción se puede calcular midiendo cuánto deS{\displaystyle S}está enR{\displaystyle R}.

Una proporción se define matemáticamente como la razón de la cantidad de elementos (una cantidad contable ) en un subconjunto.S{\displaystyle S}al tamaño de un conjuntoR{\displaystyle R}:

PAG=incógnitanorte,{\displaystyle P={\frac {X}{N}},}

dóndeincógnita{\displaystyle X}es el recuento de éxitos en la población, ynorte{\displaystyle N}es el tamaño de la población.

Esta definición matemática puede generalizarse para proporcionar la definición de la proporción muestral:

pag^=incógnitanorte{\displaystyle {\sombrero {p}}={\frac {x}{n}}}

dóndeincógnita{\displaystyle x}es el recuento de éxitos en la muestra, ynorte{\displaystyle n}es el tamaño de la muestra obtenida de la población. [ 5 ] [ 2 ]

Estimación

Uno de los principales objetivos de estudio en estadística inferencial es determinar el valor "verdadero" de un parámetro. Generalmente, el valor real de un parámetro nunca se conoce a menos que se realice un censo de la población estudiada. Sin embargo, existen métodos estadísticos que permiten obtener una estimación razonable del parámetro. Estos métodos incluyen intervalos de confianza y pruebas de hipótesis .

Estimar el valor de una proporción de la población puede tener grandes implicaciones en los ámbitos de la agricultura, los negocios, la economía, la educación, la ingeniería, los estudios ambientales, la medicina, el derecho, las ciencias políticas, la psicología y la sociología.

Una proporción poblacional puede estimarse mediante el uso de un intervalo de confianza conocido como proporción de una muestra en el intervalo Z, cuya fórmula se muestra a continuación:

pag^±zpag^(1pag^)norte{\displaystyle {\hat {p}}\pm z^{*}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}

dóndepag^{\displaystyle {\hat {p}}}es la proporción de la muestra,norte{\displaystyle n}es el tamaño de la muestra yz{\displaystyle z^{*}}es la parte superior 1do2{\displaystyle {\frac {1-C}{2}}}valor crítico de la distribución normal estándar para un nivel de confianzado{\displaystyle C}. [ 6 ]

Prueba

Para derivar la fórmula de la proporción de una muestra en el intervalo Z , es necesario considerar una distribución muestral de proporciones muestrales. La media de la distribución muestral de proporciones muestrales se suele denotar comoμpag^=PAG{\displaystyle \mu _{\hat {p}}=P}y su desviación estándar se denota como: [ 2 ]

σpag^=PAG(1PAG)norte{\displaystyle \sigma _{\hat {p}}={\sqrt {\frac {P(1-P)}{n}}}}

Dado que el valor dePAG{\displaystyle P}es desconocido, una estadística imparcialpag^{\displaystyle {\hat {p}}}se utilizará paraPAG{\displaystyle P}La media y la desviación estándar se reescriben respectivamente como:

μpag^=pag^{\displaystyle \mu _{\sombrero {p}}={\sombrero {p}}}yσpag^=pag^(1pag^)norte{\displaystyle \sigma _{\hat {p}}={\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}

Aplicando el teorema del límite central , la distribución muestral de las proporciones de la muestra es aproximadamente normal , siempre que la muestra sea razonablemente grande y no esté sesgada.

Supongamos que se calcula la siguiente probabilidad:

PAG(z<pag^PAGpag^(1pag^)norte<z)=do{\displaystyle P\left(-z^{*}<{\frac {{\hat {p}}-P}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}<z^{*}\right)=C},

dónde0<do<1{\displaystyle 0<C<1}y±z{\displaystyle \pm z^{*}}son los valores críticos estándar.

La distribución muestral de las proporciones de la muestra es aproximadamente normal cuando satisface los requisitos del Teorema del Límite Central.

La desigualdad

z<pag^PAGpag^(1pag^)norte<z{\displaystyle -z^{*}<{\frac {{\hat {p}}-P}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}<z^{*}}

puede reescribirse algebraicamente de la siguiente manera:

z<pag^PAGpag^(1pag^)norte<z{\displaystyle -z^{*}<{\frac {{\hat {p}}-P}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}<z^{*}}
zpag^(1pag^)norte<pag^PAG<zpag^(1pag^)norte{\displaystyle \Rightarrow -z^{*}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}<{\hat {p}}-P<z^{*}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}
pag^zpag^(1pag^)norte<PAG<pag^+zpag^(1pag^)norte{\displaystyle \Rightarrow -{\hat {p}}-z^{*}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}<-P<-{\hat {p}}+z^{*}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}
pag^zpag^(1pag^)norte<PAG<pag^+zpag^(1pag^)norte{\displaystyle \Rightarrow {\hat {p}}-z^{*}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}<P<{\hat {p}}+z^{*}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}

Condiciones para la inferencia

En general, la fórmula utilizada para estimar una proporción poblacional requiere la sustitución de valores numéricos conocidos. Sin embargo, estos valores numéricos no pueden sustituirse "a ciegas" en la fórmula, ya que la inferencia estadística exige que la estimación de un parámetro desconocido esté justificada. Para que la estimación de un parámetro esté justificada, es necesario verificar tres condiciones:

  1. Las observaciones individuales de los datos deben obtenerse a partir de una muestra aleatoria simple de la población de interés.
  2. Las observaciones individuales de los datos deben mostrar normalidad . Esto se puede asumir matemáticamente con la siguiente definición:
    • Dejarnorte{\displaystyle n}Sea el tamaño de la muestra de una muestra aleatoria dada y seapag^{\displaystyle {\hat {p}}}sea ​​su proporción muestral. Si nortepag^10{\displaystyle n{\hat {p}}\geq 10} y norte(1pag^)10{\displaystyle n(1-{\hat {p}})\geq 10}, entonces las observaciones individuales de los datos muestran normalidad.
  3. Las observaciones individuales de los datos deben ser independientes entre sí. Esto se puede asumir matemáticamente con la siguiente definición:
    • Dejarnorte{\displaystyle N}sea ​​el tamaño de la población de interés y dejemosnorte{\displaystyle n}sea ​​el tamaño de la muestra de una muestra aleatoria simple de la población. Sinorte10norte{\displaystyle N\geq 10n}, entonces las observaciones individuales de los datos son independientes entre sí.

Las condiciones para el muestreo aleatorio simple (SRS), la normalidad y la independencia a veces se denominan condiciones para la caja de herramientas de inferencia en la mayoría de los libros de texto de estadística .

Ejemplo

Supongamos que se están celebrando elecciones presidenciales en una democracia. Una muestra aleatoria de 400 votantes elegibles de la población electoral de la democracia muestra que 272 votantes apoyan al candidato B. Un politólogo quiere determinar qué porcentaje de la población electoral apoya al candidato B.

Para responder a la pregunta del politólogo, se puede construir una proporción de una muestra en el intervalo Z con un nivel de confianza del 95% para determinar la proporción de la población de votantes elegibles en esta democracia que apoyan al candidato B.

Solución

Se sabe a partir de la muestra aleatoria quepag^=272400=0,68{\displaystyle {\hat {p}}={\frac {272}{400}}=0.68}con tamaño de muestranorte=400{\displaystyle n=400}Antes de construir un intervalo de confianza, se verificarán las condiciones para la inferencia.

  • Dado que se obtuvo una muestra aleatoria de 400 votantes de la población votante, se cumple la condición para una muestra aleatoria simple.
  • Dejarnorte=400{\displaystyle n=400}ypag^=0,68{\displaystyle {\hat {p}}=0.68}, se comprobará sinortepag^10{\displaystyle n{\hat {p}}\geq 10} ynorte(1pag^)10{\displaystyle n(1-{\hat {p}})\geq 10}
(400)(0,68)1027210{\displaystyle (400)(0.68)\geq 10\Rightarrow 272\geq 10} y (400)(10,68)1012810{\displaystyle (400)(1-0.68)\geq 10\Rightarrow 128\geq 10}
Se han cumplido las condiciones para la normalidad.
  • Dejarnorte{\displaystyle N}sea ​​el tamaño de la población votante en esta democracia, y deje quenorte=400{\displaystyle n=400}. Sinorte10norte{\displaystyle N\geq 10n}, entonces está la independencia.
norte10(400)norte4000{\displaystyle N\geq 10(400)\Rightarrow N\geq 4000}
El tamaño de la poblaciónnorte{\displaystyle N}Se puede suponer que esta democracia cuenta con al menos 4.000 votantes. Por lo tanto, se cumple la condición para la independencia.

Una vez verificadas las condiciones para la inferencia, es admisible construir un intervalo de confianza.

Dejarpag^=0,68,norte=400,{\displaystyle {\hat {p}}=0.68,n=400,}ydo=0,95{\displaystyle C=0.95}

Para resolverz{\displaystyle z^{*}}, la expresión1do2{\displaystyle {\frac {1-C}{2}}}se utiliza.

1do2=10,952=0,052=0,0250{\displaystyle {\frac {1-C}{2}}={\frac {1-0.95}{2}}={\frac {0.05}{2}}=0.0250}

La curva normal estándar conz{\displaystyle z^{*}}lo que da un área de cola superior de 0,0250 y un área de 0,9750 paraZz{\displaystyle Z\leq z^{*}}.
Una tabla con probabilidades normales estándar para Zz{\displaystyle Z\leq z}.

Al examinar una curva de campana normal estándar, el valor dez{\displaystyle z^{*}}se puede determinar identificando qué puntuación estándar da a la curva normal estándar un área de cola superior de 0,0250 o un área de 1 – 0,0250 = 0,9750. El valor paraz{\displaystyle z^{*}}También se puede encontrar a través de una tabla de probabilidades normales estándar.

A partir de una tabla de probabilidades normales estándar, el valor deZ{\displaystyle Z}que da un área de 0.9750 es 1.96. Por lo tanto, el valor paraz{\displaystyle z^{*}}es 1,96.

Los valores parapag^=0,68{\displaystyle {\hat {p}}=0.68},norte=400{\displaystyle n=400},z=1,96{\displaystyle z^{*}=1.96}Ahora se puede sustituir en la fórmula para la proporción de una muestra en el intervalo Z:

pag^±zpag^(1pag^)norte{\displaystyle {\hat {p}}\pm z^{*}{\sqrt {\frac {{\hat {p}}(1-{\hat {p}})}{n}}}}
(0,68)±(1,96)(0,68)(10,68)400{\displaystyle \Rightarrow (0.68)\pm (1.96){\sqrt {\frac {(0.68)(1-0.68)}{400}}}}
0,68±1,960,000544{\displaystyle \Rightarrow 0.68\pm 1.96{\sqrt {0.000544}}}
(0,63429,0,72571){\displaystyle \Rightarrow {\bigl (}0.63429,\,0.72571{\bigr )}}

Basándonos en las condiciones de inferencia y la fórmula para la proporción de una muestra en el intervalo Z, se puede concluir con un nivel de confianza del 95% que el porcentaje de la población votante en esta democracia que apoya al candidato B está entre el 63,429% y el 72,571%.

Valor del parámetro en el rango del intervalo de confianza

Una pregunta frecuente en estadística inferencial es si un parámetro se encuentra dentro de un intervalo de confianza. La única forma de responder a esta pregunta es mediante un censo. Siguiendo el ejemplo anterior, la probabilidad de que la proporción poblacional se encuentre dentro del intervalo de confianza es 1 o 0. Es decir, el parámetro está incluido en el intervalo o no lo está. El objetivo principal de un intervalo de confianza es ilustrar mejor cuál podría ser el valor ideal de un parámetro.

Errores comunes y malas interpretaciones en las estimaciones.

Un error muy común que surge de la construcción de un intervalo de confianza es la creencia de que el nivel de confianza, comodo=95%{\displaystyle C=95\%}, significa 95% de probabilidad. Esto es incorrecto. El nivel de confianza se basa en una medida de certeza, no de probabilidad. Por lo tanto, los valores dedo{\displaystyle C}Caen entre 0 y 1, exclusivamente.

Estimación de P mediante muestreo de conjuntos ordenados

Se puede obtener una estimación más precisa de P eligiendo el muestreo de conjuntos ordenados en lugar del muestreo aleatorio simple [ 7 ] [ 8 ]

Véase también

Referencias

  1. Introducción a las investigaciones estadísticas . Wiley. 18 de agosto de 2014. ISBN 978-1-118-95667-0.
  2. 1 2 3 Weisstein, Eric W. "Proporción de muestra" . mathworld.wolfram.com . Consultado el 22 de agosto de 2020 .
  3. "6.3: La proporción muestral" . Statistics LibreTexts . 16 de abril de 2014. Consultado el 22 de agosto de 2020 .
  4. Ott, R. Lyman (1993). Introducción a los métodos estadísticos y al análisis de datos . Duxbury Press. ISBN 0-534-93150-2.
  5. Weisstein, Eric (1998). CRC Concise Encyclopedia of Mathematics . Chapman & Hall/CRC. Bibcode : 1998ccem.book.....W .
  6. Hinders, Duane (2008). Edición anotada para el profesor de La práctica de la estadística . WH Freeman. ISBN 978-0-7167-7703-8.
  7. Abbasi, Azhar Mehmood; Yousaf Shad, Muhammad (15 de mayo de 2021). "Estimación de la proporción poblacional mediante muestreo de conjuntos ordenados basado en concomitantes" . Communications in Statistics – Theory and Methods . 51 (9): 2689– 2709. doi : 10.1080/03610926.2021.1916529 . ISSN 0361-0926 . S2CID 236554602 .  
  8. Abbasi, Azhar Mehmood; Shad, Muhammad Yousaf (15 de mayo de 2021). "Estimación de la proporción poblacional mediante muestreo de conjuntos ordenados basado en concomitantes" . Communications in Statistics – Theory and Methods . 51 (9): 2689– 2709. doi : 10.1080/03610926.2021.1916529 . ISSN 0361-0926 . S2CID 236554602 .