En estadística , una muestra aleatoria simple (o MRS ) es un subconjunto de individuos (una muestra ) elegido de un conjunto mayor (una población ) en el que se selecciona aleatoriamente un subconjunto de individuos , todos con la misma probabilidad. Es un proceso de selección de una muestra de forma aleatoria. En la MRS, cada subconjunto de k individuos tiene la misma probabilidad de ser elegido para la muestra que cualquier otro subconjunto de k individuos. [ 1 ] El muestreo aleatorio simple es un tipo básico de muestreo y puede ser un componente de otros métodos de muestreo más complejos. [ 2 ]
Introducción
El principio del muestreo aleatorio simple establece que cada conjunto con el mismo número de elementos tiene la misma probabilidad de ser elegido. Por ejemplo, supongamos que 10 estudiantes universitarios quieren una entrada para un partido de baloncesto, pero solo hay seis disponibles. Deciden entonces establecer un método justo para determinar quiénes pueden asistir. A cada uno se le asigna un número del 1 al 10, y se generan números aleatorios, ya sea electrónicamente o a partir de una tabla de números aleatorios . Los números fuera del rango del 1 al 10 se ignoran, al igual que cualquier número previamente seleccionado. Los primeros seis números identificarían a los afortunados ganadores de las entradas.
En poblaciones pequeñas y, a menudo, también en grandes, este tipo de muestreo se realiza típicamente " sin reemplazo ", es decir, se evita deliberadamente elegir a cualquier miembro de la población más de una vez. Si bien el muestreo aleatorio simple puede realizarse con reemplazo, esto es menos común y normalmente se describe con mayor detalle como muestreo aleatorio simple con reemplazo . El muestreo realizado sin reemplazo ya no es independiente, pero aún satisface la intercambiabilidad , por lo que la mayoría de los resultados de la estadística matemática siguen siendo válidos. Además, para una muestra pequeña de una población grande, el muestreo sin reemplazo es aproximadamente lo mismo que el muestreo con reemplazo, ya que la probabilidad de elegir al mismo individuo dos veces es baja. Los libros de texto de metodología de encuestas generalmente consideran el muestreo aleatorio simple sin reemplazo como el punto de referencia para calcular la eficiencia relativa de otros enfoques de muestreo. [ 3 ]
Una selección aleatoria imparcial de individuos es importante para que, si se extraen muchas muestras, la muestra promedio represente con precisión a la población. Sin embargo, esto no garantiza que una muestra en particular sea una representación perfecta de la población. El muestreo aleatorio simple simplemente permite extraer conclusiones válidas externamente sobre toda la población a partir de la muestra. El concepto puede extenderse cuando la población es un área geográfica. [ 4 ] En este caso, los marcos de muestreo de área son relevantes.
Conceptualmente, el muestreo aleatorio simple es la técnica de muestreo probabilístico más sencilla. Requiere un marco de muestreo completo , cuya construcción puede no estar disponible o ser inviable para poblaciones grandes. Incluso si se dispone de un marco completo, pueden existir enfoques más eficientes si se cuenta con información adicional útil sobre las unidades de la población.
Las ventajas radican en que está libre de errores de clasificación y requiere un conocimiento mínimo previo de la población, más allá del marco muestral. Su simplicidad también facilita la interpretación de los datos recopilados de esta manera. Por estas razones, el muestreo aleatorio simple es más adecuado en situaciones donde no se dispone de mucha información sobre la población y la recopilación de datos puede realizarse de manera eficiente con elementos distribuidos aleatoriamente, o donde el costo del muestreo es lo suficientemente bajo como para que la eficiencia sea menos importante que la simplicidad. Si estas condiciones no se cumplen, el muestreo estratificado o el muestreo por conglomerados pueden ser una mejor opción.
Relación entre la muestra aleatoria simple y otros métodos
Muestreo de probabilidad igual (epsem)
Un método de muestreo en el que cada unidad individual tiene la misma probabilidad de ser seleccionada se denomina muestreo de probabilidad igual (epsem, por sus siglas en inglés).
El uso de una muestra aleatoria simple siempre dará como resultado una muestra epsem, pero no todas las muestras epsem son SRS. Por ejemplo, si una maestra tiene una clase organizada en 5 filas de 6 columnas y quiere tomar una muestra aleatoria de 5 estudiantes, podría elegir una de las 6 columnas al azar. Esta sería una muestra epsem, pero no todos los subconjuntos de 5 alumnos tienen la misma probabilidad, ya que solo los subconjuntos que están organizados como una sola columna son elegibles para la selección. También hay formas de construir muestreo multietápico , que no son srs, mientras que la muestra final será epsem. [ 5 ] Por ejemplo, el muestreo aleatorio sistemático produce una muestra para la cual cada unidad individual tiene la misma probabilidad de inclusión, pero diferentes conjuntos de unidades tienen diferentes probabilidades de ser seleccionados.
Las muestras que son epsem son autoponderadas , lo que significa que el inverso de la probabilidad de selección para cada muestra es igual.
Distinción entre una muestra aleatoria sistemática y una muestra aleatoria simple.
Consideremos una escuela con 1000 estudiantes y supongamos que un investigador desea seleccionar a 100 de ellos para un estudio posterior. Todos sus nombres podrían colocarse en un recipiente y luego se podrían extraer 100 nombres. No solo cada persona tiene la misma probabilidad de ser seleccionada, sino que también podemos calcular fácilmente la probabilidad ( P ) de que una persona determinada sea elegida, ya que conocemos el tamaño de la muestra ( n ) y la población ( N ):
1. En el caso de que una persona determinada solo pueda ser seleccionada una vez (es decir, después de la selección, la persona es eliminada del grupo de selección):
2. En caso de que alguna persona seleccionada vuelva a la lista de selección (es decir, pueda ser elegida más de una vez):
Esto significa que cada estudiante de la escuela tiene, en cualquier caso, aproximadamente una probabilidad de 1 entre 10 de ser seleccionado mediante este método. Además, cualquier combinación de 100 estudiantes tiene la misma probabilidad de ser seleccionados.
Si se introduce un patrón sistemático en el muestreo aleatorio, se habla de "muestreo sistemático (aleatorio)". Un ejemplo sería si los alumnos de la escuela tuvieran números asociados a sus nombres que van del 0001 al 1000, y eligiéramos un punto de partida aleatorio, por ejemplo, el 0533, y luego seleccionáramos cada décimo nombre para obtener una muestra de 100 (empezando de nuevo con el 0003 después de llegar al 0993). En este sentido, esta técnica es similar al muestreo por conglomerados, ya que la elección de la primera unidad determinará el resto. Esto ya no es un muestreo aleatorio simple, porque algunas combinaciones de 100 alumnos tienen una mayor probabilidad de selección que otras; por ejemplo, {3, 13, 23, ..., 993} tiene una probabilidad de selección de 1/10, mientras que {1, 2, 3, ..., 100} no puede seleccionarse con este método.
Muestreo de una población dicotómica
Si los miembros de la población se dividen en tres tipos, digamos "azul", "rojo" y "negro", el número de elementos rojos en una muestra de tamaño dado variará según la muestra y, por lo tanto, es una variable aleatoria cuya distribución puede estudiarse. Dicha distribución depende del número de elementos rojos y negros en la población total. Para una muestra aleatoria simple con reemplazo, la distribución es una distribución binomial . Para una muestra aleatoria simple sin reemplazo, se obtiene una distribución hipergeométrica . [ 6 ]
Algoritmos
Se han desarrollado varios algoritmos eficientes para el muestreo aleatorio simple. [ 7 ] [ 8 ] Un algoritmo ingenuo es el algoritmo de selección por selección, donde en cada paso eliminamos el elemento de ese paso del conjunto con igual probabilidad y lo colocamos en la muestra. Continuamos hasta tener una muestra del tamaño deseado.La desventaja de este método es que requiere acceso aleatorio al conjunto.
El algoritmo de selección-rechazo desarrollado por Fan et al. en 1962 [ 9 ] requiere una sola pasada sobre los datos; sin embargo, es un algoritmo secuencial y requiere conocimiento del recuento total de elementos., que no está disponible en escenarios de transmisión en directo.
Sunter demostró en 1977 un algoritmo de ordenación aleatoria muy simple. [ 10 ] El algoritmo simplemente asigna un número aleatorio extraído de una distribución uniforme.como clave para cada elemento, luego ordena todos los elementos usando la clave y selecciona el más pequeño.elementos.
J. Vitter en 1985 [ 11 ] propuso algoritmos de muestreo de embalses , que son ampliamente utilizados. Este algoritmo no requiere conocimiento del tamaño de la población.por adelantado y utiliza espacio constante.
El muestreo aleatorio también puede acelerarse muestreando a partir de la distribución de los huecos entre muestras [ 12 ] y saltándose los huecos.
Véase también
Referencias
- ↑ Yates, Daniel S.; David S. Moore; Daren S. Starnes (2008). La práctica de la estadística, 3.ª ed . Freeman . ISBN 978-0-7167-7309-2.
- ↑ Thompson, Steven K. (2012). Muestreo . Serie Wiley de probabilidad y estadística (3.ª ed.). Hoboken, NJ: John Wiley & Sons. ISBN 978-1-118-16293-4.
- ↑ Cochran, William Gemmell (1977). Técnicas de muestreo . Serie Wiley de probabilidad y estadística matemática (3.ª ed.). Nueva York: Wiley. ISBN 978-0-471-16240-7.
- ↑ Cressie, Noel AC (2015). Estadística para datos espaciales ( Edición revisada). Hoboken, NJ: John Wiley & Sons, Inc. ISBN 978-1-119-11517-5.
- ↑ Peters, Tim J., y Jenny I. Eachus. "Lograr la misma probabilidad de selección bajo diversas estrategias de muestreo aleatorio". Epidemiología pediátrica y perinatal 9.2 (1995): 219-224.
- ↑ Ash, Robert B. (2008). Teoría básica de la probabilidad . Mineola, NY: Dover Publications. ISBN 978-0-486-46628-6OCLC 190785258 .
- ^ Tilla, Yves; Tillé, Yves (1 de enero de 2006). Algoritmos de muestreo - Springer . Serie Springer en Estadística. doi : 10.1007/0-387-34240-0 . ISBN 978-0-387-30814-2.
- ↑ Meng, Xiangrui (2013). "Muestreo aleatorio simple escalable y muestreo estratificado" (PDF) . Actas de la 30.ª Conferencia Internacional sobre Aprendizaje Automático (ICML-13) : 531–539 .
- ↑ Fan, CT; Muller, Mervin E.; Rezucha, Ivan (1962-06-01). "Desarrollo de planes de muestreo mediante técnicas de selección secuencial (elemento por elemento) y computadoras digitales". Journal of the American Statistical Association . 57 (298): 387– 402. doi : 10.1080/01621459.1962.10480667 . ISSN 0162-1459 .
- ↑ Sunter, AB (1977-01-01). "Muestreo secuencial por listas con probabilidades iguales o desiguales sin reemplazo". Applied Statistics . 26 (3): 261– 268. doi : 10.2307/2346966 . JSTOR 2346966 .
- ↑ Vitter, Jeffrey S. (1985-03-01). "Muestreo aleatorio con un reservorio". ACM Trans. Math. Softw . 11 (1): 37– 57. CiteSeerX 10.1.1.138.784 . doi : 10.1145/3147.3165 . ISSN 0098-3500 .
- ↑ Vitter, Jeffrey S. (1984-07-01). "Métodos más rápidos para el muestreo aleatorio". Communications of the ACM . 27 (7): 703– 718. CiteSeerX 10.1.1.329.6400 . doi : 10.1145/358105.893 . ISSN 0001-0782 .
Enlaces externos
Contenido multimedia relacionado con el muestreo aleatorio en Wikimedia Commons.
- Técnicas de muestreo