En estadística , el muestreo por conglomerados es un método de muestreo que se utiliza cuando en una población estadística se observan agrupaciones homogéneas pero heterogéneas internamente . Se emplea con frecuencia en la investigación de mercados .
En este plan de muestreo, la población total se divide en grupos (conocidos como conglomerados) y se selecciona una muestra aleatoria simple de cada grupo. A continuación, se muestrean los elementos de cada conglomerado. Si se muestrean todos los elementos de cada conglomerado, se denomina muestreo por conglomerados de una etapa. Si se selecciona una submuestra aleatoria simple de elementos dentro de cada grupo, se denomina muestreo por conglomerados de dos etapas. Una motivación común para el muestreo por conglomerados es reducir el número total de entrevistas y los costos, manteniendo la precisión deseada. Para un tamaño de muestra fijo, el error aleatorio esperado es menor cuando la mayor parte de la variación en la población se encuentra dentro de los grupos, y no entre ellos.
Clúster elemental
Idealmente, la población dentro de un conglomerado debería ser lo más heterogénea posible, pero debe existir homogeneidad entre conglomerados. Cada conglomerado debe ser una representación a pequeña escala de la población total. Los conglomerados deben ser mutuamente excluyentes y exhaustivos en su conjunto. Posteriormente, se utiliza una técnica de muestreo aleatorio en los conglomerados relevantes para seleccionar los que se incluirán en el estudio. En el muestreo por conglomerados de una sola etapa, se muestrean todos los elementos de cada uno de los conglomerados seleccionados. En el muestreo por conglomerados de dos etapas, se aplica una técnica de muestreo aleatorio a los elementos de cada uno de los conglomerados seleccionados.
La principal diferencia entre el muestreo por conglomerados y el muestreo estratificado radica en que, en el muestreo por conglomerados, el conglomerado se considera la unidad de muestreo, por lo que el muestreo se realiza sobre una población de conglomerados (al menos en la primera etapa). En el muestreo estratificado, el muestreo se realiza sobre elementos dentro de cada estrato. En el muestreo estratificado, se extrae una muestra aleatoria de cada estrato, mientras que en el muestreo por conglomerados solo se muestrean los conglomerados seleccionados. Una motivación común para el muestreo por conglomerados es reducir costos mediante el aumento de la eficiencia del muestreo. Esto contrasta con el muestreo estratificado, donde la motivación es aumentar la precisión.
También existe el muestreo por conglomerados multietápico , en el que se toman al menos dos etapas para seleccionar elementos de los conglomerados.
Cuando los grupos son de diferentes tamaños
Sin modificar el parámetro estimado, el muestreo por conglomerados no presenta sesgo cuando los conglomerados tienen aproximadamente el mismo tamaño. En este caso, el parámetro se calcula combinando todos los conglomerados seleccionados. Cuando los conglomerados tienen tamaños diferentes, existen varias opciones:
Un método consiste en muestrear conglomerados y luego encuestar todos los elementos de cada uno. Otro método es un método de dos etapas que consiste en muestrear una proporción fija de unidades (ya sea el 5%, el 50% u otro porcentaje, según consideraciones de costos) dentro de cada uno de los conglomerados seleccionados. El uso de la muestra obtenida mediante estas opciones proporcionará un estimador insesgado. Sin embargo, el tamaño de la muestra ya no se fija de antemano. Esto conlleva una fórmula más compleja para el error estándar del estimador, así como problemas con la presentación del plan de estudio (ya que el análisis de potencia y las estimaciones de costos suelen estar relacionados con un tamaño de muestra específico).
Una tercera solución posible consiste en utilizar un muestreo con probabilidad proporcional al tamaño . En este método, la probabilidad de seleccionar un conglomerado es proporcional a su tamaño, por lo que un conglomerado grande tiene mayor probabilidad de ser seleccionado que uno pequeño. La ventaja reside en que, al seleccionar conglomerados con probabilidad proporcional al tamaño, se debe realizar el mismo número de entrevistas en cada conglomerado muestreado, de modo que cada unidad muestreada tenga la misma probabilidad de ser seleccionada.
Aplicaciones del muestreo por conglomerados
Un ejemplo de muestreo por conglomerados es el muestreo por áreas o muestreo geográfico por conglomerados . Cada conglomerado es un área geográfica dentro de un marco de muestreo por áreas . Dado que encuestar a una población geográficamente dispersa puede resultar costoso, se puede lograr una mayor economía que con el muestreo aleatorio simple agrupando a varios encuestados dentro de un área local en un conglomerado. Por lo general, es necesario aumentar el tamaño total de la muestra para lograr una precisión equivalente en los estimadores , pero el ahorro de costos puede hacer que dicho aumento sea factible.
Para la organización de un censo de población , el primer paso suele ser dividir el área geográfica total en áreas de enumeración o secciones censales para la organización del trabajo de campo. Las áreas de enumeración también pueden ser útiles como unidades de primera etapa para el muestreo por conglomerados en muchos tipos de encuestas. Cuando un censo de población está desactualizado, la lista de individuos no debe usarse directamente como marco de muestreo para una encuesta socioeconómica. Actualizar todo el censo es económicamente inviable. Una buena alternativa puede ser mantener las antiguas áreas de enumeración, con alguna actualización en áreas muy dinámicas, como los suburbios urbanos, seleccionar una muestra de áreas de enumeración y actualizar la lista de individuos o hogares solo en las áreas de enumeración seleccionadas. [ 1 ]
El muestreo por conglomerados se utiliza para estimar bajas tasas de mortalidad en casos como guerras , hambrunas y desastres naturales . [ 2 ]
Ciencias pesqueras
Es casi imposible tomar una muestra aleatoria simple de peces de una población, lo que requeriría que los individuos fueran capturados individualmente y al azar. [ 3 ] Esto se debe a que los artes de pesca capturan a los peces en grupos (o racimos).
En el muestreo de pesquerías comerciales, los costos de operación en el mar suelen ser demasiado elevados como para seleccionar las capturas de forma individual y aleatoria. Por lo tanto, las observaciones se agrupan además por embarcación o viaje de pesca.
Ciencias económicas
El Banco Mundial ha aplicado el muestreo adaptativo por conglomerados para estudiar las empresas informales en los países en desarrollo de una manera rentable, ya que el sector informal no está registrado oficialmente y resulta demasiado costoso estudiarlo mediante un muestreo aleatorio simple. [ 4 ] El enfoque sigue un muestreo en dos etapas: primero, se utiliza el muestreo adaptativo por conglomerados para generar una estimación del universo de empresas informales en funcionamiento, y segundo, para obtener una muestra aleatoria sobre las características de dichas empresas.
Ventajas
- Puede resultar más económico que otros planes de muestreo, por ejemplo, debido a los menores gastos de viaje y de administración.
- Viabilidad: Este plan de muestreo tiene en cuenta poblaciones numerosas. Dado que estos grupos son tan pequeños, implementar cualquier otro plan de muestreo resultaría muy costoso.
- Economía: Los dos principales gastos habituales, es decir, los desplazamientos y la elaboración de listas, se reducen considerablemente con este método. Por ejemplo: Recopilar información sobre cada hogar de una ciudad sería muy costoso, mientras que recopilar información sobre diferentes manzanas de la ciudad resultará más económico. En este caso, tanto los desplazamientos como la elaboración de listas se reducirán notablemente.
- Variabilidad reducida: en el caso excepcional de una correlación intraclase negativa entre sujetos dentro de un grupo, los estimadores generados mediante muestreo por conglomerados producirán estimaciones más precisas que los datos obtenidos a partir de una muestra aleatoria simple (es decir, el efecto del diseño será mayor que 1). Este no es un escenario común.
Uso principal: cuando no se dispone del marco de muestreo de todos los elementos, podemos recurrir únicamente al muestreo por conglomerados.
Desventajas
- Un mayor error de muestreo , que puede expresarse mediante el efecto de diseño : la razón entre la varianza de un estimador hecho a partir de las muestras del estudio de conglomerados y la varianza de un estimador obtenido a partir de una muestra de sujetos en un estudio no conglomerado muestreado aleatoriamente y igualmente fiable . [ 5 ] Cuanto mayor sea la correlación intraclase entre sujetos dentro de un conglomerado, peor será el efecto de diseño (es decir, cuanto mayor sea de 1. Indicando un mayor aumento esperado en la varianza del estimador). En otras palabras, cuanto mayor sea la heterogeneidad entre conglomerados y mayor la homogeneidad entre sujetos dentro de un conglomerado, menos precisos serán nuestros estimadores. Esto se debe a que en tales casos es mejor muestrear tantos conglomerados como sea posible y conformarse con una pequeña muestra de sujetos dentro de cada conglomerado (es decir, muestreo de conglomerados en dos etapas).
- Complejidad. El muestreo por conglomerados es más sofisticado y requiere mayor atención en cuanto a cómo planificar y cómo analizar (es decir, tener en cuenta los pesos de los sujetos durante la estimación de parámetros, intervalos de confianza, etc.).
Más información sobre el muestreo por conglomerados.
Muestreo por conglomerados en dos etapas
El muestreo por conglomerados en dos etapas, un caso simple de muestreo multietápico , se obtiene seleccionando muestras de conglomerados en la primera etapa y luego seleccionando una muestra de elementos de cada conglomerado muestreado. Consideremos una población de N conglomerados en total. En la primera etapa, se seleccionan n conglomerados utilizando el método de muestreo por conglomerados ordinario. En la segunda etapa, se suele utilizar el muestreo aleatorio simple . [ 6 ] Se utiliza por separado en cada conglomerado y el número de elementos seleccionados de diferentes conglomerados no es necesariamente igual. El número total de conglomerados N , el número de conglomerados seleccionados n y el número de elementos de los conglomerados seleccionados deben ser predeterminados por el diseñador de la encuesta. El muestreo por conglomerados en dos etapas tiene como objetivo minimizar los costos de la encuesta y, al mismo tiempo, controlar la incertidumbre relacionada con las estimaciones de interés. [ 7 ] Este método se puede utilizar en ciencias de la salud y sociales. Por ejemplo, los investigadores utilizaron el muestreo por conglomerados en dos etapas para generar una muestra representativa de la población iraquí para realizar encuestas de mortalidad. [ 8 ] El muestreo en este método puede ser más rápido y más confiable que otros métodos, razón por la cual este método ahora se usa con frecuencia.
Inferencia cuando el número de clústeres es pequeño
Los métodos de muestreo por conglomerados pueden generar un sesgo significativo al trabajar con un número reducido de conglomerados. Por ejemplo, puede ser necesario agrupar a nivel estatal o municipal, unidades que pueden ser pequeñas y de número fijo. Los métodos microeconométricos para datos de panel suelen utilizar paneles cortos, lo que equivale a tener pocas observaciones por conglomerado y muchos conglomerados. El problema de los conglomerados pequeños puede considerarse un problema incidental de parámetros. [ 9 ] Si bien las estimaciones puntuales pueden estimarse con una precisión razonable, si el número de observaciones por conglomerado es suficientemente alto, necesitamos el número de conglomerados.para que se activen las asintóticas. Si el número de clústeres es bajo, la matriz de covarianza estimada puede estar sesgada a la baja. [ 10 ]
Un número reducido de conglomerados supone un riesgo cuando existe autocorrelación o autocorrelación intraclase, como en el contexto de Moulton. Cuando hay pocos conglomerados, tendemos a subestimar la autocorrelación entre observaciones cuando se produce un choque aleatorio, o la autocorrelación intraclase en un entorno de Moulton. [ 11 ] Varios estudios han resaltado las consecuencias de la autocorrelación y el problema de los conglomerados pequeños. [ 12 ] [ 13 ]
En el marco del factor de Moulton, se puede derivar una explicación intuitiva del problema de los clústeres pequeños a partir de la fórmula del factor de Moulton. Supongamos, para simplificar, que el número de observaciones por clúster es fijo en n . A continuación,representa la matriz de covarianza ajustada para agrupamiento,representa la matriz de covarianza no ajustada por agrupamiento, y ρ representa la correlación intraclase:
La razón en el lado izquierdo indica cuánto sobreestima la precisión el escenario sin ajustar. Por lo tanto, un número alto significa un fuerte sesgo a la baja de la matriz de covarianza estimada. Un problema de clúster pequeño puede interpretarse como un n grande: cuando los datos son fijos y el número de clústeres es bajo, el número de datos dentro de un clúster puede ser alto. De ello se deduce que la inferencia, cuando el número de clústeres es pequeño, no tendrá la cobertura correcta. [ 11 ]
Se han propuesto varias soluciones para el problema de los clústeres pequeños. Se puede utilizar una matriz de varianza robusta para clústeres con corrección de sesgo, realizar ajustes de distribución T o utilizar métodos bootstrap con refinamientos asintóticos, como el percentil-t o el wild bootstrap, que pueden conducir a una inferencia mejorada para muestras finitas. [ 10 ] Cameron, Gelbach y Miller (2008) proporcionan microsimulaciones para diferentes métodos y encuentran que el wild bootstrap funciona bien frente a un número pequeño de clústeres. [ 14 ]
Véase también
Referencias
- ↑ "MANUAL SOBRE MARCOS DE MUESTREO MAESTROS PARA ESTADÍSTICAS AGRÍCOLAS - PDF Descarga gratuita" . docplayer.net . Consultado el 10 de enero de 2024 .
- ↑ David Brown, Un estudio afirma que el número de muertos "excesivos" en Irak ha llegado a 655.000 , Washington Post , miércoles 11 de octubre de 2006. Consultado el 14 de septiembre de 2010.
- ↑ Nelson, Gary A. (julio de 2014). "Muestreo por conglomerados: un diseño de encuesta generalizado, pero poco reconocido, en la investigación pesquera". Transactions of the American Fisheries Society . 143 (4): 926– 938. Bibcode : 2014TrAFS.143..926N . doi : 10.1080/00028487.2014.901252 .
- ↑ Aga, Gemechu A.; Francis, David C.; Jolevski, Filip; Rodriguez Meza, Jorge L.; Wimpey, Joshua S. (enero de 2023). "Una aplicación del muestreo adaptativo por conglomerados para encuestar negocios informales". Journal of Survey Statistics and Methodology . 11 (5): 1246– 1266. doi : 10.1093/jssam/smac037 .
- ↑ Kerry y Bland (1998). Notas estadísticas: El coeficiente de correlación intraclúster en la aleatorización por conglomerados . British Medical Journal , 316, 1455–1460.
- ↑ Ahmed, Saifuddin (2009). Métodos en encuestas por muestreo (PDF) . Universidad Johns Hopkins y Saifuddin Ahmed. Archivado (PDF) del original el 28 de septiembre de 2013.
- ↑ Daniel Pfeffermann; C. Radhakrishna Rao (2009). Manual de Estadística Vol. 29A Encuestas por Muestreo: Teoría, Métodos e Inferencia . Elsevier BV ISBN 978-0-444-53124-7.
- ↑ LP Galway; Nathaniel Bell; Al S SAE; Amy Hagopian; Gilbert Burnham; Abraham Flaxman; Wiliam M Weiss; Julie Rajaratnam; Tim K Takaro (27 de abril de 2012). "Un método de muestreo por conglomerados en dos etapas utilizando datos de población en cuadrícula, un SIG e imágenes de Google Earth™ en una encuesta de mortalidad basada en la población en Irak" . International Journal of Health Geographics . 11 (1): 12. Bibcode : 2012IJHGg..11...12G . doi : 10.1186 / 1476-072X-11-12 . PMC 3490933. PMID 22540266 .
- ↑ Cameron AC y PK Trivedi (2005): Microeconometría: Métodos y aplicaciones. Cambridge University Press, Nueva York.
- 1 2 Cameron, C. y DL Miller (2015): Una guía práctica para la inferencia robusta en clústeres. Journal of Human Resources 50(2), pp. 317–372.
- 1 2 Angrist, JD y J.-S. Pischke (2009): Econometría mayormente inofensiva. Un compañero para el empirista. Princeton University Press, Nueva Jersey.
- ↑ Bertrand, M., E. Duflo y S. Mullainathan (2004): ¿Hasta qué punto debemos confiar en las estimaciones de diferencias en diferencias? Quarterly Journal of Economics 119(1), pp. 249–275.
- ↑ Kezdi, G. (2004): Estimación robusta del error estándar en modelos de panel de efectos fijos. Revista Estadística Húngara 9, págs. 95–116.
- ↑ Cameron, C., J. Gelbach y DL Miller (2008): Mejoras basadas en Bootstrap para la inferencia con errores agrupados. The Review of Economics and Statistics 90, pp. 414–427.
- Técnicas de muestreo
- Investigación de mercado