La detección automática de interacciones mediante chi-cuadrado ( CHAID ) [ 1 ] es una técnica de árbol de decisión basada en pruebas de significancia ajustadas ( corrección de Bonferroni , prueba de Holm-Bonferroni ). [ 2 ] [ 3 ]
Historia
CHAID se basa en una extensión formal de los procedimientos AID (Automatic Interaction Detection) [ 4 ] y THAID (THeta Automatic Interaction Detection) [ 5 ] [ 6 ] de las décadas de 1960 y 1970, que a su vez fueron extensiones de investigaciones anteriores, incluyendo la realizada por Belson en el Reino Unido en la década de 1950. [ 7 ]
En 1975, la técnica CHAID se desarrolló en Sudáfrica. Fue publicada en 1980 por Gordon V. Kass, quien había completado una tesis doctoral sobre el tema. [ 2 ]
En Ritschard se puede encontrar una historia de los métodos de árboles supervisados anteriores , incluyendo una descripción detallada del algoritmo CHAID original y la extensión exhaustiva de CHAID por Biggs, De Ville y Suen. [ 3 ] [ 1 ]
Se utilizó CHAID como técnica de minería de datos . Esta técnica se basa en la división multidimensional para crear grupos discretos y comprender su impacto en la variable dependiente. Se prefirió CHAID para el análisis debido a cinco criterios principales:
1. Una buena proporción de los datos de entrada eran categóricos;
2. Su eficiencia en grandes conjuntos de datos;
3. Su carácter altamente visual y su facilidad de interpretación;
4. Facilidad de implementación/integración de las reglas de negocio generadas a partir de CHAID en el negocio; y
5. La calidad de los datos de entrada se puede manejar de manera eficiente [ 8 ] [ 9 ]
Propiedades
CHAID puede utilizarse para predicción (de forma similar al análisis de regresión ; esta versión de CHAID se conoce originalmente como XAID), así como para clasificación y para la detección de interacción entre variables. [ 4 ] [ 5 ] [ 6 ]
En la práctica, el modelo CHAID se utiliza a menudo en el contexto del marketing directo para seleccionar grupos de consumidores y predecir cómo sus respuestas a algunas variables afectan a otras, aunque otras aplicaciones iniciales se dieron en los campos de la investigación médica y psiquiátrica.
Al igual que otros árboles de decisión, las ventajas de CHAID radican en que su resultado es altamente visual y fácil de interpretar. Dado que utiliza divisiones múltiples por defecto, requiere tamaños de muestra bastante grandes para funcionar eficazmente, ya que con muestras pequeñas los grupos de encuestados pueden reducirse rápidamente hasta ser demasiado pequeños para un análisis fiable.
Una ventaja importante de CHAID sobre alternativas como la regresión múltiple es que no es paramétrica.
Véase también
Referencias
- 1 2 Ritschard, Gilbert (2013). "CHAID y métodos de árboles supervisados anteriores" . Cuestiones contemporáneas en minería de datos exploratoria en las ciencias del comportamiento, McArdle, JJ y G. Ritschard (Eds) . Nueva York: Routledge: 48–74 .
- 1 2 Kass, GV (1980). "Una técnica exploratoria para investigar grandes cantidades de datos categóricos" . Applied Statistics . 29 (2): 119– 127. doi : 10.2307/2986296 . JSTOR 2986296 .
- 1 2 Biggs, David; De Ville, Barry; Suen, Ed (1991). "Un método para elegir particiones multidireccionales para árboles de clasificación y decisión" . Journal of Applied Statistics . 18 (1): 49– 62. Bibcode : 1991JApSt..18...49B . doi : 10.1080/02664769100000005 . ISSN 0266-4763 .
- 1 2 Morgan, James N.; Sonquist, John A. (1963). "Problemas en el análisis de datos de encuestas y una propuesta" . Journal of the American Statistical Association . 58 (302): 415– 434. doi : 10.1080/01621459.1963.10500855 . ISSN 0162-1459 .
- 1 2 Messenger, Robert; Mandell, Lewis (1972). "Una técnica de búsqueda modal para el análisis multivariado predictivo en escala nominal" . Journal of the American Statistical Association . 67 (340): 768– 772. doi : 10.1080/01621459.1972.10481290 . ISSN 0162-1459 .
- 1 2 Morgan, James N. (1973). THAID, un programa de análisis secuencial para el análisis de variables dependientes en escala nominal . Robert C. Messenger. Ann Arbor, Michigan. ISBN 0-87944-137-2OCLC 666930 .
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - ↑ Belson, William A. (1959). "Coincidencia y predicción según el principio de clasificación biológica" . Applied Statistics . 8 (2): 65– 75. doi : 10.2307/2985543 . JSTOR 2985543 .
- ↑ Behera, Desik (noviembre de 2012). "Adquisición de clientes de seguros: el método CHAID" . Research Gate . Consultado el 7 de agosto de 2025 .
- ↑ Kotane, Inta (septiembre de 2024). "APLICACIÓN DE ÁRBOLES DE DECISIÓN CHAID Y MÉTODOS DE REDES NEURONALES PARA PRONOSTICAR EL RENDIMIENTO DE LAS EMPRESAS DE LA INDUSTRIA DE CEREALES" . Research Gate . doi : 10.17770/het2024.28.8264 . Consultado el 7 de agosto de 2025 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace )
Bibliografía
- Press, Laurence I.; Rogers, Miles S.; y Shure, Gerald H.; Una técnica interactiva para el análisis de datos multivariados , Behavioral Science, vol. 14 (1969), págs. 364–370
- Hawkins, Douglas M.; y Kass, Gordon V.; Detección automática de interacciones , en Hawkins, Douglas M. (ed.), Temas de análisis multivariante aplicado , Cambridge University Press, Cambridge, 1982, págs. 269-302 .
- Hooton, Thomas M.; Haley, Robert W.; Culver, David H.; White, John W.; Morgan, W. Meade; y Carroll, Raymond J.; Asociaciones conjuntas de múltiples factores de riesgo con la aparición de infecciones nosocomiales , American Journal of Medicine, vol. 70, (1981), págs. 960–970
- Brink, Susanne; y Van Schalkwyk, Dirk J.; Ferritina sérica y volumen corpuscular medio como predictores de las reservas de hierro en la médula ósea , South African Medical Journal, vol. 61, (1982), págs. 432–434
- McKenzie, Dean P.; McGorry, Patrick D.; Wallace, Chris S.; Low, Lee H.; Copolov, David L.; y Singh, Bruce S.; Construcción de un árbol de decisión diagnóstico mínimo , Métodos de información en medicina, vol. 32 (1993), págs. 161-166
- Magidson, Jay; El enfoque CHAID para el modelado de segmentación: detección automática de interacciones mediante chi-cuadrado , en Bagozzi, Richard P. (ed); Métodos avanzados de investigación de marketing , Blackwell, Oxford, GB, 1994, pp. 118–159
- Hawkins, Douglas M.; Young, SS; y Rosinko, A.; Análisis de un gran conjunto de datos de estructura-actividad mediante partición recursiva , Relaciones cuantitativas estructura-actividad, vol. 16, (1997), págs. 296–302
Enlaces externos
- Luchman, JN; CHAID: Módulo de Stata para realizar detección automatizada de interacciones mediante chi-cuadrado . Disponible para descarga gratuita o escriba en Stata: ssc install chaid.
- Luchman, JN; CHAIDFOREST: Módulo de Stata para realizar una clasificación de conjunto de bosques aleatorios basada en la detección automatizada de interacciones de chi-cuadrado (CHAID) como aprendiz base . Disponible para descarga gratuita o escriba en Stata: ssc install chaidforest.
- IBM SPSS Decision Trees genera árboles CHAID exhaustivos, así como otros tipos de árboles, como CART.
- El paquete CHAID para R está disponible en R-Forge.
- Investigación de mercado
- Segmentación del mercado
- Algoritmos estadísticos
- Clasificación estadística
- Árboles de decisión
- Algoritmos de clasificación