Articulo de referencia

Método del codo (agrupación)

Varianza explicada. El círculo rojo indica el punto de inflexión. Por lo tanto, el número de clústeres seleccionados debe ser 4. En el análisis de conglomerados , el método del ...

Varianza explicada. El círculo rojo indica el punto de inflexión. Por lo tanto, el número de clústeres seleccionados debe ser 4.

En el análisis de conglomerados , el método del codo es una heurística que se utiliza para determinar el número de conglomerados en un conjunto de datos . Este método consiste en graficar la variación explicada en función del número de conglomerados y seleccionar el punto de inflexión de la curva como el número de conglomerados a utilizar. El mismo método puede emplearse para elegir el número de parámetros en otros modelos basados ​​en datos, como el número de componentes principales para describir un conjunto de datos.

El método se remonta a una especulación de Robert L. Thorndike en 1953. [ 1 ]

Intuición

Utilizar el punto de inflexión de una curva como punto de corte es una heurística común en la optimización matemática para determinar un punto donde los rendimientos decrecientes ya no justifican el costo adicional. En la agrupación de datos, esto significa que se debe elegir un número de clústeres tal que agregar otro no mejore significativamente el modelado de los datos.

La intuición es que aumentar el número de clústeres mejorará naturalmente el ajuste (explicará más de la variación), ya que hay más parámetros (más clústeres) para usar, pero que en algún punto esto es sobreajuste , y el codo lo refleja. Por ejemplo, dados datos que en realidad consisten en k grupos etiquetados (por ejemplo, k puntos muestreados con ruido), agrupar con más de k clústeres "explicará" más de la variación (ya que puede usar clústeres más pequeños y compactos), pero esto es sobreajuste, ya que está subdividiendo los grupos etiquetados en múltiples clústeres. La idea es que los primeros clústeres agregarán mucha información (explicarán mucha variación), ya que los datos realmente consisten en esa cantidad de grupos (por lo que estos clústeres son necesarios), pero una vez que el número de clústeres excede el número real de grupos en los datos, la información agregada caerá drásticamente, porque simplemente está subdividiendo los grupos reales. Suponiendo que esto ocurra, habrá un punto de inflexión pronunciado en el gráfico de variación explicada frente a clústeres: aumentando rápidamente hasta k ( región de subajuste ) y luego aumentando lentamente después de k (región de sobreajuste).

Crítica

El método del codo se considera subjetivo y poco fiable. En muchas aplicaciones prácticas, la elección de un "codo" resulta muy ambigua, ya que el gráfico no presenta un codo pronunciado. [ 2 ] Esto puede ocurrir incluso en casos en los que todos los demás métodos para determinar el número de clústeres en un conjunto de datos (como se menciona en ese artículo) coinciden en el número de clústeres.

Gráfico de la suma de los errores cuadráticos (SSE) a medida que k aumenta, siguiendo una forma típica de 1/k.
El patrón típico en forma de "codo" que se utiliza para elegir el número de clústeres aparece incluso para datos uniformes.

Incluso en datos aleatorios uniformes sin clústeres significativos, la curva sigue la proporción 1/k , lo que lleva a los usuarios a ver un "codo" y a elegir erróneamente un número "óptimo" de clústeres. [ 3 ] Debido a que el número de clústeres y la varianza restante no tienen relación semántica, los diversos intentos de capturar el codo mediante la "pendiente" están mal definidos y son sensibles al rango de parámetros. [ 3 ]

Medidas de variación

Existen diversas medidas de " varianza explicada " utilizadas en el método del codo. Lo más común es cuantificar la variación mediante la varianza , y la razón utilizada es la razón entre la varianza entre grupos y la varianza total. Alternativamente, se utiliza la razón entre la varianza entre grupos y la varianza dentro de los grupos, que es el estadístico F de la prueba ANOVA unidireccional . [ 4 ]

Véase también

Referencias

  1. Robert L. Thorndike (diciembre de 1953). "¿Quién pertenece a la familia?". Psychometrika . 18 (4): 267– 276. doi : 10.1007/BF02289263 . S2CID 120467216 . 
  2. Véase, por ejemplo, Ketchen, Jr, David J.; Shook, Christopher L. (1996). "La aplicación del análisis de clústeres en la investigación de gestión estratégica: un análisis y una crítica" . Strategic Management Journal . 17 (6): 441– 458. doi : 10.1002/(SICI)1097-0266(199606)17:6 < 441::AID-SMJ819 > 3.0.CO ; 2-G .
  3. 1 2 Schubert, Erich (2023-07-05). "Dejar de usar el criterio del codo para k-means y cómo elegir el número de clústeres en su lugar" . ACM SIGKDD Explorations Newsletter . 25 (1): 36– 42. arXiv : 2212.12189 . doi : 10.1145/3606274.3606278 . ISSN 1931-0145 . 
  4. Véase, por ejemplo, la Figura 6 en
    • Gota, Cyril; Toft, Peter; Rostrup, Egill; Nielsen, Finn Arup; Hansen, Lars Kai (marzo de 1999). "Sobre la agrupación de series temporales de resonancia magnética funcional". NeuroImagen . 9 (3): 298– 310. CiteSeerX 10.1.1.29.2679 . doi : 10.1006/nimg.1998.0391 . PMID 10075900 . S2CID 14147564 .