Articulo de referencia

Análisis de clúster

El resultado de un análisis de clúster se muestra como la coloración de los cuadrados en tres clústeres. El análisis de clústeres , o clustering , es una técnica de análisis de ...

El resultado de un análisis de clúster se muestra como la coloración de los cuadrados en tres clústeres.

El análisis de clústeres , o clustering , es una técnica de análisis de datos que busca dividir un conjunto de objetos en grupos, de manera que los objetos dentro de un mismo grupo (llamado clúster ) presenten mayor similitud entre sí (en algún sentido específico definido por el analista) que con los de otros grupos (clústeres). Es una tarea fundamental del análisis exploratorio de datos y una técnica común para el análisis estadístico de datos , utilizada en numerosos campos, como el reconocimiento de patrones , el análisis de imágenes , la recuperación de información , la bioinformática , la compresión de datos , los gráficos por computadora y el aprendizaje automático .

El análisis de clústeres se refiere a una familia de algoritmos y tareas, más que a un algoritmo específico . Se puede realizar mediante diversos algoritmos que difieren significativamente en su comprensión de lo que constituye un clúster y cómo encontrarlos de manera eficiente. Las nociones comunes de clústeres incluyen grupos con distancias pequeñas entre sus miembros, áreas densas del espacio de datos, intervalos o distribuciones estadísticas particulares . Por lo tanto, la agrupación se puede formular como un problema de optimización multiobjetivo . El algoritmo de agrupación y la configuración de parámetros adecuados (incluidos parámetros como la función de distancia a utilizar, un umbral de densidad o el número de clústeres esperados) dependen del conjunto de datos individual y del uso previsto de los resultados. El análisis de clústeres como tal no es una tarea automática, sino un proceso iterativo de descubrimiento de conocimiento o de optimización multiobjetivo interactiva que implica ensayo y error. A menudo es necesario modificar el preprocesamiento de datos y los parámetros del modelo hasta que el resultado alcance las propiedades deseadas.

Además del término «agrupamiento» , existen otros términos con significados similares, como «clasificación automática» , «taxonomía numérica» , «botriología» (del griego βότρυς , « uva » ), «análisis tipológico» y «detección de comunidades ». Las sutiles diferencias suelen radicar en el uso de los resultados: mientras que en la minería de datos lo que interesa son los grupos resultantes, en la clasificación automática lo que interesa es el poder discriminatorio resultante.

El análisis de conglomerados se originó en la antropología por Driver y Kroeber en 1932 [ 1 ] y fue introducido en la psicología por Joseph Zubin en 1938 [ 2 ] y Robert Tryon en 1939 [ 3 ] y fue utilizado de manera famosa por Cattell a partir de 1943 [ 4 ] para la clasificación de la teoría de rasgos en la psicología de la personalidad .

Definición

La noción de "clúster" no puede definirse con precisión, lo cual explica la gran cantidad de algoritmos de agrupamiento existentes. [ 5 ] Existe un denominador común: un grupo de objetos de datos. Sin embargo, diferentes investigadores emplean distintos modelos de clúster, y para cada uno de estos modelos se pueden aplicar diferentes algoritmos. La noción de clúster, según la definen los diferentes algoritmos, varía significativamente en sus propiedades. Comprender estos "modelos de clúster" es fundamental para entender las diferencias entre los diversos algoritmos. Algunos modelos de clúster típicos incluyen:

  • Modelos de conectividad : por ejemplo,la agrupación jerárquicaconstruye modelos basados ​​en la conectividad de distancia.
  • Modelo de centroide : por ejemplo, elalgoritmo k-meansrepresenta cada clúster mediante un único vector de media.
  • Modelos de distribución : los clústeres se modelan utilizando distribuciones estadísticas, comolas distribuciones normales multivariadasutilizadas por elalgoritmo de expectativa-maximización.
  • Modelos de densidad : por ejemplo,DBSCAN,OPTICSyHDBSCANdefinen los clústeres como regiones densas conectadas en el espacio de datos.
  • Modelo de subespacio s: en elbiclustering(también conocido como co-clustering o agrupamiento de dos modos), los clústeres se modelan con miembros del clúster y atributos relevantes.
  • Modelos de grupo : algunos algoritmos no proporcionan un modelo refinado para sus resultados y solo proporcionan la información de agrupación.
  • Modelos basados ​​en grafos : unacamarilla, es decir, un subconjunto de nodos en ungrafotal que cada dos nodos del subconjunto están conectados por una arista, puede considerarse una forma prototípica de clúster. Las relajaciones del requisito de conectividad completa (puede faltar una fracción de las aristas) se conocen como cuasi-camarillas, como en elalgoritmo de agrupamiento HCS.
  • Modelos de grafos con signos : Cada camino en un grafo con signos tiene un signo resultante del producto de los signos de las aristas. Bajo los supuestos de la teoría del equilibrio , las aristas pueden cambiar de signo y dar lugar a un grafo bifurcado. El axioma de agrupamiento más débil (ningún ciclo tiene exactamente una arista negativa) produce resultados con más de dos clústeres, o subgrafos con solo aristas positivas. [ 6 ]
  • Modelos neuronales : la red neuronalno supervisada más conocidaes elmapa autoorganizadoy estos modelos generalmente se pueden caracterizar como similares a uno o más de los modelos anteriores, e incluyen modelos de subespacio cuando las redes neuronales implementan una forma deanálisis de componentes principalesoanálisis de componentes independientes.

Una "agrupación" es esencialmente un conjunto de dichos clústeres, que generalmente contienen todos los objetos del conjunto de datos. Además, puede especificar la relación entre los clústeres, por ejemplo, una jerarquía de clústeres anidados unos dentro de otros. Las agrupaciones se pueden distinguir a grandes rasgos de la siguiente manera:

  • Agrupamiento rígido : cada objeto pertenece a un clúster o no.
  • Agrupamiento suave (también:Agrupamiento difuso ): cada objeto pertenece a cada grupo en cierto grado (por ejemplo, una probabilidad de pertenecer al grupo).

También son posibles distinciones más sutiles, por ejemplo:

  • Agrupamiento por particionamiento estricto : cada objeto pertenece a un único clúster.
  • Agrupamiento por particionamiento estricto con valores atípicos : los objetos también pueden no pertenecer a ningún clúster; en cuyo caso se consideranvalores atípicos.
  • Agrupamiento superpuesto (también:agrupamiento alternativo,agrupamiento multivista): los objetos pueden pertenecer a más de un grupo; generalmente implica grupos rígidos.
  • Agrupamiento jerárquico : los objetos que pertenecen a un grupo hijo también pertenecen al grupo padre.
  • Agrupamiento en subespacios : mientras que en un agrupamiento superpuesto, dentro de un subespacio definido de forma única, no se espera que los clústeres se superpongan.

Algoritmos

Comparación visual de diferentes algoritmos de agrupamiento en conjuntos de datos 2D simples.

Como se indicó anteriormente, los algoritmos de agrupamiento se pueden clasificar según su modelo de clúster. La siguiente descripción general solo incluirá los ejemplos más destacados, ya que existen posiblemente más de 100 algoritmos de agrupamiento publicados. No todos proporcionan modelos para sus clústeres y, por lo tanto, no se pueden clasificar fácilmente. En Wikipedia se puede encontrar una descripción general de los algoritmos explicados en la lista de algoritmos estadísticos .

No existe un algoritmo de agrupamiento objetivamente "correcto", pero como se señaló, "el agrupamiento es subjetivo". [ 5 ] De hecho, un enfoque axiomático del agrupamiento demuestra que es imposible que cualquier método de agrupamiento cumpla simultáneamente tres propiedades fundamentales: invariancia de escala (los resultados permanecen inalterados bajo escalamiento proporcional de distancias), riqueza (se pueden lograr todas las particiones posibles de los datos) y consistencia entre las distancias y la estructura de agrupamiento. [ 7 ] El algoritmo de agrupamiento más apropiado para un problema particular a menudo debe elegirse experimentalmente, a menos que exista una razón matemática para preferir un modelo de agrupamiento sobre otro. Un algoritmo diseñado para un tipo de modelo generalmente fallará en un conjunto de datos que contenga un tipo de modelo radicalmente diferente. [ 5 ] Por ejemplo, k-means no puede encontrar agrupamientos no convexos. [ 5 ] La mayoría de los métodos de agrupamiento tradicionales asumen que los agrupamientos exhiben una forma esférica, elíptica o convexa. [ 8 ]

Agrupamiento basado en conectividad (agrupamiento jerárquico)

La agrupación basada en conectividad, también conocida como agrupación jerárquica , se basa en la idea de que los objetos están más relacionados entre sí que con los más lejanos. Estos algoritmos forman clústeres conectando objetos según su distancia. Un clúster puede entenderse en términos de la distancia máxima necesaria para conectar sus elementos.

A diferentes distancias, aparecen distintas agrupaciones de clústeres. Estas agrupaciones se pueden visualizar mediante un dendrograma , un diagrama en forma de árbol que muestra cómo se fusionan los clústeres a medida que aumenta la distancia. Esto explica el término " agrupamiento jerárquico ": en lugar de generar una única partición del conjunto de datos, el algoritmo crea una jerarquía de clústeres que se fusionan a diferentes distancias. En un dendrograma, el eje Y muestra la distancia a la que se fusionan los clústeres, mientras que el eje X organiza los objetos de forma que los clústeres aparezcan como ramas continuas.

La agrupación basada en conectividad es una familia de métodos que difieren en la forma en que se calculan las distancias entre clústeres. Además de elegir una función de distancia , el usuario también debe seleccionar un criterio de enlace , que determina cómo se calcula la distancia entre clústeres. Los criterios de enlace comunes incluyen la agrupación de enlace simple (distancia mínima entre puntos), la agrupación de enlace completo (distancia máxima) y UPGMA o WPGMA (enlace promedio basado en distancias medias). La agrupación jerárquica puede ser aglomerativa (combinando elementos individuales) o divisiva (dividiendo el conjunto de datos completo).

En la agrupación jerárquica aglomerativa, el algoritmo generalmente procede de la siguiente manera:

  1. Comience considerando cada punto de datos como un clúster independiente.
  2. Identifica los dos grupos más cercanos basándote en una medida de distancia elegida.
  3. Fusionarlos en un único clúster.
  4. Recalcula las distancias entre el nuevo clúster y los clústeres restantes utilizando el criterio de enlace seleccionado.
  5. Repita hasta que todos los puntos de datos se fusionen en un único grupo. [ 9 ]

Este proceso genera una jerarquía completa de posibles agrupaciones, en lugar de un único resultado final. Se puede obtener una agrupación específica seleccionando un nivel de corte en el dendrograma, que determina cuántos grupos se forman.

Estos métodos no producen una partición única del conjunto de datos, sino una jerarquía de la cual el usuario debe elegir los clústeres apropiados. También son sensibles a los valores atípicos, que pueden aparecer como clústeres separados o provocar la fusión de otros clústeres. Este efecto, especialmente en el agrupamiento de enlace simple , se conoce como el "fenómeno de encadenamiento". En el caso general, la complejidad esO(norte3){\displaystyle {\mathcal {O}}(n^{3})}para la agrupación aglomerativa yO(2norte1){\displaystyle {\mathcal {O}}(2^{n-1})}para la agrupación divisiva , [ 10 ] lo que las hace computacionalmente costosas para grandes conjuntos de datos. Para algunos casos especiales, métodos más eficientes (con complejidadO(norte2){\displaystyle {\mathcal {O}}(n^{2})}) son conocidos, como SLINK [ 11 ] para agrupamiento de enlace simple y CLINK [ 12 ] para agrupamiento de enlace completo.

Agrupamiento basado en centroides

En la agrupación basada en centroides, cada clúster está representado por un vector central, que no necesariamente pertenece al conjunto de datos. Cuando el número de clústeres se fija en k , la agrupación k -medias se define formalmente como un problema de optimización: encontrar los k centros de clúster y asignar los objetos al centro de clúster más cercano, de manera que se minimicen las distancias al cuadrado desde el clúster.

Se sabe que el problema de optimización en sí es NP-difícil , por lo que el enfoque común es buscar solo soluciones aproximadas. Un método aproximado particularmente conocido es el algoritmo de Lloyd , [ 13 ] a menudo denominado simplemente " algoritmo k-means " (aunque otro algoritmo introdujo este nombre ). Sin embargo, solo encuentra un óptimo local y comúnmente se ejecuta varias veces con diferentes inicializaciones aleatorias. Las variaciones de k -means a menudo incluyen optimizaciones tales como elegir el mejor de múltiples ejecuciones, pero también restringir los centroides a miembros del conjunto de datos ( k -medoides ), elegir medianas ( agrupamiento k -medianas ), elegir los centros iniciales de manera menos aleatoria ( k -means++ ) o permitir una asignación de clúster difusa ( c-means difuso ).

La mayoría de los algoritmos de tipo k -medias requieren que se especifique de antemano el número de clústeres ( k ), lo que se considera una de sus mayores desventajas. Además, estos algoritmos prefieren clústeres de tamaño similar, ya que siempre asignan un objeto al centroide más cercano, lo que a menudo resulta en bordes de clústeres mal definidos. Esto ocurre principalmente porque el algoritmo optimiza los centros de los clústeres, no sus bordes. Los pasos del algoritmo de agrupamiento basado en centroides son:

  1. Seleccione k grupos distintos al azar. Estos son los centroides iniciales que se van a optimizar.
  2. Supongamos un conjunto de observaciones, ( x 1 , x 2 , ..., x n ) . Asignamos cada observación al centroide con el que tiene la menor distancia euclidiana al cuadrado . Esto da como resultado k grupos distintos, cada uno con observaciones únicas.
  3. Recalcular los centroides (ver agrupamiento k -means ).
  4. Salir del programa si los nuevos centroides son equivalentes a los centroides de la iteración anterior. De lo contrario, repetir el algoritmo, ya que los centroides aún no han convergido.

El algoritmo K-means posee varias propiedades teóricas interesantes. En primer lugar, divide el espacio de datos en una estructura conocida como diagrama de Voronoi . En segundo lugar, su concepto es similar al de la clasificación por vecinos más cercanos, por lo que es popular en el aprendizaje automático . En tercer lugar, puede considerarse una variante del agrupamiento basado en modelos, y el algoritmo de Lloyd, una variante del algoritmo de Expectación-Maximización para este modelo, que se describe más adelante.

El siguiente pseudocódigo [ 14 ] describe la forma estándar de refinamiento iterativo de k -medias. El algoritmo alterna entre un paso de asignación , que etiqueta cada punto con su centroide más cercano, y un paso de actualización , que recalcula cada centroide como la media de sus puntos asignados. La convergencia está garantizada en un número finito de iteraciones, aunque el resultado puede ser un óptimo local .

entrada: conjunto de datosincógnita1,...,incógnitaPAG{\displaystyle \mathbf {x} _{1},...,\mathbf {x} _{P}}inicializaciones para los centroidesdo1,...,doK{\displaystyle \mathbf {c} _{1},...,\mathbf {c} _{K}}, número máximo de iteracionesJ{\displaystyle J} paraj=1,,J{\displaystyle \,\,j=1,\ldots ,J} # Asignaciones de clústeres parapag=1,,PAG{\displaystyle \,\,p=1,\ldots ,P}apag=argininak=1,,Kdokincógnitapag2{\displaystyle a_{p}={\underset {k=1,\ldots ,K}{\mbox{argmin}}}\,\,\left\Vert \mathbf {c} _{k}-\mathbf {x} _{p}\right\Vert _{2}} # Actualizar ubicaciones de centroides parak=1,,K{\displaystyle \,\,k=1,\ldots ,K}denotar Sk el conjunto de índices de puntos incógnitapag actualmente asignado a la kth grupo{\displaystyle {\text{denote }}S_{k}{\text{ the index set of points }}X_{p}{\text{ currently assigned to the }}k_{th}{\text{ cluster}}}actualizar dok a través de dok=1|Sk|pagSkincógnitapag{\displaystyle {\text{update }}c_{k}{\text{ via }}c_{k}={\frac {1}{\left|S_{k}\right|}}{\underset {p\in S_{k}}{\sum }}\mathbf {x} _{p}} # Actualizar las asignaciones de clústeres usando la versión final parapag=1,,PAG{\displaystyle \,\,p=1,\ldots ,P}apag=argininak=1,,Kdokincógnitapag2{\displaystyle a_{p}={\underset {k=1,\ldots ,K}{\mbox{argmin}}}\,\,\left\Vert \mathbf {c} _{k}-\mathbf {x} _{p}\right\Vert _{2}}Salida: centroides óptimos y asignaciones [ 14 ]

Los problemas de agrupamiento basados ​​en centroides, como k -medias y k -medoides, son casos especiales del problema de localización de instalaciones métricas sin restricciones de capacidad , un problema canónico en las comunidades de investigación operativa y geometría computacional. En un problema básico de localización de instalaciones (del cual existen numerosas variantes que modelan escenarios más complejos), la tarea consiste en encontrar las mejores ubicaciones de almacenes para atender de manera óptima a un conjunto dado de consumidores. Se puede considerar a los "almacenes" como centroides de clústeres y a las "ubicaciones de los consumidores" como los datos que se van a agrupar. Esto permite aplicar las soluciones algorítmicas bien desarrolladas de la literatura sobre localización de instalaciones al problema de agrupamiento basado en centroides que se considera en este estudio.

Agrupamiento basado en modelos

El marco de agrupamiento más relacionado con la estadística es el agrupamiento basado en modelos , que se fundamenta en modelos de distribución . Este enfoque modela los datos como si provinieran de una mezcla de distribuciones de probabilidad. Tiene la ventaja de proporcionar respuestas estadísticas rigurosas a preguntas como cuántos grupos existen, qué método o modelo de agrupamiento utilizar y cómo detectar y tratar los valores atípicos.

Si bien la base teórica de estos métodos es excelente, presentan problemas de sobreajuste a menos que se restrinja la complejidad del modelo. Un modelo más complejo suele explicar mejor los datos, lo que dificulta intrínsecamente la elección de la complejidad adecuada. Los métodos de agrupamiento estándar basados ​​en modelos incluyen modelos más parsimoniosos, basados ​​en la descomposición en valores propios de las matrices de covarianza, que ofrecen un equilibrio entre el sobreajuste y la fidelidad a los datos.

Un método destacado es el de los modelos de mezcla gaussiana (que utilizan el algoritmo de maximización de la esperanza ). En este método, el conjunto de datos se modela con un número fijo (para evitar el sobreajuste) de distribuciones gaussianas que se inicializan aleatoriamente y cuyos parámetros se optimizan iterativamente para ajustarse mejor al conjunto de datos. Esto converge a un óptimo local , por lo que varias ejecuciones pueden producir resultados diferentes. Para obtener una agrupación estricta, los objetos suelen asignarse a la distribución gaussiana a la que probablemente pertenecen; para las agrupaciones flexibles, esto no es necesario.

La agrupación basada en la distribución produce modelos complejos para los clústeres que pueden capturar la correlación y la dependencia entre los atributos. Sin embargo, estos algoritmos suponen una carga adicional para el usuario: para muchos conjuntos de datos reales, puede que no exista un modelo matemático definido de forma concisa (por ejemplo, asumir distribuciones gaussianas es una suposición bastante fuerte sobre los datos).

Agrupamiento basado en la densidad

En la agrupación basada en densidad, [ 15 ] los clústeres se definen como áreas de mayor densidad que el resto del conjunto de datos. Los objetos en áreas dispersas, que son necesarios para separar los clústeres, generalmente se consideran ruido y puntos de frontera.

El método de agrupamiento basado en densidad más popular [ 16 ] es DBSCAN [ 17 ] . A diferencia de muchos métodos más recientes, presenta un modelo de clúster bien definido llamado "alcanceabilidad por densidad". Similar al agrupamiento basado en enlaces, se basa en conectar puntos dentro de ciertos umbrales de distancia. Sin embargo, solo conecta puntos que satisfacen un criterio de densidad, en la variante original definido como un número mínimo de otros objetos dentro de este radio. Un clúster consta de todos los objetos conectados por densidad (que pueden formar un clúster de forma arbitraria, a diferencia de muchos otros métodos) más todos los objetos que se encuentran dentro del rango de estos objetos. Otra propiedad interesante de DBSCAN es que su complejidad es bastante baja: requiere un número lineal de consultas de rango en la base de datos, y que descubrirá esencialmente los mismos resultados (es determinista para los puntos centrales y de ruido, pero no para los puntos de borde) en cada ejecución, por lo que no es necesario ejecutarlo varias veces. OPTICS [ 18 ] es una generalización de DBSCAN que elimina la necesidad de elegir un valor apropiado para el parámetro de rango.ε{\displaystyle \varepsilon }y produce un resultado jerárquico relacionado con el de la agrupación de enlaces . DeLi-Clu, [ 19 ] Density-Link-Clustering combina ideas de la agrupación de enlaces simples y OPTICS, eliminando elε{\displaystyle \varepsilon }parámetro completo y ofrece mejoras de rendimiento sobre OPTICS mediante el uso de un índice R-tree . HDBSCAN [ 20 ] extiende DBSCAN convirtiéndolo en un algoritmo de agrupamiento jerárquico y luego utilizando una técnica para extraer un agrupamiento plano basado en la estabilidad de los clústeres.

El principal inconveniente de DBSCAN y OPTICS es que requieren una disminución de la densidad para detectar los límites de los clústeres. En conjuntos de datos con, por ejemplo, distribuciones gaussianas superpuestas (un caso común en datos artificiales), los límites de los clústeres generados por estos algoritmos suelen parecer arbitrarios, ya que la densidad de los clústeres disminuye continuamente. En un conjunto de datos compuesto por mezclas de gaussianas, estos algoritmos casi siempre son superados por métodos como el agrupamiento EM , que son capaces de modelar con precisión este tipo de datos.

Mean-shift es un método de agrupamiento donde cada objeto se mueve al área más densa en su vecindad, basándose en la estimación de densidad del kernel . Eventualmente, los objetos convergen a máximos locales de densidad. De forma similar al agrupamiento k-means, estos "atractores de densidad" pueden servir como representantes del conjunto de datos, pero Mean-shift puede detectar clústeres de forma arbitraria, similar a DBSCAN. Debido al costoso procedimiento iterativo y a la estimación de densidad, Mean-shift suele ser más lento que DBSCAN o k-Means. Además, la aplicabilidad del algoritmo Mean-shift a datos multidimensionales se ve obstaculizada por el comportamiento no suave de la estimación de densidad del kernel, lo que resulta en una sobrefragmentación de las colas de los clústeres. [ 19 ]

Agrupamiento basado en cuadrículas

La técnica basada en cuadrículas se utiliza para conjuntos de datos multidimensionales . [ 21 ] En esta técnica, creamos una estructura de cuadrícula y la comparación se realiza sobre cuadrículas (también conocidas como celdas). La técnica basada en cuadrículas es rápida y tiene una baja complejidad computacional. Existen dos tipos de métodos de agrupamiento basados ​​en cuadrículas: STING y CLIQUE. Los pasos involucrados en el algoritmo de agrupamiento basado en cuadrículas son:

  1. Dividir el espacio de datos en un número finito de celdas.
  2. Seleccione aleatoriamente una celda 'c', donde c no debe ser recorrida previamente.
  3. Calcula la densidad de 'c'.
  4. Si la densidad de 'c' es mayor que la densidad umbral:
    1. Marcar la celda 'c' como un nuevo clúster.
    2. Calcula la densidad de todos los vecinos de 'c'.
    3. Si la densidad de una celda vecina es mayor que la densidad umbral, entonces agregue la celda al grupo y repita los pasos 4.2 y 4.3 hasta que no haya ningún vecino con una densidad mayor que la densidad umbral.
  5. Repita los pasos 2, 3 y 4 hasta que se hayan recorrido todas las celdas.
  6. Detener.

Big data

Con la creciente necesidad de procesar Big data , la disposición a intercambiar significado semántico de los clústeres generados por rendimiento se vuelve más relevante. Por lo tanto, se han realizado esfuerzos para mejorar el rendimiento de los algoritmos existentes. [ 22 ] [ 23 ] Entre ellos se encuentran CLARANS , [ 24 ] y BIRCH . [ 25 ] Esto llevó al desarrollo de métodos de preagrupamiento como canopy clustering , que puede procesar conjuntos de datos enormes de manera eficiente, pero los "clústeres" resultantes son simplemente una prepartición aproximada del conjunto de datos para luego analizar las particiones con métodos existentes más lentos como k-means clustering .

Agrupamiento de subespacios

Para datos de alta dimensión , muchos métodos fallan debido a la maldición de la dimensionalidad , que hace que ciertas funciones de distancia sean problemáticas en espacios de alta dimensión. Esto llevó a algoritmos de agrupamiento para datos de alta dimensión que se centran en el agrupamiento de subespacios (donde solo se utilizan algunos atributos y los modelos de clúster incluyen los atributos relevantes para el clúster) y el agrupamiento de correlación que también busca clústeres de subespacios rotados arbitrarios ("correlacionados") que pueden modelarse dando una correlación de sus atributos. [ 26 ] Ejemplos de tales algoritmos de agrupamiento son CLIQUE [ 27 ] y SUBCLU . [ 28 ]

Las ideas de los métodos de agrupamiento basados ​​en la densidad (en particular la familia de algoritmos DBSCAN/OPTICS) se han adaptado al agrupamiento de subespacios (HiSC, [ 29 ] agrupamiento jerárquico de subespacios y DiSH [ 30 ] ) y al agrupamiento de correlación (HiCO, [ 31 ] agrupamiento jerárquico de correlación, 4C [ 32 ] usando "conectividad de correlación" y ERiC [ 33 ] explorando clústeres de correlación jerárquicos basados ​​en la densidad).

Se han propuesto varios sistemas de agrupamiento diferentes basados ​​en la información mutua . Uno de ellos es la variación de la métrica de información de Marina Meilă; [ 34 ] otro proporciona agrupamiento jerárquico. [ 35 ] Utilizando algoritmos genéticos, se puede optimizar una amplia gama de funciones de ajuste diferentes, incluida la información mutua. [ 36 ] Asimismo, la propagación de creencias , un desarrollo reciente en ciencias de la computación y física estadística , ha llevado a la creación de nuevos tipos de algoritmos de agrupamiento. [ 37 ]

Evaluación y valoración

La evaluación (o "validación") de los resultados de la agrupación es tan difícil como la agrupación misma. [ 38 ] Los enfoques populares incluyen la evaluación " interna ", donde la agrupación se resume en una única puntuación de calidad; la evaluación " externa ", donde la agrupación se compara con una clasificación de "verdad fundamental" existente; la evaluación " manual " por un experto humano; y la evaluación " indirecta " mediante la evaluación de la utilidad de la agrupación en su aplicación prevista. [ 39 ]

Las medidas de evaluación internas presentan el problema de que representan funciones que, a su vez, pueden considerarse un objetivo de agrupamiento. Por ejemplo, se podría agrupar el conjunto de datos mediante el coeficiente de silueta; sin embargo, no se conoce ningún algoritmo eficiente para ello. Al utilizar una medida interna de este tipo para la evaluación, se compara más bien la similitud de los problemas de optimización [ 39 ] , y no necesariamente la utilidad del agrupamiento.

La evaluación externa presenta problemas similares: si contáramos con etiquetas de referencia, no necesitaríamos agrupar los datos; y en la práctica, generalmente no disponemos de dichas etiquetas. Por otro lado, las etiquetas solo reflejan una posible partición del conjunto de datos, lo que no implica que no exista una agrupación diferente, e incluso mejor.

Ninguno de estos enfoques puede, por lo tanto, juzgar en última instancia la calidad real de una agrupación, sino que requiere evaluación humana, [ 39 ] la cual es altamente subjetiva. Sin embargo, dichas estadísticas pueden ser bastante informativas para identificar agrupaciones deficientes, [ 40 ] pero no se debe descartar la evaluación humana subjetiva. [ 40 ]

Evaluación interna

Cuando el resultado de un agrupamiento se evalúa en función de los datos que se agruparon, se habla de evaluación interna. Estos métodos suelen asignar la mejor puntuación al algoritmo que produce agrupamientos con alta similitud dentro de un mismo agrupamiento y baja similitud entre agrupamientos. Una desventaja de usar criterios internos en la evaluación de agrupamientos es que las puntuaciones altas en una medida interna no necesariamente resultan en aplicaciones efectivas de recuperación de información. [ 41 ] Además, esta evaluación está sesgada hacia los algoritmos que usan el mismo modelo de agrupamiento. Por ejemplo, el agrupamiento k-means optimiza naturalmente las distancias entre objetos, y un criterio interno basado en la distancia probablemente sobrevalorará el agrupamiento resultante.

Por lo tanto, las medidas de evaluación internas son más adecuadas para obtener información sobre situaciones en las que un algoritmo funciona mejor que otro, pero esto no implica que un algoritmo produzca resultados más válidos que otro. [ 5 ] La validez medida por dicho índice depende de la afirmación de que este tipo de estructura existe en el conjunto de datos. Un algoritmo diseñado para un tipo de modelos no tiene ninguna posibilidad si el conjunto de datos contiene un conjunto de modelos radicalmente diferente, o si la evaluación mide un criterio radicalmente diferente. [ 5 ] Por ejemplo, el agrupamiento k-means solo puede encontrar clústeres convexos, y muchos índices de evaluación asumen clústeres convexos. En un conjunto de datos con clústeres no convexos, ni el uso de k- means, ni un criterio de evaluación que asuma convexidad, es adecuado.

Muchas medidas de evaluación interna se basan en la intuición de que los elementos del mismo grupo deberían ser más similares que los elementos de grupos diferentes. [ 42 ] : 115–121 Por ejemplo, se pueden utilizar los siguientes métodos para evaluar la calidad de los algoritmos de agrupamiento basados ​​en criterios internos:

El índice de Davies-Bouldin se puede calcular mediante la siguiente fórmula: DB=1nortei=1nortemáximoji(σi+σjd(doi,doj)){\displaystyle DB={\frac {1}{n}}\sum _{i=1}^{n}\max _{j\neq i}\left({\frac {\sigma _{i}+\sigma _{j}}{d(c_{i},c_{j})}}\right)} donde n es el número de clústeres,doi{\displaystyle c_{i}}es el centroide del clústeri{\displaystyle i},σi{\displaystyle \sigma _{i}}es la distancia promedio de todos los elementos en el clústeri{\displaystyle i}al centroidedoi{\displaystyle c_{i}}, yd(doi,doj){\displaystyle d(c_{i},c_{j})}es la distancia entre los centroidesdoi{\displaystyle c_{i}}ydoj{\displaystyle c_{j}}Dado que los algoritmos que producen clústeres con distancias intraclúster bajas (alta similitud intraclúster) y distancias interclúster altas (baja similitud interclúster) tendrán un índice de Davies-Bouldin bajo, el algoritmo de agrupamiento que produce una colección de clústeres con el índice de Davies-Bouldin más pequeño se considera el mejor algoritmo según este criterio.

El índice de Dunn tiene como objetivo identificar clústeres densos y bien separados. Se define como la razón entre la distancia mínima entre clústeres y la distancia máxima dentro de cada clúster. Para cada partición de clúster, el índice de Dunn se puede calcular mediante la siguiente fórmula: [ 43 ]

D=min1i<jnorted(i,j)máximo1knorted(k),{\displaystyle D={\frac {\min _{1\leq i<j\leq n}d(i,j)}{\max _{1\leq k\leq n}d^{\prime }(k)}}\,,}

donde d ( i , j ) representa la distancia entre los clústeres i y j , y d '( k ) mide la distancia intraclúster del clúster k . La distancia interclúster d ( i , j ) entre dos clústeres puede ser cualquier número de medidas de distancia, como la distancia entre los centroides de los clústeres. De manera similar, la distancia intraclúster d '( k ) puede medirse de diversas maneras, como la distancia máxima entre cualquier par de elementos en el clúster k . Dado que el criterio interno busca clústeres con alta similitud intraclúster y baja similitud interclúster, los algoritmos que producen clústeres con un alto índice de Dunn son más deseables. 

El coeficiente de silueta compara la distancia promedio a los elementos del mismo clúster con la distancia promedio a los elementos de otros clústeres. Los objetos con un valor alto de silueta se consideran bien agrupados, mientras que los objetos con un valor bajo pueden ser valores atípicos. Este índice funciona bien con el algoritmo de agrupamiento k -means y también se utiliza para determinar el número óptimo de clústeres. [ 44 ]

Área bajo la curva para la agrupación (AUCC)

Esta matriz considera pares de objetos: la distancia entre el par como una función de puntuación y la partición de pares definida como verdaderos positivos, verdaderos negativos, falsos negativos y verdaderos negativos considerando si los pares están en los mismos clústeres o no. Este índice toma prestadas las mismas características que el AUC en el escenario supervisado incluyendo un valor esperado de 0,5 y visualización de resultados [ 45 ] .

Evaluación externa

En la evaluación externa, los resultados de la agrupación se evalúan con base en datos que no se utilizaron para la agrupación, como etiquetas de clase conocidas y puntos de referencia externos. Dichos puntos de referencia consisten en un conjunto de elementos preclasificados, y estos conjuntos suelen ser creados por humanos (expertos). Por lo tanto, los conjuntos de puntos de referencia pueden considerarse un estándar de oro para la evaluación. [ 38 ] Este tipo de métodos de evaluación miden qué tan cerca está la agrupación de las clases de referencia predeterminadas. Sin embargo, recientemente se ha debatido si esto es adecuado para datos reales, o solo para conjuntos de datos sintéticos con una verdad fundamental fáctica, ya que las clases pueden contener estructura interna, los atributos presentes pueden no permitir la separación de clústeres o las clases pueden contener anomalías . [ 46 ] Además, desde el punto de vista del descubrimiento de conocimiento , la reproducción del conocimiento conocido puede no ser necesariamente el resultado deseado. [ 46 ] En el escenario especial de la agrupación restringida , donde la metainformación (como las etiquetas de clase) ya se utiliza en el proceso de agrupación, la retención de información para fines de evaluación no es trivial. [ 47 ]

Varias medidas se adaptan de variantes utilizadas para evaluar tareas de clasificación. En lugar de contar el número de veces que una clase se asignó correctamente a un solo punto de datos (conocido como verdaderos positivos ), estas métricas de conteo de pares evalúan si cada par de puntos de datos que realmente está en el mismo clúster se predice que estará en el mismo clúster. [ 38 ]

Al igual que con la evaluación interna, existen varias medidas de evaluación externa, [ 42 ] : 125–129 por ejemplo:

Pureza

La pureza es una medida del grado en que los clústeres contienen una sola clase. [ 41 ] Su cálculo puede pensarse de la siguiente manera: Para cada clúster, cuente el número de puntos de datos de la clase más común en dicho clúster. Ahora tome la suma sobre todos los clústeres y divídala por el número total de puntos de datos. Formalmente, dado un conjunto de clústeresMETRO{\displaystyle M}y algún conjunto de clasesD{\displaystyle D}, ambos particionesnorte{\displaystyle N}Los puntos de datos, la pureza se puede definir como:

1nortemetroMETROmáximodD|metrod|{\displaystyle {\frac {1}{N}}\sum _{m\in M}\max _{d\in D}{|m\cap d|}}

Esta medida no penaliza la existencia de muchos clústeres, y cuantos más clústeres haya, más fácil será obtener una alta pureza. Siempre es posible obtener una puntuación de pureza de 1 colocando cada punto de datos en su propio clúster. Además, la pureza no funciona bien con datos desequilibrados, donde incluso los algoritmos de agrupamiento de bajo rendimiento darán un valor de pureza alto. Por ejemplo, si un conjunto de datos de tamaño 1000 consta de dos clases, una con 999 puntos y la otra con 1 punto, entonces cada partición posible tendrá una pureza de al menos el 99,9 %.

El índice de Rand [ 48 ] calcula cuán similares son los clústeres (devueltos por el algoritmo de agrupamiento) a las clasificaciones de referencia. Se puede calcular utilizando la siguiente fórmula:

RI=TPAG+TnorteTPAG+FPAG+Fnorte+Tnorte{\displaystyle RI={\frac {TP+TN}{TP+FP+FN+TN}}}

dóndeTPAG{\displaystyle TP}es el número de verdaderos positivos,Tnorte{\displaystyle TN}es el número de verdaderos negativos ,FPAG{\displaystyle FP}es el número de falsos positivos yFnorte{\displaystyle FN}es el número de falsos negativos . Las instancias que se cuentan aquí son el número de asignaciones correctas por pares . Es decir,TPAG{\displaystyle TP}es el número de pares de puntos que se agrupan juntos en la partición predicha y en la partición de verdad fundamental,FPAG{\displaystyle FP}es el número de pares de puntos que se agrupan en la partición predicha pero no en la partición de la verdad fundamental, etc. Si el conjunto de datos es de tamaño N, entoncesTPAG+Tnorte+FPAG+Fnorte=(norte2){\displaystyle TP+TN+FP+FN={\binom {N}{2}}}Un problema del índice de Rand es que los falsos positivos y los falsos negativos tienen el mismo peso. Esto puede ser una característica indeseable para algunas aplicaciones de agrupamiento. La medida F aborda esta preocupación, al igual que el índice de Rand ajustado corregido por azar .

La medida F se puede utilizar para equilibrar la contribución de los falsos negativos ponderando la exhaustividad a través de un parámetro.β0{\displaystyle \beta \geq 0}. Definamos la precisión y la exhaustividad (ambas medidas de evaluación externa en sí mismas) de la siguiente manera: PAG=TPAGTPAG+FPAG{\displaystyle P={\frac {TP}{TP+FP}}}R=TPAGTPAG+Fnorte{\displaystyle R={\frac {TP}{TP+FN}}} dóndePAG{\displaystyle P}es la tasa de precisión yR{\displaystyle R}es la tasa de recuperación . Podemos calcular la medida F utilizando la siguiente fórmula: [ 41 ]Fβ=(β2+1)PAGRβ2PAG+R{\displaystyle F_{\beta }={\frac {(\beta ^{2}+1)\cdot P\cdot R}{\beta ^{2}\cdot P+R}}} Cuandoβ=0{\displaystyle \beta =0},F0=PAG{\displaystyle F_{0}=P}En otras palabras, la recuperación no tiene impacto en la medida F cuandoβ=0{\displaystyle \beta =0}y en aumentoβ{\displaystyle \beta }asigna una cantidad creciente de peso al recuerdo en la medida F final.Tnorte{\displaystyle TN}no se tiene en cuenta y puede variar desde 0 hacia arriba sin límite.

El índice de Jaccard se utiliza para cuantificar la similitud entre dos conjuntos de datos. Este índice toma un valor entre 0 y 1. Un índice de 1 significa que los dos conjuntos de datos son idénticos, y un índice de 0 indica que no tienen elementos en común. El índice de Jaccard se define mediante la siguiente fórmula: J(A,B)=|AB||AB|=TPAGTPAG+FPAG+Fnorte{\displaystyle J(A,B)={\frac {|A\cap B|}{|A\cup B|}}={\frac {TP}{TP+FP+FN}}} Esto es simplemente el número de elementos únicos comunes a ambos conjuntos dividido por el número total de elementos únicos en ambos conjuntos. Tenga en cuenta queTnorte{\displaystyle TN}no se tiene en cuenta.

La medida simétrica de Dice duplica el peso enTPAG{\displaystyle TP}mientras sigue ignorandoTnorte{\displaystyle TN}: DSdo=2TPAG2TPAG+FPAG+Fnorte{\displaystyle DSC={\frac {2TP}{2TP+FP+FN}}}.

El índice de Fowlkes-Mallows [ 49 ] calcula la similitud entre los clústeres devueltos por el algoritmo de agrupamiento y las clasificaciones de referencia. Cuanto mayor sea el valor del índice de Fowlkes-Mallows, mayor será la similitud entre los clústeres y las clasificaciones de referencia. Se puede calcular mediante la siguiente fórmula: FMETRO=TPAGTPAG+FPAGTPAGTPAG+Fnorte{\displaystyle FM={\sqrt {{\frac {TP}{TP+FP}}\cdot {\frac {TP}{TP+FN}}}}} dóndeTPAG{\displaystyle TP}es el número de verdaderos positivos ,FPAG{\displaystyle FP}es el número de falsos positivos yFnorte{\displaystyle FN}es el número de falsos negativos .FMETRO{\displaystyle FM}El índice es la media geométrica de la precisión y la exhaustividad.PAG{\displaystyle P}yR{\displaystyle R}y, por lo tanto, también se conoce como la medida G , mientras que la medida F es su media armónica. [ 50 ] [ 51 ] Además, la precisión y la exhaustividad también se conocen como los índices de Wallace.BI{\displaystyle B^{I}}yBII{\displaystyle B^{II}}. [ 52 ] Las versiones normalizadas por azar de la exhaustividad, la precisión y la medida G corresponden a la información , la marcación y la correlación de Matthews y se relacionan fuertemente con Kappa . [ 53 ]

Índice Chi

El índice Chi [ 54 ] es un índice de validación externa que mide los resultados de la agrupación mediante la estadística chi-cuadrado . Este índice valora positivamente la dispersión de las etiquetas entre los grupos, es decir, que cada grupo tenga el menor número posible de etiquetas diferentes. Cuanto mayor sea el valor del índice Chi, mayor será la relación entre los grupos resultantes y las etiquetas utilizadas.

La información mutua es una medida teórica de la información que indica cuánta información se comparte entre una agrupación y una clasificación de referencia, y que puede detectar una similitud no lineal entre dos agrupaciones. La información mutua normalizada es una familia de variantes de esta medida, corregidas por el azar, que presenta un sesgo reducido para diferentes números de clústeres. [ 38 ]

Una matriz de confusión puede utilizarse para visualizar rápidamente los resultados de un algoritmo de clasificación (o agrupamiento). Muestra cuán diferente es un grupo con respecto al grupo de referencia (el grupo de referencia).

Medida de validez

La medida de validez (medida v corta) es una métrica combinada para la homogeneidad y la completitud de los clústeres [ 55 ].

Tendencia de agrupamiento

Medir la tendencia a la agrupación consiste en determinar en qué medida existen agrupaciones en los datos que se van a agrupar, y puede realizarse como una prueba inicial antes de intentar la agrupación. Una forma de hacerlo es comparar los datos con datos aleatorios. En promedio, los datos aleatorios no deberían tener agrupaciones .

Existen múltiples formulaciones del estadístico de Hopkins . [ 56 ] Una típica es la siguiente. [ 57 ] Seaincógnita{\displaystyle X}ser el conjunto denorte{\displaystyle n}puntos de datos end{\displaystyle d}espacio dimensional. Considere una muestra aleatoria (sin reemplazo) demetronorte{\displaystyle m\ll n}puntos de datos con miembrosincógnitai{\displaystyle x_{i}}. También genera un conjuntoY{\displaystyle Y}demetro{\displaystyle m}puntos de datos distribuidos aleatoriamente de forma uniforme. Ahora definamos dos medidas de distancia,i{\displaystyle u_{i}}ser la distancia deyiY{\displaystyle y_{i}\in Y}de su vecino más cercano en X ywi{\displaystyle w_{i}}ser la distancia deincógnitaiincógnita{\displaystyle x_{i}\in X}de su vecino más cercano en X. A continuación, definimos la estadística de Hopkins como:
H=i=1metroidi=1metroid+i=1metrowid,{\displaystyle H={\frac {\sum _{i=1}^{m}{u_{i}^{d}}}{\sum _{i=1}^{m}{u_{i}^{d}}+\sum _{i=1}^{m}{w_{i}^{d}}}}\,,}
Según esta definición, los datos aleatorios uniformes deberían tender a tener valores cercanos a 0,5, y los datos agrupados deberían tender a tener valores más cercanos a 1.
Sin embargo, los datos que contienen una sola distribución gaussiana también obtendrán una puntuación cercana a 1, ya que esta estadística mide la desviación de una distribución uniforme , no la multimodalidad , lo que la hace prácticamente inútil en la práctica (ya que los datos reales nunca son remotamente uniformes).

Ética y equidad

A medida que las corporaciones y organizaciones gubernamentales implementan cada vez más algoritmos de agrupamiento para categorizar poblaciones y automatizar decisiones con datos reales, las preocupaciones sobre el sesgo algorítmico se han vuelto más frecuentes. Dado que el agrupamiento es una forma de aprendizaje no supervisado , identifica patrones dentro de los datos existentes. En consecuencia, estos modelos pueden reforzar inadvertidamente las desigualdades históricas ya presentes en los conjuntos de datos de entrenamiento.

Definiciones de equidad en la agrupación

Lograr la equidad en el aprendizaje no supervisado basado en datos del mundo real es imposible, ya que no existe una verdad fundamental para etiquetar lo que es "correcto". Si bien los algoritmos de agrupamiento son de naturaleza matemática, son susceptibles a sesgos sistémicos dado que los datos subyacentes reflejan prejuicios tanto históricos como sociales. [ 58 ] En respuesta, los investigadores han desarrollado marcos de "agrupamiento justo", como el enfoque Fairlet, que garantiza que cada grupo mantenga una representación equilibrada de los grupos protegidos en relación con la población general. [ 59 ]

Impacto desproporcionado y medidas indirectas

Según la doctrina jurídica del impacto desproporcionado , un proceso se considera discriminatorio si produce resultados desproporcionadamente adversos para una clase protegida, incluso si el algoritmo es aparentemente neutral (es decir, no utiliza explícitamente atributos como la raza o el género). [ 60 ] La injusticia suele producirse mediante variables indirectas . Por ejemplo, incluso si se elimina la raza de un conjunto de datos, un algoritmo de agrupamiento podría utilizar códigos postales o nivel educativo como características. Dado que estas variables suelen estar estrechamente relacionadas con el estatus económico y la etnia, los grupos resultantes segregarán efectivamente a los individuos según estas características.

Impactos en el mundo real

La aplicación de la agrupación en la vigilancia predictiva ha demostrado cómo el sesgo histórico en los datos puede crear bucles de retroalimentación.

  • Estudio de caso (Chicago)
    • La lista estratégica de sospechosos del Departamento de Policía de Chicago utilizaba la agrupación para identificar a personas con mayor probabilidad de participar en delitos futuros. Sin embargo, un estudio de 2016 reveló que el modelo se centraba principalmente en personas con antecedentes policiales, en lugar de en su actividad delictiva real, lo que afectaba desproporcionadamente a las comunidades minoritarias sin reducir los índices de criminalidad. [ 61 ] Esto se debía a que el modelo se basaba en datos policiales y, por lo tanto, solo podía clasificar en función de la actividad policial y no de los delitos cometidos.
  • Disparidades demográficas
    • Las investigaciones sobre la agrupación en el reconocimiento facial han demostrado que las tasas de error son significativamente más altas para las mujeres y las personas de color. Por ejemplo, el proyecto Gender Shades descubrió que ciertos sistemas de clasificación basados ​​en agrupamiento tenían tasas de error de hasta el 34,7 % para las mujeres de piel oscura, en comparación con el 0,8 % para los hombres blancos. [ 62 ]

Aplicaciones

El análisis de clústeres se utiliza para el análisis de datos en una amplia gama de campos.

Ciencias naturales

En las ciencias naturales , técnicas como la agrupación jerárquica , k -medias , la reducción de dimensionalidad , el análisis de componentes principales (PCA) y t-SNE se utilizan con frecuencia para dar sentido a los datos densos.

Se aplicaron cuatro métodos de reducción de dimensionalidad al conjunto de datos de genotipos del proyecto Mil Genomas, ilustrando cómo la agrupación puede revelar la estructura de la población a partir de datos genéticos a gran escala.

Medicina y datos médicos

La agrupación de datos se aplica a los perfiles médicos de los pacientes para identificar subgrupos con características de salud similares, lo que respalda los enfoques de medicina de precisión .

Ciencias climáticas y de la Tierra

Esquema de un marco de análisis basado en agrupamiento aplicado a datos de ciencias ambientales y de la Tierra.
  • Geoquímica y Geología del Petróleo
    • La agrupación espacial de propiedades químicas en diferentes lugares de muestreo ayuda a los geoquímicos a identificar zonas de mineralización, plumas de contaminación y límites geológicos. [ 68 ]

Ciencia y tecnología de datos

En aplicaciones informáticas y tecnológicas, la agrupación es la fuerza motriz del aprendizaje no supervisado del aprendizaje automático y está integrada en sistemas que van desde motores de búsqueda hasta plataformas de recomendación. Los algoritmos comunes en este campo incluyen k -means , DBSCAN , mean shift y agrupación espectral , que a menudo se aplican después de la extracción de características o la incrustación , pasos que mapean datos brutos, como texto, imágenes y registros de sensores, a un espacio vectorial que permite la agrupación basada en la distancia . [ 70 ]

Un flujo de trabajo de agrupamiento mediante aprendizaje automático para la deconvolución automatizada de imágenes, que ilustra cómo el agrupamiento no supervisado puede acelerar los procesos de visión artificial .

Aprendizaje automático y reconocimiento de patrones

  • Detección de anomalías
    • Las anomalías y los valores atípicos se definen generalmente en función de la estructura de agrupamiento de un conjunto de datos: los puntos que se alejan considerablemente de cualquier grupo establecido se marcan como inusuales. Esto convierte al agrupamiento en un elemento fundamental para la detección de intrusiones , la detección de fraudes y la monitorización de fallos industriales.
  • Métodos de Monte Carlo de cadena de Markov
    • La agrupación se utiliza para localizar y caracterizar los extremos de la distribución objetivo, lo que permite un muestreo más eficiente en la inferencia probabilística de alta dimensión.

Agrupación de documentos y textos

Visualización t-SNE de incrustaciones de palabras de la literatura del siglo XIX. La proximidad en la proyección 2D refleja la similitud semántica, un paso previo común para la agrupación de documentos.
  • DevOps
    • La agrupación se ha utilizado para analizar la efectividad de los equipos DevOps y para agrupar las canalizaciones de despliegue según sus características de rendimiento. [ 73 ]

La World Wide Web y las redes

Un gráfico de NodeXL sobre la actividad en Twitter durante el movimiento Occupy Wall Street. La agrupación mediante detección de comunidades revela subgrupos conversacionales distintos dentro de la red más amplia.
  • Análisis de redes sociales
    • En el estudio de las redes sociales , la agrupación se utiliza para identificar comunidades dentro de grandes grupos de personas, revelando cámaras de eco, centros de influencia y grupos de interés orgánicos que serían opacos en un gráfico de seguidores simple.
  • Agrupación de resultados de búsqueda
    • La agrupación puede crear un conjunto de resultados de búsqueda más relevante que las listas clasificadas tradicionales, especialmente cuando un término de búsqueda es ambiguo. [ 72 ] Por ejemplo, «manzana», que puede referirse tanto a Apple como a Apple Inc. Las herramientas de agrupación basadas en la web, como Clusty , agrupan los resultados por significados distintos, lo que permite que un algoritmo de clasificación devuelva una cobertura completa al seleccionar el mejor resultado de cada grupo.
  • Sistemas de recomendación
    • Los sistemas de recomendación utilizan la agrupación para predecir las preferencias desconocidas de un usuario analizando los gustos y las actividades de usuarios similares dentro del mismo grupo.

En el ámbito empresarial y las ciencias sociales, la agrupación se aplica con mayor frecuencia a datos tabulares de encuestas y transacciones, con el objetivo de segmentar poblaciones en grupos de consumidores, generar análisis de mercado detallados o ilustrar las preferencias de los votantes.

Negocios y Economía

  • Finanzas
    • El análisis de clústeres se ha utilizado para agrupar acciones en sectores según la covariación de sus rendimientos, lo que facilita la construcción de carteras y la gestión de riesgos . [ 75 ] También se aplica en la modelización del riesgo crediticio para agrupar a prestatarios con perfiles de riesgo similares y en el trading algorítmico para identificar cambios de régimen en el comportamiento del mercado.
  • Agrupación de artículos de compra
    • La agrupación permite organizar la gran variedad de artículos disponibles en internet en conjuntos de productos únicos. Por ejemplo, todos los artículos de eBay se pueden agrupar en secciones de productos específicas, como artículos para el hogar o ropa.

Ciencias Sociales

  • Análisis de secuencias en ciencias sociales
    • El análisis de conglomerados se utiliza para identificar patrones en las trayectorias de la vida familiar, las carreras profesionales y el uso del tiempo diario o semanal, lo que da como resultado tipologías del curso de la vida que arrojan luz sobre la estratificación social y la desigualdad.
  • Análisis del delito
    • La agrupación de datos permite identificar áreas con una elevada incidencia de determinados tipos de delitos. Al localizar los "puntos críticos" donde se han producido delitos similares a lo largo del tiempo, las fuerzas del orden pueden desplegar sus recursos de forma más estratégica. [ 77 ]
  • minería de datos educativos
    • El análisis de conglomerados se utiliza para identificar grupos de escuelas o estudiantes con perfiles académicos similares, lo que permite intervenciones dirigidas y una asignación más equitativa de recursos. [ 78 ]
  • Tipologías e investigación de opinión
    • Proyectos como los emprendidos por el Pew Research Center utilizan el análisis de conglomerados para discernir tipologías de opiniones, hábitos y datos demográficos a partir de datos de encuestas, lo que sirve de base tanto para el análisis político como para la comunicación estratégica.

Véase también

Tipos especializados de análisis de clústeres

Técnicas utilizadas en el análisis de conglomerados

Proyección y preprocesamiento de datos

Otro

Referencias

  1. Driver y Kroeber (1932). «Expresión cuantitativa de las relaciones culturales» . Publicaciones de la Universidad de California en arqueología y etnología estadounidenses . Expresión cuantitativa de las relaciones culturales. Berkeley, CA: University of California Press: 211–256 . Archivado del original el 6 de diciembre de 2020. Consultado el 18 de febrero de 2019 .
  2. Zubin, Joseph (1938). "Una técnica para medir la afinidad de pensamiento". The Journal of Abnormal and Social Psychology . 33 (4): 508– 516. doi : 10.1037/h0055441 . ISSN 0096-851X . 
  3. Tryon, Robert C. (1939). Análisis de clústeres: perfil de correlación y análisis ortométrico (factorial) para el aislamiento de unidades en la mente y la personalidad . Edwards Brothers.
  4. Cattell, RB (1943). "La descripción de la personalidad: rasgos básicos resueltos en grupos". Journal of Abnormal and Social Psychology . 38 (4): 476– 506. doi : 10.1037/h0054116 .
  5. 1 2 3 4 5 6 Estivill-Castro, Vladimir (20 de junio de 2002). "Por qué tantos algoritmos de agrupamiento: un documento de posición". Boletín informativo de ACM SIGKDD Explorations . 4 (1): 65– 75. doi : 10.1145/568574.568575 . S2CID 7329935 . 
  6. James A. Davis (mayo de 1967) "Agrupamiento y equilibrio estructural en grafos", Human Relations 20:181–7
  7. Kleinberg, Jon (2002). Un teorema de imposibilidad para la agrupación (PDF) . Avances en sistemas de procesamiento de información neuronal. Vol. 15. MIT Press. 
  8. Gao, Caroline X.; Dwyer, Dominic; Zhu, Ye; Smith, Catherine L.; Du, Lan; Filia, Kate M.; Bayer, Johanna; Menssink, Jana M.; Wang, Teresa; Bergmeir, Christoph; Wood, Stephen; Cotton, Sue M. (2023-09-01). "Una visión general de los métodos de agrupamiento con directrices para su aplicación en la investigación en salud mental" . Psychiatry Research . 327 115265. doi : 10.1016/j.psychres.2023.115265 . hdl : 10481/84538 . ISSN 0165-1781 . PMID 37348404 .  
  9. Murtagh, Fionn; Contreras, Pedro (2012). "Algoritmos para agrupamiento jerárquico: una visión general". WIREs Data Mining and Knowledge Discovery . 2 (1): 86– 97. doi : 10.1002/widm.53 .
  10. Everitt, Brian (2011). Análisis de clústeres . Chichester, West Sussex, Reino Unido: Wiley. ISBN 9780470749913.
  11. Sibson, R. (1973). "SLINK: un algoritmo óptimamente eficiente para el método de clúster de enlace único" (PDF) . The Computer Journal . 16 (1). British Computer Society: 30–34 . doi : 10.1093/comjnl/16.1.30 .
  12. Defays, D. (1977). "Un algoritmo eficiente para un método de enlace completo". The Computer Journal . 20 (4). British Computer Society: 364– 366. doi : 10.1093/comjnl/20.4.364 .
  13. Lloyd, S. (1982). "Cuantización por mínimos cuadrados en PCM" . IEEE Transactions on Information Theory . 28 (2): 129– 137. Bibcode : 1982ITIT...28..129L . doi : 10.1109/TIT.1982.1056489 . S2CID 10833328 . 
  14. 1 2 "11.5 Agrupamiento K-means" . kenndanielso.github.io . Recuperado el 20 de abril de 2026 .
  15. Kriegel, Hans-Peter ; Kröger, Peer; Sander, Jörg; Zimek, Arthur (2011). "Agrupación basada en densidad" . WIREs Minería de datos y descubrimiento de conocimientos . 1 (3): 231– 240. doi : 10.1002/widm.30 . S2CID 36920706 . 
  16. Búsqueda académica de Microsoft: artículos de minería de datos más citados. Archivado el 21/04/2010 en Wayback Machine : DBSCAN ocupa el puesto 24, cuando se consultó el 18/04/2010.
  17. Ester, Martin; Kriegel, Hans-Peter ; Sander, Jörg; Xu, Xiaowei (1996). «Un algoritmo basado en densidad para descubrir clústeres en grandes bases de datos espaciales con ruido». En Simoudis, Evangelos; Han, Jiawei; Fayyad, Usama M. (eds.). Actas de la Segunda Conferencia Internacional sobre Descubrimiento de Conocimiento y Minería de Datos (KDD-96) . AAAI Press . págs. 226–231 . ISBN  1-57735-004-9.
  18. Ankerst, Mihael; Breunig, Markus M.; Kriegel, Hans-Peter ; Sander, Jörg (1999). "OPTICS: Ordenación de puntos para identificar la estructura de agrupamiento". Conferencia internacional ACM SIGMOD sobre gestión de datos . ACM Press . págs. 49–60 . CiteSeerX 10.1.1.129.6542 .  
  19. 1 2 Achtert, E.; Böhm, C.; Kröger, P. (2006). "DeLi-Clu: Mejora de la robustez, la completitud, la usabilidad y la eficiencia del agrupamiento jerárquico mediante una clasificación de pares más cercanos". Avances en el descubrimiento del conocimiento y la minería de datos . Notas de clase en informática. Vol. 3918. pp. 119–128 . CiteSeerX 10.1.1.64.1161 . doi : 10.1007/11731139_16 . ISBN    978-3-540-33206-0.
  20. Campello, Ricardo JGB; Moulavi, Davoud; Sander, Joerg (2013). "Agrupamiento basado en densidad basado en estimaciones de densidad jerárquicas" . En Pei, Jian; Tseng, Vincent S.; Cao, Longbing; Motoda, Hiroshi; Xu, Guandong (eds.). Avances en descubrimiento de conocimiento y minería de datos . Lecture Notes in Computer Science. Vol. 7819. Berlín, Heidelberg: Springer. pp. 160–172 . doi : 10.1007/978-3-642-37456-2_14 . ISBN   978-3-642-37456-2.
  21. Aggarwal, Charu C.; Reddy, Chandan K. (eds.). Agrupación de datos : algoritmos y aplicaciones . ISBN  978-1-315-37351-5OCLC 1110589522 
  22. Sculley, D. (2010). Agrupamiento k-means a escala web . Actas del 19º Congreso Mundial de la Web.
  23. Huang, Z. (1998). "Extensiones del algoritmo k -medias para agrupar grandes conjuntos de datos con valores categóricos". Minería de datos y descubrimiento de conocimiento . 2 (3): 283– 304. doi : 10.1023/A:1009769707641 . S2CID 11323096 . 
  24. R. Ng y J. Han. "Método de agrupamiento eficiente y efectivo para la minería de datos espaciales". En: Actas de la 20.ª Conferencia VLDB, páginas 144-155, Santiago, Chile, 1994.
  25. Tian Zhang, Raghu Ramakrishnan, Miron Livny. " Un método eficiente de agrupamiento de datos para bases de datos muy grandes ". En: Actas de la Conferencia Internacional sobre Gestión de Datos, ACM SIGMOD, págs. 103-114.
  26. Kriegel, Hans-Peter ; Kröger, Peer; Zimek, Arthur (julio de 2012). "Agrupamiento de subespacios". Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery . 2 (4): 351– 364. doi : 10.1002/widm.1057 . S2CID 7241355 . 
  27. Agrawal, R.; Gehrke, J.; Gunopulos, D.; Raghavan, P. (2005). "Agrupamiento automático de subespacios de datos de alta dimensión". Minería de datos y descubrimiento de conocimiento . 11 : 5–33 . CiteSeerX 10.1.1.131.5152 . doi : 10.1007/s10618-005-1396-1 . S2CID 9289572 .  
  28. Karin Kailing, Hans-Peter Kriegel y Peer Kröger. Agrupamiento de subespacios conectados por densidad para datos de alta dimensión . En: Actas de la Conferencia Internacional SIAM sobre Minería de Datos (SDM'04) , págs. 246–257, 2004.
  29. ^ Achtert, E.; Böhm, C.; Kriegel, H.-P. ; Kröger, P.; Müller-Gorman, I.; Zimek, A. (2006). "Encontrar jerarquías de grupos subespaciales". Descubrimiento de conocimientos en bases de datos: PKDD 2006 . Apuntes de conferencias sobre informática. vol. 4213. págs. 446– 453. CiteSeerX 10.1.1.705.2956 . doi : 10.1007/11871637_42 . ISBN    978-3-540-45374-1.
  30. Achtert, E.; Böhm, C.; Kriegel, HP ; Kröger, P.; Müller-Gorman, I.; Zimek, A. (2007). "Detección y visualización de jerarquías de clústeres de subespacios". Avances en bases de datos: conceptos, sistemas y aplicaciones . Notas de clase en ciencias de la computación. Vol. 4443. págs. 152–163 . CiteSeerX 10.1.1.70.7843 . doi : 10.1007/978-3-540-71703-4_15 . ISBN    978-3-540-71702-7.
  31. Achtert, E.; Böhm, C.; Kröger, P.; Zimek, A. (2006). «Extracción de jerarquías de clústeres de correlación». 18.ª Conferencia Internacional sobre Gestión de Bases de Datos Científicas y Estadísticas (SSDBM'06) . págs. 119–128 . CiteSeerX 10.1.1.707.7872 . doi : 10.1109/SSDBM.2006.35 . ISBN   978-0-7695-2590-7. S2CID 2679909 . 
  32. Böhm, C.; Kailing, K.; Kröger, P.; Zimek, A. (2004). "Cálculo de clústeres de objetos conectados por correlación". Actas de la conferencia internacional ACM SIGMOD de 2004 sobre gestión de datos - SIGMOD '04 . pág. 455. CiteSeerX 10.1.1.5.1279 . doi : 10.1145/1007568.1007620 . ISBN   978-1581138597. S2CID 6411037 . 
  33. Achtert, E.; Bohm, C.; Kriegel, HP ; Kröger, P.; Zimek, A. (2007). "Sobre la exploración de relaciones complejas de clústeres de correlación". 19.ª Conferencia Internacional sobre Gestión de Bases de Datos Científicas y Estadísticas (SSDBM 2007) . pág. 7. CiteSeerX 10.1.1.71.5021 . doi : 10.1109/SSDBM.2007.21 . ISBN   978-0-7695-2868-7. S2CID 1554722 . 
  34. Meilă, Marina (2003). "Comparación de agrupaciones mediante la variación de la información". Teoría del aprendizaje y máquinas kernel . Notas de clase en informática. Vol. 2777. pp. 173–187 . doi : 10.1007/978-3-540-45167-9_14 . ISBN   978-3-540-40720-1.
  35. Kraskov, Alexander; Stögbauer, Harald; Andrzejak, Ralph G.; Grassberger, Peter (1 de diciembre de 2003). "Agrupamiento jerárquico basado en información mutua". arXiv : q-bio/0311039 .
  36. Auffarth, B. (18–23 de julio de 2010). "Agrupamiento mediante un algoritmo genético con operador de mutación sesgado" . Wcci Cec . IEEE.
  37. Frey, BJ; Dueck, D. (2007). "Clustering by Passing Messages Between Data Points". Science . 315 (5814): 972– 976. Bibcode : 2007Sci...315..972F . CiteSeerX 10.1.1.121.3145 . doi : 10.1126/science.1136800 . PMID 17218491 . S2CID 6502291 .   
  38. 1 2 3 4 Pfitzner, Darius; Leibbrandt, Richard; Powers, David (2009). "Caracterización y evaluación de medidas de similitud para pares de agrupaciones". Knowledge and Information Systems . 19 (3). Springer: 361– 394. doi : 10.1007/s10115-008-0150-6 . S2CID 6935380 . 
  39. 1 2 3 Feldman, Ronen; Sanger, James (2007-01-01). The Text Mining Handbook: Advanced Approaches in Analyzing Unstructured Data . Cambridge Univ. Press. ISBN 978-0521836579OCLC 915286380 
  40. 1 2 Weiss, Sholom M.; Indurkhya, Nitin; Zhang, Tong; Damerau, Fred J. (2005). Text Mining: Predictive Methods for Analyzing Unstructured Information . Springer. ISBN 978-0387954332OCLC 803401334 
  41. ^ Manning , Christopher D .; Raghavan, Prabhakar; Schütze, Hinrich (7 de julio de 2008). Introducción a la recuperación de información . Prensa de la Universidad de Cambridge. ISBN 978-0-521-86571-5.
  42. 1 2 Descubrimiento de conocimiento en bases de datos – Parte III – Agrupamiento (PDF) , Universidad de Heidelberg , 2017{{citation}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  43. Dunn, J. (1974). "Clústeres bien separados y particiones difusas óptimas". Journal of Cybernetics . 4 : 95–104 . doi : 10.1080/01969727408546059 .
  44. Rousseeuw, Peter J. (1987). "Siluetas: una ayuda gráfica para la interpretación y validación del análisis de clústeres". Journal of Computational and Applied Mathematics . 20 : 53–65 . doi : 10.1016/0377-0427(87)90125-7 .
  45. Jaskowiak, Pablo A.; Costa, Ivan G.; Campello, Ricardo JGB (2022-05-01). "El área bajo la curva ROC como medida de la calidad del agrupamiento" . Data Mining and Knowledge Discovery . 36 (3): 1219– 1245. arXiv : 2009.02400 . doi : 10.1007/s10618-022-00829-0 . ISSN 1573-756X . 
  46. 1 2 Färber, Ines; Günnemann, Stephan; Kriegel, Hans-Peter ; Kröger, Peer; Müller, Emmanuel; Schubert, Erich; Seidl, Thomas; Zimek, Arthur (2010). "Sobre el uso de etiquetas de clase en la evaluación de agrupaciones" (PDF) . En Fern, Xiaoli Z.; Davidson, Ian; Dy, Jennifer (eds.). MultiClust: Descubrimiento, resumen y uso de múltiples agrupaciones . ACM SIGKDD .
  47. Pourrajabi, M.; Moulavi, D.; Campello, RJGB; Zimek, A. ; Sander, J.; Goebel, R. (2014). "Selección de modelos para agrupamiento semisupervisado". Actas de la 17.ª Conferencia Internacional sobre la Extensión de la Tecnología de Bases de Datos (EDBT) . págs. 331–342 . doi : 10.5441/002/edbt.2014.31 . 
  48. Rand, WM (1971). "Criterios objetivos para la evaluación de métodos de agrupamiento". Journal of the American Statistical Association . 66 (336). American Statistical Association: 846– 850. arXiv : 1704.01036 . doi : 10.2307/2284239 . JSTOR 2284239 . 
  49. Fowlkes, EB; Mallows, CL (1983). "Un método para comparar dos agrupaciones jerárquicas". Journal of the American Statistical Association . 78 (383): 553– 569. Bibcode : 1983JASA...78..553F . doi : 10.1080/01621459.1983.10478008 . JSTOR 2288117 . 
  50. Powers, David (2003). Recuperación y precisión frente a la casa de apuestas . Conferencia Internacional sobre Ciencias Cognitivas. págs. 529–534 . 
  51. Arabie, P. (1985). "Comparación de particiones". Journal of Classification . 2 (1): 1985. doi : 10.1007/BF01908075 . S2CID 189915041 . 
  52. Wallace, DL (1983). "Comentario". Journal of the American Statistical Association . 78 (383): 569– 579. doi : 10.1080/01621459.1983.10478009 .
  53. Powers, David (2012). El problema con Kappa . Capítulo europeo de la Asociación de Lingüística Computacional. pp. 345–355 . 
  54. Luna-Romera, José María; Martínez-Ballesteros, María; García-Gutiérrez, Jorge; Riquelme, José C. (junio 2019). "Índice de validez de agrupamiento externo basado en prueba estadística de chi-cuadrado" . Ciencias de la Información . 487 : 1– 17. doi : 10.1016/j.ins.2019.02.046 . hdl : 11441/132081 . S2CID 93003939 . 
  55. Rosenberg, Andrew y Julia Hirschberg. «Medida V: Una medida de evaluación de clústeres externos basada en la entropía condicional». Actas de la conferencia conjunta de 2007 sobre métodos empíricos en procesamiento del lenguaje natural y aprendizaje computacional del lenguaje natural (EMNLP-CoNLL). 2007. pdf
  56. Hopkins, Brian; Skellam, John Gordon (1954). "Un nuevo método para determinar el tipo de distribución de individuos de plantas". Annals of Botany . 18 (2). Annals Botany Co: 213– 227. doi : 10.1093/oxfordjournals.aob.a083391 .
  57. Banerjee, A. (2004). "Validación de clústeres mediante la estadística de Hopkins". 2004 IEEE International Conference on Fuzzy Systems (IEEE Cat. No.04CH37542) . Vol. 1. pp. 149–153 . doi : 10.1109/FUZZY.2004.1375706 . ISBN   978-0-7803-8353-1. S2CID 36701919 . 
  58. Barocas, S., & Selbst, AD (2016). "El impacto dispar del Big Data." California Law Review .
  59. Chierichetti, F., et al. (2017). "Agrupación justa mediante Fairlets." Actas de la 31.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS).
  60. Feldman, M., et al. (2015). "Certificación y eliminación del impacto discriminatorio". Actas de la 21.ª Conferencia Internacional ACM SIGKDD .
  61. Lum, K., & Isaac, W. (2016). "¿Predecir y servir? Policía predictiva y despliegue estratégico." Significance, Royal Statistical Society .
  62. Buolamwini, J., & Gebru, T. (2018). "Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification." Proceedings of Machine Learning Research .
  63. Johnson, Stephen C. (1967-09-01). "Esquemas de agrupamiento jerárquico". Psychometrika . 32 (3): 241– 254. doi : 10.1007/BF02289588 . ISSN 1860-0980 . PMID 5234703 . S2CID 930698 .   
  64. Hartuv, Erez; Shamir, Ron (2000-12-31). "Un algoritmo de agrupamiento basado en la conectividad de grafos". Information Processing Letters . 76 (4): 175– 181. doi : 10.1016/S0020-0190(00)00142-3 . ISSN 0020-0190 . 
  65. Remm, Maido; Storm, Christian EV; Sonnhammer, Erik LL (2001-12-14). "Agrupación automática de ortólogos y parálogos internos a partir de comparaciones de especies por pares". Journal of Molecular Biology . 314 (5): 1041– 1052. doi : 10.1006/jmbi.2000.5197 . ISSN 0022-2836 . PMID 11743721 .  
  66. Filipovych, Roman; Resnick, Susan M.; Davatzikos, Christos (2011). "Análisis de clúster semisupervisado de datos de imágenes" . NeuroImage . 54 (3): 2185– 2197. doi : 10.1016/j.neuroimage.2010.09.074 . PMC 3008313. PMID 20933091 .  
  67. Huth, R.; et al. (2008). "Clasificaciones de patrones de circulación atmosférica: avances recientes y aplicaciones" (PDF) . Ann. NY Acad. Sci . 1146 (1): 105– 152. Bibcode : 2008NYASA1146..105H . doi : 10.1196 / annals.1446.019 . PMID 19076414. S2CID 22655306 .   
  68. Sadeghi, Behnam (2025). "Agrupamiento en la ciencia de datos geográficos: Navegando la incertidumbre para seleccionar el método más fiable" . Ore Geology Reviews . 282 .
  69. Basak, SC; Magnuson, VR; Niemi, CJ; Regal, RR (1988). "Determinación de la similitud estructural de sustancias químicas mediante índices de teoría de grafos" . Discr. Appl. Math . 19 ( 1–3 ): 17–44 . doi : 10.1016/0166-218x(88)90004-2 .
  70. Agrupación de datos grandes y de alta dimensión .
  71. Bewley, A.; et al. "Estimación de volumen en tiempo real de la carga útil de una dragalina". Conferencia Internacional IEEE sobre Robótica y Automatización . 2011 : 1571–1576 . 
  72. 1 2 Di Marco, Antonio; Navigli, Roberto (2013). "Agrupación y diversificación de resultados de búsqueda web con inducción de sentido de palabras basada en grafos". Lingüística Computacional . 39 (3): 709– 754. doi : 10.1162/COLI_a_00148 . S2CID 1775181 . 
  73. Informe sobre el estado de DevOps de 2022 (PDF) (Informe). Investigación y evaluación de DevOps de Google Cloud (DORA). 29 de septiembre de 2022. págs. 8, 14, 74. 
  74. Grobe, Mathias; Burghardt, Dirk. "Microdiagramas: visualización de datos puntuales categóricos de redes sociales basadas en la ubicación" . Cartografía y Ciencias de la Información Geográfica . doi : 10.1080/15230406.2020.1733438 .
  75. Arnott, Robert D. (1980-11-01). "Análisis de clústeres y covariación de precios de acciones". Financial Analysts Journal . 36 (6): 56– 62. doi : 10.2469/faj.v36.n6.56 . ISSN 0015-198X . 
  76. ^ Reuterer, Thomas; Dan, Daniel. "Análisis de conglomerados en investigación de mercados" . Manual de investigación de mercados . doi : 10.1007/978-3-319-05542-8_11-1 .
  77. Keller, Fernando. "Un enfoque de agrupamiento k-means refinado para optimizar la ubicación de instalaciones policiales urbanas" . Decision Analytics .
  78. "Técnica de clasificación y su combinación con agrupamiento y minería de reglas de asociación en la minería de datos educativos: una revisión" .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Cluster_analysis&oldid=1360782645 "