Articulo de referencia

Clasificación de datos (inteligencia empresarial)

En inteligencia empresarial , la clasificación de datos es "la construcción de algún tipo de método para realizar juicios sobre una secuencia continua de casos, donde cada nuevo...

En inteligencia empresarial , la clasificación de datos es "la construcción de algún tipo de método para realizar juicios sobre una secuencia continua de casos, donde cada nuevo caso debe asignarse a una de las clases predefinidas". [ 1 ]

La clasificación de datos está estrechamente relacionada con la agrupación de datos , pero mientras que la agrupación de datos es descriptiva , la clasificación de datos es predictiva . [ 2 ] [ 3 ] En esencia, la clasificación de datos consiste en utilizar variables con valores conocidos para predecir valores desconocidos o futuros de otras variables. Se puede utilizar, por ejemplo, en marketing directo , detección de fraude en seguros o diagnóstico médico . [ 3 ]

El primer paso para realizar una clasificación de datos es agrupar el conjunto de datos utilizado para el entrenamiento de categorías, para crear el número de categorías deseado. A continuación, se aplica un algoritmo , denominado clasificador , a las categorías, creando un modelo descriptivo para cada una. Estos modelos se pueden utilizar posteriormente para categorizar nuevos elementos en el sistema de clasificación creado. [ 2 ]

Eficacia

Según Golfarelli y Rizzi, estas son las medidas de efectividad del clasificador: [ 2 ]

  • Precisión predictiva : ¿Qué tan bien predice las categorías para nuevas observaciones?
  • Velocidad : ¿Cuál es el coste computacional de utilizar el clasificador?
  • Robustez : ¿Qué tan bien funcionan los modelos creados si la calidad de los datos es baja?
  • Escalabilidad : ¿El clasificador funciona de manera eficiente con grandes cantidades de datos?
  • Interpretabilidad : ¿Son comprensibles los resultados para los usuarios?

Ejemplos típicos de datos de entrada para la clasificación de datos podrían ser variables como datos demográficos , información sobre el estilo de vida o comportamiento económico.

Desafíos

La clasificación de datos presenta varios desafíos. Uno de ellos es la necesidad de que todos los usuarios de categorías, como clientes , realicen el modelado mediante un proceso iterativo. Esto garantiza que los cambios en las características de los grupos de clientes no pasen desapercibidos, evitando que las categorías existentes queden obsoletas sin que nadie se dé cuenta.

Esto podría ser de especial importancia para las compañías de seguros o bancarias , donde la detección de fraudes es fundamental. Los nuevos patrones de fraude podrían pasar desapercibidos si no se desarrollan e implementan métodos para monitorear estos cambios y alertar cuando las categorías cambian, desaparecen o surgen otras nuevas.

Referencias

  1. Mehanna, Fadi Samih Omar (2005). Hacia una técnica de clasificación de datos escalable y eficiente . Universidad de Louisville. p.  v . Recuperado el 10 de enero de 2024 .
  2. 1 2 3 Golfarelli, M. y Rizzi, S. (2009). Diseño de almacenes de datos  : principios y metodologías modernas. McGraw-Hill Osburn. ISBN 0-07-161039-1
  3. 1 2 Kimball, R. et al. (2008). The Data Warehouse Lifecycle Toolkit. (2.ª ed.) . Wiley. ISBN 0-471-25547-5
Obtenido de " https://en.wikipedia.org/w/index.php?title=Data_classification_(business_intelligence)&oldid=1194853606 "