Articulo de referencia

Datos inciertos

En informática , los datos inciertos son aquellos que contienen ruido , lo que provoca que se desvíen de los valores correctos, previstos u originales. En la era del big data , ...

En informática , los datos inciertos son aquellos que contienen ruido , lo que provoca que se desvíen de los valores correctos, previstos u originales. En la era del big data , la incertidumbre o veracidad de los datos es una de sus características definitorias. Los datos crecen constantemente en volumen, variedad, velocidad e incertidumbre (1/veracidad). Hoy en día, abundan los datos inciertos en la web, en las redes de sensores y en las empresas, tanto en sus fuentes estructuradas como no estructuradas. Por ejemplo, puede haber incertidumbre respecto a la dirección de un cliente en un conjunto de datos empresariales, o en las lecturas de temperatura capturadas por un sensor debido al envejecimiento del mismo. En 2012, IBM destacó la gestión de datos inciertos a gran escala en su informe de perspectivas tecnológicas globales [ 1 ] , que presenta un análisis exhaustivo con una proyección de tres a diez años para identificar tecnologías disruptivas significativas que transformarán el mundo. Para tomar decisiones empresariales con confianza basadas en datos reales, los análisis deben tener en cuenta necesariamente los diversos tipos de incertidumbre presentes en grandes volúmenes de datos. Los análisis basados ​​en datos inciertos afectarán la calidad de las decisiones posteriores, por lo que no se pueden ignorar el grado y el tipo de imprecisiones presentes en dichos datos.

Los datos inciertos se encuentran en el ámbito de las redes de sensores ; en el texto, donde abunda el texto ruidoso en las redes sociales, la web y en las empresas, donde los datos estructurados y no estructurados pueden ser antiguos, obsoletos o simplemente incorrectos; y en la modelización, donde el modelo matemático puede ser solo una aproximación del proceso real. Al representar dichos datos en una base de datos , es necesario seleccionar un modelo de base de datos incierto adecuado.

Ejemplo de modelo de datos para datos inciertos

Una forma de representar datos inciertos es mediante distribuciones de probabilidad . Tomemos como ejemplo una base de datos relacional . Hay tres formas principales de representar la incertidumbre como distribuciones de probabilidad en un modelo de base de datos de este tipo .

En la incertidumbre de atributos , cada atributo incierto en una tupla está sujeto a su propia distribución de probabilidad independiente . [ 2 ] Por ejemplo, si se toman lecturas de temperatura y velocidad del viento, cada una se describiría mediante su propia distribución de probabilidad, ya que conocer la lectura de una medición no proporcionaría ninguna información sobre la otra.

En la incertidumbre correlacionada , múltiples atributos pueden describirse mediante una distribución de probabilidad conjunta . [ 2 ] Por ejemplo, si se toman lecturas de la posición de un objeto y se almacenan las coordenadas x e y , la probabilidad de diferentes valores puede depender de la distancia a las coordenadas registradas. Como la distancia depende de ambas coordenadas, puede ser apropiado utilizar una distribución conjunta para estas coordenadas, ya que no son independientes .

En la incertidumbre de tuplas , todos los atributos de una tupla están sujetos a una distribución de probabilidad conjunta. Esto abarca el caso de incertidumbre correlacionada, pero también incluye el caso en el que existe una probabilidad de que una tupla no pertenezca a la relación relevante, lo cual se indica cuando la suma de todas las probabilidades no es igual a uno. [ 2 ] Por ejemplo, supongamos que tenemos la siguiente tupla de una base de datos probabilística :

Entonces, la tupla tiene un 10% de probabilidad de no existir en la base de datos.

Referencias

  1. Perspectivas tecnológicas mundiales (PDF) (Informe). 2012.
  2. 1 2 3 Prabhakar, Sunil. "ORION: Gestión de datos inciertos (de sensores)" (PDF) . Ciencias de la Computación . Archivado del original (PDF) el 20 de julio de 2011. Recuperado el 29 de septiembre de 2008 .
  • Habich Volk; Clemens Utzny; Ralf Dittmann; Wolfgang Lehner. "Agrupamiento basado en densidad con consideración de errores de valores de medición imprecisos". Séptima Conferencia Internacional IEEE sobre Talleres de Minería de Datos, 2007. Talleres ICDM 2007. IEEE.
  • Volk Rosentahl; Martin Hahmann; Dirk Habich; Wolfgang Lehner. "Agrupación de datos inciertos con mundos posibles". Actas del 1er Taller sobre Gestión y Minería de Datos Inciertos, en conjunto con la 25ª Conferencia Internacional sobre Ingeniería de Datos, 2009. IEEE.