Los datos oscuros son datos que se adquieren a través de diversas operaciones de redes informáticas , pero que no se utilizan de ninguna manera para obtener información o para la toma de decisiones . [ 1 ] [ 2 ] La capacidad de una organización para recopilar datos puede superar el rendimiento al que puede analizarlos . En algunos casos, la organización puede incluso desconocer que se están recopilando datos. [ 3 ] IBM estima que aproximadamente el 90 por ciento de los datos generados por sensores y conversiones analógicas-digitales nunca se utilizan. [ 4 ]
En un contexto industrial, los datos oscuros pueden incluir información recopilada por sensores y telemática . [ 5 ]
Las organizaciones conservan datos ocultos por multitud de razones, y se estima que la mayoría de las empresas solo analizan el 1 % de sus datos. [ 6 ] A menudo se almacenan para el cumplimiento normativo [ 7 ] y el mantenimiento de registros. [ 1 ] Algunas organizaciones creen que los datos ocultos podrían serles útiles en el futuro, una vez que hayan adquirido mejor tecnología analítica y de inteligencia empresarial para procesar la información. [ 3 ] Dado que el almacenamiento es económico, almacenar datos es fácil. Sin embargo, almacenar y proteger los datos suele implicar mayores gastos (o incluso riesgos) que el beneficio potencial. [ 1 ]
En el discurso académico, el término «datos oscuros» fue acuñado esencialmente por Bryan P. Heidorn. Lo utiliza para describir los datos de investigación, especialmente los de la cola larga de la ciencia (los numerosos proyectos de investigación pequeños), que no están o ya no están disponibles para la investigación porque desaparecen en un cajón sin una gestión de datos adecuada. [ 8 ] Sin esto, los datos se vuelven oscuros, y otras razones para ello son, por ejemplo, la falta de anotación de metadatos, la falta de planes de gestión de datos y la ausencia de curadores de datos. [ 9 ]
Análisis
El término "datos oscuros" se refiere a menudo a datos que no son procesables por ordenador. Por ejemplo, una empresa puede tener una gran cantidad de datos que solo existen como imágenes escaneadas de páginas. Incluso el texto plano de dichos documentos no está disponible sin una tecnología como el reconocimiento óptico de caracteres (OCR) , cuya precisión puede variar considerablemente. Incluso con OCR, no se puede determinar el significado de cada parte de los datos. Un ejemplo claro es si una palabra en mayúscula es un nombre o no, y, en caso afirmativo, si representa a una persona, un lugar, una organización o incluso una obra de arte. Referencias bibliográficas y de otro tipo, datos dentro de tablas (que pueden estar etiquetados adecuadamente para los humanos, pero no para su procesamiento) e innumerables afirmaciones representadas con toda la complejidad y ambigüedad del lenguaje humano.
Gran cantidad de datos no utilizados son muy valiosos y se usarían si fuera posible ; sin embargo, están bloqueados porque se encuentran en formatos difíciles de procesar, categorizar, identificar y analizar. A menudo, la razón por la que las empresas no utilizan sus datos ocultos es la cantidad de recursos que requeriría y la dificultad de analizarlos. En otras palabras, los datos son "oscuros" no porque no se utilicen, sino porque no se pueden utilizar (de forma viable o económica) debido a su deficiente representación.
Existen numerosas representaciones de datos que facilitan su acceso para la automatización. Sin embargo, gran parte de la información carece de identificación de elementos o relaciones; y mucha más la pierde durante procesos posteriores como guardarla en formatos de página, imprimirla, escanearla o enviarla por fax. El proceso de recuperación puede resultar costoso.
Según Computer Weekly , el 60% de las organizaciones cree que su capacidad de generación de informes de inteligencia empresarial es "inadecuada" y el 65% afirma tener "enfoques de gestión de contenido algo desorganizados". [ 10 ]
Pertinencia
Los datos útiles pueden convertirse en datos obsoletos una vez que pierden relevancia, debido a que no se procesan con la suficiente rapidez. Esto se conoce como "información efímera" en el contexto de los "datos en tiempo real". Por ejemplo, si una empresa conoce la geolocalización de un cliente, puede realizar ofertas basadas en dicha ubicación; sin embargo, si estos datos no se procesan de inmediato, podrían volverse irrelevantes en el futuro. Según IBM, aproximadamente el 60 % de los datos pierde su valor inmediatamente. [ 4 ]
Almacenamiento
Según el New York Times , el 90 % de la energía utilizada por los centros de datos se desperdicia. [ 11 ] Si no se almacenaran datos, se podrían ahorrar costes energéticos. Además, existen costes asociados a la subutilización de la información y, por lo tanto, a las oportunidades perdidas. Según Datamation, «los entornos de almacenamiento de las organizaciones de EMEA constan de un 54 % de datos oscuros, un 32 % de datos redundantes, obsoletos y triviales, y un 14 % de datos críticos para el negocio. Para 2020, esto podría suponer un coste de almacenamiento y gestión de hasta 891.000 millones de dólares que, de otro modo, podrían evitarse». [ 12 ]
El almacenamiento continuo de datos ocultos puede poner en riesgo a una organización, especialmente si se trata de datos sensibles. En caso de una filtración, esto puede tener graves repercusiones, tanto financieras como legales, y dañar seriamente la reputación de la organización. Por ejemplo, una filtración de los registros privados de los clientes podría resultar en el robo de información sensible, lo que podría derivar en un robo de identidad . Otro ejemplo sería la filtración de la propia información sensible de la empresa, por ejemplo, la relacionada con la investigación y el desarrollo . Estos riesgos pueden mitigarse evaluando y auditando la utilidad de estos datos para la organización, empleando un cifrado y una seguridad robustos [ 13 ] y, finalmente, si se decide eliminarlos, deben eliminarse de forma que resulten irrecuperables [ 14 ] .
Futuro
Generalmente se considera que, a medida que se desarrollan sistemas informáticos más avanzados para el análisis de datos, mayor será el valor de los datos oscuros. Se ha señalado que "los datos y el análisis serán la base de la revolución industrial moderna". [ 5 ] Por supuesto, esto incluye los datos que actualmente se consideran "datos oscuros" debido a la falta de recursos para procesarlos. Todos estos datos que se recopilan pueden utilizarse en el futuro para maximizar la productividad y permitir que las organizaciones satisfagan la demanda de los consumidores. Los avances tecnológicos están ayudando a aprovechar estos datos oscuros de forma asequible. Además, muchas organizaciones no se dan cuenta del valor de los datos oscuros en la actualidad; por ejemplo, en el sector de la salud y la educación, las organizaciones manejan grandes cantidades de datos que podrían crear un potencial significativo para atender a estudiantes y pacientes de la misma manera que los servicios financieros y de consumo se dirigen a su público objetivo. [ 15 ]
Referencias
- 1 2 3 "Datos oscuros" . Gartner .
- ↑ Tittel, Ed (24 de septiembre de 2014). "Los peligros de los datos oscuros y cómo minimizar su exposición" . CIO . Archivado del original el 15 de enero de 2019. Recuperado el 15 de septiembre de 2015 .
- 1 2 Brantley, Bill (17 de junio de 2015). "The API Briefing: the Challenge of Government's Dark Data" . Digitalgov.gov .
- 1 2 Johnson, Heather (30 de octubre de 2015). "Desenterrando datos oscuros: lo que pone a IBM a la vanguardia de la economía de la información" . SiliconANGLE . Recuperado el 3 de noviembre de 2015 .
- 1 2 Dennies, Paul (19 de febrero de 2015). "TeradataVoice: Fábricas del futuro: El valor de los datos oscuros" . Forbes . Archivado del original el 22 de febrero de 2015.
- ↑ Shahzad, M. Ahmad (3 de enero de 2017). "El desafío de la transformación de los macrodatos para la industria manufacturera" . IBM Big Data & Analytics Hub . Archivado del original el 6 de marzo de 2018. Recuperado el 23 de enero de 2017 .
- ↑ "¿Estás utilizando tus datos oscuros de forma eficaz?" . Archivado del original el 16 de enero de 2017. Consultado el 12 de enero de 2017 .
- ↑ Heidorn, P. Bryan. "Arrojando luz sobre los datos oscuros en la larga cola de la ciencia". Library trends 57.2 (2008): 280-299.
- ↑ Schembera, B., Durán, JM. Datos oscuros como el nuevo desafío para la ciencia de datos masivos y la introducción del responsable de datos científicos. Philos. Technol. 33, 93–115 (2020). https://doi.org/10.1007/s13347-019-00346-x
- ↑ Miles, Doug (27 de diciembre de 2013). "Los datos oscuros podrían frenar el camino al éxito del big data" . ComputerWeekly . Recuperado el 3 de noviembre de 2015 .
- ↑ Glanz, James (22 de septiembre de 2012). "Los centros de datos desperdician enormes cantidades de energía, desmintiendo la imagen de la industria" . The New York Times . Consultado el 2 de noviembre de 2015 .
- ↑ Hernández, Pedro (30 de octubre de 2015). "Las empresas están acumulando datos 'oscuros': Veritas" . Datamation . Recuperado el 4 de noviembre de 2015 .
- ↑ "DarkShield utiliza aprendizaje automático para encontrar y enmascarar información de identificación personal" . IRI . Consultado el 14 de enero de 2019 .
- ↑ Tittel, Ed (24-09-2014). "Los peligros de los datos oscuros y cómo minimizar su exposición" . CIO . Archivado del original el 15-01-2019 . Recuperado el 02-11-2015 .
- ↑ Prag, Crystal (30 de septiembre de 2014). "Aprovechando los datos oscuros: Preguntas y respuestas con Melissa McCormack" . The Machine Learning Times . Recuperado el 4 de noviembre de 2015 .
- Análisis de datos
- Recopilación de datos
- Bases de datos
- Almacenamiento de datos informáticos