Articulo de referencia

preprocesamiento de datos

El preprocesamiento de datos puede referirse a la manipulación, filtrado o aumento de datos antes de su análisis, y suele ser un paso importante en el proceso de minería de dato...

El preprocesamiento de datos puede referirse a la manipulación, filtrado o aumento de datos antes de su análisis, y suele ser un paso importante en el proceso de minería de datos . Los métodos de recopilación de datos a menudo carecen de un control adecuado, lo que da lugar a valores fuera de rango, combinaciones de datos imposibles y valores faltantes , entre otros problemas. El preprocesamiento es el proceso mediante el cual los datos no estructurados se transforman en representaciones inteligibles adecuadas para modelos de aprendizaje automático. Esta fase del modelo aborda el ruido para obtener mejores resultados a partir del conjunto de datos original, que era ruidoso. Este conjunto de datos también presenta cierto nivel de valores faltantes.

La figura muestra la deduplicación , un método de preprocesamiento de datos. Se enmarca dentro de la limpieza de conjuntos de datos .

El proceso de preprocesamiento utilizado puede tener grandes efectos en las conclusiones extraídas del análisis posterior. Por lo tanto, la representación y la calidad de los datos son necesarias antes de ejecutar cualquier análisis. [ 1 ] Si hay una alta proporción de información irrelevante y redundante o datos ruidosos y poco fiables, entonces el descubrimiento de conocimiento durante la fase de entrenamiento puede ser más difícil. Los pasos de preparación y filtrado de datos pueden tomar una cantidad considerable de tiempo de procesamiento. Ejemplos de métodos utilizados en el preprocesamiento de datos incluyen limpieza , selección de instancias , normalización , codificación one-hot , transformación de datos , extracción de características y selección de características .

Aplicaciones

minería de datos

El preprocesamiento de datos permite eliminar información no deseada mediante la limpieza de datos, lo que proporciona al usuario un conjunto de datos con información más valiosa tras la etapa de preprocesamiento para su posterior manipulación en el proceso de minería de datos. Editar dicho conjunto de datos para corregir la corrupción de datos o errores humanos es un paso crucial para obtener cuantificadores precisos como verdaderos positivos, verdaderos negativos, falsos positivos y falsos negativos, que se encuentran en una matriz de confusión comúnmente utilizada para el diagnóstico médico. Los usuarios pueden combinar archivos de datos y utilizar el preprocesamiento para filtrar el ruido innecesario, lo que permite una mayor precisión. Los usuarios utilizan scripts de programación en Python junto con la biblioteca pandas, que les permite importar datos de valores separados por comas como un marco de datos. Este marco de datos se utiliza para manipular datos, lo que de otro modo sería difícil de hacer en Excel. Pandas (software) es una potente herramienta que permite el análisis y la manipulación de datos, lo que facilita enormemente la visualización de datos, las operaciones estadísticas y mucho más. Muchos también utilizan el lenguaje de programación R para realizar estas tareas.

Existen muchas razones por las que un usuario transforma archivos existentes en uno nuevo. Algunos aspectos del preprocesamiento de datos pueden incluir la imputación de valores faltantes, la agregación de cantidades numéricas y la transformación de datos continuos en categorías ( agrupación de datos ). [ 2 ] Técnicas más avanzadas, como el análisis de componentes principales y la selección de características , trabajan con fórmulas estadísticas y se aplican a conjuntos de datos complejos registrados por rastreadores GPS y dispositivos de captura de movimiento.

Preprocesamiento de datos semánticos

La minería de datos semántica es un subconjunto de la minería de datos que busca específicamente incorporar conocimiento del dominio , como la semántica formal, en el proceso de minería de datos. El conocimiento del dominio es el conocimiento del entorno en el que se procesaron los datos. Este conocimiento puede tener una influencia positiva en muchos aspectos de la minería de datos, como el filtrado de datos redundantes o inconsistentes durante la fase de preprocesamiento. [ 3 ] El conocimiento del dominio también funciona como restricción. Lo hace al utilizar un conjunto de conocimiento previo para reducir el espacio necesario para la búsqueda y actuar como guía para los datos. En resumen, el preprocesamiento semántico busca filtrar los datos utilizando el entorno original de dichos datos de manera más correcta y eficiente.

Existen problemas cada vez más complejos que requieren ser resueltos mediante técnicas más elaboradas para analizar mejor la información existente. En lugar de crear un script simple para agregar diferentes valores numéricos en un solo valor, tiene sentido centrarse en el preprocesamiento de datos basado en la semántica. [ 4 ] La idea es construir una ontología específica que explique a un nivel superior de qué trata el problema. [ 5 ] En lo que respecta a la minería de datos semánticos y el preprocesamiento semántico, las ontologías son una forma de conceptualizar y definir formalmente el conocimiento y los datos semánticos. El Protégé (software) es la herramienta estándar para construir una ontología. En general, el uso de ontologías cierra las brechas entre datos, aplicaciones, algoritmos y resultados que surgen de las discrepancias semánticas. Como resultado, la minería de datos semánticos combinada con ontologías tiene muchas aplicaciones donde la ambigüedad semántica puede afectar la utilidad y la eficiencia de los sistemas de datos. Las aplicaciones incluyen el campo médico, el procesamiento del lenguaje, la banca, [ 6 ] e incluso la tutoría, [ 7 ] entre muchas más.

Existen diversas ventajas al utilizar un enfoque de minería de datos semántica y ontológico. Como se mencionó anteriormente, estas herramientas pueden ayudar durante la fase de preprocesamiento al filtrar los datos no deseados del conjunto de datos. Además, una semántica formal bien estructurada integrada en ontologías bien diseñadas puede proporcionar datos potentes que las máquinas pueden leer y procesar fácilmente. [ 8 ] Un ejemplo particularmente útil de esto se encuentra en el uso médico del procesamiento de datos semánticos. Por ejemplo, un paciente sufre una emergencia médica y es trasladado de urgencia al hospital. Los socorristas intentan determinar el mejor medicamento para administrarle. Con el procesamiento de datos convencional, examinar todos los datos médicos del paciente para asegurar que reciba el mejor tratamiento podría llevar demasiado tiempo y poner en riesgo su salud o incluso su vida. Sin embargo, utilizando ontologías procesadas semánticamente, los socorristas podrían salvar la vida del paciente. Herramientas como un razonador semántico pueden usar ontologías para inferir cuál es el mejor medicamento para administrar al paciente basándose en su historial médico, como si tiene cierto cáncer u otras afecciones, simplemente examinando el lenguaje natural utilizado en los registros médicos del paciente. [ 9 ] Esto permitiría a los primeros intervinientes buscar medicamentos de forma rápida y eficiente sin tener que preocuparse por el historial médico del paciente, ya que el razonador semántico ya habría analizado estos datos y encontrado soluciones. En general, esto ilustra la increíble potencia del uso de la minería de datos semánticos y las ontologías. Permiten una extracción de datos más rápida y eficiente por parte del usuario, ya que este tiene menos variables que considerar, puesto que los datos preprocesados ​​semánticamente y la ontología construida para los datos ya han considerado muchas de estas variables. Sin embargo, este enfoque tiene algunas desventajas. Principalmente, requiere una gran cantidad de potencia computacional y complejidad, incluso con conjuntos de datos relativamente pequeños. [ 10 ] Esto podría resultar en mayores costos y mayores dificultades para construir y mantener sistemas de procesamiento de datos semánticos. Esto puede mitigarse en cierta medida si el conjunto de datos ya está bien organizado y formateado, pero incluso en ese caso, la complejidad sigue siendo mayor en comparación con el procesamiento de datos estándar.

A continuación se muestra un diagrama sencillo que combina algunos de los procesos, en particular la minería de datos semánticos y su uso en ontologías.

Diagrama simple de minería de datos semánticos

El diagrama muestra un conjunto de datos dividido en dos partes: las características de su dominio, o conocimiento del dominio, y los datos adquiridos. Las características del dominio se procesan para convertirse en conocimiento del dominio comprensible para el usuario y aplicable a los datos. Mientras tanto, el conjunto de datos se procesa y almacena para que el conocimiento del dominio pueda aplicarse a él, permitiendo así la continuidad del proceso. Esta aplicación conforma la ontología. A partir de ahí, la ontología se puede utilizar para analizar datos y procesar resultados.

El preprocesamiento difuso es otra técnica más avanzada para resolver problemas complejos. El preprocesamiento difuso y la minería de datos difusos utilizan conjuntos difusos . Estos conjuntos de datos se componen de dos elementos: un conjunto y una función de pertenencia para el conjunto, que comprende 0 y 1. El preprocesamiento difuso utiliza este conjunto de datos difusos para fundamentar los valores numéricos con información lingüística. Los datos brutos se transforman entonces en lenguaje natural . En última instancia, el objetivo de la minería de datos difusos es ayudar a lidiar con información inexacta, como una base de datos incompleta. Actualmente, el preprocesamiento difuso, así como otras técnicas de minería de datos basadas en lógica difusa, se utilizan con frecuencia en redes neuronales e inteligencia artificial. [ 11 ]

Referencias

  1. Pyle, D., 1999. Preparación de datos para minería de datos. Morgan Kaufmann Publishers, Los Altos, California .
  2. Hastie, Trevor; Tibshirani, Robert; Friedman, Jerome H. (2009). Los elementos del aprendizaje estadístico: minería de datos, inferencia y predicción . Springer. ISBN 978-0-387-84884-6.
  3. Dou, Deijing y Wang, Hao y Liu, Haishan. "Minería de datos semánticos: una revisión de enfoques basados ​​en ontologías" (PDF) . Universidad de Oregón.{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  4. Culmone, Rosario y Falcioni, Marco y Quadrini, Michela (2014). Un marco basado en ontologías para el preprocesamiento de datos semánticos orientado al reconocimiento de la actividad humana . SEMAPRO 2014: Octava Conferencia Internacional sobre Avances en Procesamiento Semántico. Alexey Cheptsov, Centro de Computación de Alto Rendimiento de Stuttgart (HLRS). S2CID 196091422 . {{cite conference}}: CS1 maint: varios nombres: lista de autores ( enlace )
  5. David Perez-Rey y Alberto Anguita y Jose Crespo (2006). OntoDataClean: Integración y preprocesamiento de datos distribuidos basados ​​en ontologías . Análisis de datos biológicos y médicos. Springer Berlin Heidelberg. pp. 262–272 . doi : 10.1007/11946465_24 . 
  6. Yerashenia, Natalia y Bolotov, Alexander y Chan, David y Pierantoni, Gabriele (2020). "Preprocesamiento de datos semánticos para un modelo computacional de predicción de quiebras basado en aprendizaje automático" . 2020 IEEE 22nd Conference on Business Informatics (CBI) (PDF) . IEEE. págs. 66–75 . doi : 10.1109/CBI49978.2020.00015 . ISBN  978-1-7281-9926-9. S2CID 219499599 . {{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  7. Chang, Maiga; D'Aniello, Giuseppe; Gaeta, Matteo; Orciuoli, Francesco; Sampson, Demetrois; Simonelli, Carmine (2020). "Building Ontology-Driven Tutoring Models for Intelligent Tutoring Systems Using Data Mining" . IEEE Access . 8. IEEE: 48151–48162 . Bibcode : 2020IEEEA...848151C . doi : 10.1109/ACCESS.2020.2979281 . S2CID 214594754 . 
  8. Dou, Deijing y Wang, Hao y Liu, Haishan. "Minería de datos semánticos: una revisión de enfoques basados ​​en ontologías" (PDF) . Universidad de Oregón.{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  9. Kahn, Atif y Doucette, John A. y Jin, Changjiu y Fu Lijie y Cohen, Robin. "UN ENFOQUE ONTOLÓGICO PARA LA MINERÍA DE DATOS EN MEDICINA DE URGENCIAS" (PDF) . Universidad de Waterloo. Archivado del original (PDF) el 19 de mayo de 2023. Recuperado el 10 de diciembre de 2021 .{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  10. Sirichanya, Chanmee y Kraisak Kesorn (2021). "Minería de datos semánticos en la era de la información: una revisión sistemática" . International Journal of Intelligent Systems . 36 (8): 3880–3916 . doi : 10.1002/int.22443 . S2CID 235506360 . 
  11. Wong, Kok Wai y Fung, Chun Che y Law, Kok Way (2000). "Reglas de preprocesamiento difuso para la mejora de un modelo de interpretación de registros de pozos basado en redes neuronales artificiales". Actas de TENCON 2000. Sistemas y tecnologías inteligentes para el nuevo milenio (Cat. No. 00CH37119) . Vol. 1. IEEE. págs. 400–405 . doi : 10.1109/TENCON.2000.893697 . ISBN   0-7803-6355-8. S2CID 10384426 . {{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  • Compendio de procesamiento de datos en línea
  • Preprocesamiento de datos en minería de datos predictiva. Knowledge Eng. Review 34: e1 (2019)