Articulo de referencia

preprocesamiento de datos

El preprocesamiento de datos puede referirse a la manipulación, filtrado o aumento de datos antes de su análisis, y suele ser un paso importante en el proceso de minería de dato...

El preprocesamiento de datos puede referirse a la manipulación, filtrado o aumento de datos antes de su análisis, y suele ser un paso importante en el proceso de minería de datos . Los métodos de recopilación de datos a menudo carecen de un control adecuado, lo que da lugar a valores fuera de rango, combinaciones de datos imposibles y valores faltantes , entre otros problemas. El preprocesamiento es el proceso mediante el cual los datos no estructurados se transforman en representaciones inteligibles adecuadas para modelos de aprendizaje automático. Esta fase del modelo aborda el ruido para obtener mejores resultados a partir del conjunto de datos original, que era ruidoso. Este conjunto de datos también presenta cierto nivel de valores faltantes.

La figura muestra la deduplicación , un método de preprocesamiento de datos. Se enmarca dentro de la limpieza de conjuntos de datos .

El proceso de preprocesamiento utilizado puede tener grandes efectos en las conclusiones extraídas del análisis posterior. Por lo tanto, la representación y la calidad de los datos son necesarias antes de ejecutar cualquier análisis. [ 1 ] Si hay una alta proporción de información irrelevante y redundante o datos ruidosos y poco fiables, entonces el descubrimiento de conocimiento durante la fase de entrenamiento puede ser más difícil. Los pasos de preparación y filtrado de datos pueden tomar una cantidad considerable de tiempo de procesamiento. Ejemplos de métodos utilizados en el preprocesamiento de datos incluyen limpieza , selección de instancias , normalización , codificación one-hot , transformación de datos , extracción de características y selección de características .

Aplicaciones

minería de datos

El preprocesamiento de datos permite eliminar información no deseada mediante la limpieza de datos, lo que proporciona al usuario un conjunto de datos con información más valiosa tras la etapa de preprocesamiento para su posterior manipulación en el proceso de minería de datos. Editar dicho conjunto de datos para corregir la corrupción de datos o errores humanos es un paso crucial para obtener cuantificadores precisos como verdaderos positivos, verdaderos negativos, falsos positivos y falsos negativos, que se encuentran en una matriz de confusión comúnmente utilizada para el diagnóstico médico. Los usuarios pueden combinar archivos de datos y utilizar el preprocesamiento para filtrar el ruido innecesario, lo que permite una mayor precisión. Los usuarios utilizan scripts de programación en Python junto con la biblioteca pandas, que les permite importar datos de valores separados por comas como un marco de datos. Este marco de datos se utiliza para manipular datos, lo que de otro modo sería difícil de hacer en Excel. Pandas (software) es una potente herramienta que permite el análisis y la manipulación de datos, lo que facilita enormemente la visualización de datos, las operaciones estadísticas y mucho más. Muchos también utilizan el lenguaje de programación R para realizar estas tareas.

Existen muchas razones por las que un usuario transforma archivos existentes en uno nuevo. Algunos aspectos del preprocesamiento de datos pueden incluir la imputación de valores faltantes, la agregación de cantidades numéricas y la transformación de datos continuos en categorías ( agrupación de datos ). [ 2 ] Técnicas más avanzadas, como el análisis de componentes principales y la selección de características , trabajan con fórmulas estadísticas y se aplican a conjuntos de datos complejos registrados por rastreadores GPS y dispositivos de captura de movimiento.

Preprocesamiento de datos semánticos

La minería de datos semántica es un subconjunto de la minería de datos que busca específicamente incorporar conocimiento del dominio , como la semántica formal, en el proceso de minería de datos. El conocimiento del dominio es el conocimiento del entorno en el que se procesaron los datos. Este conocimiento puede tener una influencia positiva en muchos aspectos de la minería de datos, como el filtrado de datos redundantes o inconsistentes durante la fase de preprocesamiento. [ 3 ] El conocimiento del dominio también funciona como restricción. Lo hace al utilizar un conjunto de conocimiento previo para reducir el espacio necesario para la búsqueda y actuar como guía para los datos. En resumen, el preprocesamiento semántico busca filtrar los datos utilizando el entorno original de dichos datos de manera más correcta y eficiente.

Existen problemas cada vez más complejos que requieren ser resueltos mediante técnicas más elaboradas para analizar mejor la información existente. En lugar de crear un script simple para agregar diferentes valores numéricos en un solo valor, tiene sentido centrarse en el preprocesamiento de datos basado en la semántica. [ 4 ] La idea es construir una ontología específica que explique a un nivel superior de qué trata el problema. [ 5 ] En lo que respecta a la minería de datos semánticos y el preprocesamiento semántico, las ontologías son una forma de conceptualizar y definir formalmente el conocimiento y los datos semánticos. El Protégé (software) es la herramienta estándar para construir una ontología. En general, el uso de ontologías cierra las brechas entre datos, aplicaciones, algoritmos y resultados que surgen de las discrepancias semánticas. Como resultado, la minería de datos semánticos combinada con ontologías tiene muchas aplicaciones donde la ambigüedad semántica puede afectar la utilidad y la eficiencia de los sistemas de datos. Las aplicaciones incluyen el campo médico, el procesamiento del lenguaje, la banca, [ 6 ] e incluso la tutoría, [ 7 ] entre muchas más.

There are various strengths to using a semantic data mining and ontological based approach. As previously mentioned, these tools can help during the per-processing phase by filtering out non-desirable data from the data set. Additionally, well-structured formal semantics integrated into well designed ontologies can return powerful data that can be easily read and processed by machines.[8] A specifically useful example of this exists in the medical use of semantic data processing. As an example, a patient is having a medical emergency and is being rushed to hospital. The emergency responders are trying to figure out the best medicine to administer to help the patient. Under normal data processing, scouring all the patient’s medical data to ensure they are getting the best treatment could take too long and risk the patients’ health or even life. However, using semantically processed ontologies, the first responders could save the patient’s life. Tools like a semantic reasoner can use ontology to infer the what best medicine to administer to the patient is based on their medical history, such as if they have a certain cancer or other conditions, simply by examining the natural language used in the patient's medical records.[9] This would allow the first responders to quickly and efficiently search for medicine without having worry about the patient’s medical history themselves, as the semantic reasoner would already have analyzed this data and found solutions. In general, this illustrates the incredible strength of using semantic data mining and ontologies. They allow for quicker and more efficient data extraction on the user side, as the user has fewer variables to account for, since the semantically pre-processed data and ontology built for the data have already accounted for many of these variables. However, there are some drawbacks to this approach. Namely, it requires a high amount of computational power and complexity, even with relatively small data sets.[10] This could result in higher costs and increased difficulties in building and maintaining semantic data processing systems. This can be mitigated somewhat if the data set is already well organized and formatted, but even then, the complexity is still higher when compared to standard data processing.

Below is a simple a diagram combining some of the processes, in particular semantic data mining and their use in ontology.

Diagrama simple de minería de datos semánticos

El diagrama muestra un conjunto de datos dividido en dos partes: las características de su dominio, o conocimiento del dominio, y los datos adquiridos. Las características del dominio se procesan para convertirse en conocimiento del dominio comprensible para el usuario y aplicable a los datos. Mientras tanto, el conjunto de datos se procesa y almacena para que el conocimiento del dominio pueda aplicarse a él, permitiendo así la continuidad del proceso. Esta aplicación conforma la ontología. A partir de ahí, la ontología se puede utilizar para analizar datos y procesar resultados.

El preprocesamiento difuso es otra técnica más avanzada para resolver problemas complejos. El preprocesamiento difuso y la minería de datos difusos utilizan conjuntos difusos . Estos conjuntos de datos se componen de dos elementos: un conjunto y una función de pertenencia para el conjunto, que comprende 0 y 1. El preprocesamiento difuso utiliza este conjunto de datos difusos para fundamentar los valores numéricos con información lingüística. Los datos brutos se transforman entonces en lenguaje natural . En última instancia, el objetivo de la minería de datos difusos es ayudar a lidiar con información inexacta, como una base de datos incompleta. Actualmente, el preprocesamiento difuso, así como otras técnicas de minería de datos basadas en lógica difusa, se utilizan con frecuencia en redes neuronales e inteligencia artificial. [ 11 ]

Referencias

  1. Pyle, D., 1999. Preparación de datos para minería de datos. Morgan Kaufmann Publishers, Los Altos, California .
  2. Hastie, Trevor; Tibshirani, Robert; Friedman, Jerome H. (2009). Los elementos del aprendizaje estadístico: minería de datos, inferencia y predicción . Springer. ISBN 978-0-387-84884-6.
  3. Dou, Deijing y Wang, Hao y Liu, Haishan. "Minería de datos semánticos: una revisión de enfoques basados ​​en ontologías" (PDF) . Universidad de Oregón.{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  4. Culmone, Rosario y Falcioni, Marco y Quadrini, Michela (2014). Un marco basado en ontologías para el preprocesamiento de datos semánticos orientado al reconocimiento de la actividad humana . SEMAPRO 2014: Octava Conferencia Internacional sobre Avances en Procesamiento Semántico. Alexey Cheptsov, Centro de Computación de Alto Rendimiento de Stuttgart (HLRS). S2CID 196091422 . {{cite conference}}: CS1 maint: varios nombres: lista de autores ( enlace )
  5. David Perez-Rey y Alberto Anguita y Jose Crespo (2006). OntoDataClean: Integración y preprocesamiento de datos distribuidos basados ​​en ontologías . Análisis de datos biológicos y médicos. Springer Berlin Heidelberg. pp. 262–272 . doi : 10.1007/11946465_24 . 
  6. Yerashenia, Natalia y Bolotov, Alexander y Chan, David y Pierantoni, Gabriele (2020). "Preprocesamiento de datos semánticos para un modelo computacional de predicción de quiebras basado en aprendizaje automático" . 2020 IEEE 22nd Conference on Business Informatics (CBI) (PDF) . IEEE. págs. 66–75 . doi : 10.1109/CBI49978.2020.00015 . ISBN  978-1-7281-9926-9. S2CID 219499599 . {{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  7. Chang, Maiga; D'Aniello, Giuseppe; Gaeta, Matteo; Orciuoli, Francesco; Sampson, Demetrois; Simonelli, Carmine (2020). "Building Ontology-Driven Tutoring Models for Intelligent Tutoring Systems Using Data Mining" . IEEE Access . 8. IEEE: 48151–48162 . Bibcode : 2020IEEEA...848151C . doi : 10.1109/ACCESS.2020.2979281 . S2CID 214594754 . 
  8. Dou, Deijing y Wang, Hao y Liu, Haishan. "Minería de datos semánticos: una revisión de enfoques basados ​​en ontologías" (PDF) . Universidad de Oregón.{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  9. Kahn, Atif y Doucette, John A. y Jin, Changjiu y Fu Lijie y Cohen, Robin. "UN ENFOQUE ONTOLÓGICO PARA LA MINERÍA DE DATOS EN MEDICINA DE URGENCIAS" (PDF) . Universidad de Waterloo. Archivado del original (PDF) el 19 de mayo de 2023. Recuperado el 10 de diciembre de 2021 .{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  10. Sirichanya, Chanmee y Kraisak Kesorn (2021). "Minería de datos semánticos en la era de la información: una revisión sistemática" . International Journal of Intelligent Systems . 36 (8): 3880–3916 . doi : 10.1002/int.22443 . S2CID 235506360 . 
  11. Wong, Kok Wai y Fung, Chun Che y Law, Kok Way (2000). "Reglas de preprocesamiento difuso para la mejora de un modelo de interpretación de registros de pozos basado en redes neuronales artificiales". Actas de TENCON 2000. Sistemas y tecnologías inteligentes para el nuevo milenio (Cat. No. 00CH37119) . Vol. 1. IEEE. págs. 400–405 . doi : 10.1109/TENCON.2000.893697 . ISBN   0-7803-6355-8. S2CID 10384426 . {{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  • Compendio de procesamiento de datos en línea
  • Preprocesamiento de datos en minería de datos predictiva. Knowledge Eng. Review 34: e1 (2019)