La recuperación de información multimedia ( MMIR o MIR ) es una disciplina de investigación de la informática que tiene como objetivo extraer información semántica de fuentes de datos multimedia . [1] [ verificación fallida ] Las fuentes de datos incluyen medios directamente perceptibles como audio , imagen y video , fuentes indirectamente perceptibles como texto , descripciones semánticas, [2] bioseñales , así como fuentes no perceptibles como bioinformación, precios de acciones, etc. La metodología de MMIR se puede organizar en tres grupos:
- Métodos para resumir el contenido de los medios ( extracción de características ). El resultado de la extracción de características es una descripción.
- Métodos para el filtrado de descripciones de medios (por ejemplo, eliminación de redundancia )
- Métodos para la categorización de descripciones de medios en clases.
Métodos de extracción de características
La extracción de características está motivada por el gran tamaño de los objetos multimedia, así como por su redundancia y, posiblemente, su ruido. [1] : 2 [ verificación fallida ] En general, se pueden lograr dos objetivos posibles mediante la extracción de características:
- Resumen de contenido multimedia. Los métodos para el resumen incluyen, en el dominio del audio, por ejemplo, coeficientes cepstrales de frecuencia mel , tasa de cruces por cero y energía de corta duración. En el dominio visual, se pueden utilizar histogramas de color [3] como el Descriptor de color escalable MPEG-7 para el resumen.
- Detección de patrones mediante autocorrelación y/o correlación cruzada . Los patrones son fragmentos de medios recurrentes que pueden detectarse ya sea comparando fragmentos a lo largo de las dimensiones del medio (tiempo, espacio, etc.) o comparando fragmentos de medios con plantillas (por ejemplo, plantillas de rostros, frases). Los métodos típicos incluyen la codificación predictiva lineal en el dominio de audio/bioseñales, [4] la descripción de texturas en el dominio visual y los n-gramas en la recuperación de información de texto.
Métodos de fusión y filtrado
La recuperación de información multimedia implica el uso de múltiples canales para la comprensión del contenido multimedia. [5] Cada uno de estos canales se describe mediante transformaciones de características específicas del medio. Las descripciones resultantes deben fusionarse en una descripción por objeto multimedia. La fusión se puede realizar mediante una simple concatenación si las descripciones son de tamaño fijo. Las descripciones de tamaño variable (como las que se dan con frecuencia en la descripción de movimiento) primero deben normalizarse a una longitud fija.
Los métodos que se utilizan con frecuencia para filtrar descripciones incluyen el análisis factorial (por ejemplo, mediante PCA), la descomposición en valores singulares (por ejemplo, como indexación semántica latente en la recuperación de texto) y la extracción y prueba de momentos estadísticos. Se utilizan conceptos avanzados, como el filtro Kalman, para fusionar descripciones.
Métodos de categorización
En general, se pueden emplear todas las formas de aprendizaje automático para la categorización de descripciones multimedia [1] : 125 [ verificación fallida ] aunque algunos métodos se utilizan con más frecuencia en un área que en otra. Por ejemplo, los modelos ocultos de Markov son de última generación en reconocimiento de voz , mientras que la deformación temporal dinámica (un método semánticamente relacionado) es de última generación en alineamiento de secuencias genéticas. La lista de clasificadores aplicables incluye lo siguiente:
- Enfoques métricos ( análisis de conglomerados , modelo de espacio vectorial , distancias de Minkowski , alineación dinámica)
- Métodos de vecino más cercano ( algoritmo de K vecinos más cercanos , K-medias, mapa autoorganizado )
- Minimización de riesgos (regresión de vectores de soporte, máquina de vectores de soporte , análisis discriminante lineal )
- Métodos basados en densidad (redes de Bayes, procesos de Markov , modelos de mezcla)
- Redes neuronales ( perceptrones , memorias asociativas, redes de picos)
- Heurísticas ( árboles de decisión , bosques aleatorios, etc.)
La selección del mejor clasificador para un problema determinado (conjunto de pruebas con descripciones y etiquetas de clase, la llamada verdad fundamental ) se puede realizar automáticamente, por ejemplo, utilizando Weka Data Miner.
Problemas abiertos
La calidad de los sistemas MMIR [6] depende en gran medida de la calidad de los datos de entrenamiento. Las descripciones discriminativas se pueden extraer de fuentes de medios en varias formas. El aprendizaje automático proporciona métodos de categorización para todos los tipos de datos. Sin embargo, el clasificador solo puede ser tan bueno como los datos de entrenamiento proporcionados. Por otro lado, requiere un esfuerzo considerable proporcionar etiquetas de clase para bases de datos grandes. El éxito futuro de MMIR dependerá de la provisión de dichos datos. [7] La competencia anual TRECVID es actualmente una de las fuentes más relevantes de verdad fundamental de alta calidad.
Áreas relacionadas
MMIR ofrece una visión general de los métodos empleados en las áreas de recuperación de información. [8] [9] Los métodos de un área se adaptan y se emplean en otros tipos de medios. El contenido multimedia se fusiona antes de realizar la clasificación. Por lo tanto, los métodos MMIR suelen reutilizarse de otras áreas, como:
- Análisis de bioinformación
- Procesamiento de bioseñales
- Recuperación de imágenes y vídeos basada en contenido
- Reconocimiento facial
- Clasificación de audio y música (Recuperación de información musical)
- Reconocimiento automático de contenido
- Reconocimiento de voz
- Análisis de gráficos técnicos
- Navegación de videos
- Recuperación de información textual
- Recuperación de imágenes
- Aprendiendo a clasificar
La Revista Internacional de Recuperación de Información Multimedia [10] documenta el desarrollo de la MMIR como disciplina de investigación independiente de estas áreas. Véase también el Manual de Recuperación de Información Multimedia [11] para obtener una descripción completa de esta disciplina de investigación.
Referencias
- ^ abc H Eidenberger. Comprensión fundamental de los medios , atpress, 2011, pág. 1.
- ^ Sikos, LF (2016). "Herramientas de anotación de vídeo semántico basadas en RDF con mapeo de conceptos a datos vinculados para la indexación de vídeo de próxima generación: una revisión exhaustiva". Herramientas y aplicaciones multimedia . 76 (12): 14437–14460. doi :10.1007/s11042-016-3705-7. S2CID 254832794.
- ^ A Del Bimbo. Recuperación de información visual , Morgan Kaufmann, 1999.
- ^ HG Kim, N Moreau, T Sikora. MPEG-7 Audio y más allá", Wiley, 2005.
- ^ MS Lew (Ed.). Principios de recuperación de información visual , Springer, 2001.
- ^ JC Nordbotten. "Sistemas de recuperación de información multimedia". Consultado el 14 de octubre de 2011.
- ^ H Eidenberger. Fronteras de la comprensión de los medios , atpress, 2012.
- ^ H Eidenberger. Comprensión profesional de los medios , atpress, 2012.
- ^ Raieli, Roberto (2016). "Introducción de la recuperación de información multimedia a las bibliotecas". JLIS.it . 7 (3): 9–42. doi :10.4403/jlis.it-11530. S2CID 56652314.
- ^ "Revista internacional de recuperación de información multimedia", Springer, 2011, consultado el 21 de octubre de 2011.
- ^ H Eidenberger. Manual de recuperación de información multimedia , atpress, 2012.