La interacción multimodal proporciona al usuario múltiples formas de interactuar con un sistema. Una interfaz multimodal ofrece diversas herramientas para la entrada y salida de datos.
La interacción multimodal persona-ordenador implica una comunicación natural con entornos virtuales y físicos. Facilita la comunicación libre y natural entre usuarios y sistemas automatizados, permitiendo una entrada flexible (voz, escritura a mano, gestos) y una salida flexible ( síntesis de voz , gráficos). La fusión multimodal combina entradas de diferentes modalidades, resolviendo ambigüedades.
Dos grupos principales de interfaces multimodales se centran en métodos de entrada alternativos y entrada/salida combinadas. Las múltiples modalidades de entrada mejoran la usabilidad, beneficiando a usuarios con discapacidades. Los dispositivos móviles suelen emplear XHTML+Voz para la entrada. Los sistemas biométricos multimodales utilizan múltiples datos biométricos para superar limitaciones. El análisis de sentimientos multimodal implica el análisis de texto, audio y datos visuales para la clasificación de sentimientos. GPT-4 , un modelo de lenguaje multimodal , integra varias modalidades para una mejor comprensión del lenguaje. Los sistemas de salida multimodal presentan información a través de señales visuales y auditivas, utilizando el tacto y el olfato. La fusión multimodal integra información de diferentes modalidades, empleando fusión multinivel basada en reconocimiento, basada en decisiones e híbrida.
Las ambigüedades en la información multimodal se abordan mediante métodos de prevención, resolución a posteriori y resolución por aproximación.
Introducción
La interacción multimodal humano-computadora se refiere a la "interacción con el entorno virtual y físico a través de modos naturales de comunicación" [ 1 ] . Esto implica que la interacción multimodal permite una comunicación más libre y natural, conectando a los usuarios con sistemas automatizados tanto en la entrada como en la salida [ 2 ] . Específicamente, los sistemas multimodales pueden ofrecer un entorno flexible, eficiente y utilizable que permite a los usuarios interactuar a través de modalidades de entrada, como el habla , la escritura a mano , los gestos con las manos y la mirada , y recibir información del sistema a través de modalidades de salida, como la síntesis de voz, los gráficos inteligentes y otras modalidades, combinadas oportunamente. Luego, un sistema multimodal debe reconocer las entradas de las diferentes modalidades combinándolas según restricciones temporales y contextuales [ 3 ] para permitir su interpretación. Este proceso se conoce como fusión multimodal y es objeto de varios trabajos de investigación desde la década de los noventa hasta la actualidad. [ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ] Las entradas fusionadas son interpretadas por el sistema. La naturalidad y la flexibilidad pueden producir más de una interpretación para cada modalidad (canal) diferente y para su uso simultáneo, y en consecuencia pueden producir ambigüedad multimodal [ 12 ] generalmente debido a imprecisión, ruido u otros factores similares. Para resolver ambigüedades, se han propuesto varios métodos. [ 13 ] [ 14 ] [ 15 ] [ 16 ] [ 17 ] [ 18 ] Finalmente, el sistema devuelve al usuario las salidas a través de los diversos canales modales (desagregados) organizados de acuerdo con una retroalimentación consistente (fisión). [ 19 ] El uso generalizado de dispositivos móviles, sensores y tecnologías web puede ofrecer recursos computacionales adecuados para gestionar la complejidad implícita en la interacción multimodal. "El uso de la nube para involucrar recursos computacionales compartidos en la gestión de la complejidad de la interacción multimodal representa una oportunidad. De hecho, la computación en la nube permite ofrecer recursos computacionales compartidos, escalables y configurables que pueden aprovisionarse y liberarse de forma dinámica y automática". [ 20]
Entrada multimodal
Se han fusionado dos grupos principales de interfaces multimodales: uno centrado en métodos de entrada alternativos y el otro en la entrada/salida combinada. El primer grupo de interfaces combinaba diversos modos de entrada de usuario más allá de la entrada/salida tradicional de teclado y ratón , como voz, lápiz, tacto, gestos manuales, [ 21 ] mirada y movimientos de cabeza y cuerpo. [ 22 ] La interfaz más común combina una modalidad visual (por ejemplo, una pantalla, teclado y ratón) con una modalidad de voz ( reconocimiento de voz para la entrada, síntesis de voz y audio grabado para la salida). Sin embargo, también se pueden utilizar otras modalidades, como la entrada basada en lápiz o la entrada/salida háptica . Las interfaces de usuario multimodales constituyen un área de investigación en la interacción persona-ordenador (HCI).
La ventaja de las múltiples modalidades de entrada radica en una mayor usabilidad : las debilidades de una modalidad se compensan con las fortalezas de otra. En un dispositivo móvil con una interfaz visual y un teclado pequeños, una palabra puede ser difícil de escribir, pero muy fácil de pronunciar (por ejemplo, Poughkeepsie ). Piense en cómo accedería y buscaría en catálogos de medios digitales desde estos mismos dispositivos o decodificadores. Y en un ejemplo real, la información del paciente en un quirófano es consultada verbalmente por los miembros del equipo quirúrgico para mantener un entorno aséptico, y se presenta casi en tiempo real de forma auditiva y visual para maximizar la comprensión.
Las interfaces de usuario de entrada multimodal tienen implicaciones para la accesibilidad . [ 23 ] Una aplicación multimodal bien diseñada puede ser utilizada por personas con una amplia variedad de discapacidades. Los usuarios con discapacidad visual dependen de la modalidad de voz con alguna entrada de teclado. Los usuarios con discapacidad auditiva dependen de la modalidad visual con alguna entrada de voz. Otros usuarios tendrán "limitaciones situacionales" (por ejemplo, usar guantes en un entorno muy ruidoso, conducir o necesitar ingresar un número de tarjeta de crédito en un lugar público) y simplemente usarán las modalidades apropiadas según lo deseen. Por otro lado, una aplicación multimodal que requiere que los usuarios puedan operar todas las modalidades está muy mal diseñada.
La forma más común de entrada multimodal en el mercado utiliza el lenguaje de marcado web XHTML+Voice (también conocido como X+V), una especificación abierta desarrollada por IBM , Motorola y Opera Software . X+V está actualmente en consideración por el W3C y combina varias recomendaciones del W3C , incluyendo XHTML para marcado visual, VoiceXML para marcado de voz y XML Events , un estándar para la integración de lenguajes XML . Los navegadores multimodales que admiten X+V incluyen IBM WebSphere Everyplace Multimodal Environment, Opera para Embedded Linux y Windows , y ACCESS Systems NetFront para Windows Mobile . Para desarrollar aplicaciones multimodales, los desarrolladores de software pueden usar un kit de desarrollo de software , como IBM WebSphere Multimodal Toolkit, basado en el marco de código abierto Eclipse , que incluye un depurador , editor y simulador de X+V .
Biometría multimodal
Los sistemas biométricos multimodales utilizan múltiples sensores o datos biométricos para superar las limitaciones de los sistemas biométricos unimodales. [ 24 ] Por ejemplo, los sistemas de reconocimiento de iris pueden verse afectados por el envejecimiento del iris [ 25 ] y el reconocimiento electrónico de huellas dactilares puede empeorar por huellas desgastadas o cortadas. Si bien los sistemas biométricos unimodales están limitados por la integridad de su identificador, es improbable que varios sistemas unimodales presenten las mismas limitaciones. Los sistemas biométricos multimodales pueden obtener conjuntos de información del mismo marcador (es decir, múltiples imágenes de un iris o escaneos del mismo dedo) o información de diferentes datos biométricos (que requieren escaneos de huellas dactilares y, mediante reconocimiento de voz , un código de acceso hablado). [ 26 ] [ 27 ]
Los sistemas biométricos multimodales pueden fusionar estos sistemas unimodales de forma secuencial, simultánea, en combinación o en serie, lo que se refiere a los modos de integración secuencial, paralela, jerárquica y serial, respectivamente. La fusión de la información biométrica puede ocurrir en diferentes etapas de un sistema de reconocimiento. En el caso de la fusión a nivel de características, se fusionan los datos mismos o las características extraídas de múltiples datos biométricos. La fusión a nivel de puntuación de coincidencia consolida las puntuaciones generadas por múltiples clasificadores pertenecientes a diferentes modalidades. Finalmente, en el caso de la fusión a nivel de decisión, los resultados finales de múltiples clasificadores se combinan mediante técnicas como la votación por mayoría . Se cree que la fusión a nivel de características es más efectiva que los otros niveles de fusión porque el conjunto de características contiene información más rica sobre los datos biométricos de entrada que la puntuación de coincidencia o la decisión de salida de un clasificador. Por lo tanto, se espera que la fusión a nivel de características proporcione mejores resultados de reconocimiento. [ 24 ]
Los ataques de suplantación de identidad consisten en enviar características biométricas falsas a los sistemas biométricos y representan una grave amenaza que puede comprometer su seguridad. Si bien se suele creer que los sistemas biométricos multimodales son intrínsecamente más resistentes a los ataques de suplantación de identidad, estudios recientes [ 28 ] han demostrado que pueden eludirse suplantando incluso una sola característica biométrica.
Un sistema propuesto de criptosistema biométrico multimodal que involucra el rostro, la huella dactilar y las venas de la palma de la mano por Prasanalakshmi [ 29 ] La integración del criptosistema combina biometría con criptografía , donde las venas de la palma actúan como una clave criptográfica, ofreciendo un alto nivel de seguridad ya que las venas de la palma son únicas y difíciles de falsificar. La huella dactilar implica la extracción de minucias (terminaciones y bifurcaciones) y técnicas de coincidencia. Los pasos incluyen mejora de imagen, binarización, extracción de ROI y adelgazamiento de minucias. El sistema facial utiliza matrices de dispersión basadas en clases para calcular características para el reconocimiento, y las venas de la palma actúan como una clave criptográfica irrompible , asegurando que solo el usuario correcto pueda acceder al sistema. El concepto de biometría cancelable permite alterar ligeramente los rasgos biométricos para garantizar la privacidad y evitar el robo. Si se ven comprometidos, se pueden emitir nuevas variaciones de los datos biométricos. La plantilla de huella dactilar cifrada se cifra utilizando la clave de las venas de la palma a través de operaciones XOR . Esta huella dactilar cifrada se oculta dentro de la imagen facial utilizando técnicas esteganográficas. El registro y la verificación de los datos biométricos (huella dactilar, venas de la palma de la mano, rostro) se capturan, cifran e integran en una imagen facial. El sistema extrae los datos biométricos y los compara con los valores almacenados para su verificación. El sistema se probó con bases de datos de huellas dactilares, logrando una precisión de verificación del 75 % con una tasa de error del 25 % y un tiempo de procesamiento aproximado de 50 segundos para el registro y 22 segundos para la verificación. La alta seguridad se debe al cifrado de las venas de la palma de la mano, eficaz contra la suplantación biométrica, y el enfoque multimodal garantiza la fiabilidad incluso si falla un dato biométrico. Existe potencial para la integración con tarjetas inteligentes o sistemas integrados en la tarjeta, lo que mejora la seguridad en los sistemas de identificación personal .
Análisis de sentimiento multimodal
El análisis de sentimiento multimodal es una tecnología para el análisis de sentimiento tradicional basado en texto , que incluye modalidades como datos de audio y visuales. [ 30 ] Puede ser bimodal, que incluye diferentes combinaciones de dos modalidades, o trimodal, que incorpora tres modalidades. [ 31 ] Con la gran cantidad de datos de redes sociales disponibles en línea en diferentes formatos como videos e imágenes, el análisis de sentimiento convencional basado en texto ha evolucionado hacia modelos más complejos de análisis de sentimiento multimodal, [ 32 ] [ 33 ] que se pueden aplicar en el desarrollo de asistentes virtuales , [ 34 ] análisis de reseñas de películas de YouTube, [ 35 ] análisis de videos de noticias, [ 36 ] y reconocimiento de emociones (a veces conocido como detección de emociones ) como monitoreo de la depresión , [ 37 ] entre otros.
De forma similar al análisis de sentimientos tradicional , una de las tareas más básicas en el análisis de sentimientos multimodal es la clasificación de sentimientos , que clasifica diferentes sentimientos en categorías como positivo, negativo o neutro. [ 38 ] La complejidad del análisis de características de texto, audio y visuales para realizar dicha tarea requiere la aplicación de diferentes técnicas de fusión, como la fusión a nivel de características, a nivel de decisión y la fusión híbrida. [ 32 ] El rendimiento de estas técnicas de fusión y los algoritmos de clasificación aplicados se ven influenciados por el tipo de características textuales, de audio y visuales empleadas en el análisis. [ 39 ]
Modelos de lenguaje multimodales
Generative Pre-trained Transformer 4 ( GPT-4 ) es un modelo de lenguaje grande desarrollado por OpenAI y el cuarto en su serie de modelos fundacionales GPT . [ 40 ]
GPT-4 está precedido por GPT-3.5 y seguido por su sucesor, GPT-5 . GPT-4V es una versión de GPT-4 que puede procesar imágenes además de texto. [ 41 ] OpenAI no ha revelado detalles técnicos ni estadísticas sobre GPT-4, como el tamaño exacto del modelo. [ 42 ]
Una versión temprana de GPT-4 fue integrada por Microsoft en Bing Chat , lanzado en febrero de 2023. GPT-4 se lanzó en ChatGPT en marzo de 2023, [ 43 ] y se eliminó en 2025. [ 44 ] GPT-4 todavía está disponible en la API de OpenAI . [ 45 ]
Salida multimodal
El segundo grupo de sistemas multimodales presenta a los usuarios pantallas multimedia y salida multimodal, principalmente en forma de señales visuales y auditivas. Los diseñadores de interfaces también han comenzado a utilizar otras modalidades, como el tacto y el olfato. Entre los beneficios propuestos del sistema de salida multimodal se incluyen la sinergia y la redundancia. La información que se presenta a través de varias modalidades se fusiona y se refiere a diversos aspectos del mismo proceso. El uso de varias modalidades para procesar exactamente la misma información proporciona un mayor ancho de banda de transferencia de información. [ 46 ] [ 47 ] [ 48 ] Actualmente, la salida multimodal se utiliza principalmente para mejorar el mapeo entre el medio de comunicación y el contenido y para apoyar la gestión de la atención en entornos ricos en datos donde los operadores se enfrentan a considerables demandas de atención visual. [ 49 ]
Un paso importante en el diseño de interfaces multimodales es la creación de mapeos naturales entre modalidades y la información y las tareas. El canal auditivo difiere de la visión en varios aspectos. Es omnidireccional, transitorio y siempre reservado. [ 49 ] La salida de voz, una forma de información auditiva, recibió considerable atención. Se han desarrollado varias pautas para el uso de la voz. Michaelis y Wiggins (1982) sugirieron que la salida de voz debería usarse para mensajes cortos y simples que no se consultarán posteriormente. También se recomendó que la voz debería generarse en el tiempo y requerir una respuesta inmediata.
El sentido del tacto se utilizó por primera vez como medio de comunicación a finales de la década de 1950. [ 50 ] No solo es un canal de comunicación prometedor, sino también único. A diferencia de la vista y el oído, los dos sentidos tradicionales empleados en la interacción persona-ordenador, el sentido del tacto es proximal: percibe objetos que están en contacto con el cuerpo y es bidireccional, ya que permite tanto la percepción como la interacción con el entorno.
Ejemplos de retroalimentación auditiva incluyen iconos sonoros en los sistemas operativos de las computadoras que indican las acciones de los usuarios (por ejemplo, eliminar un archivo, abrir una carpeta, error), salida de voz para presentar la guía de navegación en vehículos y salida de voz para advertir a los pilotos en las cabinas de los aviones modernos. Ejemplos de señales táctiles incluyen las vibraciones de la palanca de la señal de giro para advertir a los conductores de un automóvil en su punto ciego, la vibración del asiento del automóvil como advertencia para los conductores y el vibrador de la palanca de mando en los aviones modernos que alerta a los pilotos de una pérdida inminente. [ 49 ]
Los espacios de interfaz invisibles se hicieron posibles gracias a la tecnología de sensores. El infrarrojo, el ultrasonido y las cámaras son ahora de uso común. [ 51 ] La transparencia de la interfaz con el contenido se mejora al proporcionar un vínculo inmediato y directo a través de un mapeo significativo, de modo que el usuario tiene retroalimentación directa e inmediata a la entrada y la respuesta del contenido se convierte en una posibilidad de interacción con la interfaz (Gibson 1979).
fusión multimodal
El proceso de integrar información de diversas modalidades de entrada y combinarlas en un comando completo se denomina fusión multimodal. [ 5 ] En la literatura, se han propuesto tres enfoques principales para el proceso de fusión, según los principales niveles arquitectónicos (reconocimiento y decisión) en los que se puede realizar la fusión de las señales de entrada: basado en el reconocimiento, [ 9 ] [ 10 ] [ 52 ] basado en la decisión, [ 7 ] [ 8 ] [ 11 ] [ 53 ] [ 54 ] [ 55 ] [ 56 ] y fusión híbrida multinivel. [ 4 ] [ 6 ] [ 57 ] [ 58 ] [ 59 ] [ 60 ] [ 61 ] [ 62 ]
La fusión basada en el reconocimiento (también conocida como fusión temprana) consiste en combinar los resultados de cada reconocedor modal mediante mecanismos de integración, como por ejemplo, técnicas de integración estadística, teoría de agentes, modelos ocultos de Markov, redes neuronales artificiales, etc. Ejemplos de estrategias de fusión basadas en el reconocimiento son el marco de acción, [ 52 ] los vectores de entrada [ 9 ] y las ranuras. [ 10 ]
La fusión basada en decisiones (también conocida como fusión tardía) combina la información semántica extraída mediante procedimientos de fusión específicos basados en el diálogo para obtener la interpretación completa. Ejemplos de estrategias de fusión basadas en decisiones son las estructuras de características tipificadas, [ 53 ] [ 58 ] los crisoles de fusión, [ 55 ] [ 56 ] los marcos semánticos, [ 7 ] [ 11 ] y las retículas con marca de tiempo. [ 8 ]
Las posibles aplicaciones de la fusión multimodal incluyen entornos de aprendizaje, relaciones con el consumidor, seguridad/vigilancia, animación por computadora, etc. Individualmente, los modos se definen fácilmente, pero surge la dificultad de que la tecnología los considere como una fusión combinada. [ 63 ] Es difícil para los algoritmos tener en cuenta la dimensionalidad; existen variables que escapan a las capacidades computacionales actuales. Por ejemplo, el significado semántico: dos oraciones podrían tener el mismo significado léxico pero diferente información emocional. [ 63 ]
En la fusión híbrida multinivel, la integración de las modalidades de entrada se distribuye entre los niveles de reconocimiento y decisión. La fusión híbrida multinivel incluye las siguientes tres metodologías: transductores de estados finitos, [ 58 ] gramáticas multimodales [ 6 ] [ 57 ] [ 59 ] [ 60 ] [ 61 ] [ 62 ] [ 64 ] y movimientos de diálogo. [ 65 ]
Ambigüedad
Las acciones o comandos del usuario producen entradas multimodales (mensaje multimodal [ 3 ] ), que deben ser interpretadas por el sistema. El mensaje multimodal es el medio que permite la comunicación entre usuarios y sistemas multimodales. Se obtiene mediante la fusión de información transmitida a través de varias modalidades, considerando los diferentes tipos de cooperación entre ellas [ 66 ] , las relaciones temporales [ 67 ] entre las modalidades involucradas y las relaciones entre fragmentos de información conectados con estas modalidades [ 68 ] .
El mapeo natural entre la entrada multimodal, que se proporciona a través de varias modalidades de interacción (canal visual y auditivo y sentido del tacto), y la información y las tareas implica gestionar los problemas típicos de la comunicación entre humanos, como la ambigüedad. Una ambigüedad surge cuando es posible más de una interpretación de la entrada. Una ambigüedad multimodal [ 12 ] surge tanto si un elemento, que se proporciona a través de una modalidad, tiene más de una interpretación (es decir, las ambigüedades se propagan a nivel multimodal), como si los elementos, conectados con cada modalidad, se interpretan de forma unívoca, pero la información referida a diferentes modalidades es incoherente a nivel sintáctico o semántico (es decir, una oración multimodal tiene diferentes significados o diferentes estructuras sintácticas).
En "La gestión de ambigüedades" [ 14 ] , los métodos para resolver ambigüedades y proporcionar la interpretación correcta de la entrada del usuario se organizan en tres clases principales: métodos de prevención, resolución a posteriori y resolución por aproximación. [ 13 ] [ 15 ]
Los métodos de prevención obligan a los usuarios a seguir un comportamiento de interacción predefinido según un conjunto de transiciones entre diferentes estados permitidos del proceso de interacción. Ejemplos de métodos de prevención son: método procedimental, [ 69 ] reducción del poder expresivo de la gramática del lenguaje, [ 70 ] mejora del poder expresivo de la gramática del lenguaje. [ 71 ]
La resolución a posteriori de ambigüedades utiliza un enfoque de mediación. [ 16 ] Ejemplos de técnicas de mediación son: repetición, p. ej. repetición por modalidad, [ 16 ] granularidad de reparación [ 72 ] y deshacer, [ 17 ] y elección. [ 18 ]
Los métodos de resolución de aproximación no requieren ninguna participación del usuario en el proceso de desambiguación. Todos ellos pueden requerir el uso de algunas teorías, como lógica difusa , campos aleatorios de Markov , redes bayesianas y modelos ocultos de Markov . [ 13 ] [ 15 ]
Véase también
- Independencia del dispositivo
- Sistema biométrico multimodal
- Búsqueda multimodal
- Reconocimiento de voz
- Actividad de Interacción Multimodal del W3C : una iniciativa del W3C que tiene como objetivo proporcionar medios (principalmente XML ) para dar soporte a escenarios de interacción multimodal en la web.
- Accesibilidad web
- Guante con alambre
- XHTML+Voz
Referencias
- ^ Bourguet, ML (2003). " Diseño y creación de prototipos de comandos multimodales ". Actas de Interacción Humano-Computadora (INTERACT'03), págs. 717-720.
- ^ Stivers, T., Sidnell, J. Introducción: Interacción multimodal. Semiotica, 156(1/4), pp. 1-20. 2005.
- ^ a b Caschera MC, Ferri F., Grifoni P. (2007). " Sistemas de interacción multimodal: características de información y tiempo ". International Journal of Web and Grid Services (IJWGS), Vol. 3 - Issue 1, pp 82-99.
- ^ a b D'Ulizia, A., Ferri, F. y Grifoni, P. (2010). "Generación de gramáticas multimodales para el procesamiento de diálogos multimodales". IEEE Transactions on Systems, Man, and Cybernetics, Part A: Systems and Humans, Vol 40, no 6, pp. 1130 – 1145.
- ^ a b D'Ulizia, A. (2009). " Explorando estrategias de fusión de entrada multimodal ". En: Grifoni P (ed) Manual de investigación sobre interacción humano-computadora multimodal y servicios omnipresentes: técnicas evolutivas para mejorar la accesibilidad. IGI Publishing, pp. 34-57.
- ^ a b c Sun, Y., Shi, Y., Chen, F. y Chung, V. (2007). "Un procesador de lenguaje multimodal eficiente para cadenas de entrada paralelas en la fusión de entrada multimodal", en Actas de la Conferencia Internacional sobre Computación Semántica, págs. 389-396.
- ^ a b c Russ, G., Sallans, B., Hareter, H. (2005). " Fusión de información basada en semántica en una interfaz multimodal ". Conferencia internacional sobre interacción persona-ordenador (HCI'05), Las Vegas, Nevada, EE. UU., 20-23 de junio, pp. 94-100.
- ^ a b c Corradini, A., Mehta M., Bernsen, NO, Martin, J.-C. (2003). "Fusión de entrada multimodal en la interacción humano-computadora: el ejemplo del proyecto NICE en curso". En Actas de la conferencia NATO-ASI sobre fusión de datos para el monitoreo de situaciones, detección de incidentes, alerta y gestión de respuesta, Ereván, Armenia.
- ^ a b c Pavlovic, VI, Berry, GA, Huang, TS (1997). " Integración de información audiovisual para su uso en la interacción inteligente humano-computadora ". Actas de la Conferencia Internacional de Procesamiento de Imágenes de 1997 (ICIP '97), Volumen 1, pp. 121-124.
- ^ a b c Andre, M., Popescu, VG, Shaikh, A., Medl, A., Marsic, I., Kulikowski, C., Flanagan JL (1998). " Integración de voz y gestos para la interacción multimodal humano-computadora ". En Segunda Conferencia Internacional sobre Comunicación Multimodal Cooperativa. 28-30 de enero, Tilburg, Países Bajos.
- ^ a b c Vo, MT, Wood, C. (1996). " Construyendo un marco de aplicación para la integración de entrada de voz y lápiz en interfaces de aprendizaje multimodal ". En Actas de Acústica, Habla y Procesamiento de Señales (ICASSP'96), 7-10 de mayo, IEEE Computer Society, Volumen 06, pp. 3545-3548.
- ^ a b Caschera, MC, Ferri, F., Grifoni, P. (2013). " De las ambigüedades modales a las multimodales: un enfoque de clasificación ", Journal of Next Generation Information Technology (JNIT), Vol. 4, No. 5, pp. 87 -109.
- ^ a b c Caschera, MC, Ferri, F., Grifoni, P. (2013). InteSe: Un modelo integrado para resolver ambigüedades en oraciones multimodales . IEEE Transactions on Systems, Man, and Cybernetics: Systems, Volumen: 43, Número: 4, pp. 911 - 931.18. Spilker, J., Klarner, M., Görz, G. (2000). "Procesamiento de autocorrecciones en un sistema de voz a voz". COLING 2000. pp. 1116-1120.
- ^ a b Caschera MC, Ferri F., Grifoni P., (2007). " La gestión de ambigüedades ". En Lenguajes visuales para computación interactiva: definiciones y formalizaciones. IGI Publishing. pp.129-140.
- ^ a b c J. Chai, P. Hong y MX Zhou, (2004). " Un enfoque probabilístico para la resolución de referencias en interfaces de usuario multimodales " en Proc. 9th Int. Conf. Intell. User Interf., Madeira, Portugal, enero de 2004, pp. 70–77.
- ^ a b c Dey, AK Mankoff, J., (2005). " Diseño de mediación para aplicaciones sensibles al contexto ". ACM Trans. Comput.-Hum. Interact. 12(1), pp. 53-80.
- ^ a b Spilker, J., Klarner, M., Görz, G. (2000). "Procesamiento de autocorrecciones en un sistema de voz a voz". COLING 2000. pp. 1116-1120.
- ^ a b Mankoff, J., Hudson, SE, Abowd, GD (2000). " Proporcionar soporte integrado a nivel de conjunto de herramientas para la ambigüedad en interfaces basadas en reconocimiento ". Actas de la Conferencia ACM CHI'00 sobre Factores Humanos en Sistemas Informáticos. págs. 368 – 375.
- ^ Grifoni P (2009) Fisión multimodal. En: Interacción humano-computadora multimodal y servicios ubicuos. IGI Global, pp 103–120
- ^ Patrizia Grifoni, Fernando Ferri, Maria Chiara Caschera, Arianna D'Ulizia, Mauro Mazzei, "MIS: Servicios de interacción multimodal en una perspectiva de la nube", JNIT: Revista de tecnología de la información de próxima generación, vol. 5, núm. 4, págs. 01 ~ 10, 2014
- ^ Kettebekov, Sanshzar y Rajeev Sharma (2001). " Hacia el control natural de gestos/voz en una pantalla grande ". Actas de la EHCI '01, 8.ª Conferencia Internacional IFIP sobre Ingeniería para la Interacción Humano-Computadora, páginas 221-234.
- ^ Marius Vassiliou, V. Sundareswaran, S. Chen, R. Behringer, C. Tam, M. Chan, P. Bangayan y J. McGee (2000), «Interfaz hombre-máquina multimodal integrada y realidad aumentada para aplicaciones de visualización interactiva», en Darrel G. Hopper (ed.) Cockpit Displays VII: Displays for Defense Applications (Proc. SPIE . 4022), 106-115. ISBN 0-8194-3648-8
- ^ Vitense, HS; Jacko, JA; Emery, VK (2002). "Retroalimentación multimodal: establecimiento de una línea base de rendimiento para mejorar el acceso de personas con discapacidades visuales" . Conferencia ACM sobre Tecnologías de Asistencia .
- ^ a b Haghighat, Mohammad; Abdel-Mottaleb, Mohamed; Alhalabi, Wadee (2016). "Análisis de correlación discriminante: fusión de características en tiempo real para el reconocimiento biométrico multimodal". IEEE Transactions on Information Forensics and Security . 11 (9): 1984– 1996. Bibcode : 2016ITIF...11.1984H . doi : 10.1109/TIFS.2016.2569061 . S2CID 15624506 .
- ^ "Preguntas sobre los sistemas de reconocimiento de iris" . Science Daily . 12 de julio de 2012. Archivado del original el 22 de octubre de 2012.
- ^ Saylor, Michael (2012). La ola móvil: cómo la inteligencia móvil lo cambiará todo . Perseus Books/Vanguard Press. pág. 99. ISBN 978-0-306-82298-8.
- ^ Bill Flook (3 de octubre de 2013). "Esta es la 'guerra biométrica' de la que hablaba Michael Saylor" . Washington Business Journal . Archivado del original el 7 de octubre de 2013.
- ^ Zahid Akhtar, «Seguridad de los sistemas biométricos multimodales frente a ataques de suplantación de identidad» (PDF). Archivado el 2 de abril de 2015 en Wayback Machine . Departamento de Ingeniería Eléctrica y Electrónica, Universidad de Cagliari. Cagliari, Italia, 6 de marzo de 2012.
- ^ Prasanalakshmi, "Sistema criptográfico biométrico multimodal que involucra rostro, huella dactilar y venas de la palma de la mano" , julio de 2011
- ^ Soleymani, Mohammad; Garcia, David; Jou, Brendan; Schuller, Björn; Chang, Shih-Fu; Pantic, Maja (septiembre de 2017). "Una revisión del análisis de sentimientos multimodal" . Image and Vision Computing . 65 : 3–14 . doi : 10.1016/j.imavis.2017.08.003 . S2CID 19491070 .
- ^ Karray, Fakhreddine; Milad, Alemzadeh; Saleh, Jamil Abou; Mo Nours, Arab (2008). "Interacción humano-computadora: panorama general del estado del arte" (PDF) . Revista internacional sobre detección inteligente y sistemas inteligentes . 1 : 137–159 . doi : 10.21307/ijssis-2017-283 .
- ^ a b Poria, Soujanya; Cambria, Erik; Bajpai, Rajiv; Hussain, Amir (septiembre de 2017). "Una revisión de la computación afectiva: del análisis unimodal a la fusión multimodal" . Information Fusion . 37 : 98–125 . doi : 10.1016/j.inffus.2017.02.003 . hdl : 1893/25490 . S2CID 205433041 .
- ^ Nguyen, Quy Hoang; Nguyen, Minh-Van Truong; Van Nguyen, Kiet (2025). "Nuevo conjunto de datos de referencia y marco de fusión intermodal de grano fino para el análisis de sentimiento multimodal de categoría de aspecto en vietnamita". Multimedia Systems . 31 4. arXiv : 2405.00543 . doi : 10.1007/s00530-024-01558-8 .
- ^ "La IA de Google hará llamadas telefónicas por ti" . BBC News . 8 de mayo de 2018. Consultado el 12 de junio de 2018 .
- ^ Wollmer, Martin; Weninger, Felix; Knaup, Tobias; Schuller, Bjorn; Sun, Congkai; Sagae, Kenji; Morency, Louis-Philippe (mayo de 2013). "Reseñas de películas de YouTube: análisis de sentimientos en un contexto audiovisual" (PDF) . IEEE Intelligent Systems . 28 (3): 46– 53. Bibcode : 2013IISys..28c..46W . doi : 10.1109/MIS.2013.34 . S2CID 12789201 .
- ^ Pereira, Moisés HR; Pádua, Flávio LC; Pereira, Adriano CM; Benevenuto, Fabricio; Dalip, Daniel H. (9 de abril de 2016). "Fusionar características visuales, textuales y de audio para el análisis de sentimientos de videos de noticias". arXiv : 1604.02612 [ cs.CL ].
- ^ Zucco, Chiara; Calabrese, Barbara; Cannataro, Mario (noviembre de 2017). «Análisis de sentimientos y computación afectiva para el monitoreo de la depresión». 2017 IEEE International Conference on Bioinformatics and Biomedicine (BIBM) . IEEE. págs. 1988–1995 . doi : 10.1109/bibm.2017.8217966 . ISBN 978-1-5090-3050-7. S2CID 24408937 .
- ^ Pang, Bo; Lee, Lillian (2008). Minería de opiniones y análisis de sentimientos . Hanover, MA: Now Publishers. ISBN 978-1601981509.
- ^ Sun, Shiliang; Luo, Chen; Chen, Junyu (julio de 2017). "Una revisión de las técnicas de procesamiento del lenguaje natural para sistemas de minería de opiniones". Information Fusion . 36 : 10–25 . doi : 10.1016/j.inffus.2016.10.004 .
- ^ Edwards, Benj (14 de marzo de 2023). "GPT-4 de OpenAI muestra un rendimiento de nivel humano en pruebas comparativas profesionales" . Ars Technica . Archivado del original el 14 de marzo de 2023. Consultado el 15 de marzo de 2023 .
- ^ Roose, Kevin (28 de septiembre de 2023). "El nuevo ChatGPT puede 'ver' y 'hablar'. Así es como funciona" . The New York Times . Archivado del original el 31 de octubre de 2023. Recuperado el 30 de octubre de 2023 .
- ^ Vincent, James (15 de marzo de 2023). "El cofundador de OpenAI habla sobre el enfoque anterior de la empresa respecto al intercambio abierto de investigaciones: "Estábamos equivocados"" . The Verge . Archivado del original el 17 de marzo de 2023 . Consultado el 18 de marzo de 2023 .
- ^ Dastin, Jeffrey; Dastin, Jeffrey (15 de marzo de 2023). "OpenAI, respaldada por Microsoft, comienza el lanzamiento de una potente IA conocida como GPT-4" . Reuters . Consultado el 7 de septiembre de 2025 .
- ^ "Dos años después de que GPT-4 revolucionara Internet, OpenAI lo está acabando silenciosamente" . PCMag UK . 11 de abril de 2025. Consultado el 7 de septiembre de 2025 .
- ^ "GPT-4" . platform.openai.com .
- ^ Oviatt, S. (2002), "Interfaces multimodales", en Jacko, J.; Sears, A (eds.), Manual de interacción persona-ordenador (PDF) , Lawrence Erlbaum
- ^ Bauckhage, C.; Fritsch, J.; Rohlfing, KJ; Wachsmuth, S.; Sagerer, G. (2002). "Evaluación de la comprensión integrada del habla y la imagen". Conferencia Internacional sobre Interfaces Multimodales . doi : 10.1109/ICMI.2002.1166961 .
- ^ Ismail, NA; O'Brien, EA (2008). "Habilitando la interacción multimodal en la navegación web de fotos digitales personales" (PDF) . Conferencia Internacional sobre Ingeniería Informática y de Comunicaciones . Archivado del original (PDF) el 18 de julio de 2011. Consultado el 3 de marzo de 2010 .
- ^ a b c Sarter, NB (2006). "Presentación de información multimodal: Guía de diseño y desafíos de investigación". Revista Internacional de Ergonomía Industrial . 36 (5): 439– 445. doi : 10.1016/j.ergon.2006.01.007 .
- ^ Geldar, FA (1957). "Aventuras en alfabetización táctil". Psicólogo americano . 12 (3): 115– 124. doi : 10.1037/h0040416 .
- ^ Brooks, A.; Petersson, E. (2007). "SoundScapes: potencial de aprendizaje no formal a partir de entornos virtuales interactivos" . SIGGRAPH . doi : 10.1145/1282040.1282059 .
- ^ a b Vo, MT (1998). " Un marco y un conjunto de herramientas para la construcción de interfaces de aprendizaje multimodal ", Tesis doctoral, Universidad Carnegie Mellon, Pittsburgh, EE. UU.
- ^ a b Cohen, PR; Johnston, M.; McGee, D.; Oviatt, SL; Pittman, J.; Smith, IA; Chen, L.; Clow, J. (1997). "Quickset: Interacción multimodal para aplicaciones distribuidas", ACM Multimedia, pp. 31-40.
- ^ Johnston, M. (1998). " Análisis multimodal basado en la unificación ". Actas de la 36.ª Reunión Anual de la Asociación de Lingüística Computacional y la 17.ª Conferencia Internacional sobre Lingüística Computacional (COLING-ACL '98), 10-14 de agosto, Universidad de Montreal, Montreal, Quebec, Canadá. pp. 624-630.
- ^ a b Nigay, L.; Coutaz, J. (1995). " Una plataforma genérica para abordar el desafío multimodal ". Actas de la Conferencia sobre Factores Humanos en Sistemas Informáticos, ACM Press.
- ^ a b Bouchet, J.; Nigay, L.; Ganille, T. (2004). " Componentes de software Icare para el desarrollo rápido de interfaces multimodales ". ICMI '04: Actas de la 6.ª conferencia internacional sobre interfaces multimodales (Nueva York, NY, EE. UU.), ACM, págs. 251-258.
- ^ a b D'Ulizia, A.; Ferri, F.; Grifoni P. (2007). " Un enfoque híbrido basado en gramáticas para la especificación de lenguajes multimodales ", Actas del taller OTM 2007, 25-30 de noviembre de 2007, Vilamoura, Portugal, Springer-Verlag, Lecture Notes in Computer Science 4805, pp. 367-376.
- ^ a b c Johnston, M.; Bangalore, S. (2000). " Análisis y comprensión multimodal de estados finitos ", En Actas de la Conferencia Internacional sobre Lingüística Computacional, Saarbrücken, Alemania.
- ^ a b Sun, Y.; Chen, F.; Shi, YD; Chung, V. (2006). " Un método novedoso para la fusión de datos multisensoriales en la interacción humano-computadora multimodal ". En Actas de la 20.ª conferencia del grupo de interés especial en interacción humano-computadora (CHISIG) de Australia sobre interacción humano-computadora: diseño: actividades, artefactos y entornos, Sídney, Australia, pp. 401-404.
- ^ a b Shimazu, H.; Takashima, Y. (1995). "Gramática de cláusulas definidas multimodales," Sistemas y computadoras en Japón, vol. 26, no 3, pp. 93-102.
- ^ a b Johnston, M.; Bangalore, S. (2005). " Integración y comprensión multimodal de estados finitos ," Nat. Lang. Eng, Vol. 11, no. 2, pp. 159-187.
- ^ a b Reitter, D.; Panttaja, EM; Cummins, F. (2004). "UI on the fly: Generating a multimodal user interface," en Proc. of HLT-NAACL-2004, Boston, Massachusetts, EE. UU.
- ^ a b Guan, Ling. "Métodos y técnicas para la fusión de información multimodal" (PDF) . Circuits & Systems Society .
- ^ D'Ulizia, A.; Ferri, F.; Grifoni P. (2011). " Un algoritmo de aprendizaje para la inferencia de gramática multimodal ", IEEE Transactions on Systems, Man, and Cybernetics - Part B: Cybernetics, Vol. 41 (6), pp. 1495 - 1510.
- ^ Pérez, G.; Amores, G.; Manchón, P. (2005). " Dos estrategias para la fusión multimodal ". En Actas de Interacción Multimodal para la Visualización y Exploración de Datos Científicos, Trento, Italia, 26–32.
- ^ Martin, JC (1997). "Hacia la cooperación inteligente entre modalidades: el ejemplo de un sistema que permite la interacción multimodal con un mapa", Actas de la Conferencia Internacional Conjunta sobre Inteligencia Artificial (IJCAI'97), Taller sobre 'Sistemas Multimodales Inteligentes', Nagoya, Japón.
- ^ Allen, JF; Ferguson, G. (1994). " Acciones y eventos en la lógica temporal de intervalos ", Journal of Logic and Computation, vol. 4, n.º 5, págs. 531-579
- ^ Bellik, Y. (2001). " Requisitos técnicos para una interacción multimodal exitosa ", Taller internacional sobre presentación de información y diálogo multimodal natural, Verona, Italia, 14-15 de diciembre.
- ^ Lee, YC; Chin, F. (1995). " Un lenguaje de consulta icónico para relaciones topológicas en SIG ". Revista Internacional de Sistemas de Información Geográfica 9(1). pp. 25-46
- ^ Calcinelli, D.; Mainguenaud, M. (1994). "Cigales, un lenguaje visual para sistemas de información geográfica: la interfaz de usuario". Journal of Visual Languages and Computing 5(2). pp. 113-132
- ^ Ferri, F.; Rafanelli, M. (2005). " GeoPQL: un lenguaje de consulta pictórico geográfico que resuelve ambigüedades en la interpretación de consultas ". J. Semántica de datos III. págs.50-80
- ^ Suhm, B., Myers, B. y Waibel, A. (1999). " Evaluación empírica y basada en modelos de la corrección de errores interactiva multimodal ". En Actas de CHI'99, mayo de 1999, págs. 584-591.
Enlaces externos
- Actividad de interacción multimodal del W3C
- Perfil XHTML+Voice 1.0 , Nota del W3C del 21 de diciembre de 2001
- Hoste, Lode, Dumas, Bruno y Signer, Beat: Mudra: Un marco unificado de interacción multimodal , En Actas de la 13.ª Conferencia Internacional sobre Interacción Multimodal (ICMI 2011), Alicante, España, noviembre de 2011.
- Toselli, Alejandro Héctor, Vidal, Enrique, Casacuberta, Francisco: Reconocimiento interactivo multimodal de patrones y aplicaciones , Springer, 2011.
- Interacción multimodal