Articulo de referencia

Reconocimiento de actividad

El reconocimiento de actividades tiene como objetivo identificar las acciones y metas de uno o más agentes a partir de una serie de observaciones sobre sus acciones y las condic...

El reconocimiento de actividades tiene como objetivo identificar las acciones y metas de uno o más agentes a partir de una serie de observaciones sobre sus acciones y las condiciones del entorno. Desde la década de 1980, este campo de investigación ha captado la atención de diversas comunidades de informática debido a su capacidad para brindar soporte personalizado a numerosas aplicaciones y su conexión con diversos campos de estudio, como la medicina, la interacción persona-computadora o la sociología.

Debido a su naturaleza multifacética, diferentes campos pueden referirse al reconocimiento de actividad como reconocimiento de planes, reconocimiento de objetivos, reconocimiento de intenciones, reconocimiento de comportamiento, estimación de ubicación y servicios basados ​​en la ubicación .

Tipos

Reconocimiento de actividad de un solo usuario basado en sensores

El reconocimiento de actividad basado en sensores integra el área emergente de redes de sensores con novedosas técnicas de minería de datos y aprendizaje automático para modelar una amplia gama de actividades humanas. [ 1 ] [ 2 ] Los dispositivos móviles (por ejemplo, teléfonos inteligentes) proporcionan datos de sensores y capacidad de cálculo suficientes para permitir el reconocimiento de actividad física y proporcionar una estimación del consumo de energía durante la vida cotidiana. Los investigadores del reconocimiento de actividad basado en sensores creen que, al capacitar a las computadoras y sensores ubicuos para monitorear el comportamiento de los agentes (con consentimiento), estas computadoras estarán mejor preparadas para actuar en nuestro nombre. Los sensores visuales que incorporan información de color y profundidad, como Kinect , permiten un reconocimiento automático de acciones más preciso y fusionan muchas aplicaciones emergentes, como la educación interactiva [ 3 ] y los entornos inteligentes. [ 4 ] Las múltiples vistas del sensor visual permiten el desarrollo del aprendizaje automático para el reconocimiento automático de acciones invariante a la vista. [ 5 ] Los sensores más avanzados utilizados en sistemas de captura de movimiento 3D permiten un reconocimiento automático de alta precisión, a costa de una configuración de sistema de hardware más compleja. [ 6 ]

Niveles de reconocimiento de actividad basado en sensores

El reconocimiento de actividad basado en sensores es una tarea compleja debido a la naturaleza ruidosa inherente de la entrada. Por ello, el modelado estadístico ha sido el principal enfoque en este campo, donde el reconocimiento se lleva a cabo y se conecta en varios niveles intermedios. En el nivel más bajo, donde se recopilan los datos de los sensores, el aprendizaje estadístico se centra en cómo determinar la ubicación precisa de los agentes a partir de los datos de señal recibidos. En un nivel intermedio, la inferencia estadística se ocupa de cómo reconocer las actividades de los individuos a partir de las secuencias de ubicación inferidas y las condiciones ambientales en los niveles inferiores. Además, en el nivel más alto, una de las principales preocupaciones es determinar el objetivo general o los subobjetivos de un agente a partir de las secuencias de actividad mediante una combinación de razonamiento lógico y estadístico.

Reconocimiento de actividad multiusuario basado en sensores

El reconocimiento de actividades de múltiples usuarios mediante sensores corporales apareció por primera vez en el trabajo de ORL utilizando sistemas de insignias activas [ 7 ] a principios de la década de 1990. Se utilizaron otras tecnologías de sensores, como los sensores de aceleración, para identificar patrones de actividad grupal en escenarios de oficina. [ 8 ] Las actividades de múltiples usuarios en entornos inteligentes se abordan en Gu et al . [ 9 ] En este trabajo, investigan el problema fundamental del reconocimiento de actividades de múltiples usuarios a partir de lecturas de sensores en un entorno doméstico y proponen un nuevo enfoque de minería de patrones para reconocer actividades tanto de un solo usuario como de múltiples usuarios en una solución unificada.

Reconocimiento de actividad grupal basado en sensores

El reconocimiento de actividades grupales es fundamentalmente diferente del reconocimiento de actividades de usuarios individuales o múltiples, ya que el objetivo es reconocer el comportamiento del grupo como una entidad, en lugar de las actividades de los miembros individuales dentro del mismo. [ 10 ] El comportamiento grupal es emergente por naturaleza, lo que significa que las propiedades del comportamiento del grupo son fundamentalmente diferentes de las propiedades del comportamiento de los individuos dentro del mismo, o cualquier suma de ese comportamiento. [ 11 ] Los principales desafíos radican en modelar el comportamiento de los miembros individuales del grupo, así como los roles del individuo dentro de la dinámica grupal [ 12 ] y su relación con el comportamiento emergente del grupo en paralelo. [ 13 ] Los desafíos que aún deben abordarse incluyen la cuantificación del comportamiento y los roles de los individuos que se unen al grupo, la integración de modelos explícitos para la descripción de roles en algoritmos de inferencia y evaluaciones de escalabilidad para grupos y multitudes muy grandes. El reconocimiento de actividades grupales tiene aplicaciones para la gestión de multitudes y la respuesta en situaciones de emergencia, así como para redes sociales y aplicaciones de Autocuantificación . [ 14 ]

Aproches

Reconocimiento de actividades mediante la lógica y el razonamiento.

Los enfoques basados ​​en la lógica registran todas las explicaciones lógicamente consistentes de las acciones observadas. Por lo tanto, deben considerarse todos los planes u objetivos posibles y consistentes. Kautz proporcionó una teoría formal del reconocimiento de planes. Describió el reconocimiento de planes como un proceso de inferencia lógica de circunscripción. Todas las acciones y planes se denominan uniformemente objetivos, y el conocimiento de un reconocedor se representa mediante un conjunto de enunciados de primer orden, denominado jerarquía de eventos. La jerarquía de eventos se codifica en lógica de primer orden , que define la abstracción, la descomposición y las relaciones funcionales entre los tipos de eventos. [ 15 ]

El marco general de Kautz para el reconocimiento de planes tiene una complejidad temporal exponencial en el peor de los casos, medida en el tamaño de la jerarquía de entrada. Lesh y Etzioni fueron un paso más allá y presentaron métodos para escalar el reconocimiento de objetivos y así aumentar la capacidad computacional de su trabajo. A diferencia del enfoque de Kautz, donde la biblioteca de planes se representa explícitamente, el enfoque de Lesh y Etzioni permite la construcción automática de bibliotecas de planes a partir de primitivas de dominio. Además, introdujeron representaciones compactas y algoritmos eficientes para el reconocimiento de objetivos en grandes bibliotecas de planes. [ 16 ]

Los planes y objetivos inconsistentes se modifican repetidamente cuando surgen nuevas acciones. Además, presentaron métodos para adaptar un reconocedor de objetivos a fin de manejar el comportamiento idiosincrásico individual a partir de una muestra del comportamiento reciente de un individuo. Pollack et al. describieron un modelo de argumentación directa que permite conocer la fuerza relativa de varios tipos de argumentos para la descripción de creencias e intenciones.

Un problema grave de los enfoques basados ​​en la lógica es su incapacidad o inviabilidad inherente para representar la incertidumbre. No ofrecen ningún mecanismo para priorizar un enfoque coherente sobre otro y son incapaces de decidir si un plan en particular es más probable que otro, siempre que ambos sean lo suficientemente coherentes como para explicar las acciones observadas. Además, los métodos basados ​​en la lógica presentan una falta de capacidad de aprendizaje.

Otro enfoque para el reconocimiento de actividades basado en lógica es utilizar el razonamiento de flujo basado en la programación de conjuntos de respuestas , [ 17 ] y se ha aplicado al reconocimiento de actividades para aplicaciones relacionadas con la salud, [ 18 ] que utiliza restricciones débiles para modelar un grado de ambigüedad/incertidumbre.

Reconocimiento de actividad mediante razonamiento probabilístico

La teoría de la probabilidad y los modelos de aprendizaje estadístico se aplican más recientemente en el reconocimiento de actividades para razonar sobre acciones, planes y objetivos en condiciones de incertidumbre. [ 19 ] En la literatura, se han presentado varios enfoques que representan explícitamente la incertidumbre al razonar sobre los planes y objetivos de un agente.

Utilizando datos de sensores como entrada, Hodges y Pollack diseñaron sistemas basados ​​en aprendizaje automático para identificar individuos mientras realizan actividades cotidianas rutinarias como preparar café. [ 20 ] El Laboratorio de Investigación de Intel (Seattle) y la Universidad de Washington en Seattle han realizado algunos trabajos importantes sobre el uso de sensores para detectar planes humanos. [ 21 ] [ 22 ] [ 23 ] Algunos de estos trabajos infieren los modos de transporte del usuario a partir de lecturas de identificadores de radiofrecuencia (RFID) y sistemas de posicionamiento global (GPS).

Se ha demostrado que el uso de modelos probabilísticos temporales funciona bien en el reconocimiento de actividades y generalmente supera a los modelos no temporales. [ 24 ] Los modelos generativos como el Modelo Oculto de Markov (HMM) y las Redes Bayesianas Dinámicas (DBN) formuladas de manera más general son opciones populares para modelar actividades a partir de datos de sensores. [ 25 ] [ 26 ] [ 27 ] [ 28 ] Los modelos discriminativos como los Campos Aleatorios Condicionales (CRF) también se aplican comúnmente y también ofrecen un buen rendimiento en el reconocimiento de actividades. [ 29 ] [ 30 ]

Los modelos generativos y discriminativos tienen sus ventajas y desventajas, y la elección ideal depende de su ámbito de aplicación. Aquí se puede encontrar un conjunto de datos junto con implementaciones de varios modelos populares (HMM, CRF) para el reconocimiento de actividades .

Los modelos probabilísticos temporales convencionales, como el modelo oculto de Markov (HMM) y el modelo de campos aleatorios condicionales (CRF), modelan directamente las correlaciones entre las actividades y los datos de los sensores observados. En los últimos años, una creciente evidencia ha respaldado el uso de modelos jerárquicos que tienen en cuenta la rica estructura jerárquica que existe en los datos del comportamiento humano. [ 26 ] [ 31 ] [ 32 ] La idea central aquí es que el modelo no correlaciona directamente las actividades con los datos de los sensores, sino que divide la actividad en subactividades (a veces denominadas acciones) y modela las correlaciones subyacentes en consecuencia. Un ejemplo podría ser la actividad de preparar un salteado, que puede dividirse en las subactividades o acciones de cortar verduras, freír las verduras en una sartén y servirlo en un plato. Ejemplos de este tipo de modelo jerárquico son los Modelos Ocultos de Markov por Capas (LHMM) [ 31 ] y el modelo oculto de Markov jerárquico (HHMM), que han demostrado superar significativamente a su contraparte no jerárquica en el reconocimiento de actividades. [ 26 ]

Enfoque basado en minería de datos para el reconocimiento de actividades

A diferencia de los enfoques tradicionales de aprendizaje automático, recientemente se ha propuesto un enfoque basado en minería de datos. En el trabajo de Gu et al., el problema del reconocimiento de actividades se formula como un problema de clasificación basado en patrones. Propusieron un enfoque de minería de datos basado en patrones discriminativos que describen cambios significativos entre dos clases de datos de actividades cualesquiera para reconocer actividades secuenciales, intercaladas y concurrentes en una solución unificada. [ 33 ] Gilbert et al. utilizan esquinas 2D tanto en el espacio como en el tiempo. Estas se agrupan espacial y temporalmente mediante un proceso jerárquico, con un área de búsqueda creciente. En cada etapa de la jerarquía, las características más distintivas y descriptivas se aprenden de manera eficiente a través de la minería de datos (regla Apriori). [ 34 ]

Reconocimiento de actividad basado en GPS

El reconocimiento de actividades basado en la ubicación también puede basarse en datos GPS para reconocer actividades. [ 35 ] [ 36 ]

Uso de sensores

Reconocimiento de actividad basado en la visión

El seguimiento y la comprensión del comportamiento de los agentes mediante vídeos grabados con diversas cámaras constituyen un problema crucial y complejo. La técnica principal empleada es la visión artificial . El reconocimiento de actividad basado en visión artificial ha encontrado numerosas aplicaciones, como la interacción persona-ordenador, el diseño de interfaces de usuario , el aprendizaje robótico y la vigilancia, entre otras. Las conferencias científicas donde suelen presentarse trabajos sobre reconocimiento de actividad basado en visión artificial son ICCV y CVPR .

Se ha avanzado mucho en el reconocimiento de actividad basado en visión. Los investigadores han probado diversos métodos, como el flujo óptico , el filtrado de Kalman y los modelos ocultos de Markov , entre otros, utilizando diferentes modalidades como cámara única, estéreo e infrarrojos. Además, han considerado múltiples aspectos de este tema, incluyendo el seguimiento de peatones individuales, el seguimiento de grupos y la detección de objetos caídos.

Recientemente, algunos investigadores han utilizado cámaras RGBD como Microsoft Kinect para detectar actividades humanas. [ 37 ] Las cámaras de profundidad añaden una dimensión extra, es decir, profundidad, que las cámaras 2D normales no proporcionan. La información sensorial de estas cámaras de profundidad se ha utilizado para generar un modelo de esqueleto humano en tiempo real con diferentes posiciones corporales. [ 38 ] Esta información del esqueleto proporciona información significativa que los investigadores han utilizado para modelar actividades humanas que se entrenan y posteriormente se utilizan para reconocer actividades desconocidas. [ 39 ] [ 40 ]

Con el reciente auge del aprendizaje profundo, el reconocimiento de actividades basado en vídeo RGB ha experimentado un rápido desarrollo. Utiliza vídeos capturados por cámaras RGB como entrada y realiza varias tareas, entre ellas: clasificación de vídeo, detección del inicio y el final de la actividad en los vídeos, y localización espacio-temporal de la actividad y de las personas que la realizan. [ 41 ] Los métodos de estimación de pose [ 42 ] permiten extraer características esqueléticas más representativas para el reconocimiento de acciones. [ 43 ] Dicho esto, se ha descubierto que el reconocimiento de acciones basado en aprendizaje profundo puede sufrir ataques adversarios, en los que un atacante altera la entrada de forma insignificante para engañar a un sistema de reconocimiento de acciones. [ 44 ]

A pesar del notable progreso del reconocimiento de actividad basado en la visión, su uso para la mayoría de las aplicaciones de vigilancia visual reales sigue siendo una aspiración lejana. [ 45 ] Por el contrario, el cerebro humano parece haber perfeccionado la capacidad de reconocer acciones humanas. Esta capacidad se basa no solo en el conocimiento adquirido, sino también en la aptitud para extraer información relevante para un contexto dado y el razonamiento lógico. Con base en esta observación, se ha propuesto mejorar los sistemas de reconocimiento de actividad basados ​​en la visión integrando el razonamiento de sentido común y el conocimiento contextual y de sentido común .

Reconocimiento jerárquico de la actividad humana (HAR, por sus siglas en inglés)

El reconocimiento jerárquico de la actividad humana es una técnica dentro de la visión por computadora y el aprendizaje automático. Su objetivo es identificar y comprender las acciones o comportamientos humanos a partir de datos visuales. Este método implica estructurar las actividades jerárquicamente, creando un marco que representa las conexiones e interdependencias entre diversas acciones. [ 46 ] Las técnicas HAR se pueden utilizar para comprender las correlaciones de datos y los fundamentos del modelo para mejorar los modelos, equilibrar la precisión y las preocupaciones de privacidad en áreas de aplicación sensibles, e identificar y gestionar etiquetas triviales que no tienen relevancia en casos de uso específicos. [ 47 ]

Niveles de reconocimiento de actividad basado en la visión

En el reconocimiento de actividad basado en visión, el proceso computacional suele dividirse en cuatro pasos: detección de personas, seguimiento de personas, reconocimiento de la actividad humana y, posteriormente, una evaluación de la actividad de alto nivel.

Localización de acción de grano fino

En el reconocimiento de actividades basado en visión artificial , la localización de acciones de grano fino suele proporcionar máscaras de segmentación por imagen que delimitan el objeto humano y su categoría de acción (por ejemplo, Segment-Tube [ 48 ] ). A menudo se emplean técnicas como redes de Markov dinámicas , CNN y LSTM para explotar las correlaciones semánticas entre fotogramas de vídeo consecutivos. Las características geométricas de grano fino, como los cuadros delimitadores objetivos y las posturas humanas, facilitan el reconocimiento de actividades con redes neuronales gráficas . [ 41 ] [ 49 ]

Reconocimiento automático de la marcha

Una forma de identificar a personas específicas es por su manera de caminar. Se puede utilizar software de reconocimiento de la marcha para registrar el patrón de marcha o el perfil de las características de la marcha de una persona en una base de datos con el fin de reconocerla posteriormente, incluso si lleva un disfraz.

Reconocimiento de actividad basado en Wi-Fi

Cuando se realiza el reconocimiento de actividad en interiores y en ciudades utilizando las señales Wi-Fi y los puntos de acceso 802.11 ampliamente disponibles , existe mucho ruido e incertidumbre. Estas incertidumbres pueden modelarse utilizando un modelo de red bayesiana dinámica . [ 50 ] En un modelo de objetivos múltiples que puede razonar sobre los objetivos entrelazados del usuario, se aplica un modelo de transición de estado determinista . [ 51 ] Otro método posible modela las actividades concurrentes y entrelazadas en un enfoque probabilístico. [ 52 ] Un modelo de descubrimiento de acciones del usuario podría segmentar las señales Wi-Fi para producir posibles acciones. [ 53 ]

Modelos básicos de reconocimiento Wi-Fi

Una de las ideas principales sobre el reconocimiento de la actividad Wi-Fi es que, cuando la señal atraviesa el cuerpo humano durante su transmisión, se producen reflexión, difracción y dispersión. Los investigadores pueden obtener información de estas señales para analizar la actividad del cuerpo humano.

Modelo de transmisión estática

Como se muestra en [ 54 ] , cuando las señales inalámbricas se transmiten en interiores, los obstáculos como paredes, el suelo y el cuerpo humano provocan diversos efectos como reflexión, dispersión, difracción y dispersión. Por lo tanto, el receptor recibe múltiples señales de diferentes trayectorias al mismo tiempo, debido a que las superficies reflejan la señal durante la transmisión, lo que se conoce como efecto multitrayectoria .

El modelo estático se basa en estos dos tipos de señales: la señal directa y la señal reflejada. Dado que no hay obstáculos en la trayectoria directa, la transmisión de la señal directa se puede modelar mediante la ecuación de transmisión de Friis :

PAGr=PAGtGRAMOtGRAMOrλ2(4π)2d2{\displaystyle P_{r}={\frac {P_{t}G_{t}G_{r}\lambda ^{2}}{(4\pi )^{2}d^{2}}}}
PAGt{\displaystyle P_{t}}es la potencia suministrada a los terminales de entrada de la antena transmisora;
PAGr{\displaystyle P_{r}}es la potencia disponible en los terminales de salida de la antena receptora;
d{\displaystyle d}es la distancia entre las antenas;
GRAMOt{\displaystyle G_{t}}es la ganancia de la antena de transmisión;
GRAMOr{\displaystyle G_{r}}está recibiendo ganancia de antena;
λ{\displaystyle \lambda }es la longitud de onda de la radiofrecuencia

Si consideramos la señal reflejada, la nueva ecuación es:

PAGr=PAGtGRAMOtGRAMOrλ2(4π)2(d+4h)2{\displaystyle P_{r}={\frac {P_{t}G_{t}G_{r}\lambda ^{2}}{(4\pi )^{2}(d+4h)^{2}}}}
h{\displaystyle h}es la distancia entre los puntos de reflexión y la trayectoria directa.

Cuando aparece el ser humano, tenemos una nueva vía de transmisión. Por lo tanto, la ecuación final es:

PAGr=PAGtGRAMOtGRAMOrλ2(4π)2(d+4h+Δ)2{\displaystyle P_{r}={\frac {P_{t}G_{t}G_{r}\lambda ^{2}}{(4\pi )^{2}(d+4h+\Delta )^{2}}}}

Δ{\displaystyle \Delta }es la diferencia aproximada de la trayectoria causada por el cuerpo humano.

Modelo de transmisión dinámica

En este modelo, consideramos el movimiento humano, que provoca que la trayectoria de transmisión de la señal cambie continuamente. Podemos utilizar el efecto Doppler para describir este efecto, que está relacionado con la velocidad del movimiento.

ΔF=2vporqueθdoF{\displaystyle \Delta f={\frac {2v\cos \theta }{c}}f}

Al calcular el desplazamiento Doppler de la señal recibida, podemos determinar el patrón de movimiento y, por lo tanto, identificar la actividad humana. Por ejemplo, en [ 55 ], el desplazamiento Doppler se utiliza como huella digital para lograr una identificación de alta precisión de nueve patrones de movimiento diferentes.

Zona de Fresnel

La zona de Fresnel se utilizó inicialmente para estudiar la interferencia y la difracción de la luz, y posteriormente se empleó para construir el modelo de transmisión de señales inalámbricas. La zona de Fresnel es una serie de intervalos elípticos cuyos focos coinciden con las posiciones del emisor y el receptor.

Cuando una persona se mueve a través de diferentes zonas de Fresnel, la trayectoria de la señal formada por la reflexión del cuerpo humano cambia, y si las personas se mueven verticalmente a través de las zonas de Fresnel, el cambio de la señal será periódico. En dos artículos, Wang et al. aplicaron el modelo de Fresnel a la tarea de reconocimiento de actividad y obtuvieron un resultado más preciso. [ 56 ] [ 57 ]

Modelado del cuerpo humano

En algunas tareas, debemos considerar modelar el cuerpo humano con precisión para obtener mejores resultados. Por ejemplo, [ 57 ] describió el cuerpo humano como cilindros concéntricos para la detección de la respiración. El exterior del cilindro representa la caja torácica cuando las personas inhalan, y el interior, cuando exhalan. Por lo tanto, la diferencia entre el radio de estos dos cilindros representa la distancia recorrida durante la respiración. El cambio de las fases de la señal se puede expresar en la siguiente ecuación:

θ=2π2Δdλ{\displaystyle \theta =2\pi {\frac {2\,\Delta d}{\lambda }}}
θ{\displaystyle \theta }es el cambio de las fases de la señal;
λ{\displaystyle \lambda }es la longitud de onda de la radiofrecuencia;
Δd{\displaystyle \Delta d}es la distancia de desplazamiento de la caja torácica;

conjuntos de datos

Existen algunos conjuntos de datos populares que se utilizan para evaluar el rendimiento de los algoritmos de reconocimiento de actividad o de acciones.

  • UCF-101: Consta de 101 clases de acciones humanas, más de 13 000 clips y 27 horas de datos de vídeo. Las clases de acciones incluyen maquillarse, tocar el dhol, golpear un bate de críquet, afeitarse la barba, etc. [ 58 ]
  • HMDB51: Esta es una colección de videos realistas de diversas fuentes, incluyendo películas y videos web. El conjunto de datos se compone de 6849 videoclips de 51 categorías de acción (como “saltar”, “besar” y “reír”), con al menos 101 clips por categoría. [ 59 ]
  • Cinética: Este conjunto de datos es significativamente mayor que los anteriores. Contiene 400 clases de acciones humanas, con al menos 400 videoclips para cada acción. Cada clip dura aproximadamente 10 segundos y proviene de un video diferente de YouTube . Este conjunto de datos fue creado por DeepMind. [ 60 ]

Aplicaciones

Mediante el monitoreo automático de las actividades humanas, se puede brindar rehabilitación domiciliaria a personas que sufren lesiones cerebrales traumáticas. Se pueden encontrar aplicaciones que van desde aplicaciones relacionadas con la seguridad y el apoyo logístico hasta servicios basados ​​en la ubicación . [ 61 ] Se han desarrollado sistemas de reconocimiento de actividad para la observación de la vida silvestre [ 62 ] y el ahorro de energía en edificios. [ 63 ]

Véase también

Referencias

  1. Tanzeem Choudhury, Gaetano Borriello , et al. La plataforma de detección móvil: un sistema embebido para el reconocimiento de actividades. Publicado en la revista IEEE Pervasive Magazine, número especial sobre computación basada en actividades, abril de 2008.
  2. Nishkam Ravi, Nikhil Dandekar, Preetham Mysore, Michael Littman. Reconocimiento de actividad a partir de datos de acelerómetro . Actas de la Decimoséptima Conferencia sobre Aplicaciones Innovadoras de la Inteligencia Artificial (IAAI/AAAI 2005).
  3. Yang, Yang; Leung, Howard; Shum, Hubert PH; Li, Jiao; Zeng, Lanling; Aslam, Nauman; Pan, Zhigeng (2018). "CCESK: un sistema educativo de caracteres chinos basado en Kinect". Transacciones IEEE sobre tecnologías de aprendizaje . 11 (3): 342– 347. Código bibliográfico : 2018ITLT...11..342Y . doi : 10.1109/TLT.2017.2723888 . S2CID 52899136 . 
  4. Ho, Edmond SL; Chan, Jacky CP; Chan, Donald CK; Shum, Hubert PH; Cheung, Yiu-ming; Yuen, PC (2016). "Mejora de la precisión de la clasificación de posturas para la monitorización de la actividad humana basada en sensores de profundidad en entornos inteligentes" . Computer Vision and Image Understanding . 148 : 97–110 . doi : 10.1016/j.cviu.2015.12.011 . S2CID 207060860 . 
  5. Zhang, Jingtian; Shum, Hubert PH; Han, Jungong; Shao, Ling (2018). "Reconocimiento de acciones desde vistas arbitrarias mediante aprendizaje de diccionario transferible" . IEEE Transactions on Image Processing . 27 (10): 4709– 4723. Bibcode : 2018ITIP...27.4709Z . doi : 10.1109/TIP.2018.2836323 . PMID 29994770. S2CID 49536771 .  
  6. Shen, Yijun; Yang, Longzhi; Ho, Edmond SL; Shum, Hubert PH (2020). "Comparación de la actividad humana basada en la interacción" . IEEE Transactions on Visualization and Computer Graphics . 26 (8): 115673– 115684. Bibcode : 2020ITVCG..26.2620S . doi : 10.1109/TVCG.2019.2893247 . PMID 30703028. S2CID 73447673 .  
  7. Want R., Hopper A., ​​Falcao V., Gibbons J.: El sistema de localización de insignias activas, ACM Transactions on Information Systems, vol. 40, n.º 1, págs. 91–102, enero de 1992
  8. Bieber G., Kirste T., Untersuchung des gruppendynamischen Aktivitaetsverhaltes im Office-Umfeld, 7. Berliner Werkstatt Mensch-Maschine-Systeme, Berlín, Alemania, 2007
  9. Tao Gu, Zhanqing Wu, Liang Wang, Xianping Tao y Jian Lu. Minería de patrones emergentes para el reconocimiento de actividades de múltiples usuarios en computación ubicua . En Actas de la 6.ª Conferencia Internacional sobre Sistemas Móviles y Ubicuos: Computación, Redes y Servicios (MobiQuitous '09), Toronto, Canadá, 13-16 de julio de 2009.
  10. Dawud Gordon, Jan-Hendrik Hanne, Martin Berchtold, Ali Asghar Nazari Shirehjini, Michael Beigl: Hacia el reconocimiento de la actividad de grupos colaborativos mediante dispositivos móviles , Mobile Networks and Applications 18(3), 2013, pp. 326–340
  11. Lewin, K. Teoría de campo en ciencias sociales: artículos teóricos seleccionados. Libros de bolsillo de ciencias sociales. Harper, Nueva York, 1951.
  12. Hirano, T., y Maekawa, T. Un modelo híbrido no supervisado/supervisado para el reconocimiento de actividades grupales . En Actas del Simposio Internacional de Computadoras Portátiles de 2013, ISWC '13, ACM (Nueva York, NY, EE. UU., 2013), 21–24
  13. Brdiczka, O., Maisonnasse, J., Reignier, P., y Crowley, JL Detección de actividades de grupos pequeños a partir de observaciones multimodales . Applied Intelligence 30, 1 (julio de 2007), 47–57.
  14. Dawud Gordon, Reconocimiento de la actividad grupal mediante dispositivos de detección portátiles , Tesis doctoral, Instituto Tecnológico de Karlsruhe, 2014
  15. H. Kautz. " Una teoría formal del reconocimiento de planes ". En tesis doctoral, Universidad de Rochester, 1987.
  16. N. Lesh y O. Etzioni. " Un reconocedor de objetivos rápido y fiable ". En Actas de la Conferencia Internacional Conjunta sobre Inteligencia Artificial , 1995.
  17. Do, Thang; Seng W. Loke; Fei Liu (2011). "Programación de conjuntos de respuestas para el razonamiento de flujos". Avances en inteligencia artificial . Notas de clase en ciencias de la computación. Vol. 6657. págs. 104–109 . CiteSeerX 10.1.1.453.2348 . doi : 10.1007/978-3-642-21043-3_13 . ISBN    978-3-642-21042-6.
  18. Do, Thang; Seng W. Loke; Fei Liu (2012). "HealthyLife: un sistema de reconocimiento de actividad con teléfono inteligente que utiliza razonamiento de flujo basado en lógica" (PDF) . Actas de la 9.ª Conferencia Internacional sobre Sistemas Móviles y Ubicuos: Computación, Redes y Servicios (Mobiquitous 2012) .
  19. E. Charniak y RP Goldman. " Un modelo bayesiano de reconocimiento de planes ". Inteligencia Artificial , 64:53–79, 1993.
  20. MR Hodges y ME Pollack. " Una 'huella digital de uso de objetos': El uso de sensores electrónicos para la identificación humana ". En Actas de la 9.ª Conferencia Internacional sobre Computación Ubicua , 2007.
  21. Mike Perkowitz, Matthai Philipose, Donald J. Patterson y Kenneth P. Fishkin. « Extracción de modelos de actividades humanas de la web ». En Actas de la Decimotercera Conferencia Internacional de la World Wide Web (WWW 2004), páginas 573-582, mayo de 2004.
  22. Matthai Philipose, Kenneth P. Fishkin, Mike Perkowitz, Donald J. Patterson, Dieter Fox, Henry Kautz y Dirk Hähnel. « Inferencia de actividades a partir de interacciones con objetos ». En IEEE Pervasive Computing , páginas 50-57, octubre de 2004.
  23. Dieter Fox Lin Liao, Donald J. Patterson y Henry A. Kautz. " Aprendizaje e inferencia de rutinas de transporte ". Artif. Intell. , 171(5–6):311–331, 2007.
  24. TLM van Kasteren, Gwenn Englebienne, BJA Kröse. « Reconocimiento de la actividad humana a partir de datos de redes de sensores inalámbricos: evaluación comparativa y software ». Reconocimiento de la actividad en entornos inteligentes omnipresentes, 165–186, Atlantis Press
  25. Piyathilaka, L.; Kodagoda, S., " Método oculto de Markov basado en mezcla gaussiana para el reconocimiento de la actividad diaria humana utilizando características del esqueleto 3D ", 8.ª Conferencia IEEE sobre Electrónica Industrial y Aplicaciones (ICIEA), vol., n.º, págs. 567, 572, 19-21 de junio de 2013
  26. ^ TLM van Kasteren, Gwenn Englebienne, Ben Kröse" Reconocimiento de actividad jerárquica mediante acciones agrupadas automáticamente ", 2011 , Ambient Intelligence, 82–91, Springer Berlin/Heidelberg
  27. Daniel Wilson y Chris Atkeson. Seguimiento y reconocimiento de actividad simultáneos (estrella) mediante múltiples sensores binarios anónimos . En Actas de la 3.ª conferencia internacional sobre computación ubicua, Pervasive, páginas 62-79, Múnich, Alemania, 2005.
  28. Nuria Oliver , Barbara Rosario y Alex Pentland , «Un sistema de visión artificial bayesiano para modelar las interacciones humanas», aparece en el número especial de PAMI sobre vigilancia y monitorización visual, agosto de 2000.
  29. TLM Van Kasteren, Athanasios Noulas, Gwenn Englebienne, Ben Kröse, " Reconocimiento preciso de la actividad en un entorno doméstico ", 21/9/2008, Actas de la 10.ª conferencia internacional sobre computación ubicua, 1-9, ACM
  30. Derek Hao Hu, Sinno Jialin Pan, Vincent Wenchen Zheng, Nathan NanLiu y Qiang Yang. Reconocimiento de actividad del mundo real con múltiples objetivos. Archivado el 9 de agosto de 2017 en Wayback Machine . En Actas de la décima conferencia internacional sobre computación ubicua, Ubicomp, páginas 30-39, Nueva York, NY, EE. UU., 2008. ACM.
  31. 1 2 Nuria Oliver , Ashutosh Garg y Eric Horvitz. Representaciones en capas para el aprendizaje y la inferencia de la actividad de oficina a partir de múltiples canales sensoriales . Comput. Vis. Image Underst., 96(2):163–180, 2004.
  32. Amarnag Subramanya, Alvin Raj, Jeff Bilmes y Dieter Fox. Modelos jerárquicos para el reconocimiento de actividad . En Actas de la conferencia internacional sobre procesamiento de señales multimedia, MMSP, Victoria, CA, octubre de 2006.
  33. Tao Gu, Zhanqing Wu, Xianping Tao, Hung Keng Pung y Jian Lu. epSICAR: Un enfoque basado en patrones emergentes para el reconocimiento de actividades secuenciales, intercaladas y concurrentes . En Actas de la 7.ª Conferencia Internacional Anual IEEE sobre Computación y Comunicaciones Ubicuas (Percom '09), Galveston, Texas, del 9 al 13 de marzo de 2009.
  34. Gilbert A, Illingworth J, Bowden R. Reconocimiento de acciones mediante características compuestas jerárquicas extraídas . IEEE Trans. Análisis de patrones y aprendizaje automático.
  35. Liao, Lin, Dieter Fox y Henry Kautz. « Campos aleatorios condicionales jerárquicos para el reconocimiento de actividad basado en GPS ». Investigación en robótica. Springer, Berlín, Heidelberg, 2007. 487–506.
  36. Liao, Lin, Dieter Fox y Henry Kautz. " Reconocimiento de actividad basado en la ubicación ". Avances en sistemas de procesamiento de información neuronal. 2006.
  37. Ho, Edmond SL; Chan, Jacky CP; Chan, Donald CK; Shum, Hubert PH; Cheung, Yiu-ming; Yuen, PC (2016). "Mejora de la precisión de la clasificación de posturas para la monitorización de la actividad humana basada en sensores de profundidad en entornos inteligentes" . Computer Vision and Image Understanding . 148. Elsevier: 97–110 . doi : 10.1016/j.cviu.2015.12.011 . ISSN 1077-3142 . 
  38. Shum, Hubert PH; Ho, Edmond SL; Jiang, Yang; Takagi, Shu (2013). " Reconstrucción de postura en tiempo real para Microsoft Kinect" . IEEE Transactions on Cybernetics . 43 (5). IEEE: 1357–1369 . Bibcode : 2013ITCyb..43.1357S . doi : 10.1109/TCYB.2013.2275945 . ISSN 2168-2267 . PMID 23981562. S2CID 14124193 .   
  39. Piyathilaka, L.; Kodagoda, S., " Método oculto de Markov basado en mezcla gaussiana para el reconocimiento de la actividad diaria humana utilizando características del esqueleto 3D ", 8.ª Conferencia IEEE sobre Electrónica Industrial y Aplicaciones (ICIEA), vol., n.º, págs. 567, 572, 19-21 de junio de 2013. URL: https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=6566433&isnumber=6566328
  40. Piyathilaka, L. y Kodagoda, S., 2015. Reconocimiento de la actividad humana para robots domésticos. En Robótica de campo y de servicio (págs. 395–408). Springer, Cham. "Reconocimiento de la actividad humana para robots domésticos"
  41. 1 2 Qiao, Tanqiu; Men, Qianhui; Li, Frederick WB; Kubotani, Yoshiki; Morishima, Shigeo; Shum, Hubert PH (2022). Reconocimiento de la interacción humano-objeto multipersona en vídeos mediante características geométricas . Lecture Notes in Computer Science. Vol. 13664. Springer. pp. 474–491 . arXiv : 2207.09425 . doi : 10.1007/978-3-031-19772-7_28 . ISBN   978-3-031-19772-7.
  42. Huang, Ying; Shum, Hubert PH; Ho, Edmond SL; Aslam, Nauman (2020). "Estimación de pose de alta velocidad para múltiples personas con transferencia de características profundas" . Computer Vision and Image Understanding . 197–198 103010. Elsevier. doi : 10.1016/j.cviu.2020.103010 . ISSN 1077-3142 . S2CID 219905793 .  
  43. Men, Qianhui; Ho, Edmond SL; Shum, Hubert PH; Leung, Howard (2023). "Aprendizaje contrastivo focalizado invariante a la vista para el reconocimiento de acciones basado en esqueletos autosupervisado". Neurocomputing . 537. Elsevier: 198–209 . arXiv : 2304.00858 . doi : 10.1016/j.neucom.2023.03.070 . ISSN 0925-2312 . 
  44. Lu, Zhengzhi; Wang, He; Chang, Ziyi; Yang, Guoan; Shum, Hubert PH (2023). Ataque adversario duro sin caja en el reconocimiento de acciones humanas basado en esqueletos con gradiente informado por movimiento de esqueletos . IEEE/CVF. arXiv : 2308.05681 .
  45. Bux, Allah; Angelov, Plamen; Habib, Zulfiqar (2017). "Una revisión exhaustiva sobre enfoques de representación de acciones basados ​​en el aprendizaje y la creación manual para el reconocimiento de la actividad humana" . Applied Sciences . 7 (1): 110. doi : 10.3390/app7010110 .
  46. Aggarwal, JK; Ryoo, MS (2011-04-29). "Análisis de la actividad humana: una revisión" . ACM Computing Surveys . 43 (3): 16:1–16:43. doi : 10.1145/1922649.1922653 . ISSN 0360-0300 . S2CID 5388357 .  
  47. Altın, Mahsun; Gürsoy, Furkan; Xu, Lina (2021). "Estructura jerárquica generada por máquina de las actividades humanas para revelar cómo piensan las máquinas" . IEEE Access . 9 : 18307–18317 . arXiv : 2101.07855 . Bibcode : 2021IEEEA ...918307A . doi : 10.1109/ACCESS.2021.3053084 . ISSN 2169-3536 . 
  48. Wang, Le; Duan, Xuhuan; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (2018-05-22). "Segment-Tube: Localización de acciones espaciotemporales en vídeos sin recortar con segmentación por fotograma" (PDF) . Sensors . 18 (5): 1657. Bibcode : 2018Senso..18.1657W . doi : 10.3390/s18051657 . ISSN 1424-8220 . PMC 5982167. PMID 29789447 .   .
  49. Zhang, Xiatian; Moubayed, Noura Al; Shum, Hubert PH (2022). "Hacia la anticipación del flujo de trabajo quirúrgico basada en el aprendizaje de representaciones gráficas". 2022 IEEE-EMBS International Conference on Biomedical and Health Informatics (BHI) . IEEE. pp. 01–04 . arXiv : 2208.03824 . doi : 10.1109/BHI56158.2022.9926801 . ISBN  978-1-6654-8791-7.
  50. Jie Yin, Xiaoyong Chai y Qiang Yang, « Reconocimiento de objetivos de alto nivel en una red LAN inalámbrica ». En Actas de la Decimonovena Conferencia Nacional sobre Inteligencia Artificial (AAAI-04), San José, California, EE. UU., julio de 2004. Páginas 578-584
  51. Xiaoyong Chai y Qiang Yang, " Reconocimiento de múltiples objetivos a partir de señales de bajo nivel ". Actas de la Vigésima Conferencia Nacional sobre Inteligencia Artificial (AAAI 2005), Pittsburgh, PA, EE. UU., julio de 2005. Páginas 3-8.
  52. Derek Hao Hu, Qiang Yang. " CIGAR: Reconocimiento simultáneo e intercalado de objetivos y actividades ", de próxima publicación en AAAI 2008.
  53. Jie Yin, Dou Shen, Qiang Yang y Ze-nian Li " Reconocimiento de actividad mediante segmentación basada en objetivos ". Actas de la Vigésima Conferencia Nacional sobre Inteligencia Artificial (AAAI 2005), Pittsburgh, PA, EE. UU., julio de 2005. Páginas 28-33.
  54. D. Zhang, J. Ma, Q. Chen y LM Ni, « Un sistema basado en RF para el seguimiento de objetos sin transceptor» , Actas de la Conferencia sobre Computación y Comunicaciones Ubicuas. White Plains, EE. UU., 2007: 135-144.
  55. Q. Pu, S. Gupta, S. Gollakota y S. Patel, “ Reconocimiento de gestos en todo el hogar mediante señales inalámbricas ”, Actas de la 19.ª Conferencia Internacional Anual sobre Computación Móvil y Redes, Nueva York, EE. UU., 2013: 27–38.
  56. D. Wu, D. Zhang, C. Xu, Y. Wang y H. Wang." Wider: Estimación de la dirección de la marcha mediante señales inalámbricas ", Actas de la Conferencia Internacional Conjunta ACM de 2016 sobre Computación Pervasiva y Ubicua, Nueva York, EE. UU., 2016:351–362.
  57. 1 2 H. Wang, D. Zhang, J. Ma, Y. Wang, Y. Wang, D. Wu, T. Gu y B. Xie, " Detección de la respiración humana con dispositivos wifi comerciales: ¿Importan la ubicación del usuario y la orientación corporal? ", Actas de la Conferencia Internacional Conjunta ACM de 2016 sobre Computación Pervasiva y Ubicua, Nueva York, EE. UU., 2016:25–36.
  58. "UCF101 – Conjunto de datos de reconocimiento de acciones" . 2021. Archivado del original el 23 de enero de 2020.
  59. "Papers with Code – HMDB51 Dataset" . paperswithcode.com . Consultado el 23 de agosto de 2021 .
  60. Kay, Will; Carreira, Joao; Simonyan, Karen; Zhang, Brian; Hillier, Chloe; Vijayanarasimhan, Sudheendra; Viola, Fabio; Green, Tim; Back, Trevor; Natsev, Paul; Suleyman, Mustafa (2017-05-19). "The Kinetics Human Action Video Dataset". arXiv : 1705.06950 [ cs.CV ].
  61. Pollack, ME y otros, LEB 2003. " Autominder: un sistema ortopédico cognitivo inteligente para personas con deterioro de la memoria . Archivado el 10 de agosto de 2017 en Wayback Machine ". Robotics and Autonomous Systems 44(3–4):273–282.
  62. Gao, Lianli, et al. " Un sistema de etiquetado semántico y reconocimiento de actividad basado en la web para datos de acelerometría de especies "." Informática Ecológica 13 (2013): 47–56.
  63. Nguyen, Tuan Anh y Marco Aiello. " Edificios energéticamente inteligentes basados ​​en la actividad del usuario: un estudio ". Energía y edificios 56 (2013): 244–257.