La captura de movimiento sin marcadores ( MMC ) es una técnica que se utiliza para registrar y analizar el movimiento humano sin colocar marcadores físicos ni hardware en el cuerpo del sujeto. [ 1 ] A diferencia de los sistemas optoelectrónicos tradicionales que rastrean marcadores retroreflectantes o activos , los enfoques sin marcadores se basan en datos de vídeo capturados por una o más cámaras y en software , generalmente basado en aprendizaje profundo , para identificar y rastrear puntos anatómicos clave del movimiento humano. [ 2 ]
El campo se ha desarrollado rápidamente desde principios de la década de 2000, impulsado por los avances en visión artificial y la disponibilidad de varios conjuntos de datos de entrenamiento . [ 3 ] Estos sistemas pueden estimar la postura corporal completa en dos o tres dimensiones, en tiempo real, a partir de una o varias cámaras, según la precisión requerida. Esta flexibilidad ha permitido su implementación en medicina clínica , [ 4 ] [ 5 ] deporte , [ 6 ] [ 7 ] entretenimiento [ 8 ] y robótica . [ 9 ]
Historia
El primer estudio de MMC se publicó en 1985, [ 10 ] que fue el primer enfoque para recuperar las estructuras corporales 3D de una persona a partir de una sola vista . En 1996, varios estudios se centraron en la extracción de partes específicas del cuerpo humano, como las extremidades, detectadas con tres cámaras sincronizadas mediante la correspondencia de primitivas geométricas con contornos de múltiples vistas, [ 11 ] o el seguimiento de la cabeza y la mano utilizando cámaras estéreo y modelado de blob gaussiano 2D. [ 3 ] [ 12 ]
Para el año 2000, la detección de puntos clave mediante cuadros delimitadores permitió la extrapolación de un esqueleto de 13 articulaciones. [ 13 ] En 2004, se obtuvo un esqueleto de 16 articulaciones aplicando cinemática inversa . [ 14 ] En 2008, el procesamiento de datos incorporó representaciones de vóxeles volumétricos para el seguimiento multivista, reconstruyendo la envoltura visual del cuerpo con manchas gaussianas . [ 3 ] [ 15 ]
Transición al aprendizaje profundo
En 2011, Kinect de Microsoft utilizó bosques de decisión aleatorios entrenados en imágenes de profundidad sintéticas para estimar posiciones articulares 3D en tiempo real , convirtiéndose en uno de los ejemplos más exitosos de aprendizaje automático pre-aprendizaje profundo en el seguimiento de movimiento [ 8 ] .

Desde 2013, el aprendizaje profundo se convirtió en el paradigma dominante para la captura de movimiento sin marcadores. DeepPose fue uno de los primeros en demostrar el potencial de este cambio, utilizando una cascada de redes convolucionales con activaciones de unidad lineal rectificada (ReLU) para refinar iterativamente las predicciones de articulaciones en múltiples etapas. [ 3 ] El enfoque logró una precisión y velocidad que superaron los métodos anteriores, lo que contribuyó a la gran adopción del aprendizaje profundo en la estimación de pose. [ 16 ]
Partiendo de esta base, en los años siguientes se lanzaron varios marcos de código abierto. Openpose, presentado en 2017, fue uno de los primeros sistemas en lograr la estimación de la pose 2D de múltiples personas en tiempo real. [ 17 ] Admite la detección de hasta 135 puntos de referencia por individuo, cubriendo todo el cuerpo, incluyendo manos, pies y rostro. [ 18 ]
En 2020, grandes empresas tecnológicas entraron en el campo con sus propias contribuciones. Por ejemplo, Google lanzó el marco MediaPipe , diseñado específicamente para ejecutarse en tiempo real directamente en dispositivos periféricos como los teléfonos inteligentes . [ 19 ]
Principios de funcionamiento
Una vez que se ha entrenado un modelo, la extracción de puntos clave anatómicos de imágenes o vídeos sin procesar implica una secuencia de pasos de procesamiento:
- Adquisición de datos: Las grabaciones se realizan utilizando una de dos grandes categorías de hardware:
- Las cámaras RGB estándar , que capturan información de color pero no contienen datos de profundidad inherentes,
- Sensores con percepción de profundidad: incluyendo cámaras RGB-D , que capturan información visual y de profundidad, así como dispositivos de tiempo de vuelo (ToF) y escáneres LiDAR , que generan un mapa de profundidad físico [ 8 ] .
- Detección y aislamiento: Dependiendo de la arquitectura, el sistema procesa la escena utilizando uno de dos métodos principales: [ 20 ] [ 21 ]
- Métodos descendentes : detectan a uno o más individuos en el fotograma, normalmente mediante un detector de cuadros delimitadores , y luego estiman la postura de cada persona.
- De abajo hacia arriba: detecta todos los puntos clave anatómicos presentes en la imagen sin ninguna etapa previa de detección de personas, procediendo directamente al mapeo anatómico.
- Mapeo anatómico: El modelo analiza al sujeto e identifica las ubicaciones de puntos clave específicos del cuerpo mediante la extracción de características . [ 3 ]

Proceso de mapeo anatómico - Reconstrucción esquelética: En algunos algoritmos, en lugar de devolver un conjunto de coordenadas de puntos clave independientes, estos sistemas conectan los puntos identificados según un modelo corporal predefinido, produciendo una representación esquelética que hace explícita la postura. [ 3 ]

Tecnología y metodología
La base de la mayoría de los sistemas sin marcadores es un modelo de aprendizaje profundo , normalmente una red neuronal convolucional (CNN) o un transformador de visión , entrenado para localizar puntos clave anatómicos directamente en el espacio de la imagen 2D. Cuando se necesita información tridimensional, se aplica una etapa adicional conocida como "elevación 3D".
Este enfoque depende de la configuración de la cámara disponible:
- En los sistemas monoculares , que operan desde un único punto de vista, deben depender de las redes entrenadas para inferirlo a partir de señales visuales, explotando conocimientos previos sobre las proporciones del cuerpo humano y las posturas típicas. [ 22 ]
- En configuraciones multicámara, es posible recuperar coordenadas 3D a través de geometría epipolar y triangulación , utilizando las relaciones geométricas entre puntos de vista calibrados. [ 23 ]
Conjunto de datos
Los modelos de aprendizaje profundo para la captura de movimiento sin marcadores se entrenan y evalúan utilizando conjuntos de datos anotados que combinan secuencias de vídeo con datos de pose precisos . Estos datos de referencia se obtienen generalmente de sistemas de captura de movimiento basados en marcadores , que siguen siendo el estándar de referencia en el campo. [ 3 ]

Una estrategia alternativa, adoptada por varios conjuntos de datos a gran escala, consiste en agregar y unificar registros existentes basados en marcadores recopilados en múltiples estudios, produciendo corpus de entrenamiento más amplios sin necesidad de nuevas sesiones de captura dedicadas. [ 3 ]
Los primeros conjuntos de datos de referencia, como Human3.6M, se grabaron en un estudio controlado con un pequeño número de actores y cámaras sincronizadas, junto con datos de referencia basados en marcadores. [ 24 ] Conjuntos de datos posteriores, como MPI-INF-3DHP, introdujeron capturas multivista en escenas con pantalla verde, interiores y exteriores. [ 25 ] 3D Poses in the Wild (3DPW) grabó actividades cotidianas al aire libre utilizando una cámara de mano combinada con sensores inerciales corporales para obtener datos de referencia. [ 26 ]
Para la estimación de pose 2D, el conjunto de datos COCO proporciona anotaciones de puntos clave en una gran cantidad de imágenes naturales, y se usa comúnmente para entrenar o evaluar la etapa 2D de pipelines como OpenPose. [ 27 ]
AMASS adopta un enfoque diferente, unificando muchos archivos existentes basados en marcadores bajo el modelo corporal SMPL, [ 28 ] produciendo un gran conjunto de datos de movimiento para entrenamiento y generación de datos sintéticos . [ 29 ] Además, conjuntos de datos totalmente sin marcadores, como FreeMan, han buscado mejorar la generalización en el mundo real, utilizando grabaciones de cámaras de consumo con múltiples vistas en diversos sujetos y entornos sin hardware especializado. [ 30 ]
También existen conjuntos de datos específicos de dominio para aplicaciones clínicas. Por ejemplo, se combinan secuencias de movimiento 3D con puntuaciones de gravedad de la enfermedad (por ejemplo, calificaciones basadas en UPDRS ) para respaldar la evaluación de la calidad del movimiento en lugar de la estimación general de la postura. [ 31 ]
Sesgo demográfico y equidad representativa
Los sistemas de captura de movimiento sin marcadores pueden heredar los sesgos presentes en el conjunto de datos utilizado para entrenar sus modelos. El problema ha surgido en conjuntos de datos de referencia ampliamente utilizados. Se ha descubierto que COCO subrepresenta a mujeres, adultos mayores y personas con tonos de piel más oscuros. [ 32 ] Este desequilibrio puede producir caídas medibles en la precisión de detección para esos grupos, lo cual es preocupante dondequiera que la tecnología se implemente en contextos sensibles. [ 33 ] [ 34 ]
Como resultado, el rendimiento del sistema se informa cada vez más en subgrupos demográficos en lugar de como una única cifra de precisión agregada. Las tarjetas de modelos [ 35 ] y las hojas de datos de conjuntos de datos son dos formatos desarrollados con este objetivo en mente, y su adopción ha ido creciendo gradualmente.
Sistemas disponibles
Los algoritmos pueden variar en cuanto al número de cámaras que requieren y si están diseñados para procesar un solo sujeto o a varias personas simultáneamente. Además, existen implementaciones tanto en forma de marcos de investigación de código abierto como en sistemas comerciales.
marcos de código abierto
Cada vez son más los marcos de código abierto para la captura de movimiento sin marcadores que se han puesto a disposición del público, normalmente a través de plataformas para compartir código como Github .
Sistemas comerciales
Más allá de los marcos de investigación de código abierto, la industria ofrece una gama de sistemas comerciales diseñados para entornos donde la alta fidelidad cinemática es fundamental. Estas soluciones suelen integrar hardware y software propietarios en configuraciones multicámara precalibradas. Entre las soluciones comerciales de captura de movimiento sin marcadores se incluyen sistemas como Vicon, OptiTrack, Qualisys, The Captury y Theia.
Aplicaciones
La captura de movimiento sin marcadores se ha adoptado en diversos campos, debido principalmente a su capacidad para funcionar sin las condiciones de laboratorio controladas que suelen requerir los sistemas basados en marcadores.
Clínico

En contextos clínicos, se han explorado sistemas sin marcadores para diversas aplicaciones, particularmente en el campo de la rehabilitación . La enfermedad de Parkinson ha sido uno de los grupos de pacientes más estudiados para la evaluación sin marcadores, y la mayoría de los estudios se han centrado en parámetros de la marcha como la longitud de la zancada, la cadencia y el balanceo de los brazos. [ 42 ]
Dado que no se requieren marcadores ni dispositivos portátiles , las evaluaciones pueden realizarse en salas clínicas estándar o en el domicilio del paciente, lo que reduce la brecha entre las mediciones controladas de laboratorio y la función en el mundo real. [ 43 ] Sin embargo, su adopción clínica sigue siendo cautelosa, ya que los estudios de validación han demostrado que la precisión para ciertas rotaciones articulares, particularmente en el tronco y la cadera, aún puede ser inferior a la que proporcionan los sistemas basados en marcadores. [ 44 ] [ 45 ]
Deporte
Los sistemas sin marcadores permiten realizar análisis biomecánicos en el campo, en la cancha o en la piscina, en lugar de solo en estudios de captura de movimiento dedicados, lo que hace que el análisis del movimiento sea más accesible para entrenadores y científicos del deporte sin interferir en el movimiento natural del atleta . [ 46 ] La capacidad de realizar capturas no intrusivas en competición de atletas de clase mundial, antes imposible con soluciones basadas en marcadores, abrió un nuevo campo de análisis, siendo el tenis citado como un deporte donde la infraestructura de transmisión existente podría respaldar el análisis con la fidelidad adecuada. [ 47 ]
Entretenimiento
La industria del entretenimiento fue una de las primeras en adoptar la captura de movimiento y las técnicas sin marcadores. De hecho, cada vez complementa más los procesos basados en marcadores en la producción de cine , televisión y videojuegos .
En el ámbito de los videojuegos para el consumidor, Microsoft Kinect representó una de las primeras implementaciones a gran escala del seguimiento corporal sin marcadores. Lanzado en noviembre de 2010 como accesorio para Xbox 360 , utilizaba una combinación de una cámara RGB y un sensor de profundidad infrarrojo para rastrear el movimiento de todo el cuerpo sin necesidad de un controlador físico, lo que permitía la interacción basada en gestos en entornos domésticos. [ 48 ] Vendió más de ocho millones de unidades en sus primeros sesenta días, estableciendo un récord mundial Guinness como el dispositivo electrónico de consumo de venta más rápida de la época. [ 49 ]
Robótica e interacción humano-robot
En la investigación robótica , la captura de movimiento sin marcadores se utiliza para estudiar cómo se mueven los humanos durante tareas colaborativas, proporcionando los datos cinemáticos necesarios para programar robots que puedan anticipar y responder a las acciones humanas de forma segura. [ 50 ] También aparece en los sistemas de aprendizaje por imitación, donde un robot aprende una habilidad motora observando una demostración humana grabada en vídeo estándar en lugar de mediante teleoperación directa . [ 51 ]
Limitaciones y ética
Desafíos técnicos
A pesar de sus ventajas, la captura de movimiento sin marcadores se enfrenta a una serie de limitaciones técnicas que restringen su precisión y fiabilidad en condiciones reales:
- La oclusión es una de las fuentes de error más comunes. [ 52 ] Cuando una articulación desaparece de la vista, el sistema no tiene información visual directa con la que trabajar y debe estimar su posición a partir del contexto. [ 53 ]
- Los algoritmos entrenados en entornos interiores tienden a degradarse cuando se implementan en entornos con sombras fuertes, luz solar directa, condiciones de poca luz o iluminación que cambia rápidamente. [ 54 ] [ 55 ] Las regiones sobreexpuestas o subexpuestas pueden hacer que la silueta del sujeto se fusione con el fondo, lo que reduce la precisión del paso de aislamiento del sujeto del que depende el resto del proceso. [ 56 ]
- El desenfoque por movimiento es una fuente adicional de error, especialmente durante movimientos rápidos. Esta limitación está directamente relacionada con la velocidad de adquisición de fotogramas de la cámara en relación con la velocidad del movimiento. Si la velocidad de fotogramas es insuficiente, los puntos de referencia articulares se difuminan entre los fotogramas y su ubicación precisa se vuelve ambigua. [ 57 ]
- El coste computacional también supone una limitación. Para realizar inferencias precisas en tiempo real, especialmente en múltiples vistas de cámara, normalmente se requieren GPU modernas dedicadas , y las configuraciones multivista suelen necesitar más de una. Esto dificulta la implementación en entornos donde no se dispone de ese tipo de hardware, como en exteriores o en dispositivos de consumo. [ 58 ]
Consideraciones sociales y éticas
La captura de movimiento sin marcadores plantea problemas de privacidad distintos a los asociados con los sistemas basados en marcadores. Dado que no requiere cooperación ni instrumentación del sujeto, en principio puede implementarse en espacios públicos, entornos comerciales o clínicos sin el conocimiento ni el consentimiento del individuo. La capacidad de extraer información biométrica y de comportamiento de grabaciones de vídeo estándar la sitúa en una categoría diferente a la de los sistemas portátiles , donde la presencia de un sensor es visible para el sujeto. [ 59 ]
Véase también
Referencias
- ↑ Colyer, Steffi L.; Evans, Murray; Cosker, Darren P.; Salo, Aki IT (diciembre de 2018). "Una revisión de la evolución del análisis de movimiento basado en la visión y la integración de métodos avanzados de visión por computadora para desarrollar un sistema sin marcadores" . Sports Medicine - Open . 4 (1) 24. doi : 10.1186/s40798-018-0139-y . ISSN 2199-1170 . PMC 5986692. PMID 29869300 .
- ↑ Mündermann, Lars; Corazza, Stefano; Andriacchi, Thomas P (diciembre de 2006). "La evolución de los métodos para la captura del movimiento humano que conducen a la captura de movimiento sin marcadores para aplicaciones biomecánicas" . Journal of NeuroEngineering and Rehabilitation . 3 (1) 6. doi : 10.1186/1743-0003-3-6 . ISSN 1743-0003 . PMC 1513229. PMID 16539701 .
- 1 2 3 4 5 6 7 8 Nagorny, Pierre; Kevelham, Bart; Chagué, Sylvain; Charbonnier, Caecilia (2025-09-29). "Una revisión exhaustiva de la captura de movimiento sin marcadores multivista multipersona en tiempo real" . ACM Computing Surveys . 58 (3): 75:1–75:34. doi : 10.1145/3757733 . ISSN 0360-0300 .
- ↑ Kidziński, Łukasz; Yang, Bryan; Hicks, Jennifer L.; Rajagopal, Apoorva; Delp, Scott L.; Schwartz, Michael H. (2020-08-13). "Las redes neuronales profundas permiten el análisis cuantitativo del movimiento utilizando vídeos de una sola cámara" . Nature Communications . 11 (1): 4054. Bibcode : 2020NatCo..11.4054K . doi : 10.1038/s41467-020-17807- z . ISSN 2041-1723 . PMC 7426855. PMID 32792511 .
- ↑ Scott, Bradley; Seyres, Martin; Philp, Fraser; Chadwick, Edward K.; Blana, Dimitra (2022-05-26). "Aplicaciones sanitarias de la captura de movimiento sin marcadores con una sola cámara: una revisión exploratoria" . PeerJ . 10 e13517. Bibcode : 2022PeerJ..1013517S . doi : 10.7717/peerj.13517 . ISSN 2167-8359 . PMC 9148557. PMID 35642200 .
- ↑ Thomas, Graham; Gade, Rikke; Moeslund, Thomas B.; Carr, Peter; Hilton, Adrian (junio de 2017). "Visión por computadora para deportes: aplicaciones actuales y temas de investigación" . Computer Vision and Image Understanding . 159 : 3–18 . doi : 10.1016/j.cviu.2017.04.011 .
- ↑ Rematas, Konstantinos; Kemelmacher-Shlizerman, Ira; Curless, Brian; Seitz, Steve (junio de 2018). "Fútbol en tu mesa". Conferencia IEEE/CVF de 2018 sobre visión por computadora y reconocimiento de patrones . IEEE. págs. 4738–4747 . Bibcode : 2018cvpr.conf..498R . doi : 10.1109/CVPR.2018.00498 . ISBN 978-1-5386-6420-9.
- 1 2 3 Shotton, Jamie; Fitzgibbon, Andrew; Cook, Mat; Sharp, Toby; Finocchio, Mark; Moore, Richard; Kipman, Alex; Blake, Andrew (junio de 2011). "Reconocimiento de la postura humana en tiempo real en partes a partir de imágenes de profundidad individuales". CVPR 2011. IEEE. págs. 1297–1304 . Bibcode : 2011cvpr.conf....9S . doi : 10.1109/CVPR.2011.5995316 . ISBN 978-1-4577-0394-2.
- ↑ Koppula, Hema Swetha; Gupta, Rudhir; Saxena, Ashutosh (julio de 2013). "Aprendizaje de actividades humanas y posibilidades de interacción con objetos a partir de vídeos RGB-D" . The International Journal of Robotics Research . 32 (8): 951– 970. Bibcode : 2013IJRR...32..951K . doi : 10.1177/0278364913478446 . ISSN 0278-3649 .
- ↑ Lee, Hsi-Jian; Chen, Zen (1985-05-01). "Determinación de posturas del cuerpo humano en 3D a partir de una sola vista" . Computer Vision, Graphics, and Image Processing . 30 (2): 148– 168. doi : 10.1016/0734-189X(85)90094-5 . ISSN 0734-189X .
- ↑ Gavrila, DM; Davis, LS (1996). "Seguimiento de humanos en acción basado en modelos 3D: Un enfoque multivista". Actas de la Conferencia de la Sociedad de Computación del IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . IEEE. pp. 73–80 . Bibcode : 1996cvpr.conf...13G . doi : 10.1109/CVPR.1996.517056 . ISBN 978-0-8186-7259-0.
- ↑ Azarbayejani, A.; Pentland, A. (1996). "Seguimiento estéreo de personas con autocalibración en tiempo real mediante estimación de forma 3D a partir de características de blob". Actas de la 13.ª Conferencia Internacional sobre Reconocimiento de Patrones . Vol. 3. IEEE. págs. 627–632 . Bibcode : 1996icpr....3..123A . doi : 10.1109/ICPR.1996.547022 . ISBN 978-0-8186-7282-8.
- ↑ Yonemoto, S.; Arita, D.; Taniguchi, R.-I. (2000). "Control de figura humana guiado visualmente en tiempo real mediante síntesis de movimiento basada en IK". Actas del Quinto Taller IEEE sobre Aplicaciones de Visión por Computadora . IEEE Comput. Soc. pp. 194–200 . Bibcode : 2000wacv.conf...29Y . doi : 10.1109/WACV.2000.895422 . ISBN 978-0-7695-0813-9.
- ↑ Date, N.; Yoshimoto, H.; Arita, D.; Taniguchi, R. (2004). "Detección de movimiento humano en tiempo real basada en cinemática inversa basada en visión para aplicaciones interactivas". Actas de la 17.ª Conferencia Internacional sobre Reconocimiento de Patrones, 2004. ICPR 2004. Vol. 3. IEEE. pp. 318–321 . Bibcode : 2004icpr....3...96D . doi : 10.1109/ICPR.2004.1334531 . ISBN 978-0-7695-2128-2.
- ↑ Caillette, Fabrice; Galata, Aphrodite; Howard, Toby (febrero de 2008). "Seguimiento en tiempo real del cuerpo humano en 3D mediante modelos de comportamiento aprendidos" . Computer Vision and Image Understanding . 109 (2): 112– 125. doi : 10.1016/j.cviu.2007.05.005 .
- ↑ Toshev, Alexander; Szegedy, Christian (junio de 2014). "DeepPose: Estimación de la postura humana mediante redes neuronales profundas". Conferencia IEEE de 2014 sobre visión por computadora y reconocimiento de patrones . págs. 1653–1660 . arXiv : 1312.4659 . Bibcode : 2014cvpr.conf..217T . doi : 10.1109/CVPR.2014.214 . ISBN 978-1-4799-5118-5.
- 1 2 Cao, Zhe; Simon, Tomas; Wei, Shih-En; Sheikh, Yaser (julio de 2017). "Estimación de pose 2D en tiempo real para múltiples personas mediante campos de afinidad de partes". Conferencia IEEE de 2017 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 1302–1310 . Bibcode : 2017cvpr.confQ.143C . doi : 10.1109/CVPR.2017.143 . ISBN 978-1-5386-0457-1.
- ↑ Vina, Abirami (17 de junio de 2025). "¿Qué es OpenPose? Explorando un hito en la estimación de pose" . www.ultralytics.com . Recuperado el 30 de junio de 2026 .
- 1 2 Bazarevsky, Valentín; Grishchenko, Iván; Raveendran, Karthik; Zhu, Tyler; Zhang, ventilador; Grundmann, Matías (17 de junio de 2020). "BlazePose: seguimiento de posturas corporales en tiempo real en el dispositivo". arXiv : 2006.10204 [ cs.CV ].
- ↑ Poppe, Ronald (octubre de 2007). "Análisis del movimiento humano basado en la visión: una visión general" . Computer Vision and Image Understanding . 108 ( 1–2 ): 4–18 . Bibcode : 2007CVIU..108....4P . doi : 10.1016/j.cviu.2006.10.016 .
- ↑ Chen, Yucheng; Tian, Yingli; He, Mingyi (2020-03-01). "Estimación de la pose humana monocular: una revisión de los métodos basados en aprendizaje profundo" . Computer Vision and Image Understanding . 192 102897. arXiv : 2006.01423 . doi : 10.1016/j.cviu.2019.102897 . ISSN 1077-3142 .
- ↑ Kanazawa, Angjoo; Black, Michael J.; Jacobs, David W.; Malik, Jitendra (2018-06-23). "Recuperación integral de la forma y postura humanas". arXiv : 1712.06584 [ cs.CV ].
- ↑ Hartley, Richard; Zisserman, Andrew (2003). Geometría de múltiples vistas en visión por computadora (2.ª ed.). Cambridge: Cambridge University Press. ISBN 978-0-511-18618-9.
- 1 2 Ionescu, Catalin; Papava, Dragos; Olaru, Vlad; Sminchisescu, Cristian (julio de 2014). "Human3.6M: conjuntos de datos a gran escala y métodos predictivos para la detección humana en 3D en entornos naturales". IEEE Transactions on Pattern Analysis and Machine Intelligence . 36 (7): 1325– 1339. Bibcode : 2014ITPAM..36.1325I . doi : 10.1109/TPAMI.2013.248 . ISSN 0162-8828 . PMID 26353306 .
- 1 2 Mehta, Dushyant (4 de octubre de 2017). "Estimación monocular de la pose humana en 3D en entornos reales mediante supervisión de CNN mejorada" . mpi-inf.mpg . Recuperado el 1 de julio de 2026 .
- 1 2 von Marcard, Timo; Henschel, Roberto; Black, Michael J.; Rosenhahn, Bodo; Pons-Moll, Gerard (2018). "Recuperación precisa de la pose humana 3D en entornos reales mediante IMU y una cámara en movimiento" . En Ferrari, Vittorio; Hebert, Martial; Sminchisescu, Cristian; Weiss, Yair (eds.). Visión por computadora – ECCV 2018. Lecture Notes in Computer Science. Vol. 11214. Cham: Springer International Publishing. pp. 614–631 . doi : 10.1007/978-3-030-01249-6_37 . ISBN 978-3-030-01248-9. Consultado el 1 de julio de 2026 .
- 1 2 Lin, Tsung-Yi; Maire, Michael; Belongie, Serge; Bourdev, Lubomir; Girshick, Ross; Hays, James; Perona, Pietro; Ramanan, Deva; Zitnick, C. Lawrence (2015-02-21). "Microsoft COCO: Objetos comunes en contexto". arXiv : 1405.0312 [ cs.CV ].
- ↑ Loper, Matthew; Mahmood, Naureen; Romero, Javier; Pons-Moll, Gerard; Black, Michael J. (2015-11-04). "SMPL: un modelo lineal multipersona con piel" . ACM Transactions on Graphics . 34 (6): 1– 16. doi : 10.1145/2816795.2818013 . ISSN 0730-0301 .
- 12 Mahmood , Naureen; Ghorbani, Nima; Troje, Nikolaus F.; Pons-Moll, Gerard; Negro, Michael (octubre de 2019). "AMASS: Archivo de captura de movimiento como formas de superficie". Conferencia internacional IEEE/CVF 2019 sobre visión por computadora (ICCV) . IEEE. págs. 5441– 5450. arXiv : 1904.03278 . Código Bib : 2019iccv.conf..554M . doi : 10.1109/ICCV.2019.00554 . ISBN 978-1-7281-4803-8.
- 1 2 Wang, Jiong; Yang, Fengyu; Gou, Wenbo; Li, Bingliang; Yan, Danqi; Zeng, enfermo; Gao, Yijun; Wang, Junle; Jing, Yanqing (3 de abril de 2024). "FreeMan: hacia una evaluación comparativa de la estimación de la pose humana en 3D en condiciones del mundo real". arXiv : 2309.05073 [ cs.CV ].
- ↑ Adeli, Vida; Klabucar, Iván; Rajabi, Javad; Filtjens, Benjamín; Mehraban, Soroush; Wang, Diwei; Seo, Hyewon; Hoang, Trung-Hieu; Do, Minh N. (5 de octubre de 2025), CARE-PD: un conjunto de datos clínicos anonimizados en varios sitios para la evaluación de la marcha de la enfermedad de Parkinson , arXiv : 2510.04312
- ↑ Xiang, Alice (17 de abril de 2023). "Exponiendo las limitaciones en las evaluaciones de equidad: estimación de la postura humana" . ai.sony . Recuperado el 30 de junio de 2026 .
- ↑ Wilson, Benjamin; Hoffman, Judy; Morgenstern, Jamie (2019-02-21). "Inequidad predictiva en la detección de objetos". arXiv : 1902.11097 [ cs.CV ].
- ↑ Tan, Sarah; Caruana, Rich; Hooker, Giles; Lou, Yin (27 de diciembre de 2018). «Destilar y comparar: Auditoría de modelos de caja negra mediante destilación transparente de modelos» . Actas de la Conferencia AAAI/ACM de 2018 sobre IA, ética y sociedad . ACM. págs. 303–310 . doi : 10.1145/3278721.3278725 . ISBN 978-1-4503-6012-8.
- ↑ Mitchell, Margaret; Wu, Simone; Zaldivar, Andrew; Barnes, Parker; Vasserman, Lucy; Hutchinson, Ben; Spitzer, Elena; Raji, Inioluwa Deborah; Gebru, Timnit (29 de enero de 2019). «Model Cards for Model Reporting». Actas de la Conferencia sobre Equidad, Responsabilidad y Transparencia . págs. 220–229 . arXiv : 1810.03993 . doi : 10.1145/3287560.3287596 . ISBN 978-1-4503-6125-5.
- ↑ Mehta, Dushyant; Sridhar, Srinath; Sotnychenko, Oleksandr; Rhodin, Helge; Shafiei, Mohammad; Seidel, Hans-Peter; Xu, Weipeng; Casas, Dan; Theobalt, Christian (2017-08-31). "VNect: Estimación de la pose humana en 3D en tiempo real con una sola cámara RGB". ACM Transactions on Graphics . 36 (4): 1– 14. arXiv : 1705.01583 . doi : 10.1145/3072959.3073596 . ISSN 0730-0301 .
- ↑ Mathis, Alexander; Mamidanna, Pranav; Cury, Kevin M.; Abe, Taiga; Murthy, Venkatesh N.; Mathis, Mackenzie Weygandt; Bethge, Matthias (septiembre de 2018). "DeepLabCut: estimación de pose sin marcadores de partes del cuerpo definidas por el usuario con aprendizaje profundo" . Nature Neuroscience . 21 (9): 1281– 1289. doi : 10.1038/s41593-018-0209-y . ISSN 1546-1726 . PMID 30127430 .
- ↑ Chen, Xin; Pang, Anqi; Yang, Wei; Ma, Yuexin; Xu, Lan; Yu, Jingyi (octubre de 2021). "SportsCap: captura monocular de movimiento humano 3D y comprensión detallada en vídeos deportivos complejos" . Revista Internacional de Visión por Computadora . 129 (10): 2846–2864 . doi : 10.1007/s11263-021-01486-4 . ISSN 0920-5691 .
- ^ Colmillo, Hao-Shu; Li, Jiefeng; Tang, Hongyang; Xu, Chao; Zhu, Haoyi; Xiu, Yuliang; Li, Yong-Lu; Lu, Cewu (7 de noviembre de 2022). "AlphaPose: estimación y seguimiento de posturas regionales de varias personas de cuerpo entero en tiempo real". arXiv : 2211.03375 [ cs.CV ].
- ↑ Maji, Debapriya; Nagori, Soyeb; Mathew, Manu; Poddar, Deepak (2022-04-14). "YOLO-Pose: Mejora de YOLO para la estimación de pose de múltiples personas mediante la pérdida de similitud de puntos clave de objetos". arXiv : 2204.06806 [ cs.CV ].
- ↑ Uhlrich, Scott D.; Falisse, Antoine; Kidziński, Łukasz; Muccini, Julie; Ko, Michael; Chaudhari, Akshay S.; Hicks, Jennifer L.; Delp, Scott L. (2023-10-19). "OpenCap: Dinámica del movimiento humano a partir de vídeos de teléfonos inteligentes" . PLOS Computational Biology . 19 (10) e1011462. Bibcode : 2023PLSCB..19E1462U . doi : 10.1371/journal.pcbi.1011462 . ISSN 1553-7358 . PMC 10586693. PMID 37856442 .
- ↑ Lam, Winnie WT; Tang, Yuk Ming; Fong, Kenneth NK (2023-05-02). "Una revisión sistemática de las aplicaciones de la tecnología de captura de movimiento sin marcadores (MMC) para la medición clínica en rehabilitación" . Journal of NeuroEngineering and Rehabilitation . 20 (1) 57. doi : 10.1186/s12984-023-01186-9 . ISSN 1743-0003 . PMC 10155325. PMID 37131238 .
- ↑ Wade, Logan; Needham, Laurie; McGuigan, Polly; Bilzon, James (25 de febrero de 2022). "Aplicaciones y limitaciones de los métodos actuales de captura de movimiento sin marcadores para la biomecánica de la marcha clínica" . PeerJ . 10 e12995 . Bibcode : 2022PeerJ..1012995W . doi : 10.7717/peerj.12995 . ISSN 2167-8359 . PMC 8884063. PMID 35237469 .
- ↑ Scataglini, Sofia; Abts, Eveline; Van Bocxlaer, Cas; Van den Bussche, Maxime; Meletani, Sara; Truijen, Steven (2024-06-06). "Precisión, validez y fiabilidad de los sistemas de captura de movimiento 3D basados en cámaras sin marcadores frente a los sistemas de captura de movimiento 3D basados en marcadores en el análisis de la marcha: una revisión sistemática y un metaanálisis" . Sensors . 24 (11): 3686. Bibcode : 2024Senso..24.3686S . doi : 10.3390/s24113686 . ISSN 1424-8220 . PMC 11175331. PMID 38894476 .
- ↑ Varcin, Florent; Boocock, Mark G. (marzo de 2026). "La precisión, validez y fiabilidad de la captura de movimiento sin marcadores Theia3D para el estudio de la biomecánica del movimiento humano: una revisión sistemática" . Inteligencia Artificial en Medicina . 173 103332. doi : 10.1016/j.artmed.2025.103332 . PMID 41518893 .
- ↑ Adlou, Bahman; Wilburn, Christopher; Weimar, Wendi (2025-07-13). "Tecnologías de captura de movimiento para la mejora del rendimiento atlético y la evaluación del riesgo de lesiones: una revisión para organizaciones multideportivas" . Sensors . 25 (14): 4384. Bibcode : 2025Senso..25.4384A . doi : 10.3390/ s25144384 . ISSN 1424-8220 . PMC 12299843. PMID 40732512 .
- ↑ Boey, Desmond; Girard, Olivier; Lee, Marcus; Elliott, Bruce; Reid, Machar (19 de mayo de 2026). "Desbloqueando el potencial del análisis de movimiento sin marcadores basado en vídeo para estudiar el rendimiento deportivo de clase mundial". Journal of Sports Sciences . 44 (10): 1261– 1274. doi : 10.1080/02640414.2025.2576412 . ISSN 0264-0414 . PMID 41140067 .
- ↑ Shotton, Jamie; Fitzgibbon, Andrew; Cook, Mat; Sharp, Toby; Finocchio, Mark; Moore, Richard; Kipman, Alex; Blake, Andrew (junio de 2011). "Reconocimiento de la postura humana en tiempo real a partir de imágenes de profundidad individuales". CVPR 2011. IEEE. págs. 1297–1304 . Bibcode : 2011cvpr.conf....9S . doi : 10.1109/CVPR.2011.5995316 . ISBN 978-1-4577-0394-2.
- ↑ "Microsoft Kinect, el dispositivo de venta más rápida registrado"" . bbc.com . 10 de marzo de 2011 . Consultado el 1 de julio de 2026 .
- ↑ Martini, Enrico; Parekh, Harshil; Peng, Shaoting; Bombieri, Nicola; Figueroa, Nadia (agosto de 2024). "Un filtro robusto para el seguimiento de múltiples personas sin marcadores en escenarios de interacción humano-robot". 33.ª Conferencia Internacional IEEE de 2024 sobre Comunicación Interactiva entre Robots y Humanos (ROMAN) . págs. 424–429 . Bibcode : 2024roma.conf...62M . doi : 10.1109/RO-MAN60168.2024.10731365 . ISBN 979-8-3503-7502-2.
- ↑ Nogueira, Ana Filipa Rodrigues; Oliveira, Hélder P.; Teixeira, Luis F. (1 de marzo de 2025). "Estimación de la pose humana 3D de vistas múltiples sin marcadores: una encuesta" . Computación de Imagen y Visión . 155 105437.doi : 10.1016/ j.imavis.2025.105437 . ISSN 0262-8856 .
- ↑ Chen, Yucheng; Tian, Yingli; He, Mingyi (marzo de 2020). "Estimación de la pose humana monocular: una revisión de los métodos basados en aprendizaje profundo" . Computer Vision and Image Understanding . 192 102897. arXiv : 2006.01423 . doi : 10.1016/j.cviu.2019.102897 .
- ↑ Bogo, Federica; Kanazawa, Angjoo; Lassner, Christoph; Gehler, Peter; Romero, Javier; Black, Michael J. (2016-07-27). "Keep it SMPL: Estimación automática de la pose y forma humana en 3D a partir de una sola imagen". arXiv : 1607.08128 [ cs.CV ].
- ↑ Mehta, Dushyant; Rhodin, Helge; Casas, Dan; Fua, Pascal; Sotnychenko, Oleksandr; Xu, Weipeng; Theobalt, Christian (octubre de 2017). "Estimación monocular de la pose humana en 3D en entornos reales mediante supervisión de CNN mejorada". Conferencia Internacional de Visión 3D (3DV) de 2017. IEEE. págs. 506–516 . Bibcode : 2017dv...conf...64M . doi : 10.1109/3DV.2017.00064 . ISBN 978-1-5386-2610-8.
- ↑ von Marcard, Timo; Henschel, Roberto; Black, Michael J.; Rosenhahn, Bodo; Pons-Moll, Gerard (2018). "Recuperación precisa de la pose humana 3D en entornos reales mediante IMU y una cámara en movimiento" . En Ferrari, Vittorio; Hebert, Martial; Sminchisescu, Cristian; Weiss, Yair (eds.). Visión por computadora – ECCV 2018. Lecture Notes in Computer Science. Vol. 11214. Cham: Springer International Publishing. pp. 614–631 . doi : 10.1007/978-3-030-01249-6_37 . ISBN 978-3-030-01248-9. Consultado el 1 de julio de 2026 .
- ↑ Sigal, Leonid; Balan, Alexandru O.; Black, Michael J. (marzo de 2010). "HumanEva: Conjunto de datos de captura de movimiento y vídeo sincronizados y algoritmo de referencia para la evaluación del movimiento humano articulado" . International Journal of Computer Vision . 87 ( 1–2 ): 4–27 . Bibcode : 2010IJCV...87....4S . doi : 10.1007/s11263-009-0273-6 . ISSN 0920-5691 .
- ^ Seethapathi, Nidhi; Wang, Shaofei; Saluja, Rachit; Blohm, Gunnar; Kording, Konrad P. (24 de julio de 2019). "La ciencia del movimiento necesita diferentes algoritmos de seguimiento de pose". arXiv : 1907.10226 [ cs.CV ].
- ↑ Mehta, Dushyant; Sotnychenko, Oleksandr; Mueller, Franziska; Xu, Weipeng; Elgharib, Mohamed; Fua, Pascal; Seidel, Hans-Peter; Rhodin, Helge; Pons-Moll, Gerard; Theobalt, Christian (2020-08-31). "XNect: Captura de movimiento 3D multipersona en tiempo real con una sola cámara RGB". ACM Transactions on Graphics . 39 (4). arXiv : 1907.00837 . doi : 10.1145/3386569.3392410 . ISSN 0730-0301 .
- ↑ Xiang, Alice (2022). "Ser 'visto' vs. 'mal visto': tensiones entre privacidad y equidad en la visión por computadora". SSRN 4068921 .
Enlaces externos
- Tendencias para 2026: la captura de movimiento sin marcadores en el campo se convierte en el nuevo estándar en Move4D.
- ¿Qué es la captura de movimiento sin marcadores? en Vicon
- Captura de movimiento
- Animación por computadora
- Gráficos por computadora en 3D
- Dispositivos de entrada de computación