Articulo de referencia

Tubería de medios

{{Cite web |last=Hon Law |first=Wai |title=Release MediaPipe v0.10.26 · google-ai-edge/mediapipe |url=https://github.com/google-ai-edge/mediapipe/releases/tag/v0.10.26 |access-d...

MediaPipe es un marco de código abierto con muchas bibliotecas desarrolladas por Google para varias soluciones de inteligencia artificial y aprendizaje automático . Estas soluciones abarcan desde inteligencia artificial generativa , [ 2 ] [ 3 ] visión artificial en tiempo real , [ 4 ] [ 5 ] [ 6 ] procesamiento del lenguaje natural [ 7 ] y técnicas de audio [ 8 ] [ 9 ] [ 10 ] . Estas soluciones también se pueden usar en varias plataformas como Android , [ 11 ] [ 12 ] web JavaScript , [ 13 ] Python [ 14 ] [ 15 ] e iOS , [ 16 ] compatible con dispositivos de borde . [ 17 ] [ 18 ] [ 19 ]

Historia

Google lleva mucho tiempo utilizando MediaPipe en sus productos y servicios. Desde 2012, se ha utilizado para el análisis en tiempo real de vídeo y audio en YouTube. Con el tiempo, MediaPipe se ha incorporado a muchos más productos, como Gmail, Google Home, etc. [ 20 ]

La primera versión estable de MediaPipe fue la versión 0.5.0. [ 21 ] Se hizo de código abierto en junio de 2019 en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones en Long Beach, California, por Google Research . Esta versión inicial incluía solo cinco ejemplos de pipelines: Detección de objetos, Detección de rostros, Seguimiento de manos , Seguimiento de múltiples manos y Segmentación de cabello. [ 22 ] Desde su lanzamiento inicial hasta abril de 2023, se han creado numerosos pipelines. En mayo de 2025, se presentó MediaPipe Solutions. Esta transición ofreció más capacidades para el aprendizaje automático en el dispositivo. [ 23 ] MediaPipe ahora está bajo la subdivisión de Google, Google AI Edge.

Soluciones

Las soluciones disponibles de MediaPipe son:

Las soluciones heredadas de MediaPipe son:

  • Detección facial
  • Malla facial
  • Iris
  • Manos
  • Pose
  • Holístico
  • Segmentación de selfies
  • Segmentación del cabello
  • Detección de objetos
  • Seguimiento de cajas
  • Seguimiento de movimiento instantáneo
  • Objectrón
  • CUCHILLO
  • Volteo automático
  • MediaSequence
  • YouTube 8M

Lenguaje de programación

MediaPipe está escrito principalmente en el lenguaje de programación C++ , aunque este no es el único lenguaje de programación utilizado en su creación. Otros lenguajes de programación importantes utilizados en su código fuente incluyen Python , Starlark y Java . [ 21 ]

La capacidad de MediaPipe para separarse en un sistema de componentes permite la personalización. También hay soluciones predefinidas disponibles, y puede ser útil comenzar con ellas y optimizarlas ligeramente para obtener un resultado ideal. [ 24 ]

Cómo funciona MediaPipe

MediaPipe contiene multitud de componentes diferentes que trabajan conjuntamente para crear un marco de visión artificial de propósito general. Cada componente funciona de forma única con arquitecturas distintas.

Seguimiento de manos

MediaPipe incluye un sistema de seguimiento de manos diseñado para funcionar de manera eficiente en dispositivos con recursos computacionales limitados. Este sistema estima un conjunto de puntos de referencia 3D para cada mano detectada y está diseñado para mantenerse estable en una amplia gama de entornos, incluyendo diferentes posturas, condiciones de iluminación y movimientos. [ 25 ]

MediaPipe funciona a partir de un modelo de aprendizaje profundo preentrenado que se entrena para detectar el área de la palma de las manos humanas, lo cual se realiza mediante un modelo detector llamado BlazePalm. [ 24 ] [ 26 ] A partir de la identificación de la palma, MediaPipe puede usar el posicionamiento de la palma como entrada para un segundo modelo que predice las posiciones de puntos de referencia clave que representarán la estructura de la mano. [ 25 ]

Manos antes de la detección de manos de MediaPipe
Manos después de la detección de manos de MediaPipe

MediaPipe supervisa continuamente la confianza de sus predicciones y vuelve a ejecutar la detección cuando es necesario para mantener su precisión, mientras que el suavizado temporal ayuda a reducir la fluctuación entre fotogramas. Para escenas con más de una mano, el proceso se repite de forma independiente para cada región detectada. [ 25 ] [ 24 ]

Estimación de la postura humana

Otra área en la que MediaPipe se especializa es en el reconocimiento de cambios en el cuerpo humano, específicamente en la postura. MediaPipe puede brindar soporte para la creación de sistemas de análisis de la postura corporal. Esto puede ser útil en muchos campos, como la ergonomía, las artes, los deportes y el entretenimiento. [ 24 ]

Referencias

  1. Hon Law, Wai. "Lanzamiento de MediaPipe v0.10.26 · google-ai-edge/mediapipe" . GitHub . Consultado el 21 de noviembre de 2025 .
  2. Abstreiter, Maximilian; Tarkoma, Sasu; Morabito, Roberto (2025-03-12), Sometimes Painful but Certainly Promising: Feasibility and Trade-offs of Language Model Inference at the Edge , arXiv : 2503.09114 , recuperado el 21-11-2025
  3. Nezami, Zeinab; Hafeez, Maryam; Djemame, Karim; Zaidi, Syed Ali Raza (18 de noviembre de 2024), IA generativa en el borde: arquitectura y evaluación del rendimiento , arXiv : 2411.17712 , consultado el 21 de noviembre de 2025
  4. Luna-Jiménez, Cristina; Gil-Martín, Manuel; Kleinlein, Ricardo; San Segundo, Rubén; Fernández-Martínez, Fernando (2023-10-09). "Interpretación del reconocimiento del lenguaje de señas mediante Transformers y MediaPipe Landmarks" . Conferencia Internacional sobre Interacción Multimodal . ICMI '23. Nueva York, NY, EE.UU.: Asociación de Maquinaria de Computación. págs. 373– 377. doi : 10.1145/3577190.3614143 . ISBN  979-8-4007-0055-2.
  5. Kim, Jong-Wook; Choi, Jin-Young; Ha, Eun-Ju; Choi, Jae-Ho (2023-02-20). "Estimación de la pose humana utilizando el método de optimización y pose de MediaPipe basado en un modelo humanoide" . Applied Sciences . 13 (4): 2700. Bibcode : 2023ApSci..13.2700K . doi : 10.3390/app13042700 . ISSN 2076-3417 . 
  6. Thaman, B.; Cao, T.; Caporusso, N. (23 de mayo de 2022). Detección de mascarillas faciales mediante MediaPipe Facemesh . 45.ª Convención Internacional del Aniversario de la Información, la Comunicación y la Tecnología Electrónica (MIPRO) de 2022. Opatija, Croacia: IEEE. págs. 378–382 . doi : 10.23919/MIPRO55190.2022.9803531 . ISBN  978-953-233-103-5.
  7. Kim, Heejin; Lee, Jeongha; Bahn, Hyokyung (2025-11-17). "Repensando el almacenamiento en caché de E/S para la inferencia de modelos de lenguaje grandes en plataformas móviles con recursos limitados" . Matemáticas . 13 (22): 3689. doi : 10.3390/math13223689 . ISSN 2227-7390 . 
  8. Meyer, David; Abecassis, Eitan; Fernandez-Labrador, Clara; Schroers, Christopher (2024). "RAST: Una herramienta de sincronización de audio de referencia para contenido doblado" . Interspeech 2024. pp. 67–71 . doi : 10.21437/Interspeech.2024-2203 . 
  9. Høgenhaug, Mads; Friis, Marcus; Pedersen, Morten; Rossi, Luca (2025-04-03), TikTok StitchGraph: Caracterización de patrones de comunicación en TikTok a través de una colección de redes de interacción , arXiv : 2502.18661 , consultado el 21/11/2025
  10. Withanage Don, Daksitha Senel; Kiderle, Thomas; Mertes, Silvan; Schiller, Dominik; Ritschel, Hannes; André, Elisabeth (24 de marzo de 2025). «MeLaX: Conversaciones con IA generativa en agentes socialmente interactivos» . Actas complementarias de la 30.ª Conferencia Internacional sobre Interfaces de Usuario Inteligentes . ACM. págs. 163-166 . doi : 10.1145/3708557.3716363 . ISBN  979-8-4007-1409-2.
  11. Sreenath, Sreehari; Daniels, D. Ivan; Ganesh, Apparaju SD; Kuruganti, Yashaswi S.; Chittawadigi, Rajeevlochana G. (30 de septiembre de 2021). "Seguimiento monocular de la mano humana en la cámara de un teléfono inteligente mediante MediaPipe y su aplicación en robótica". 2021 IEEE 9th Region 10 Humanitarian Technology Conference (R10-HTC) . IEEE. págs. 1–6 . doi : 10.1109/R10-HTC53172.2021.9641542 . ISBN  978-1-6654-3240-5.
  12. Nunes, João; Nascimento, Thamer Horbylon; Felix, Juliana; Soares, Fabrizzio (2025-07-08). "Reconocimiento de gestos manuales en tiempo real para el control de vídeo sin contacto mediante MediaPipe y Random Forest". 2025 IEEE 49th Annual Computers, Software, and Applications Conference (COMPSAC) . IEEE. pp. 1776–1781 . doi : 10.1109/COMPSAC65507.2025.00242 . ISBN  979-8-3315-7434-5.
  13. Patel, Meenu; Rao, Saksham; Chauhan, Shweta; Kumar, Bibek (16 de diciembre de 2024). "Reconocimiento de gestos manuales en tiempo real mediante Python y una aplicación web". 1.ª Conferencia Internacional de 2024 sobre Avances en Computación, Comunicación y Redes (ICAC2N) . IEEE. págs. 564–570 . doi : 10.1109/ICAC2N63387.2024.10895151 . ISBN  979-8-3503-5681-6.
  14. Kumar Rao B, Narendra; Panini Challa, Nagendra; Krishna, ES Phalguna; Chakravarthi, S. Sreenivasa (12 de mayo de 2023). "Sistema de detección de puntos de referencia faciales con OpenCV Mediapipe y Python utilizando el enfoque de flujo óptico (activo)" . Tercera Conferencia Internacional de 2023 sobre Computación Avanzada y Tecnologías Innovadoras en Ingeniería (ICACITE) . IEEE. págs. 92–96 . doi : 10.1109/icacite57410.2023.10182585 . ISBN  979-8-3503-9926-4.
  15. Kaur, Husanpreet; Jyoti; Devi, Sanjana; Rahul (24 de mayo de 2024). "Decodificador de lenguaje corporal usando Python". Quinta Conferencia Internacional de Tecnologías Emergentes (INCET) de 2024. IEEE. págs. 1–6 . doi : 10.1109/INCET61516.2024.10593646 . ISBN  979-8-3503-6115-5.
  16. Lugaresi, Camillo; Tang, Jiuqiang; Nash, Hadón; McClanahan, Chris; Uboweja, Esha; Hays, Michael; Zhang, ventilador; Chang, Chuo-Ling; Yong, Ming Guang (14 de junio de 2019), MediaPipe: un marco para crear canales de percepción , arXiv : 1906.08172 , consultado el 21 de noviembre de 2025
  17. Yung-Chen; Hsieh; Sun, Yu (10 de agosto de 2025), Una aplicación móvil inteligente para monitorear y corregir la postura al sentarse usando Raspberry Pi y detección de postura MediaPipe , arXiv : 2508.11683 , consultado el 21 de noviembre de 2025
  18. Kulkarni, Pavan Kumar V; MS, Sudha; KR, Divya; S, Vignesh; M, Sindhu (22 de mayo de 2024). "Reconocimiento de gestos en tiempo real para la manipulación de LED y servomecanismos basados ​​en Arduino mediante OpenCV y MediaPipe". 1.ª Conferencia Internacional de Comunicaciones y Ciencias de la Computación (InCCCS) de 2024. IEEE. págs. 1-5 . doi : 10.1109/InCCCS60947.2024.10593524 . ISBN  979-8-3503-5885-8.
  19. Williams-Linera, Eric; Ramírez-Cortés, Juan Manuel (18 de septiembre de 2024). «Sistema de visión estéreo basado en NVIDIA Jetson Nano para la evaluación en tiempo real de posturas de yoga». Simposio Internacional IEEE de Tecnología y Sociedad (ISTAS) de 2024. IEEE. págs. 1-7 . doi : 10.1109/ISTAS61960.2024.10732331 . ISBN  979-8-3315-4070-8.
  20. Pranav Durai, Kukil (1 de marzo de 2022). "MediaPipe: la guía definitiva para el procesamiento de vídeo" . learnopencv.com . Consultado el 1 de diciembre de 2025 .
  21. 1 2 Yong, Ming. "Lanzamiento de MediaPipe v0.5.0 · google-ai-edge/mediapipe" . GitHub . Consultado el 21 de noviembre de 2025 .
  22. "Detección y seguimiento de objetos mediante MediaPipe - Blog de desarrolladores de Google" . developers.googleblog.com . Consultado el 21/11/2025 .
  23. "Presentación de las soluciones MediaPipe para el aprendizaje automático en dispositivos - Blog de desarrolladores de Google" . developers.googleblog.com . Consultado el 21 de noviembre de 2025 .
  24. 1 2 3 4 Kukil, Pranav Durai (2022-03-01). "MediaPipe: la guía definitiva para el procesamiento de vídeo" . learnopencv.com . Consultado el 2025-12-01 .{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace )
  25. 1 2 3 Zhang, ventilador; Bazarevsky, Valentín; Vakunov, Andrei; Tkachenka, Andrei; Cantado, George; Chang, Chuo-Ling; Grundmann, Matthias (18 de junio de 2020), MediaPipe Hands: seguimiento de manos en tiempo real en el dispositivo , arXiv : 2006.10214 , consultado el 22 de noviembre de 2025
  26. "Seguimiento de manos en tiempo real en el dispositivo con MediaPipe" . research.google . Consultado el 19 de diciembre de 2025 .