Articulo de referencia

animación facial por computadora

La animación facial por ordenador es principalmente un área de los gráficos por ordenador que engloba métodos y técnicas para generar y animar imágenes o modelos del rostro de u...

La animación facial por ordenador es principalmente un área de los gráficos por ordenador que engloba métodos y técnicas para generar y animar imágenes o modelos del rostro de un personaje. El personaje puede ser humano , humanoide, animal , criatura legendaria , etc. Debido a su temática y tipo de resultado, también se relaciona con muchos otros campos científicos y artísticos, desde la psicología hasta la animación tradicional . La importancia de los rostros humanos en la comunicación verbal y no verbal, junto con los avances en el hardware y el software de gráficos por ordenador, han generado un considerable interés científico, tecnológico y artístico en la animación facial por ordenador.

Si bien el desarrollo de métodos de gráficos por computadora para la animación facial comenzó a principios de la década de 1970, los logros más importantes en este campo son más recientes y se produjeron a partir de finales de la década de 1980.

El conjunto de trabajos sobre animación facial por ordenador se puede dividir en dos áreas principales: técnicas para generar datos de animación y métodos para aplicar dichos datos a un personaje. Técnicas como la captura de movimiento y la animación por fotogramas clave pertenecen al primer grupo, mientras que la animación de objetivos de transformación (más conocida como animación de formas combinadas) y la animación esquelética pertenecen al segundo. La animación facial se ha popularizado gracias a largometrajes de animación y videojuegos , pero sus aplicaciones abarcan muchas más áreas como la comunicación , la educación , la simulación científica y los sistemas basados ​​en agentes (por ejemplo, los agentes de atención al cliente en línea). Con los recientes avances en la capacidad de procesamiento de los dispositivos personales y móviles , la animación facial ha pasado de aparecer en contenido prerrenderizado a crearse en tiempo de ejecución.

Historia

La expresión facial humana ha sido objeto de investigación científica durante más de cien años. El estudio de los movimientos y expresiones faciales comenzó desde una perspectiva biológica. Tras algunas investigaciones anteriores, como la de John Bulwer a finales de la década de 1640, el libro de Charles Darwin , *La expresión de las emociones en los hombres y los animales*, puede considerarse un punto de inflexión fundamental para la investigación moderna en biología del comportamiento .

El modelado y la animación de expresiones faciales mediante ordenador no son una novedad. Los primeros trabajos sobre representación facial por ordenador se realizaron a principios de la década de 1970. La primera animación facial tridimensional fue creada por Parke en 1972. En 1973, Gillenson desarrolló un sistema interactivo para ensamblar y editar imágenes faciales dibujadas con líneas. En 1974, Parke desarrolló un modelo facial tridimensional parametrizado.

Uno de los intentos más importantes para describir los movimientos faciales fue el Sistema de Codificación de la Acción Facial (FACS). Desarrollado originalmente por Carl-Herman Hjortsjö [ 1 ] en la década de 1960 y actualizado por Ekman y Friesen en 1978, FACS define 46 Unidades de Acción Facial (UA) básicas. Un grupo importante de estas Unidades de Acción representa movimientos primitivos de los músculos faciales en acciones como levantar las cejas, guiñar un ojo y hablar. Ocho UA corresponden a movimientos rígidos tridimensionales de la cabeza (es decir, girar e inclinar hacia la izquierda y la derecha, y moverse hacia arriba, abajo, adelante y atrás). FACS se ha utilizado con éxito para describir los movimientos deseados de rostros sintéticos y también para el seguimiento de la actividad facial.

A principios de la década de 1980, Platt desarrolló el primer modelo facial físico controlado por músculos, y Brennan perfeccionó las técnicas para crear caricaturas faciales. En 1985, el cortometraje animado Tony de Peltrie marcó un hito en la animación facial. Por primera vez, la animación por computadora de expresiones faciales y habla se convirtió en un elemento fundamental para la narración.

A finales de la década de 1980, Waters desarrolló un nuevo modelo basado en músculos , Magnenat-Thalmann y sus colegas crearon un modelo abstracto de acción muscular , y Lewis y Hill propusieron enfoques para la sincronización automática del habla. En la década de 1990, se observó una creciente actividad en el desarrollo de técnicas de animación facial y en el uso de la animación facial por computadora como un componente clave de la narración, como se ilustra en películas animadas como Toy Story (1995), Antz (1998), Shrek y Monsters, Inc. (ambas de 2001), y videojuegos como Los Sims . Casper (1995), un hito en esta década, fue la primera película en la que un actor principal fue creado exclusivamente mediante animación facial digital.

La sofisticación de las películas aumentó después del año 2000. En Matrix Reloaded y Matrix Revolutions , se utilizó un flujo óptico denso de varias cámaras de alta definición para capturar el movimiento facial realista en cada punto del rostro. Polar Express (película) utilizó un gran sistema Vicon para capturar más de 150 puntos. Aunque estos sistemas están automatizados, aún se requiere un gran esfuerzo de limpieza manual para que los datos sean utilizables. Otro hito en la animación facial se alcanzó con El Señor de los Anillos , donde se desarrolló un sistema de base de formas específico para cada personaje. Mark Sagar fue pionero en el uso de FACS en la animación facial de entretenimiento, y los sistemas basados ​​en FACS desarrollados por Sagar se utilizaron en Monster House , King Kong y otras películas.

Técnicas

Generación de datos de animación facial

La generación de datos de animación facial se puede abordar de diferentes maneras: 1) captura de movimiento basada en marcadores en puntos o marcas en el rostro de un intérprete, 2) técnicas de captura de movimiento sin marcadores utilizando diferentes tipos de cámaras, 3) técnicas controladas por audio y 4) animación por fotogramas clave .

  • La captura de movimiento utiliza cámaras colocadas alrededor del sujeto. Generalmente, el sujeto está equipado con reflectores (captura de movimiento pasiva) o fuentes (captura de movimiento activa) que determinan con precisión su posición en el espacio. Los datos registrados por las cámaras se digitalizan y se convierten en un modelo tridimensional del sujeto. Hasta hace poco, el tamaño de los detectores/fuentes utilizados por los sistemas de captura de movimiento hacía que la tecnología no fuera adecuada para la captura facial. Sin embargo, la miniaturización y otros avances han convertido la captura de movimiento en una herramienta viable para la animación facial por computadora. La captura de movimiento facial se utilizó ampliamente en Polar Express de Imageworks , donde se capturaron cientos de puntos de movimiento. Esta película fue muy lograda y, si bien intentó recrear el realismo, fue criticada por caer en el " valle inquietante ", el ámbito donde el realismo de la animación es suficiente para el reconocimiento humano y para transmitir el mensaje emocional, pero donde los personajes no se perciben como realistas. Las principales dificultades de la captura de movimiento son la calidad de los datos, que puede incluir vibraciones, así como el reajuste de la geometría de los puntos.
  • La captura de movimiento sin marcadores busca simplificar el proceso evitando que el intérprete tenga que usar marcadores. Recientemente han surgido varias técnicas que utilizan diferentes sensores, entre ellos cámaras de vídeo estándar, Kinect y sensores de profundidad, así como otros dispositivos basados ​​en luz estructurada. Los sistemas basados ​​en luz estructurada pueden lograr un rendimiento en tiempo real sin el uso de marcadores mediante un escáner de luz estructurada de alta velocidad. El sistema se basa en una sólida etapa de seguimiento facial fuera de línea que entrena al sistema con diferentes expresiones faciales. Las secuencias coincidentes se utilizan para construir un modelo facial lineal específico para cada persona, que posteriormente se utiliza para el seguimiento facial en línea y la transferencia de expresiones.
  • Las técnicas basadas en audio son especialmente adecuadas para la animación del habla. El habla se suele tratar de forma diferente a la animación de expresiones faciales, ya que los enfoques simples basados ​​en fotogramas clave suelen ofrecer una aproximación deficiente a la dinámica real del habla. A menudo se utilizan visemas para representar las posiciones clave en el habla observada (es decir, la posición de los labios, la mandíbula y la lengua al producir un fonema en particular ); sin embargo, existe una gran variación en la realización de los visemas durante la producción del habla natural. La fuente de esta variación se denomina coarticulación , que es la influencia de los visemas circundantes sobre el visema actual (es decir, el efecto del contexto). Para tener en cuenta la coarticulación, los sistemas actuales consideran explícitamente el contexto al combinar los fotogramas clave de los visemas [ 2 ] o utilizan unidades más largas como difonos , trifonos , sílabas o incluso unidades de longitud de palabra y oración . Uno de los enfoques más comunes para la animación del habla es el uso de funciones de dominancia introducidas por Cohen y Massaro. Cada función de dominancia representa la influencia a lo largo del tiempo que un visema tiene sobre una expresión del habla. Normalmente, la influencia será mayor en el centro del visema y disminuirá con la distancia al centro del visema. Las funciones de dominancia se combinan para generar una trayectoria del habla de forma muy similar a como se combinan las funciones base de spline para generar una curva. La forma de cada función de dominancia será diferente según el visema que representa y el aspecto del rostro que se controla (por ejemplo, ancho de labios, rotación de la mandíbula, etc.). Este enfoque para la animación del habla generada por computadora se puede ver en la cabeza parlante de Baldi. Otros modelos de habla utilizan unidades base que incluyen contexto (por ejemplo, difonos , trifonos , etc.) en lugar de visemas. Como las unidades base ya incorporan la variación de cada visema según el contexto y, en cierta medida, la dinámica de cada visema, no se requiere un modelo de coarticulación . El habla se genera simplemente seleccionando las unidades apropiadas de una base de datos y combinándolas. Esto es similar a las técnicas concatenativas en la síntesis de voz de audio . La desventaja de estos modelos es que se requiere una gran cantidad de datos capturados para producir resultados naturales, y si bien las unidades más largas producen resultados más naturales, el tamaño de la base de datos requerida aumenta con la duración promedio de cada unidad. Finalmente, algunos modelos generan directamente animaciones de voz a partir de audio. Estos sistemas suelen utilizar modelos ocultos de Markov.o redes neuronales para transformar parámetros de audio en un flujo de parámetros de control para un modelo facial. La ventaja de este método radica en su capacidad para manejar el contexto de la voz, el ritmo natural, el tempo, la expresividad emocional y la dinámica sin necesidad de algoritmos de aproximación complejos. No es necesario etiquetar la base de datos de entrenamiento, ya que no se requieren fonemas ni visemas; los únicos datos necesarios son la voz y los parámetros de animación.
  • La animación por fotogramas clave es el proceso menos automatizado para crear datos de animación, aunque ofrece el máximo control. A menudo se utiliza en combinación con otras técnicas para dar el toque final a la animación. Los datos de los fotogramas clave pueden consistir en valores escalares que definen los coeficientes de los objetivos de deformación o los valores de rotación y traslación de los huesos en modelos con una estructura ósea. Para acelerar el proceso de animación por fotogramas clave , se suele utilizar una estructura de control. Esta estructura representa un nivel de abstracción superior que puede actuarsimultáneamente sobre múltiples coeficientes de objetivos de deformación o huesos. Por ejemplo, un control de "sonrisa" puede actuar simultáneamente sobre la forma de la boca curvándose hacia arriba y los ojos entrecerrándose.

Aplicar animación facial a un personaje

Las principales técnicas utilizadas para aplicar animación facial a un personaje son: 1.) animación de objetivos de deformación , 2.) animación basada en huesos , 3.) animación basada en texturas (2D o 3D) y 4.) modelos fisiológicos .

  • Los sistemas basados ​​en objetivos de morfología (también llamados "blendshapes" ) ofrecen una reproducción rápida y un alto grado de fidelidad en las expresiones. La técnica consiste en modelar porciones de la malla facial para aproximar expresiones y visemas , y luego mezclar las diferentes submallas, conocidas como objetivos de morfología o blendshapes. Quizás el personaje más logrado que utilizó esta técnica fue Gollum, de El Señor de los Anillos . Las desventajas de esta técnica son que implican un trabajo manual intensivo y son específicas para cada personaje. Recientemente, han comenzado a surgir nuevos conceptos en el modelado 3D. Recientemente, está surgiendo una nueva tecnología que se aparta de las técnicas tradicionales, como el Modelado Controlado por Curvas [ 3 ] que enfatiza el modelado del movimiento de un objeto 3D en lugar del modelado tradicional de la forma estática.
  • La animación basada en huesos se utiliza ampliamente en videojuegos. La configuración de huesos puede variar desde unos pocos hasta casi cien para permitir todas las expresiones faciales sutiles. Las principales ventajas de la animación basada en huesos son que se puede usar la misma animación para diferentes personajes siempre que la morfología de sus rostros sea similar, y en segundo lugar, no requiere cargar en memoria todos los datos de los objetivos de morfología . La animación basada en huesos es compatible principalmente con motores de juegos 3D. Se puede usar tanto para animación 2D como 3D. Por ejemplo, es posible crear un esqueleto y animar un personaje 2D usando huesos con Adobe Flash .
Captura de pantalla del cortometraje animado "Kara" de Quantic Dream.
  • La animación basada en texturas utiliza el color de los píxeles para crear la animación en el rostro del personaje. La animación facial 2D se basa comúnmente en la transformación de imágenes, incluyendo tanto imágenes de fotografía fija como secuencias de video. La transformación de imágenes es una técnica que permite generar imágenes de transición entre un par de imágenes fijas objetivo o entre fotogramas de secuencias de video. Estas técnicas de transformación generalmente consisten en una combinación de una técnica de deformación geométrica, que alinea las imágenes objetivo, y un fundido cruzado que crea una transición suave en la textura de la imagen. Un ejemplo temprano de transformación de imágenes se puede ver en el video de Michael Jackson para "Black Or White". En la animación 3D, la animación basada en texturas se puede lograr animando la textura misma o el mapeo UV. En este último caso, se crea un mapa de texturas de todas las expresiones faciales y la animación del mapa UV se utiliza para la transición de una expresión a la siguiente.
  • Los modelos fisiológicos , como los sistemas musculares esqueléticos y los modelos de cabeza basados ​​en la física, constituyen otro enfoque para modelar la cabeza y el rostro . [ 4 ] En estos modelos, se simulan lascaracterísticas físicas y anatómicas de los huesos , los tejidos y la piel para proporcionar una apariencia realista (por ejemplo, elasticidad tipo resorte). Estos métodos pueden ser muy eficaces para lograr realismo, pero la complejidad de las estructuras faciales los hace computacionalmente costosos y difíciles de crear. Considerando la eficacia de los modelos parametrizados para fines comunicativos (como se explica en la siguiente sección), se podría argumentar que los modelos basados ​​en la física no son una opción muy eficiente en muchas aplicaciones. Esto no niega las ventajas de los modelos basados ​​en la física ni el hecho de que incluso pueden utilizarse dentro del contexto de los modelos parametrizados para proporcionar detalles locales cuando sea necesario.

Lenguajes de animación facial

Se utilizan muchos lenguajes de animación facial para describir el contenido de la animación facial. Estos se pueden introducir en un software de reproducción compatible que luego crea las acciones solicitadas. Los lenguajes de animación facial están estrechamente relacionados con otros lenguajes de presentación multimedia como SMIL y VRML . Debido a la popularidad y eficacia de XML como mecanismo de representación de datos, la mayoría de los lenguajes de animación facial se basan en XML. Por ejemplo, este es un ejemplo del Lenguaje de Marcado Humano Virtual (VHML):

<vhml> <person disposition= "angry" > Primero hablo con voz enojada y parezco muy enojado, <surprised intensity= "50" > pero de repente cambio a una expresión más sorprendida . </surprised> </person> </vhml>

Los lenguajes más avanzados permiten la toma de decisiones, el manejo de eventos y acciones paralelas y secuenciales. El lenguaje de modelado facial (FML) es un lenguaje basado en XML para describir la animación facial . [ 5 ] FML admite parámetros de animación facial MPEG-4 (FAPS), toma de decisiones y manejo dinámico de eventos , y construcciones de programación típicas como bucles . Forma parte del sistema iFACE . [ 5 ] El siguiente es un ejemplo de FML:

<fml> <act> <par> <hdmv type= "yaw" value= "15" begin= "0" end= "2000" /> <expr type= "joy" value= "-60" begin= "0" end= "2000" /> </par> <excl event_name= "kbd" event_value= "" repeat= "kbd;F3_up" > <hdmv type= "yaw" value= "40" begin= "0" end= "2000" event_value= "F1_up" /> <hdmv type= "yaw" value= "-40" begin= "0" end= "2000" event_value= "F2_up" /> </excl> </act> </fml>

Véase también

Referencias

  1. Hjortsjö, CH (1969). El rostro del hombre y el lenguaje mímico. Archivado el 6 de agosto de 2022 en Wayback Machine .
  2. Aprendizaje de la dinámica de visemas controlada por audio para animación facial 3D
  3. Ding, H.; Hong, Y. (2003). "Modelado controlado por curvas NURBS para animación facial". Computers and Graphics . 27 (3): 373– 385. doi : 10.1016/S0097-8493(03)00033-5 .
  4. Lucero, JC; Munhall, KG (1999). "Un modelo de biomecánica facial para la producción del habla". Journal of the Acoustical Society of America . 106 (5): 2834– 2842. Bibcode : 1999ASAJ..106.2834L . doi : 10.1121/1.428108 . PMID 10573899 . 
  5. 1 2 "iFACE" . Universidad de Carleton. 6 de junio de 2007. Archivado del original el 6 de junio de 2007. Recuperado el 16 de junio de 2019 .

Lecturas adicionales

  • Animación facial por computadora de Frederic I. Parke y Keith Waters, 2008 ISBN 1-56881-448-8
  • Animación facial 3D basada en datos por Zhigang Deng, Ulrich Neumann 2007 ISBN 1-84628-906-8
  • Manual de humanos virtuales por Nadia Magnenat-Thalmann y Daniel Thalmann, 2004 ISBN 0-470-02316-3
  • Osipa, Jason (2005). Deja de mirar fijamente: Modelado y animación facial bien hechos (2.ª  ed.). John Wiley & Sons. ISBN 978-0-471-78920-8.
  • Face/Off: Animación facial en vivo: tecnología de animación facial sin marcadores en tiempo real desarrollada en la ETH Zúrich.
  • El proyecto "Actores Artificiales" - Instituto de Animación
  • iFACE
  • Baldi animado
  • Descarga de Carl-Herman Hjortsjö, "El rostro del hombre y el lenguaje de la mímica". Archivado el 6 de agosto de 2022 en Wayback Machine (el título original en sueco del libro es: "Människans ansikte och mimiska språket". La traducción correcta sería: "El rostro del hombre y el lenguaje facial").
Obtenido de " https://en.wikipedia.org/w/index.php?title=Computer_facial_animation&oldid=1190835881#Face_animation_languages "