El Rich Representation Language , a menudo abreviado como RRL , es un lenguaje de animación por computadora diseñado específicamente para facilitar la interacción de dos o más personajes animados. [ 1 ] [ 2 ] [ 3 ] La investigación fue financiada por la Comisión Europea como parte del Proyecto NECA . El marco NECA (Net Environment for Embodied Emotional Conversational Agents) dentro del cual se desarrolló RRL no estaba orientado a la animación de películas, sino a la creación de "personajes virtuales" inteligentes que interactúan dentro de un mundo virtual y mantienen conversaciones con contenido emocional , junto con expresiones faciales adecuadas . [ 3 ]
RRL fue un esfuerzo de investigación pionero que influyó en el diseño de otros lenguajes, como el Player Markup Language , que extendió partes del diseño de RRL. [ 4 ] El diseño del lenguaje tenía como objetivo específico reducir el entrenamiento necesario para modelar la interacción de múltiples personajes dentro de un mundo virtual y generar automáticamente gran parte de la animación facial, así como la animación esquelética, basándose en el contenido de las conversaciones. Debido a la interdependencia de los componentes de la comunicación no verbal, como los rasgos faciales, con las palabras habladas, ninguna animación es posible en el lenguaje sin considerar el contexto de la escena en la que se desarrolla la animación, por ejemplo, la ira frente a la alegría. [ 5 ]
Problemas de diseño del lenguaje
El dominio de aplicación de RRL consiste en escenas con dos o más personajes virtuales. La representación de estas escenas requiere múltiples tipos de información, como posturas corporales , expresiones faciales , contenido semántico y significado de las conversaciones, etc. El desafío de diseño radica en que, a menudo, la información de un tipo depende de otro; por ejemplo, la postura corporal, la expresión facial y el contenido semántico de la conversación deben coordinarse. Un ejemplo es que, en una conversación acalorada, la semántica de la conversación determina la postura corporal y las expresiones faciales de una manera distinta a la de una conversación alegre. Por lo tanto, cualquier comando dentro del lenguaje para controlar las expresiones faciales debe depender inherentemente del contexto de la conversación. [ 3 ]
Los diferentes tipos de información utilizados en RRL requieren diferentes formas de expresión dentro del lenguaje; por ejemplo, mientras que la información semántica se representa mediante gramáticas , el componente de expresión facial requiere primitivas de manipulación gráfica. [ 3 ]
Un objetivo clave en el diseño de RRL fue la facilidad de desarrollo, para que la creación de escenas e interacciones estuviera al alcance de usuarios sin conocimientos avanzados de programación. Además, el diseño buscaba permitir un desarrollo incremental de forma natural, de modo que las escenas pudieran prototiparse parcialmente y luego refinarse para obtener representaciones de aspecto más natural, por ejemplo, mediante la posterior adición de parpadeo o respiración. [ 3 ]
Descripción de la escena
Tomando prestada la terminología teatral, cada sesión de interacción entre los personajes sintéticos en RRL se denomina escena . La descripción de una escena especifica el contenido, el momento y las características emocionales empleadas en ella. Un módulo específico, denominado razonador afectivo, calcula los elementos emocionales básicos involucrados en la escena, incluyendo el tipo y la intensidad de las emociones, así como sus causas. El razonador afectivo utiliza dimensiones emocionales como la intensidad y la asertividad. [ 3 ]
Aunque XML se utiliza como formato de representación base, las escenas se describen a un nivel superior dentro de un marco orientado a objetos. En este marco, los nodos (es decir, los objetos) se conectan mediante flechas o enlaces. Por ejemplo, una escena es el nodo de nivel superior que se enlaza con otros. La escena puede tener tres atributos específicos: los agentes/personas que participan en ella, la representación del discurso que sirve de base para las conversaciones y un historial que registra las relaciones temporales entre las distintas acciones. [ 3 ]
Las descripciones de las escenas se introducen en el módulo de generación de lenguaje natural, que produce oraciones adecuadas. La generación de un flujo natural en una conversación requiere un alto grado de poder representacional para los elementos emocionales. RRL utiliza un sistema de representación del discurso basado en el método estándar de referentes y condiciones . El razonador afectivo proporciona la información adecuada para seleccionar las palabras y estructuras que corresponden a oraciones específicas. [ 3 ]
Síntesis de voz y marcadores emotivos
El componente de síntesis de voz depende en gran medida de la información semántica y del comportamiento del módulo de asignación de gestos. Este componente debe operar antes que el sistema de asignación de gestos, ya que incluye la información temporal de las palabras habladas y las interjecciones emocionales . Tras interpretar el texto en lenguaje natural que se va a pronunciar, este componente añade estructura prosódica, como ritmo, acento e entonaciones. [ 3 ]
Los elementos del habla, una vez enriquecidos con acento, entonación y marcadores emocionales, se pasan al sistema de asignación de gestos. [ 3 ] RRL admite tres aspectos distintos de la gestión de emociones. Primero, se pueden proporcionar etiquetas de emoción específicas para escenas y frases específicas. Varios comandos específicos admiten la visualización de una amplia gama de emociones en los rostros de los personajes animados. [ 3 ]
En segundo lugar, existen mecanismos integrados para alinear rasgos faciales específicos con posturas corporales emotivas. En tercer lugar, se pueden intercalar interjecciones emotivas específicas, como suspiros, bostezos, risitas, etc., dentro de las acciones para aumentar la credibilidad de las expresiones del personaje. [ 3 ]
Asignación de gestos y movimientos corporales
En RRL el término gesto se usa en un sentido general y se aplica a expresiones faciales, postura corporal y gestos apropiados. Se procesan tres niveles de información dentro de la asignación de gestos: [ 3 ]
- Asignación de gestos específicos dentro de una escena a módulos específicos, por ejemplo, " tomar turnos " se gestiona en el módulo de generación de lenguaje natural.
- Refinamiento y elaboración de la asignación de gestos tras una síntesis de primer nivel del habla, por ejemplo, la adición de parpadeos y respiración a una conversación.
- Interfaz para módulos externos que gestionan la representación específica del reproductor, como los parámetros de animación facial (FAP) de MPEG-4 .
El sistema de asignación de gestos tiene tipos de gestos específicos, como movimientos corporales (por ejemplo, encogerse de hombros como indiferencia frente a hombros caídos de tristeza), movimientos emblemáticos (gestos que por convención señalan sí/no), icónicos (por ejemplo, imitar un teléfono con los dedos), deícticos (gestos de señalar), de contraste (por ejemplo, en una mano, pero en la otra), rasgos faciales (por ejemplo, cejas levantadas, ceño fruncido, sorpresa o una mirada). [ 3 ]
Véase también
Referencias
- ↑ ' Agentes virtuales inteligentes: 6.ª conferencia internacional de trabajo de Jonathan Matthew Gratch, 2006 ISBN 3-540-37593-7página 221
- ↑ Animación facial 3D basada en datos por Zhigang Deng, Ulrich Neumann 2007 ISBN 1-84628-906-8página 54
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 P. Piwek, et al. RRL: Un lenguaje de representación enriquecido para la descripción del comportamiento de los agentes en "Actas del taller AAMAS-02 sobre agentes conversacionales encarnados", 16 de julio de 2002, Bolonia, Italia.
- ↑ Tecnologías para la narración digital interactiva y el entretenimiento, por Stefan Göbel, 2004 ISBN 3-540-22283-9página 83
- ↑ Narración interactiva : Primera Conferencia Internacional Conjunta, editada por Ulrike Spierling y Nicolas Szilas, 2008 ISBN 3-540-89424-1página 93
- lenguajes informáticos
- Animación por computadora