En aprendizaje automático y visión por computadora , la teoría M es un marco de aprendizaje inspirado en el procesamiento de retroalimentación en la vía ventral de la corteza visual y desarrollado originalmente para el reconocimiento y la clasificación de objetos en escenas visuales. Posteriormente, la teoría M se aplicó a otras áreas, como el reconocimiento de voz . En ciertas tareas de reconocimiento de imágenes, los algoritmos basados en una instancia específica de la teoría M, HMAX, lograron un rendimiento a nivel humano. [ 1 ]
El principio fundamental de la teoría M consiste en extraer representaciones invariantes ante diversas transformaciones de imágenes (traslación, escala, rotación 2D y 3D, entre otras). A diferencia de otros enfoques que utilizan representaciones invariantes, en la teoría M estas no están codificadas en los algoritmos, sino que se aprenden. La teoría M también comparte algunos principios con el muestreo comprimido . Esta teoría propone una arquitectura de aprendizaje jerárquica multicapa, similar a la de la corteza visual.
Intuición
Representaciones invariantes
Un gran desafío en las tareas de reconocimiento visual es que un mismo objeto puede verse en diversas condiciones. Puede observarse desde diferentes distancias, distintos puntos de vista, con distinta iluminación, parcialmente oculto, etc. Además, para ciertas clases de objetos, como los rostros, pueden ser relevantes transformaciones específicas muy complejas, como cambios en las expresiones faciales. Para aprender a reconocer imágenes, resulta muy beneficioso eliminar estas variaciones. Esto simplifica considerablemente el problema de clasificación y, por consiguiente, reduce notablemente la complejidad de la muestra del modelo.
Un sencillo experimento computacional ilustra esta idea. Se entrenaron dos instancias de un clasificador para distinguir imágenes de aviones de imágenes de automóviles. Para el entrenamiento y la prueba de la primera instancia, se utilizaron imágenes con puntos de vista arbitrarios. La segunda instancia recibió únicamente imágenes vistas desde un punto de vista específico, lo que equivalía a entrenar y probar el sistema con una representación invariante de las imágenes. Se puede observar que el segundo clasificador tuvo un rendimiento bastante bueno incluso después de recibir un solo ejemplo de cada categoría, mientras que el rendimiento del primer clasificador fue similar al de una suposición aleatoria incluso después de ver 20 ejemplos.
Las representaciones invariantes se han incorporado a diversas arquitecturas de aprendizaje, como los neocognitrones . Sin embargo, la mayoría de estas arquitecturas proporcionaban invariancia mediante características o propiedades propias de la arquitectura. Si bien resulta útil tener en cuenta algunos tipos de transformaciones, como las traslaciones, resulta muy complejo incorporar otras, como las rotaciones 3D y los cambios en las expresiones faciales. La teoría M proporciona un marco para comprender cómo se pueden aprender dichas transformaciones. Además de una mayor flexibilidad, esta teoría también sugiere que el cerebro humano podría poseer capacidades similares.
Plantillas
Otra idea central de la teoría M guarda una estrecha relación con conceptos del campo de la detección comprimida . Una implicación del lema de Johnson-Lindenstrauss indica que , mediante proyecciones aleatorias, se puede incrustar un número determinado de imágenes en un espacio de características de baja dimensión con la misma distancia entre ellas. Este resultado sugiere que el producto escalar entre la imagen observada y otra imagen almacenada en memoria, denominada plantilla, puede utilizarse como una característica para distinguir la imagen de otras. La plantilla no tiene por qué estar relacionada con la imagen; puede elegirse aleatoriamente.
Combinando plantillas y representaciones invariantes
Las dos ideas descritas en secciones anteriores se pueden combinar para construir un marco para el aprendizaje de representaciones invariantes. La observación clave es cómo el producto escalar entre imágenesy una plantillase comporta cuando la imagen se transforma (mediante transformaciones como traslaciones, rotaciones, escalas, etc.). Si la transformaciónSi es miembro de un grupo unitario de transformaciones, entonces se cumple lo siguiente:
En otras palabras, el producto escalar de la imagen transformada y la plantilla es igual al producto escalar de la imagen original y la plantilla transformada inversamente. Por ejemplo, si la imagen se rota 90 grados, la plantilla transformada inversamente se rotará −90 grados.
Consideremos el conjunto de productos escalares de una imagen.a todas las transformaciones posibles de la plantilla:Si se aplica una transformacióna, el conjunto se convertiría en. Pero debido a la propiedad (1), esto es igual a. El conjuntoes igual al conjunto de todos los elementos enPara ver esto, observe que cadaestá endebido a la propiedad de cierre de los grupos y para cadaEn G existe su prototipocomo(a saber,). De este modo,Se puede observar que el conjunto de productos escalares permanece invariable a pesar de la transformación aplicada a la imagen. Este conjunto, por sí solo, puede servir como una representación invariante (aunque bastante compleja) de una imagen. A partir de él, se pueden derivar representaciones más prácticas.
En la sección introductoria, se afirmó que la teoría M permite aprender representaciones invariantes. Esto se debe a que las plantillas y sus versiones transformadas pueden aprenderse a partir de la experiencia visual, exponiendo el sistema a secuencias de transformaciones de objetos. Es plausible que se produzcan experiencias visuales similares en la primera infancia, por ejemplo, cuando los bebés juegan con juguetes. Dado que las plantillas pueden no tener ninguna relación con las imágenes que el sistema intentará clasificar posteriormente, los recuerdos de estas experiencias visuales pueden servir de base para reconocer muchos tipos diferentes de objetos en la edad adulta. Sin embargo, como se muestra más adelante, para algunos tipos de transformaciones se necesitan plantillas específicas.
Aspectos teóricos
De las órbitas a las medidas de distribución
Para implementar las ideas descritas en secciones anteriores, es necesario saber cómo obtener una representación invariante y computacionalmente eficiente de una imagen. Esta representación única para cada imagen se puede caracterizar mediante un conjunto de distribuciones de probabilidad unidimensionales (distribuciones empíricas de los productos escalares entre la imagen y un conjunto de plantillas almacenadas durante el aprendizaje no supervisado). Estas distribuciones de probabilidad, a su vez, se pueden describir mediante histogramas o un conjunto de sus momentos estadísticos, como se mostrará más adelante.
Órbitaes un conjunto de imágenesgenerada a partir de una sola imagenbajo la acción del grupo.
En otras palabras, las imágenes de un objeto y de sus transformaciones corresponden a una órbita.Si dos órbitas tienen un punto en común, son idénticas en todas partes, [ 2 ] es decir, una órbita es una representación invariante y única de una imagen. Por lo tanto, dos imágenes se denominan equivalentes cuando pertenecen a la misma órbita:side tal manera que. Por el contrario, dos órbitas son diferentes si ninguna de las imágenes de una órbita coincide con ninguna imagen de la otra. [ 3 ]
Surge una pregunta natural: ¿cómo se pueden comparar dos órbitas? Existen varios enfoques posibles. Uno de ellos se basa en el hecho de que, intuitivamente, dos órbitas empíricas son iguales independientemente del orden de sus puntos. Por lo tanto, se puede considerar una distribución de probabilidad.inducido por la acción del grupo sobre las imágenes(puede considerarse como una realización de una variable aleatoria).
Esta distribución de probabilidadpuede caracterizarse casi de forma única pordistribuciones de probabilidad unidimensionalesinducido por los resultados (unidimensionales) de las proyecciones, dóndeson un conjunto de plantillas (imágenes elegidas al azar) (basadas en el teorema de Cramer-Wold [ 4 ] y la concentración de medidas).
Considerarimágenes. Dejar, dóndees una constante universal. Entonces
con probabilidad, para todos.
Este resultado (de manera informal) indica que una representación aproximadamente invariante y única de una imagense puede obtener a partir de las estimaciones deDistribuciones de probabilidad unidimensionalespara. El númerode proyecciones necesarias para discriminarórbitas, inducidas porimágenes, hasta precisión(y con confianza)) es, dóndees una constante universal.
Para clasificar una imagen, se puede utilizar la siguiente "receta":
- Memoriza un conjunto de imágenes u objetos llamados plantillas;
- Memoriza las transformaciones observadas para cada plantilla;
- Calcula los productos escalares de sus transformaciones con la imagen;
- Calcula el histograma de los valores resultantes, denominado firma de la imagen;
- Compare el histograma obtenido con las firmas almacenadas en la memoria.
Estimaciones de dichas funciones de densidad de probabilidad unidimensionales (PDF).se puede escribir en términos de histogramas como, dóndees un conjunto de funciones no lineales. Estas distribuciones de probabilidad unidimensionales se pueden caracterizar con histogramas de N intervalos o con un conjunto de momentos estadísticos. Por ejemplo, HMAX representa una arquitectura en la que la agregación se realiza mediante una operación de máximo.
Grupos no compactos de transformaciones
En la "receta" para la clasificación de imágenes, los grupos de transformaciones se aproximan con un número finito de transformaciones. Dicha aproximación solo es posible cuando el grupo es compacto .
Los grupos que incluyen todas las traslaciones y todos los escalados de la imagen no son compactos, ya que permiten transformaciones arbitrariamente grandes. Sin embargo, son localmente compactos . Para grupos localmente compactos, se puede lograr la invariancia dentro de un cierto rango de transformaciones. [ 2 ]
Supongamos quees un subconjunto de transformaciones depara los cuales los patrones transformados existen en la memoria. Para una imageny plantilla, supongamos quees igual a cero en todas partes excepto en algún subconjunto deEste subconjunto se denomina soporte dey se denota comoSe puede demostrar que si para una transformación, el conjunto de soporte también estará dentro, luego firma dees invariante con respecto a. [ 2 ] Este teorema determina el rango de transformaciones para las cuales se garantiza que se cumple la invariancia.
Se puede ver que el más pequeño esCuanto mayor sea el rango de transformaciones para las que se garantiza la invariancia, significa que para un grupo que es solo localmente compacto, no todas las plantillas funcionarían igual de bien. Las plantillas preferibles son aquellas con un rango razonablemente pequeño.para una imagen genérica. Esta propiedad se llama localización: las plantillas son sensibles solo a imágenes dentro de un pequeño rango de transformaciones. Aunque minimizandoNo es absolutamente necesario para que el sistema funcione, pero mejora la aproximación de la invariancia. Requerir la localización simultáneamente para la traslación y la escala produce un tipo muy específico de plantillas: las funciones de Gabor . [ 2 ]
La conveniencia de utilizar plantillas personalizadas para grupos no compactos entra en conflicto con el principio de aprendizaje de representaciones invariantes. Sin embargo, para ciertos tipos de transformaciones de imágenes frecuentes, las plantillas podrían ser el resultado de adaptaciones evolutivas. Datos neurobiológicos sugieren que existe una sintonización similar a la de Gabor en la primera capa de la corteza visual. [ 5 ] La optimalidad de las plantillas de Gabor para traslaciones y escalas es una posible explicación de este fenómeno.
transformaciones no grupales
Muchas transformaciones interesantes de imágenes no forman grupos. Por ejemplo, las transformaciones de imágenes asociadas a la rotación 3D del objeto 3D correspondiente no forman un grupo, ya que es imposible definir una transformación inversa (dos objetos pueden verse iguales desde un ángulo pero diferentes desde otro). Sin embargo, aún es posible lograr una invariancia aproximada incluso para transformaciones que no forman grupos, si se cumple la condición de localización para las plantillas y la transformación se puede linealizar localmente.
Como se mencionó en la sección anterior, para casos específicos de traslaciones y escalado, la condición de localización puede satisfacerse mediante el uso de plantillas de Gabor genéricas. Sin embargo, para transformaciones generales (no grupales), la condición de localización solo puede satisfacerse para una clase específica de objetos. [ 2 ] Más específicamente, para satisfacer la condición, las plantillas deben ser similares a los objetos que se desean reconocer. Por ejemplo, si se desea construir un sistema para reconocer rostros rotados en 3D, es necesario utilizar otros rostros rotados en 3D como plantillas. Esto podría explicar la existencia de módulos especializados en el cerebro, como el responsable del reconocimiento facial . [ 2 ] Incluso con plantillas personalizadas, es necesaria una codificación de imágenes y plantillas similar al ruido para la localización. Esto se puede lograr de forma natural si la transformación no grupal se procesa en cualquier capa que no sea la primera en la arquitectura de reconocimiento jerárquico.
Arquitecturas jerárquicas
La sección anterior sugiere una motivación para las arquitecturas jerárquicas de reconocimiento de imágenes. Sin embargo, también ofrecen otros beneficios.
En primer lugar, las arquitecturas jerárquicas son las más adecuadas para analizar una escena visual compleja con numerosos objetos compuestos por múltiples partes, cuya posición relativa puede variar considerablemente. En este caso, los distintos elementos del sistema deben reaccionar ante diferentes objetos y partes. En las arquitecturas jerárquicas, las representaciones de las partes en diferentes niveles de jerarquía de incrustación pueden almacenarse en distintas capas de la jerarquía.
En segundo lugar, las arquitecturas jerárquicas con representaciones invariantes para las partes de los objetos pueden facilitar el aprendizaje de conceptos compositivos complejos. Esta facilitación puede producirse mediante la reutilización de representaciones aprendidas de partes construidas previamente durante el aprendizaje de otros conceptos. Como resultado, la complejidad de los ejemplos para el aprendizaje de conceptos compositivos puede reducirse considerablemente.
Finalmente, las arquitecturas jerárquicas presentan una mayor tolerancia al desorden. El problema del desorden surge cuando el objeto objetivo se encuentra frente a un fondo no uniforme, que actúa como distractor para la tarea visual. La arquitectura jerárquica proporciona firmas para partes de los objetos objetivo, que no incluyen partes del fondo y no se ven afectadas por las variaciones del mismo. [ 6 ]
En las arquitecturas jerárquicas, una capa no es necesariamente invariante a todas las transformaciones que maneja la jerarquía en su conjunto. Algunas transformaciones pueden pasar a través de esa capa hacia capas superiores, como en el caso de las transformaciones no grupales descritas en la sección anterior. Para otras transformaciones, un elemento de la capa puede producir representaciones invariantes solo dentro de un pequeño rango de transformaciones. Por ejemplo, los elementos de las capas inferiores en la jerarquía tienen un campo visual pequeño y, por lo tanto, solo pueden manejar un pequeño rango de traslación. Para tales transformaciones, la capa debe proporcionar firmas covariantes en lugar de invariantes. La propiedad de covarianza se puede escribir como, dóndees una capa,es la firma de la imagen en esa capa, ysignifica "distribución de valores de la expresión para todos".
Relación con la biología
La teoría M se basa en una teoría cuantitativa de la vía ventral de la corteza visual. [ 7 ] [ 8 ] Entender cómo funciona la corteza visual en el reconocimiento de objetos sigue siendo una tarea desafiante para la neurociencia. Los humanos y los primates son capaces de memorizar y reconocer objetos después de ver solo un par de ejemplos, a diferencia de cualquier sistema de visión artificial de última generación que generalmente requiere muchos datos para reconocer objetos. Antes del uso de la neurociencia visual en la visión por computadora, se había limitado a la visión temprana para derivar algoritmos estéreo (por ejemplo, [ 9 ] ) y para justificar el uso de filtros DoG (derivados de Gauss) y más recientemente de filtros de Gabor. [ 10 ] [ 11 ] No se ha prestado verdadera atención a características biológicamente plausibles de mayor complejidad. Si bien la visión por computadora convencional siempre se ha inspirado y desafiado por la visión humana, parece que nunca ha avanzado más allá de las primeras etapas de procesamiento en las células simples en V1 y V2. Aunque algunos de los sistemas inspirados –en diversos grados– por la neurociencia se han probado en al menos algunas imágenes naturales, los modelos neurobiológicos de reconocimiento de objetos en la corteza aún no se han extendido para trabajar con bases de datos de imágenes del mundo real. [ 12 ]
El marco de aprendizaje de la teoría M emplea una hipótesis novedosa sobre la función computacional principal de la vía ventral: la representación de nuevos objetos/imágenes en términos de una firma, que es invariante a las transformaciones aprendidas durante la experiencia visual. Esto permite el reconocimiento a partir de muy pocos ejemplos etiquetados; en el límite, solo uno.
La neurociencia sugiere que las funciones naturales que una neurona debe calcular son el producto escalar de alta dimensión entre un "parche de imagen" y otro parche de imagen (llamado plantilla), que se almacena en términos de pesos sinápticos (sinapsis por neurona). El modelo computacional estándar de una neurona se basa en un producto escalar y un umbral. Otra característica importante de la corteza visual es que consta de células simples y complejas. Esta idea fue propuesta originalmente por Hubel y Wiesel. [ 9 ] La teoría M emplea esta idea. Las células simples calculan productos escalares de una imagen y transformaciones de plantillas.para(es un conjunto de células simples). Las células complejas son responsables de agrupar y calcular histogramas empíricos o momentos estadísticos del mismo. La siguiente fórmula para construir un histograma puede ser calculada por neuronas:
dóndees una versión suave de la función escalón ,es el ancho de un intervalo del histograma, yes el número del contenedor.
Aplicaciones
Aplicaciones a la visión por computadora
En [ 13 ] [ 14 ] los autores aplicaron la teoría M al reconocimiento facial sin restricciones en fotografías naturales. A diferencia del método DAR (detección, alineación y reconocimiento), que maneja el ruido detectando objetos y recortando la imagen a su alrededor para que quede muy poco fondo, este enfoque logra la detección y alineación implícitamente almacenando transformaciones de imágenes de entrenamiento (plantillas) en lugar de detectar y alinear o recortar rostros explícitamente durante la prueba. Este sistema se basa en los principios de una teoría reciente de invariancia en redes jerárquicas y puede evitar el problema del ruido, generalmente problemático para los sistemas de alimentación directa. El sistema resultante de extremo a extremo logra una mejora drástica en el estado del arte en esta tarea de extremo a extremo, alcanzando el mismo nivel de rendimiento que los mejores sistemas que operan en imágenes alineadas y recortadas con precisión (sin datos de entrenamiento externos). También funciona bien en dos conjuntos de datos más recientes, similares a LFW, pero más difíciles: una versión significativamente desordenada (desalineada) de LFW y SUFR-W (por ejemplo, la precisión del modelo en la categoría "no alineado y sin datos externos utilizados" de LFW es del 87,55 ± 1,41 % en comparación con el APEM (adaptative probabilistic elastic matching) de última generación: 81,70 ± 1,78 %).
La teoría también se aplicó a una variedad de tareas de reconocimiento: desde el reconocimiento invariante de objetos individuales en entornos desordenados hasta problemas de categorización multiclase en conjuntos de datos disponibles públicamente (CalTech5, CalTech101, MIT-CBCL) y tareas complejas de comprensión de escenas (calles) que requieren el reconocimiento de objetos basados tanto en la forma como en la textura (en el conjunto de datos StreetScenes). [ 12 ] El enfoque funciona realmente bien: tiene la capacidad de aprender a partir de solo unos pocos ejemplos de entrenamiento y se demostró que supera a varios modelos de constelación de sistemas de última generación más complejos, el sistema jerárquico de detección de rostros basado en SVM. Un elemento clave en el enfoque es un nuevo conjunto de detectores de características tolerantes a la escala y la posición, que son biológicamente plausibles y concuerdan cuantitativamente con las propiedades de sintonización de las células a lo largo de la vía ventral de la corteza visual. Estas características son adaptativas al conjunto de entrenamiento, aunque también mostramos que un conjunto de características universales, aprendido a partir de un conjunto de imágenes naturales no relacionadas con ninguna tarea de categorización, también logra un buen rendimiento.
Aplicaciones al reconocimiento de voz
Esta teoría también puede extenderse al dominio del reconocimiento de voz. Por ejemplo, en [ 15 ] se propuso una extensión de una teoría para el aprendizaje no supervisado de representaciones visuales invariantes al dominio auditivo y se evaluó empíricamente su validez para la clasificación de sonidos de habla sonora. Los autores demostraron empíricamente que una representación de una sola capa, a nivel de fonema, extraída de características de habla base, mejora la precisión de la clasificación de segmentos y disminuye el número de ejemplos de entrenamiento en comparación con las características espectrales y cepstrales estándar para una tarea de clasificación acústica en el conjunto de datos TIMIT. [ 16 ]
Referencias
- ↑ Serre T., Oliva A., Poggio T. (2007) Una arquitectura de retroalimentación permite una categorización rápida. PNAS , vol. 104, n.º 15, págs. 6424–6429
- 1 2 3 4 5 6 F Anselmi, JZ Leibo, L Rosasco, J Mutch, A Tacchetti, T Poggio (2014) Aprendizaje no supervisado de representaciones invariantes en arquitecturas jerárquicas arXiv preprint arXiv:1311.4158
- ↑ H. Schulz-Mirbach. Construcción de características invariantes mediante técnicas de promediado. En Reconocimiento de patrones, 1994. Vol. 2 – Conferencia B: Visión por computadora y procesamiento de imágenes. Actas de la 12.ª Conferencia Internacional IAPR, volumen 2, páginas 387-390 vol. 2, 1994.
- ↑ H. Cramer y H. Wold. Algunos teoremas sobre funciones de distribución. J. London Math. Soc., 4:290–294, 1936.
- ↑ F. Anselmi, JZ Leibo, L. Rosasco, J. Mutch, A. Tacchetti, T. Poggio (2013) Materiales mágicos: una teoría de arquitecturas jerárquicas profundas para el aprendizaje de representaciones sensoriales. Documento CBCL, Instituto Tecnológico de Massachusetts, Cambridge, MA
- ↑ Liao Q., Leibo J., Mroueh Y., Poggio T. (2014) ¿Puede una jerarquía biológicamente plausible reemplazar eficazmente los procesos de detección, alineación y reconocimiento facial? CBMM Memo No. 003, Instituto Tecnológico de Massachusetts, Cambridge, MA
- ↑ M. Riesenhuber y T. Poggio Modelos jerárquicos de reconocimiento de objetos en la corteza (1999) Nature Neuroscience, vol. 2, n.º 11, págs. 1019-1025, 1999.
- ↑ T. Serre, M. Kouh, C. Cadieu, U. Knoblich, G. Kreiman y T. Poggio (2005) Una teoría del reconocimiento de objetos: cálculos y circuitos en la vía de retroalimentación de la corriente ventral en la corteza visual de los primates AI Memo 2005-036/CBCL Memo 259, Instituto Tecnológico de Massachusetts, Cambridge.
- 1 2 D.H. Hubel y TN Wiesel (1962) Campos receptivos, interacción binocular y arquitectura funcional en la corteza visual del gato The Journal of Physiology 160.
- ↑ D. Gabor (1946) Teoría de la comunicación J. IEE, vol. 93, pp. 429–459.
- ↑ JP Jones y LA Palmer (1987) Una evaluación del modelo de filtro de Gabor bidimensional de campos receptivos simples en la corteza estriada del gato J. Neurophysiol., vol. 58, pp. 1233–1258.
- 1 2 Thomas Serre, Lior Wolf, Stanley Bileschi, Maximilian Riesenhuber y Tomaso Poggio (2007) Reconocimiento robusto de objetos con mecanismos similares a los de la corteza cerebral IEEE Transactions on Pattern Analysis and Machine Intelligence, VOL. 29, NO. 3
- ↑ Qianli Liao, Joel Z Leibo, Youssef Mroueh, Tomaso Poggio (2014) ¿Puede una jerarquía biológicamente plausible reemplazar eficazmente los procesos de detección, alineación y reconocimiento facial? CBMM Memo No. 003
- ↑ Qianli Liao, Joel Z Leibo y Tomaso Poggio (2014) Aprendizaje de representaciones invariantes y aplicaciones a la verificación facial NIPS 2014
- ^ Georgios Evangelopoulos, Stephen Voinea, Chiyuan Zhang, Lorenzo Rosasco, Tomaso Poggio (2014) Aprendiendo una representación del habla invariante CBMM Memo No. 022
- ↑ "Corpus de habla continua acústico-fonética TIMIT - Consorcio de datos lingüísticos" .
- Aprendizaje automático
- visión por computadora
- Reconocimiento de voz