El campo de modelado neuronal ( NMF ) es un marco matemático para el aprendizaje automático que combina ideas de redes neuronales , lógica difusa y reconocimiento basado en modelos . También se le ha denominado campos de modelado , teoría de campos de modelado (MFT) y redes neuronales artificiales de máxima verosimilitud (MLANS). [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 6 ] Este marco fue desarrollado por Leonid Perlovsky en el AFRL . El NMF se interpreta como una descripción matemática de los mecanismos de la mente , incluyendo conceptos , emociones , instintos , imaginación , pensamiento y comprensión . El NMF es un sistema heterojerárquico de múltiples niveles . En cada nivel del NMF hay modelos conceptuales que encapsulan el conocimiento; estos generan las llamadas señales descendentes, que interactúan con las señales ascendentes de entrada . Estas interacciones están regidas por ecuaciones dinámicas , que impulsan el aprendizaje, la adaptación y la formación de nuevos modelos conceptuales para una mejor correspondencia con las señales ascendentes de entrada.
Modelos conceptuales y medidas de similitud
En general, el sistema NMF consta de múltiples niveles de procesamiento. En cada nivel, las señales de salida son los conceptos reconocidos en (o formados a partir de) las señales de entrada, de abajo hacia arriba. Las señales de entrada se asocian con (o se reconocen, o se agrupan en) conceptos según los modelos y en este nivel. En el proceso de aprendizaje, los modelos conceptuales se adaptan para una mejor representación de las señales de entrada, de modo que aumenta la similitud entre los modelos conceptuales y las señales. Este aumento de similitud puede interpretarse como la satisfacción de un instinto de conocimiento y se experimenta como emociones estéticas .
Cada nivel jerárquico consta de N "neuronas" enumeradas por índice n=1,2...N. Estas neuronas reciben señales de entrada ascendentes, X(n) , de niveles inferiores en la jerarquía de procesamiento. X (n) es un campo de activaciones sinápticas neuronales ascendentes, provenientes de neuronas en un nivel inferior. Cada neurona tiene un número de sinapsis; para mayor generalidad, cada activación neuronal se describe como un conjunto de números,
donde D es el número o las dimensiones necesarias para describir la activación de cada neurona.
Las señales descendentes, o señales de preparación, que se envían a estas neuronas son enviadas por modelos conceptuales, M m ( S m ,n).
donde M es el número de modelos. Cada modelo se caracteriza por sus parámetros, S m ; en la estructura neuronal del cerebro están codificados por la fuerza de las conexiones sinápticas, matemáticamente, están dados por un conjunto de números,
donde A es el número de dimensiones necesarias para describir el modelo individual.
Los modelos representan las señales de la siguiente manera. Supongamos que la señal X( n ) proviene de las neuronas sensoriales n activadas por el objeto m, que se caracteriza por los parámetros Sm . Estos parámetros pueden incluir la posición, la orientación o la iluminación del objeto m. El modelo Mm ( Sm , n ) predice un valor X (n) de la señal en la neurona n. Por ejemplo, durante la percepción visual, una neurona n en la corteza visual recibe una señal X (n) de la retina y una señal de priming Mm ( Sm , n) de un modelo de concepto de objeto m . La neurona n se activa si tanto la señal ascendente de la entrada de nivel inferior como la señal de priming descendente son fuertes. Varios modelos compiten por la evidencia en las señales ascendentes, adaptando sus parámetros para una mejor concordancia, como se describe a continuación. Esta es una descripción simplificada de la percepción. La percepción visual cotidiana más benigna utiliza muchos niveles, desde la retina hasta la percepción del objeto. La premisa de NMF es que las mismas leyes describen la dinámica de interacción básica en cada nivel. La percepción de detalles minúsculos, objetos cotidianos o la cognición de conceptos abstractos complejos se deben al mismo mecanismo que se describe a continuación. La percepción y la cognición implican modelos conceptuales y aprendizaje. En la percepción, los modelos conceptuales corresponden a objetos; en la cognición, corresponden a relaciones y situaciones.
El aprendizaje es una parte esencial de la percepción y la cognición, y en la teoría NMF está impulsado por la dinámica que aumenta una medida de similitud entre los conjuntos de modelos y señales, L({ X },{ M }). La medida de similitud es una función de los parámetros del modelo y las asociaciones entre las señales de entrada ascendentes y las señales de modelo conceptual descendentes. Al construir una descripción matemática de la medida de similitud, es importante reconocer dos principios:
- En primer lugar , el contenido del campo visual es desconocido antes de que se produzca la percepción.
- En segundo lugar , puede contener cualquiera de varios objetos. Cualquier señal ascendente podría contener información importante;
Por lo tanto, la medida de similitud se construye de manera que tenga en cuenta todas las señales ascendentes, X ( n ),
- (1)
Esta expresión contiene un producto de similitudes parciales, l( X (n)), sobre todas las señales ascendentes; por lo tanto, obliga al sistema NMF a tener en cuenta cada señal (incluso si un término del producto es cero, el producto es cero, la similitud es baja y el instinto de conocimiento no se satisface); esto es un reflejo del primer principio. En segundo lugar, antes de que ocurra la percepción, la mente no sabe qué objeto dio origen a una señal de una neurona retiniana en particular. Por lo tanto, se construye una medida de similitud parcial de manera que trate cada modelo como una alternativa (una suma sobre modelos conceptuales) para cada señal de neurona de entrada. Sus elementos constitutivos son similitudes parciales condicionales entre la señal X (n) y el modelo M m , l( X (n)|m). Esta medida es "condicional" a la presencia del objeto m; por lo tanto, al combinar estas cantidades en la medida de similitud general, L, se multiplican por r(m), que representa una medida probabilística de la presencia real del objeto m. Combinando estos elementos con los dos principios mencionados anteriormente, se construye una medida de similitud de la siguiente manera:
- (2)
La estructura de la expresión anterior sigue los principios estándar de la teoría de la probabilidad: se realiza una suma sobre las alternativas, m, y se multiplican varias piezas de evidencia, n. Esta expresión no es necesariamente una probabilidad, pero tiene una estructura probabilística. Si el aprendizaje es exitoso, se aproxima a una descripción probabilística y conduce a decisiones bayesianas casi óptimas. El nombre "similitud parcial condicional" para l( X (n)|m) (o simplemente l(n|m)) sigue la terminología probabilística. Si el aprendizaje es exitoso, l(n|m) se convierte en una función de densidad de probabilidad condicional , una medida probabilística de que la señal en la neurona n se originó en el objeto m. Entonces L es una probabilidad total de observar señales { X (n)} provenientes de objetos descritos por el modelo conceptual { M m }. Los coeficientes r(m), llamados priors en la teoría de la probabilidad, contienen sesgos o expectativas preliminares, se espera que los objetos m tengan valores de r(m) relativamente altos; sus valores verdaderos generalmente son desconocidos y deben aprenderse, como otros parámetros S m .
Cabe señalar que, en teoría de la probabilidad, un producto de probabilidades suele asumir que la evidencia es independiente. La expresión para L contiene un producto sobre n, pero no asume independencia entre las distintas señales X (n). Existe una dependencia entre las señales debido a los modelos conceptuales: cada modelo M m ( S m , n) predice valores de señal esperados en muchas neuronas n.
Durante el proceso de aprendizaje, los modelos conceptuales se modifican constantemente. Por lo general, las formas funcionales de los modelos, M m ( S m ,n), son fijas y la adaptación al aprendizaje solo involucra los parámetros del modelo, S m . De vez en cuando, un sistema forma un nuevo concepto, conservando al mismo tiempo uno antiguo; alternativamente, los conceptos antiguos a veces se fusionan o se eliminan. Esto requiere una modificación de la medida de similitud L; la razón es que cuantos más modelos haya, mejor será el ajuste entre los modelos y los datos. Este es un problema bien conocido, que se aborda reduciendo la similitud L mediante una "función de penalización escéptica" ( método de penalización ) p(N,M) que crece con el número de modelos M, y este crecimiento es más pronunciado para una cantidad menor de datos N. Por ejemplo, una estimación de máxima verosimilitud asintóticamente insesgada conduce a una p(N,M) multiplicativa = exp(-N par /2), donde N par es el número total de parámetros adaptativos en todos los modelos (esta función de penalización se conoce como criterio de información de Akaike , véase (Perlovsky 2001) para más información y referencias).
Aprendizaje en NMF utilizando un algoritmo de lógica dinámica
El proceso de aprendizaje consiste en estimar los parámetros del modelo S y asociar señales con conceptos maximizando la similitud L. Nótese que todas las combinaciones posibles de señales y modelos se tienen en cuenta en la expresión (2) para L. Esto se puede ver expandiendo una suma y multiplicando todos los términos, lo que resulta en M N elementos, un número enorme. Este es el número de combinaciones entre todas las señales (N) y todos los modelos (M). Esta es la fuente de la complejidad combinatoria, que se resuelve en NMF utilizando la idea de lógica dinámica . [ 7 ] [ 8 ] Un aspecto importante de la lógica dinámica es hacer coincidir la vaguedad o imprecisión de las medidas de similitud con la incertidumbre de los modelos . Inicialmente, los valores de los parámetros no se conocen y la incertidumbre de los modelos es alta; también lo es la imprecisión de las medidas de similitud. En el proceso de aprendizaje, los modelos se vuelven más precisos y la medida de similitud más nítida, el valor de la similitud aumenta.
La maximización de la similitud L se realiza de la siguiente manera. Primero, los parámetros desconocidos { S m } se inicializan aleatoriamente. Luego se calculan las variables de asociación f(m|n),
- (3).
La ecuación para f(m|n) se parece a la fórmula de Bayes para probabilidades a posteriori; si l(n|m) en el resultado del aprendizaje se convierte en probabilidades condicionales, f(m|n) se convierte en probabilidades bayesianas para la señal n originada por el objeto m. La lógica dinámica de la NMF se define de la siguiente manera:
- (4).
- (5)
Se ha demostrado el siguiente teorema (Perlovsky 2001):
Teorema . Las ecuaciones (3), (4) y (5) definen un sistema NMF dinámico convergente con estados estacionarios definidos por max{S m }L.
De ello se deduce que los estados estacionarios de un sistema MF son los estados de máxima similitud. Cuando las similitudes parciales se especifican como funciones de densidad de probabilidad (pdf) o verosimilitudes, los valores estacionarios de los parámetros { S m } son estimaciones asintóticamente insesgadas y eficientes de estos parámetros. [ 9 ] La complejidad computacional de la lógica dinámica es lineal en N.
En la práctica, al resolver las ecuaciones mediante iteraciones sucesivas, f(m|n) se puede recalcular en cada iteración utilizando (3), en lugar de la fórmula incremental (5).
La demostración del teorema anterior incluye una prueba de que la similitud L aumenta en cada iteración. Esto tiene una interpretación psicológica: el instinto de aumentar el conocimiento se satisface en cada paso, lo que genera emociones positivas: el sistema lógico dinámico NMF disfruta emocionalmente del aprendizaje.
Ejemplo de operaciones lógicas dinámicas
Encontrar patrones por debajo del ruido puede ser un problema extremadamente complejo. Si no se conoce la forma exacta del patrón y esta depende de parámetros desconocidos, estos parámetros deben determinarse ajustando el modelo del patrón a los datos. Sin embargo, cuando se desconocen las ubicaciones y orientaciones de los patrones, no está claro qué subconjunto de puntos de datos debe seleccionarse para el ajuste. Un enfoque estándar para resolver este tipo de problema es la prueba de hipótesis múltiples (Singer et al. 1974). Dado que se buscan exhaustivamente todas las combinaciones de subconjuntos y modelos, este método se enfrenta al problema de la complejidad combinatoria. En el presente ejemplo, se buscan patrones ruidosos de "sonrisa" y "ceño fruncido". Se muestran en la Fig. 1a sin ruido y en la Fig. 1b con ruido, tal como se midió realmente. El número real de patrones es 3, que se desconoce. Por lo tanto, se deben ajustar al menos 4 patrones a los datos para determinar que 3 patrones se ajustan mejor. El tamaño de la imagen en este ejemplo es de 100x100 = 10 000 puntos. Si se intenta ajustar 4 modelos a todos los subconjuntos de 10 000 puntos de datos, la complejidad computacional es M N ~ 10 6000 . Una computación alternativa mediante la búsqueda a través del espacio de parámetros produce una complejidad menor: cada patrón se caracteriza por una forma parabólica de 3 parámetros. Ajustar 4x3=12 parámetros a una cuadrícula de 100x100 mediante una prueba de fuerza bruta tomaría aproximadamente 10 32 a 10 40 operaciones, lo que sigue siendo una complejidad computacional prohibitiva. Para aplicar NMF y lógica dinámica a este problema, es necesario desarrollar modelos adaptativos paramétricos de patrones esperados. Los modelos y las similitudes parciales condicionales para este caso se describen en detalle en: [ 10 ] un modelo uniforme para el ruido, manchas gaussianas para patrones muy difusos y mal resueltos, y modelos parabólicos para 'sonrisas' y 'ceñidos'. El número de operaciones de computadora en este ejemplo fue de aproximadamente 10 10 . De este modo, un problema que no tenía solución debido a su complejidad combinatoria se vuelve solucionable mediante el uso de lógica dinámica.
Durante un proceso de adaptación, los modelos inicialmente difusos e inciertos se asocian con estructuras en las señales de entrada, y los modelos difusos se vuelven más definidos y nítidos con iteraciones sucesivas. El tipo, la forma y el número de modelos se seleccionan de manera que la representación interna dentro del sistema sea similar a las señales de entrada: los modelos conceptuales NMF representan objetos estructurales en las señales. La siguiente figura ilustra las operaciones de la lógica dinámica. En la Fig. 1(a) se muestran patrones reales de "sonrisa" y "ceño fruncido" sin ruido; (b) imagen real disponible para el reconocimiento (la señal está por debajo del ruido, la relación señal/ruido está entre -2 dB y -0,7 dB); (c) un modelo difuso inicial, una gran imprecisión corresponde a la incertidumbre del conocimiento; (d) a (m) muestran modelos mejorados en varias etapas de iteración (un total de 22 iteraciones). Cada cinco iteraciones, el algoritmo intentó aumentar o disminuir el número de modelos. Entre las iteraciones (d) y (e), el algoritmo decidió que necesita tres modelos gaussianos para el "mejor" ajuste.
Existen varios tipos de modelos: un modelo uniforme que describe el ruido (no se muestra) y un número variable de modelos de manchas y modelos parabólicos; su número, ubicación y curvatura se estiman a partir de los datos. Hasta la etapa (g), el algoritmo utilizó modelos de manchas simples; a partir de (g), el algoritmo decidió que necesitaba modelos parabólicos más complejos para describir los datos. Las iteraciones se detuvieron en (h), cuando la similitud dejó de aumentar.
Organización jerárquica de los campos del modelado neuronal
Anteriormente, se describió un único nivel de procesamiento en un sistema NMF jerárquico. En cada nivel de la jerarquía, hay señales de entrada de niveles inferiores, modelos, medidas de similitud (L), emociones (definidas como cambios en la similitud) y acciones. Estas acciones incluyen la adaptación y el comportamiento que satisface el instinto de conocimiento (maximización de la similitud). La entrada a cada nivel es un conjunto de señales X (n) o, en terminología neuronal, un campo de entrada de activaciones neuronales. El resultado del procesamiento de señales en un nivel dado son modelos activados, o conceptos m reconocidos en las señales de entrada n. Estos modelos, junto con las señales instintivas y las emociones correspondientes, pueden activar modelos de comportamiento y generar conductas en este nivel.
Los modelos activados inician otras acciones. Sirven como señales de entrada para el siguiente nivel de procesamiento, donde se reconocen o crean modelos conceptuales más generales. Las señales de salida de un nivel dado, que sirven como entrada para el siguiente nivel, son las señales de activación del modelo, a m , definidas como
a m = Σ n=1..N f(m|n).
El sistema jerárquico NMF se ilustra en la Fig. 2. Dentro de la jerarquía de la mente, cada modelo conceptual encuentra su significado y propósito "mental" en un nivel superior (además de otros propósitos). Por ejemplo, consideremos el modelo conceptual "silla". Tiene un propósito "conductual" de iniciar la acción de sentarse (si el cuerpo lo requiere); este es el propósito "corporal" en el mismo nivel jerárquico. Además, tiene un propósito "puramente mental" en un nivel superior de la jerarquía, que consiste en ayudar a reconocer un concepto más general, por ejemplo, el de una "sala de conciertos", cuyo modelo contiene filas de sillas.
De vez en cuando, un sistema crea un nuevo concepto o elimina uno antiguo. En cada nivel, el sistema NMF siempre mantiene una reserva de modelos conceptuales inactivos (difusos). Son inactivos porque sus parámetros no se adaptan a los datos; por lo tanto, su similitud con las señales es baja. Sin embargo, debido a una gran imprecisión (covarianza), la similitud no es exactamente cero. Cuando una nueva señal no encaja bien en ninguno de los modelos activos, sus similitudes con los modelos inactivos aumentan automáticamente (porque primero, se tiene en cuenta cada pieza de datos, y segundo, los modelos inactivos son vagos e imprecisos y potencialmente pueden "capturar" cada señal que no encaja en modelos activos más específicos y menos imprecisos). Cuando la señal de activación a m para un modelo inactivo, m, supera un cierto umbral, el modelo se activa. De manera similar, cuando una señal de activación para un modelo en particular cae por debajo de un umbral, el modelo se desactiva. Los umbrales de activación y desactivación se establecen generalmente en función de la información existente en un nivel jerárquico superior (información previa, recursos del sistema, número de modelos activados de varios tipos, etc.). Las señales de activación para los modelos activos en un nivel particular { a m } forman un "campo neuronal", que sirve como señales de entrada para el siguiente nivel, donde se forman conceptos más abstractos y más generales.
Referencias
- ↑: Perlovsky, LI 2001. Redes neuronales e intelecto: uso de conceptos basados en modelos. Nueva York: Oxford University Press
- ↑ Perlovsky, LI (2006). Hacia la física de la mente: conceptos, emociones, conciencia y símbolos. Phys. Life Rev. 3(1), pp.22-55.
- ↑: Deming, RW, Detección automática de minas enterradas mediante el sistema neuronal adaptativo de máxima verosimilitud (MLANS), en Actas de Control Inteligente (ISIC) , 1998. Celebrado conjuntamente con el Simposio Internacional IEEE sobre Inteligencia Computacional en Robótica y Automatización (CIRA), Sistemas Inteligentes y Semiótica (ISAS)
- ↑Sitio web del Programa de Aplicaciones Tecnológicas de la MDA
- ↑: Cangelosi, A.; Tikhanoff, V.; Fontanari, JF; Hourdakis, E., Integrating Language and Cognition: A Cognitive Robotics Approach, Computational Intelligence Magazine, IEEE, Volumen 2, Número 3, Agosto de 2007 Páginas: 65 - 70
- ↑: Sensores y tecnologías de mando, control, comunicaciones e inteligencia (C3I) para la seguridad y defensa nacional III (Volumen de actas), Editor(es): Edward M. Carapezza, Fecha: 15 de septiembre de 2004, ISBN 978-0-8194-5326-6Véase el capítulo: Arquitectura de predicción de amenazas antiterroristas.
- ↑ Perlovsky, LI (1996). Conceptos matemáticos del intelecto. Actas del Congreso Mundial sobre Redes Neuronales, San Diego, CA; Lawrence Erlbaum Associates, NJ, pp. 1013-16
- ↑ Perlovsky, LI(1997). Conceptos físicos del intelecto. Proc. Russian Academy of Sciences, 354(3), pp. 320-323.
- ↑ Cramer, H. (1946). Métodos matemáticos de estadística, Princeton University Press, Princeton, NJ.
- ↑ Linnehan, R., Mutz, Perlovsky, LI, C., Weijers, B., Schindler, J., Brockett, R. (2003). Detección de patrones bajo el ruido en imágenes. Conferencia Internacional sobre la Integración de Sistemas Multiagente con Alto Nivel de Conocimiento, Cambridge, MA, 1-3 de octubre de 2003.
Relacionado
- Aprendizaje automático