Articulo de referencia

Filtro orientable

En el procesamiento de imágenes , un filtro orientable es un filtro selectivo de orientación que puede rotarse computacionalmente en cualquier dirección. En lugar de diseñar un ...

En el procesamiento de imágenes , un filtro orientable es un filtro selectivo de orientación que puede rotarse computacionalmente en cualquier dirección. En lugar de diseñar un nuevo filtro para cada orientación, un filtro orientable se sintetiza a partir de una combinación lineal de un pequeño conjunto fijo de "filtros base". Este enfoque es eficiente y se utiliza ampliamente para tareas que implican direccionalidad, como la detección de bordes , el análisis de texturas y la reconstrucción de formas a partir de sombreado . [ 1 ] [ 2 ]

El principio de direccionalidad se ha generalizado en el aprendizaje profundo para crear redes neuronales equivariantes , que pueden reconocer características en los datos independientemente de su orientación o posición. [ 3 ] [ 4 ]

Ejemplo

Un ejemplo común de filtro orientable es la primera derivada de una función gaussiana bidimensional . Este filtro responde fuertemente a características de imagen orientadas como los bordes. Se construye a partir de dos filtros base: la derivada parcial de la gaussiana con respecto a la dirección horizontal (incógnita{\displaystyle x}) y la dirección vertical (y{\displaystyle y}).

SiGRAMO(incógnita,y){\displaystyle G(x,y)}es la función gaussiana yGRAMOincógnita{\displaystyle G_{x}}yGRAMOy{\displaystyle G_{y}}son sus derivadas parciales (que miden la tasa de cambio en laincógnita{\displaystyle x}yy{\displaystyle y}direcciones, respectivamente), un nuevo filtroGRAMOθ{\displaystyle G_{\theta }}orientado en ánguloθ{\displaystyle \theta }se puede sintetizar con la fórmula: GRAMOθ=porque(θ)GRAMOincógnita+pecado(θ)GRAMOy{\displaystyle G_{\theta }=\cos(\theta )G_{x}+\sin(\theta )G_{y}}

Aquí, los filtros básicosGRAMOincógnita{\displaystyle G_{x}}yGRAMOy{\displaystyle G_{y}}están ponderados porporque(θ){\displaystyle \cos(\theta )}ypecado(θ){\displaystyle \sin(\theta )}para "orientar" la sensibilidad del filtro hacia la orientación deseada. Esto equivale a tomar el producto escalar del vector de dirección.(porqueθ,pecadoθ){\displaystyle (\cos \theta ,\sin \theta )}con el gradiente del filtro,(GRAMOincógnita,GRAMOy){\displaystyle (G_{x},G_{y})}. [ 1 ]

Generalización en el aprendizaje profundo: redes neuronales equivariantes

El concepto de direccionalidad es fundamental para las redes neuronales equivariantes , una clase de modelos en aprendizaje profundo diseñados para comprender las simetrías en los datos. [ 5 ] Una red se considera equivariante a una transformación (como una rotación) si transformar la entrada y luego pasarla a través de la red produce el mismo resultado que pasar primero la entrada a través de la red y luego transformar la salida. Formalmente, para una transformaciónT{\displaystyle T}y una redF{\displaystyle f}, esta propiedad se define comoF(T(aporte))=T(F(aporte)){\displaystyle f(T({\text{input}}))=T(f({\text{input}}))}.

Esta comprensión inherente de la geometría hace que los modelos sean más eficientes en el uso de datos . Por ejemplo, una red equivariante a la rotación no necesita que se le muestre un objeto en múltiples orientaciones para aprender a reconocerlo; comprende intrínsecamente que un objeto rotado sigue siendo el mismo objeto. Esto conduce a una mejor generalización y rendimiento, particularmente en aplicaciones científicas. [ 3 ]

Fundamentos matemáticos

Las redes neuronales equivariantes utilizan principios de la teoría de grupos para crear operaciones que respetan las simetrías geométricas, como el grupo SO(3) para rotaciones 3D o el grupo E(3) para rotaciones y traslaciones. [ 3 ]

En lugar de aprender núcleos de filtro estándar, estas redes aprenden a combinar un conjunto fijo de núcleos base . Estas funciones base se eligen de manera que presenten comportamientos bien definidos bajo grupos de transformación.

  • Los armónicos esféricos se utilizan frecuentemente como funciones base porque forman un conjunto completo de funciones que se comportan de manera predecible bajo rotación, lo que los hace ideales para crear núcleos 3D orientables. [ 6 ]
  • Las características dentro de la red se tratan como tensores geométricos , que son objetos matemáticos (como escalares o vectores ) que se "tipifican" por su comportamiento bajo transformaciones. Estos tipos corresponden a las representaciones irreducibles (irreps) del grupo. [ 3 ]
  • El producto tensorial es la operación fundamental utilizada para combinar estas características tipificadas de manera que se preserve la equivariancia, garantizando que la red en su conjunto respete la simetría deseada. [ 3 ]

Los marcos de trabajo como e3nn simplifican la construcción de estas redes al automatizar las matemáticas complejas de las representaciones irreducibles y los productos tensoriales. [ 3 ]

Aplicaciones

Los modelos orientables y equivariantes son muy eficaces para problemas con simetrías geométricas inherentes. Algunos ejemplos son:

Referencias

  1. 1 2 Freeman, WT y Adelson, EH (1991). "El diseño y uso de filtros orientables" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 13 (9): 891– 906. doi : 10.1109/34.93808 .
  2. Perona, P. (1995). "Núcleos deformables para la visión temprana" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 17 (5): 488– 499. Bibcode : 1995ITPAM..17..488P . doi : 10.1109/34.391394 .
  3. 1 2 3 4 5 6 Geiger, Mario; Smidt, Tess (18 de julio de 2022). "e3nn: Redes neuronales euclidianas". arXiv : 2207.09453 [ cs.LG ].
  4. Zhdanov, Maksim; Hoffmann, Nico; Cesa, Gabriele (2023). "Núcleos convolucionales implícitos para CNN orientables" (PDF) . Advances in Neural Information Processing Systems 36. Curran Associates, Inc.
  5. Cohen, Taco S.; Welling, Max (27 de diciembre de 2016). "Redes neuronales convolucionales orientables". arXiv : 1612.08498 [ cs.LG ].
  6. 1 2 Weiler, Maurice; Geiger, Mario; Welling, Max; Boomsma, Wouter; Cohen, Taco S. (2018). "3D Steerable CNNs: Learning Rotationally Equivariant Features in Volumetric Data" (PDF) . Advances in Neural Information Processing Systems 31. Curran Associates, Inc.
  7. Melnyk, Pavlo; Felsberg, Michael; Wadenbäck, Mårten (2022). "Neuronas esféricas 3D orientables" . Actas de la 39.ª Conferencia Internacional sobre Aprendizaje Automático . Vol. 162. PMLR. 
  8. Batzner, Simon; Musaelian, Albert; Sun, Lixin; et al. (4 de mayo de 2022). "Redes neuronales gráficas E(3)-equivariantes para potenciales interatómicos precisos y eficientes en datos" . Nature Communications . 13 (1): 2453. Bibcode : 2022NatCo..13.2453B . doi : 10.1038/ s41467-022-29939-5 . PMC 9068367. PMID 35513421 .