Las redes neuronales gráficas ( GNN ) son redes neuronales artificiales diseñadas para tareas cuyas entradas son grafos . [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ]
Dado que los grafos generalmente no tienen un orden canónico de sus nodos, las arquitecturas de GNN suelen diseñarse para ser equivariantes a las permutaciones : al reordenar los nodos en la entrada, las representaciones de nodos correspondientes se reordenan de la misma manera. Para tareas de predicción a nivel de grafo, las GNN suelen utilizar una función de lectura invariante a las permutaciones, cuya salida no se ve afectada por el orden de los nodos. [ 6 ]
Un ejemplo destacado es el diseño molecular de fármacos . [ 7 ] [ 8 ] [ 9 ] Las moléculas pueden representarse como grafos, con nodos para los átomos y aristas para los enlaces atómicos, incluyendo a menudo propiedades químicas conocidas como características. Por lo tanto, las entradas pueden variar en tamaño, debido a la cantidad variable de átomos y enlaces. Una tarea a nivel de grafo podría ser predecir la eficacia de una molécula determinada para una aplicación médica específica, como la eliminación de la bacteria E. coli .
El elemento clave del diseño de las GNN es el uso del paso de mensajes por pares , de modo que los nodos del grafo actualizan iterativamente sus representaciones intercambiando información con sus vecinos. Se han propuesto varias arquitecturas de GNN, [ 2 ] [ 3 ] [ 10 ] [ 11 ] [ 12 ] que implementan diferentes variantes de paso de mensajes, [ 6 ] [ 13 ] comenzando con enfoques recursivos [ 2 ] o constructivos convolucionales [ 3 ] . Un documento de posición de 2022 argumentó que muchas arquitecturas descritas como que van "más allá" del paso de mensajes pueden interpretarse en cambio como paso de mensajes sobre grafos modificados adecuadamente, y propuso el término "paso de mensajes aumentado" para tales enfoques. [ 14 ]

En el ámbito más general del " aprendizaje profundo geométrico ", ciertas arquitecturas de redes neuronales existentes pueden interpretarse como GNN que operan sobre grafos adecuadamente definidos. [ 6 ] Una capa de red neuronal convolucional , en el contexto de la visión artificial , puede considerarse una GNN aplicada a grafos cuyos nodos son píxeles , y solo los píxeles adyacentes están conectados por aristas en el grafo. Una capa transformadora , en el procesamiento del lenguaje natural , puede considerarse una GNN aplicada a grafos completos cuyos nodos son palabras o tokens en un fragmento de texto en lenguaje natural .
Los dominios de aplicación relevantes para las GNN incluyen el procesamiento del lenguaje natural , [ 15 ] redes sociales , [ 16 ] redes de citas , [ 17 ] biología molecular , [ 18 ] química , [ 19 ] [ 20 ] física [ 21 ] y problemas de optimización combinatoria NP-difíciles . [ 22 ]
Las bibliotecas de código abierto que implementan GNN incluyen PyTorch Geometric [ 23 ] ( PyTorch ), TensorFlow GNN [ 24 ] ( TensorFlow ), Deep Graph Library [ 25 ] (independiente del marco), jraph [ 26 ] ( Google JAX ) y GraphNeuralNetworks.jl [ 27 ] /GeometricFlux.jl [ 28 ] ( Julia , Flux ).
Arquitectura
La arquitectura de una GNN genérica implementa las siguientes capas fundamentales : [ 6 ]
- Capas equivariantes de permutación : una capa equivariante de permutación mapea una representación de un grafo en una representación actualizada del mismo grafo. En la literatura, las capas equivariantes de permutación se implementan mediante el paso de mensajes por pares entre nodos del grafo. [ 6 ] [ 14 ] Intuitivamente, en una capa de paso de mensajes, los nodos actualizan sus representaciones agregando los mensajes recibidos de sus vecinos inmediatos. De esta manera, cada capa de paso de mensajes aumenta el campo receptivo de la GNN en un salto.
- Agrupación local : una capa de agrupación local reduce la resolución del grafo mediante submuestreo . La agrupación local se utiliza para aumentar el campo receptivo de una GNN, de forma similar a las capas de agrupación en las redes neuronales convolucionales . Algunos ejemplos son la agrupación de k vecinos más cercanos , la agrupación de los k elementos principales [ 29 ] y la agrupación de autoatención [ 30 ] .
- Agrupación global : una capa de agrupación global, también conocida como capa de lectura , proporciona una representación de tamaño fijo de todo el grafo. La capa de agrupación global debe ser invariante a las permutaciones, de modo que las permutaciones en el orden de los nodos y aristas del grafo no alteren la salida final. [ 31 ] Algunos ejemplos incluyen la suma elemento a elemento, la media o el máximo.
Las GNN estándar de paso de mensajes son, como máximo, tan expresivas como la prueba de isomorfismo de grafos de Weisfeiler-Leman . [ 32 ] [ 33 ] En la práctica, esto significa que existen diferentes estructuras de grafos que no pueden ser distinguidas por las GNN. Se pueden diseñar GNN más potentes que operen en geometrías de dimensiones superiores, como los complejos simpliciales . [ 34 ] [ 35 ] [ 13 ] A partir de 2022, si las arquitecturas futuras superarán o no la primitiva de paso de mensajes es una cuestión de investigación abierta. [ 14 ]

capas de paso de mensajes

Las capas de paso de mensajes son capas equivariantes de permutación que mapean un grafo a una representación actualizada del mismo grafo. Formalmente, pueden expresarse como redes neuronales de paso de mensajes (MPNN). [ 6 ]
Dejarser un grafo , dondees el conjunto de nodos yes el conjunto de aristas. Seaser el vecindario de algún nodoAdemás, deje queser las características del nodo, yser las características del borde. Una capa MPNN se puede expresar de la siguiente manera: [ 6 ]
dóndeyson funciones diferenciables (por ejemplo, redes neuronales artificiales ), yes un operador de agregación invariante a permutaciones que puede aceptar un número arbitrario de entradas (por ejemplo, suma elemento a elemento, media o máximo). En particular,ySe denominan funciones de actualización y de mensaje , respectivamente. Intuitivamente, en un bloque computacional MPNN, los nodos del grafo actualizan sus representaciones agregando los mensajes recibidos de sus vecinos.
Las salidas de una o más capas MPNN son representaciones de nodos.para cada nodoen el grafo. Las representaciones de nodos se pueden emplear para cualquier tarea posterior, como la clasificación de nodos/grafos o la predicción de aristas.
Los nodos del grafo en una MPNN actualizan su representación agregando información de sus vecinos inmediatos. Como tal, apilarLas capas MPNN significan que un nodo podrá comunicarse con nodos que son como máximo"saltos" de distancia. En principio, para asegurar que cada nodo reciba información de todos los demás nodos, se necesitaría apilar un número de capas MPNN igual al diámetro del grafo . Sin embargo, apilar muchas capas MPNN puede causar problemas como el suavizado excesivo [ 36 ] y la compresión excesiva [ 37 ] . El suavizado excesivo se refiere al problema de que las representaciones de los nodos se vuelven indistinguibles. La compresión excesiva se refiere al cuello de botella que se crea al comprimir las dependencias de largo alcance en representaciones de tamaño fijo. Las contramedidas como las conexiones de salto [ 11 ] [ 38 ] (como en las redes neuronales residuales ), las reglas de actualización controladas [ 39 ] y el conocimiento de salto [ 40 ] pueden mitigar el suavizado excesivo. Modificar la capa final para que sea una capa totalmente adyacente, es decir, considerando el grafo como un grafo completo , puede mitigar la compresión excesiva en problemas donde se requieren dependencias de largo alcance [ 37 ] .
En la literatura se han desarrollado otros "sabores" de MPNN, [ 6 ] como las redes neuronales convolucionales gráficas [ 10 ] y las redes de atención gráfica, [ 12 ] cuyas definiciones pueden expresarse en términos del formalismo MPNN.
Red neuronal convolucional gráfica
La red neuronal convolucional gráfica (GCN) fue introducida por primera vez por Thomas Kipf y Max Welling en 2017. [ 10 ]
Una capa GCN define una aproximación de primer orden de un filtro espectral localizado en grafos. Las GCN pueden entenderse como una generalización de las redes neuronales convolucionales a datos con estructura de grafo.
La expresión formal de una capa GCN se lee de la siguiente manera:
dóndees la matriz de representaciones de nodos,es la matriz de características de los nodos,es una función de activación (por ejemplo, ReLU ),es la matriz de adyacencia del grafo con la adición de bucles propios,es la matriz de grados del grafo con la adición de bucles propios, yes una matriz de parámetros entrenables.
En particular, dejemosSea la matriz de adyacencia del grafo: entonces, se puede definiry, dóndedenota la matriz identidad . Esta normalización garantiza que los valores propios deestán delimitados en el rango, evitando inestabilidades numéricas y gradientes explosivos/desvanecientes .
Una limitación de las GCN es que no permiten características de borde multidimensionales.. [ 10 ] Sin embargo, es posible asociar pesos escalaresa cada borde mediante la imposición, es decir, estableciendo que cada entrada no nula en la matriz de adyacencia sea igual al peso de la arista correspondiente.
Red de atención gráfica
La red de atención gráfica (GAT) fue introducida por Petar Veličković et al. en 2018. [ 12 ]
Una red de atención gráfica es una combinación de una GNN y una capa de atención. La implementación de la capa de atención en las redes neuronales gráficas ayuda a centrar la atención en la información importante de los datos, en lugar de centrarse en todos los datos.
Una capa GAT de múltiples cabezas se puede expresar de la siguiente manera:
dóndees el número de cabezas de atención ,denota concatenación de vectores ,es una función de activación (por ejemplo, ReLU ),es el conjunto de nodos vecinos inmediatos del nodo, incluyendo el nodosí mismo,son coeficientes de atención para el-la cabeza de atención, yes una matriz de parámetros entrenables para el-la cabeza de atención.
Para la capa GAT final, las salidas de cada cabezal de atención se promedian antes de la aplicación de la función de activación. Formalmente, la capa GAT final se puede escribir como:
La atención en el aprendizaje automático es una técnica que imita la atención cognitiva . En el contexto del aprendizaje en grafos, el coeficiente de atenciónmide la importancia del nodoes al nodo.
Los coeficientes de atención normalizados se calculan de la siguiente manera:
dóndees un vector de pesos aprendibles,indica transposición ,son las características de borde (si están presentes), yes una función de activación ReLU modificada . Los coeficientes de atención se normalizan mediante softmax para que sean fácilmente comparables entre diferentes nodos. [ 12 ]
Una GCN puede considerarse un caso especial de una GAT donde los coeficientes de atención no son aprendibles, sino fijos e iguales a los pesos de las aristas..
Red neuronal de secuencia de grafos con compuertas
La red neuronal de secuencia de grafos con compuertas (GGS-NN) fue introducida por Yujia Li et al. en 2015. [ 39 ] La GGS-NN extiende la formulación de GNN de Scarselli et al. [ 2 ] a secuencias de salida. El marco de paso de mensajes se implementa como una regla de actualización para una celda de unidad recurrente con compuertas (GRU).
Un GGS-NN se puede expresar de la siguiente manera:
dóndedenota concatenación de vectores ,es un vector de ceros,es una matriz de parámetros aprendibles,es una célula GRU, ydenota el índice de secuencia. En una GGS-NN, las representaciones de los nodos se consideran los estados ocultos de una celda GRU. Las características iniciales del nodose rellenan con ceros hasta la dimensión del estado oculto de la celda GRU. La misma celda GRU se utiliza para actualizar las representaciones de cada nodo.
capas de agrupación local
Las capas de agrupación local transforman un grafo en un grafo más pequeño y simplificado antes de las capas posteriores de paso de mensajes o lectura. A diferencia de la agrupación global, que agrega todas las representaciones de nodos en una única representación a nivel de grafo, la agrupación local produce un grafo intermedio con su propia matriz de características de nodos y matriz de adyacencia. Los métodos de agrupación difieren en cómo se construye este grafo simplificado: los métodos de selección de nodos, como la agrupación top-k y la agrupación de autoatención, conservan un subconjunto de los nodos originales, mientras que los métodos de agrupación de nodos asignan los nodos originales a clústeres, que se convierten en nuevos nodos, o supernodos, en el grafo simplificado. [ 31 ] En cada caso, la entrada es un grafo representado por una matriz de características de nodos.y una matriz de adyacenciaEl resultado es una matriz de características de nodos más gruesa.y una matriz de adyacencia más gruesa.
Agrupación diferenciada
El agrupamiento diferenciable, o DiffPool, es un método de agrupamiento de nodos introducido en 2018. [ 41 ] En lugar de seleccionar un subconjunto de los nodos originales, DiffPool aprende una asignación flexible de nodos a clústeres (utilizando puntuaciones entre 0 y 1). Estos clústeres se convierten en los nodos del grafo reducido utilizado por la siguiente capa de la GNN.
Dada una matriz de características de nodosy una matriz de adyacencia, DiffPool utiliza dos redes neuronales gráficas. Una calcula incrustaciones de nodos actualizadas,
y el otro calcula una matriz de asignación,
dóndedenota la asignación suave del nodoagruparse. La matriz de características de nodos y la matriz de adyacencia, ahora más gruesas, se calculan como:
En esta formulación, cada nuevo nodo enrepresenta un grupo aprendido de nodos del grafo anterior y aristas enrepresenta la conectividad agregada entre clústeres. Debido a que la matriz de asignación es diferenciable, DiffPool puede entrenarse de extremo a extremo junto con las capas GNN circundantes. La formulación original introdujo adicionalmente pérdidas auxiliares para incentivar que los nodos cercanos se asignen a clústeres similares y para fomentar asignaciones de clústeres confiables. [ 41 ]
Agrupación Top-k
Primero establecimosdóndees un vector de proyección que se puede aprender y que calcula un valor de proyección escalar para cada nodo.
La capa de agrupación top-k [ 29 ] se puede formalizar de la siguiente manera:
dóndees el subconjunto de nodos con las puntuaciones de proyección más altas (top-k),denota la multiplicación de matrices elemento a elemento , yes la función sigmoide . En otras palabras, los nodos con las k puntuaciones de proyección más altas se conservan en la nueva matriz de adyacencia.. ElLa operación hace que el vector de proyecciónentrenable mediante retropropagación , que de otro modo produciría salidas discretas. [ 29 ]
Agrupación de la autoatención
UsandoComo una capa GNN equivariante de permutación genérica (por ejemplo, GCN, GAT, MPNN), la capa de agrupación de autoatención [ 30 ] se puede formalizar de la siguiente manera:
dóndees el subconjunto de nodos con las puntuaciones de proyección más altas (top-k),denota la multiplicación de matrices elemento a elemento .
La capa de agrupación de autoatención puede considerarse una extensión de la capa de agrupación top-k. A diferencia de la agrupación top-k, las puntuaciones de autoatención calculadas en la capa de agrupación de autoatención tienen en cuenta tanto las características del grafo como su topología.
Aprendizaje de gráficos heterofílico
El principio de homofilia , es decir, que los nodos con las mismas etiquetas o atributos similares tienen más probabilidades de estar conectados, se ha considerado comúnmente como la razón principal de la superioridad de las GNN sobre las redes neuronales tradicionales (NN) en datos estructurados en grafos, especialmente en tareas a nivel de nodo. [ 42 ] Sin embargo, trabajos recientes han identificado un conjunto no trivial de conjuntos de datos donde el rendimiento de las GNN en comparación con las NN no es satisfactorio. [ 43 ] La heterofilia , es decir, la baja homofilia, se ha considerado la causa principal de esta observación empírica. [ 44 ] Se ha comenzado a revisar y reevaluar la mayoría de los modelos de grafos existentes en el escenario de heterofilia en varios tipos de grafos, por ejemplo, grafos heterogéneos , grafos temporales e hipergrafos . Además, se ha descubierto que numerosas aplicaciones relacionadas con grafos están estrechamente vinculadas al problema de la heterofilia, por ejemplo, la detección de fraude/anomalías en grafos , los ataques adversarios y la robustez de los grafos , la privacidad, el aprendizaje federado y la segmentación de nubes de puntos , la agrupación de grafos , los sistemas de recomendación , los modelos generativos , la predicción de enlaces , la clasificación y coloración de grafos , etc. En los últimos años, se ha dedicado un esfuerzo considerable al estudio y la solución del problema de la heterofilia en el aprendizaje de grafos. [ 42 ] [ 44 ] [ 45 ]
Escalabilidad y formación distribuida
El entrenamiento de redes neuronales gráficas (GNN) en grafos grandes presenta desafíos computacionales que difieren sustancialmente de los de otras arquitecturas de redes neuronales. Surgen dos escenarios problemáticos principales: el entrenamiento en un único grafo muy grande (como una red social con miles de millones de nodos) y el entrenamiento en conjuntos de grafos individuales grandes (como sistemas moleculares que requieren modelado de interacciones de orden superior).
Para el escenario de un único grafo grande, los métodos basados en muestreo reducen los requisitos de memoria al operar en subgrafos en lugar del grafo completo. Cluster-GCN particiona el grafo en subgrafos utilizando algoritmos de particionamiento de grafos , entrenando el modelo en cada partición en secuencia. [ 46 ] GraphSAINT en cambio muestrea subgrafos estocásticamente durante el entrenamiento, construyendo estimadores insesgados para la pérdida del grafo completo. [ 47 ] Los marcos distribuidos como DistDGL [ 48 ] extienden el entrenamiento a entornos de múltiples máquinas, gestionando la comunicación entre máquinas necesaria para la agregación de vecindarios cuando los nodos de un grafo están distribuidos entre máquinas.
Para tareas como las simulaciones atómicas , surge un cuello de botella diferente: las arquitecturas GNN que modelan interacciones de orden superior entre tripletes o cuádruples de átomos son intensivas en memoria a nivel de grafos individuales, lo que hace que el paralelismo de datos estándar —donde cada GPU procesa una muestra separada— sea insuficiente cuando los grafos individuales superan la memoria de un solo dispositivo. El paralelismo de grafos aborda esto distribuyendo un único grafo de entrada entre múltiples GPU, particionando nodos y aristas entre dispositivos en lugar de distribuir muestras entre dispositivos. [ 49 ] Este enfoque permitió entrenar GNN con cientos de millones a miles de millones de parámetros en sistemas atómicos que de otro modo superarían la memoria de un solo dispositivo, y se ha aplicado al desarrollo de potenciales interatómicos universales a gran escala .
Aplicaciones
Redes sociales
Las redes sociales son un dominio de aplicación importante para las GNN debido a su representación natural como grafos sociales . Las GNN se utilizan para desarrollar sistemas de recomendación basados tanto en relaciones sociales como en relaciones de elementos. [ 50 ] [ 16 ]
Optimización combinatoria
Las GNN se utilizan como bloques de construcción fundamentales para varios algoritmos de optimización combinatoria. [ 51 ] Algunos ejemplos incluyen el cálculo de caminos más cortos o circuitos eulerianos para un grafo dado, [ 39 ] la obtención de ubicaciones de chips superiores o competitivas a las soluciones humanas elaboradas manualmente, [ 52 ] y la mejora de las reglas de ramificación diseñadas por expertos en ramificación y acotación . [ 53 ]
Ciberseguridad
Cuando se visualiza como un grafo, una red de computadoras puede analizarse con GNN para la detección de anomalías. Las anomalías dentro de los grafos de procedencia a menudo se correlacionan con actividad maliciosa dentro de la red. Las GNN se han utilizado para identificar estas anomalías en nodos individuales [ 54 ] y dentro de rutas [ 55 ] para detectar procesos maliciosos, o en el nivel de aristas [ 56 ] para detectar movimiento lateral .
redes de distribución de agua
Los sistemas de distribución de agua pueden modelarse como grafos. Las GNN se han aplicado a la previsión de la demanda de agua, [ 57 ] interconectando las Áreas de Medición de Distrito (DMA) para mejorar la capacidad de previsión. Otra aplicación es el desarrollo de metamodelos. [ 58 ]
Visión por computadora
Para representar una imagen como una estructura gráfica, primero se divide en múltiples parches, cada uno de los cuales se trata como un nodo en el grafo. Luego, se forman aristas conectando cada nodo con sus vecinos más cercanos en función de la similitud espacial o de características. Esta representación basada en grafos permite la aplicación de modelos de aprendizaje de grafos a tareas visuales. La estructura relacional ayuda a mejorar la extracción de características y el rendimiento en la comprensión de imágenes. [ 59 ]
Texto y PLN
La representación de texto basada en grafos ayuda a capturar relaciones semánticas más profundas entre las palabras. Muchos estudios han utilizado redes de grafos para mejorar el rendimiento en diversas tareas de procesamiento de texto, como la clasificación de texto, la respuesta a preguntas, la traducción automática neuronal (NMT), la extracción de eventos, la verificación de hechos, etc. [ 60 ]
Simulaciones atómicas y ciencia de los materiales
Las redes neuronales gráficas (GNN) se han convertido en una herramienta fundamental para modelar las interacciones atómicas en la química computacional y la ciencia de los materiales , donde las moléculas y las estructuras cristalinas se representan de forma natural como grafos con átomos como nodos y enlaces químicos o proximidad espacial como aristas. Una ventaja clave sobre los métodos tradicionales de química cuántica, como la teoría del funcional de la densidad (DFT), es la reducción del coste computacional de O(n³) a O(n), lo que permite realizar simulaciones a escalas que antes eran impracticables.
Las primeras arquitecturas GNN para este dominio incluyen SchNet (2017), que introdujo capas convolucionales de filtro continuo para el aprendizaje en estructuras moleculares 3D, [ 61 ] y DimeNet (2020), que incorporó información angular entre átomos para mejorar la expresividad geométrica. [ 62 ] Arquitecturas equivariantes posteriores como NequIP [ 63 ] y MACE, [ 64 ] que respetan las simetrías rotacionales y traslacionales de los sistemas físicos, lograron mejoras significativas en la precisión en puntos de referencia estándar incluidos QM9, MD17 y el Materials Project .
Los grandes conjuntos de datos abiertos han impulsado un rápido progreso en esta área. El conjunto de datos Open Catalyst 2020 (OC20), que comprende más de 260 millones de cálculos DFT de interacciones superficie-catalizador-adsorbato, estableció un punto de referencia ampliamente utilizado para tareas de predicción de energía y fuerza relevantes para el descubrimiento de catalizadores . [ 65 ] Las bases de datos Materials Project y Alexandria también han proporcionado datos de estructura cristalina a gran escala para el entrenamiento de potenciales interatómicos universales. Conjuntos de datos más recientes, incluidos OMat24 y OMol25, han extendido la cobertura a moléculas orgánicas y materiales complejos a una mayor escala computacional.
Estos conjuntos de datos han permitido el desarrollo de potenciales interatómicos de aprendizaje automático universales (MLIP), modelos entrenados en diversos dominios químicos en lugar de en datos específicos del sistema. Algunos ejemplos incluyen CHGNet, [ 66 ] M3GNet, [ 67 ] MACE-MP y los Modelos Universales para Átomos (UMA) de Meta FAIR, este último entrenado en aproximadamente 500 millones de estructuras atómicas que abarcan moléculas, materiales y catalizadores. [ 68 ] GNoME, desarrollado por Google DeepMind , aplicó GNN para predecir la estabilidad de estructuras cristalinas, informando la identificación de millones de nuevos materiales candidatos estables. [ 69 ]
Referencias
- ↑ Wu, Lingfei; Cui, Peng; Pei, Jian; Zhao, Liang (2022). "Redes neuronales gráficas: fundamentos, fronteras y aplicaciones" . Springer Singapur : 725.
- 1 2 3 4 Scarselli, Franco; Gori, Marco; Tsoi, Ah Chung; Hagenbuchner, Markus; Monfardini, Gabriele (2009). " El modelo de red neuronal gráfica" . IEEE Transactions on Neural Networks . 20 (1): 61– 80. Bibcode : 2009ITNN...20...61S . doi : 10.1109/TNN.2008.2005605 . ISSN 1941-0093 . PMID 19068426. S2CID 206756462 .
- 1 2 3 Micheli, Alessio (2009). "Red neuronal para grafos: un enfoque constructivo contextual". IEEE Transactions on Neural Networks . 20 (3): 498– 511. Bibcode : 2009ITNN...20..498M . doi : 10.1109/TNN.2008.2010350 . ISSN 1045-9227 . PMID 19193509 . S2CID 17486263 .
- ↑ Sanchez-Lengeling, Benjamin; Reif, Emily; Pearce, Adam; Wiltschko, Alex (2 de septiembre de 2021). "Una introducción sencilla a las redes neuronales gráficas" . Distill . 6 (9) e33. doi : 10.23915/distill.00033 . ISSN 2476-0757 .
- ↑ Daigavane, Ameya; Ravindran, Balaraman; Aggarwal, Gaurav (2 de septiembre de 2021). "Understanding Convolutions on Graphs" . Distill . 6 (9) e32. doi : 10.23915/distill.00032 . ISSN 2476-0757 . S2CID 239678898 .
- 1 2 3 4 5 6 7 8 Bronstein, Michael M.; Bruna, Joan; Cohen, Taco; Veličković, Petar (4 de mayo de 2021). "Aprendizaje profundo geométrico: cuadrículas, grupos, grafos, geodésicas y calibres". arXiv : 2104.13478 [ cs.LG ].
- ↑ Stokes, Jonathan M.; Yang, Kevin; Swanson, Kyle; Jin, Wengong; Cubillos-Ruiz, Andres; Donghia, Nina M.; MacNair, Craig R.; French, Shawn; Carfrae, Lindsey A.; Bloom-Ackermann, Zohar; Tran, Victoria M.; Chiappino-Pepe, Anush; Badran, Ahmed H.; Andrews, Ian W.; Chory, Emma J. (20 de febrero de 2020). "Un enfoque de aprendizaje profundo para el descubrimiento de antibióticos" . Cell . 180 (4): 688–702.e13. Bibcode : 2020Cell..180..688S . doi : 10.1016/j.cell.2020.01.021 . ISSN 1097-4172 . PMC 8349178 . PMID 32084340 .
- ↑ Yang, Kevin; Swanson, Kyle; Jin, Wengong; Coley, Connor; Eiden, Philipp; Gao, Hua; Guzman-Perez, Angel; Hopper, Timothy; Kelley, Brian (20 de noviembre de 2019). "Análisis de representaciones moleculares aprendidas para la predicción de propiedades". arXiv : 1904.01561 [ cs.LG ].
- ↑ Marchant, Jo (20 de febrero de 2020). "Descubiertos potentes antibióticos mediante IA" . Nature . doi : 10.1038/d41586-020-00018-3 . PMID 33603175 .
- 1 2 3 4 Kipf, Thomas N; Welling, Max (2016). "El modelo de red neuronal gráfica". IEEE Transactions on Neural Networks . 20 (1): 61– 80. arXiv : 1609.02907 . Bibcode : 2009ITNN...20...61S . doi : 10.1109/TNN.2008.2005605 . PMID 19068426 . S2CID 206756462 .
- 1 2 Hamilton, William; Ying, Rex; Leskovec, Jure (2017). "Aprendizaje de representación inductiva en grafos grandes" ( PDF) . Neural Information Processing Systems . 31. arXiv : 1706.02216 – vía Stanford.
- 1 2 3 4 Veličković, Petar; Cucurull, Guillem; Casanova, Arantxa; Romero, Adriana; Lió, Pietro; Bengio, Yoshua (4 de febrero de 2018). "Graficar redes de atención". arXiv : 1710.10903 [ estad.ML ].
- 1 2 Hajij, M.; Zamzmi, G.; Papamarkou, T.; Miolane, N.; Guzmán-Sáenz, A.; Ramamurthy, KN; Schaub, MT (2022). "Aprendizaje profundo topológico: ir más allá de los datos gráficos". arXiv : 2206.00606 [ cs.LG ].
- ^ Veličković , Petar (2022) . "Mensaje que llega hasta arriba". arXiv : 2202.11097 [ cs.LG ].
- ↑ Wu, Lingfei; Chen, Yu; Shen, Kai; Guo, Xiaojie; Gao, Hanning; Li, Shucheng; Pei, Jian; Long, Bo (2023). "Redes neuronales gráficas para el procesamiento del lenguaje natural: una revisión" . Fundamentos y tendencias en aprendizaje automático . 16 (2): 119– 328. arXiv : 2106.06090 . doi : 10.1561/2200000096 . ISSN 1941-0093 . S2CID 206756462 .
- 1 2 Ying, Rex; He, Ruining; Chen, Kaifeng; Eksombatchai, Pong; Hamilton, William L.; Leskovec, Jure (2018). Redes neuronales convolucionales gráficas para sistemas de recomendación a escala web . pp. 974–983 . arXiv : 1806.01973 . doi : 10.1145/3219819.3219890 . ISBN 978-1-4503-5552-0. S2CID 46949657 .
- ↑ "Colección de conjuntos de datos de redes grandes de Stanford" . snap.stanford.edu . Consultado el 5 de julio de 2021 .
- ↑ Zhang, Weihang; Cui, Yang; Liu, Bowen; Loza, Martin; Park, Sung-Joon; Nakai, Kenta (5 de abril de 2024). "HyGAnno: Anotación de tipos celulares basada en redes neuronales gráficas híbridas para datos de secuenciación ATAC de células individuales" . Briefings in Bioinformatics . 25 (3) bbae152. doi : 10.1093/bib/bbae152 . PMC 10998639. PMID 38581422 .
- ↑ Gilmer, Justin; Schoenholz, Samuel S.; Riley, Patrick F.; Vinyals, Oriol; Dahl, George E. (17 de julio de 2017). "Paso de mensajes neuronales para la química cuántica" . Actas de la investigación en aprendizaje automático : 1263–1272 . arXiv : 1704.01212 .
- ↑ Coley, Connor W.; Jin, Wengong; Rogers, Luke; Jamison, Timothy F.; Jaakkola, Tommi S.; Green, William H.; Barzilay, Regina; Jensen, Klavs F. (2 de enero de 2019). "Un modelo de red neuronal convolucional gráfica para la predicción de la reactividad química" . Chemical Science . 10 (2): 370– 377. doi : 10.1039/C8SC04228D . ISSN 2041-6539 . PMC 6335848. PMID 30746086 .
- ^ Qasim, Shah Rukh; Kieseler, enero; Iiyama, Yutaro; Pierini, Maurizio Pierini (2019). "Aprendizaje de representaciones de la geometría del detector de partículas irregulares con redes de gráficos ponderados por distancia" . La revista física europea C. 79 (7): 608. arXiv : 1902.07987 . Código Bib : 2019EPJC...79..608Q . doi : 10.1140/epjc/s10052-019-7113-9 . S2CID 88518244 .
- ↑ Li, Zhuwen; Chen, Qifeng; Koltun, Vladlen (2018). "Simplificación de texto con redes generadoras de punteros basadas en autoatención". Procesamiento de información neuronal . Notas de clase en ciencias de la computación. Vol. 31. págs. 537–546 . arXiv : 1810.10659 . doi : 10.1007/978-3-030-04221-9_48 . ISBN 978-3-030-04220-2.
- ↑ Matthias, Fey; Lenssen, Jan E. (2019). "Aprendizaje rápido de representación gráfica con PyTorch Geometric". arXiv : 1903.02428 [ cs.LG ].
- ↑ «Tensorflow GNN» . GitHub . Consultado el 30 de junio de 2022 .
- ↑ "Biblioteca de grafos profundos (DGL)" . Consultado el 12 de septiembre de 2024 .
- ↑ "jraph" . GitHub . Consultado el 30 de junio de 2022 .
- ↑ Lucibello, Carlo (2021). "GraphNeuralNetworks.jl" . GitHub . Recuperado el 21 de septiembre de 2023 .
- ↑ FluxML/GeometricFlux.jl , FluxML, 31 de enero de 2024 , consultado el 3 de febrero de 2024
- 1 2 3 Gao, Hongyang; Ji, Shuiwang Ji (2019). "Graficar U-Nets". arXiv : 1905.05178 [ cs.LG ].
- 1 2 Lee, Junhyun; Lee, Inyeop; Kang, Jaewoo (2019). "Agrupación de grafos con autoatención". arXiv : 1904.08082 [ cs.LG ].
- 1 2 Liu, Chuang; Zhan, Yibing; Li, Chang; Du, Bo; Wu, Jia; Hu, Wenbin; Liu, Tongliang; Tao, Dacheng (2022). "Agrupación de gráficos para redes neuronales de gráficos: avances, desafíos y oportunidades". arXiv : 2204.07321 [ cs.LG ].
- ↑ Douglas, BL (27 de enero de 2011). "El método Weisfeiler-Lehman y la prueba de isomorfismo de grafos". arXiv : 1101.5211 [ math.CO ].
- ↑ Xu, Keyulu; Hu, Weihua; Leskovec, Jure; Jegelka, Stefanie (22 de febrero de 2019). "¿Qué tan poderosas son las redes neuronales gráficas?". arXiv : 1810.00826 [ cs.LG ].
- ^ Bodnar, cristiano; Frasca, Fabricio; Guang Wang, Yu; Nutria, Nina; Montúfar, Guido; Lió, Pietro; Bronstein, Michael (2021). "Weisfeiler y Lehman se vuelven topológicos: mensajes que pasan por redes simples". arXiv : 2103.03212 [ cs.LG ].
- ↑ Grady, Leo; Polimeni, Jonathan (2011). Cálculo discreto: análisis aplicado a grafos para la ciencia computacional (PDF) . Springer.
- ↑ Chen, Deli; Lin, Yankai; Li, Wei; Li, Peng; Zhou, Jie; Sun, Xu (2020). "Medición y alivio del problema del suavizado excesivo para redes neuronales gráficas desde la perspectiva topológica". Actas de la Conferencia AAAI sobre Inteligencia Artificial . 34 (4): 3438– 3445. arXiv : 1909.03211 . doi : 10.1609/aaai.v34i04.5747 . S2CID 202539008 .
- 1 2 Alon, Uri; Yahav, Eran (2021). "Sobre el cuello de botella de las redes neuronales gráficas y sus implicaciones prácticas". arXiv : 2006.05205 [ cs.LG ].
- ↑ Xu, Keyulu; Zhang, Mozhi; Jegelka, Stephanie ; Kawaguchi, Kenji (2021). "Optimización de redes neuronales gráficas: aceleración implícita mediante conexiones de salto y mayor profundidad". arXiv : 2105.04550 [ cs.LG ].
- 1 2 3 Li, Yujia; Tarlow, Daniel; Brockschmidt, Mark; Zemel, Richard (2016). "Redes neuronales de secuencia de grafos con compuertas". arXiv : 1511.05493 [ cs.LG ].
- ↑ Xu, Keyulu; Li, Chengtao; Tian, Yonglong; Sonobe, Tomohiro; Kawarabayashi, Ken-ichi; Jegelka, Stefanie (2018). "Representation Learning on Graphs with Jumping Knowledge Networks". arXiv : 1806.03536 [ cs.LG ].
- 1 2 Ying, Rex; You, Jiaxuan; Morris, Christopher; Ren, Xiang; Hamilton, William L.; Leskovec, Jure (2018). Aprendizaje de representación jerárquica de grafos con agrupamiento diferenciable . Avances en sistemas de procesamiento de información neuronal. Vol. 31. arXiv : 1806.08804 .
- 1 2 Luan, Sitao; Hua, Chenqing; Lu, Qincheng; Mamá, Liheng; Wu, Lirong; Wang, Xinyu; Xu, Minkai; Chang, Xiao-Wen; Precopa, Doina; Ying, Rex; Li, Stan Z.; Tang, Jian; Lobo, chico; Jegelka, Stefanie (2024). "El manual de aprendizaje de gráficos heterofílicos: puntos de referencia, modelos, análisis teórico, aplicaciones y desafíos". arXiv : 2407.09618 [ cs.LG ].
- ↑ Luan, Sitao; Hua, Chenqing; Lu, Qincheng; Zhu, Jiaqi; Chang, Xiao-Wen; Precup, Doina (2024). "¿Cuándo necesitamos redes neuronales gráficas para la clasificación de nodos?" . En Cherifi, Hocine; Rocha, Luis M.; Cherifi, Chantal; Donduran, Murat (eds.). Redes complejas y sus aplicaciones XII . Estudios en inteligencia computacional. Vol. 1141. Cham: Springer Nature Suiza. pp. 37–48 . doi : 10.1007/978-3-031-53468-3_4 . ISBN 978-3-031-53467-6.
- 1 2 Luan, Sitao; Hua, Chenqing; Lu, Qincheng; Zhu, Jiaqi; Zhao, Mingde; Zhang, Shuyuan; Chang, Xiao-Wen; Precopa, Doina (6 de diciembre de 2022). "Revisando la heterofilia para redes neuronales gráficas" . Avances en los sistemas de procesamiento de información neuronal . 35 : 1362–1375 . arXiv : 2210.07606 .
- ↑ Luan, Sitao; Hua, Chenqing; Xu, Minkai; Lu, Qincheng; Zhu, Jiaqi; Chang, Xiao-Wen; Fu, Jie; Leskovec, Jure; Precup, Doina (15 de diciembre de 2023). "¿Cuándo ayudan las redes neuronales gráficas con la clasificación de nodos? Investigación del principio de homofilia en la distinguibilidad de nodos" . Advances in Neural Information Processing Systems . 36 : 28748–28760 .
- ↑ Chiang, Wei-Lin; Liu, Xuanqing; Si, Si; Li, Yang; Bengio, Samy; Hsieh, Cho-Jui (2019). Cluster-GCN: Un algoritmo eficiente para entrenar redes neuronales convolucionales de grafos grandes y profundas . Actas de la 25.ª Conferencia Internacional ACM SIGKDD sobre Descubrimiento de Conocimiento y Minería de Datos. págs. 257–266 . arXiv : 1905.07953 . doi : 10.1145/3292500.3330925 .
- ↑ Zeng, Hanqing; Zhou, Hongkuan; Srivastava, Ajitesh; Kannan, Rajgopal; Prasanna, Viktor (2020). GraphSAINT: Método de aprendizaje inductivo basado en muestreo de grafos . Conferencia internacional sobre representaciones de aprendizaje. arXiv : 1907.04931 .
- ↑ Zheng, Da; Ma, Chao; Wang, Minjie; Zhou, Jinjing; Su, Qidong; Song, Xiang; Gan, Quan; Zhang, Zheng; Karypis, George (2020). DistDGL: Entrenamiento de redes neuronales gráficas distribuidas para grafos de miles de millones de elementos . Actas del Taller sobre Aplicaciones Irregulares: Arquitecturas y Algoritmos (IA³). arXiv : 2010.05337 .
- ↑ Sriram, Anuroop; Das, Abhishek; Wood, Brandon M.; Goyal, Siddharth; Zitnick, C. Lawrence (2022). Hacia el entrenamiento de redes neuronales gráficas de mil millones de parámetros para simulaciones atómicas . Conferencia internacional sobre representaciones de aprendizaje. arXiv : 2203.09697 .
- ^ Fanático, Wenqi; Mamá, Yao; Li, Qing; Él, Yuan; Zhao, Eric; Tang, Jiliang; Yin, Dawei (2019). Graficar redes neuronales para recomendación social . págs. 417– 426. arXiv : 1902.07243 . doi : 10.1145/3308558.3313488 . hdl : 10397/81232 . ISBN 978-1-4503-6674-8. S2CID 67769538 .
- ↑ Cappart, Quentin; Chételat, Didier; Khalil, Elias; Lodi, Andrea; Morris, Christopher; Veličković, Petar (2021). "Optimización combinatoria y razonamiento con redes neuronales gráficas". arXiv : 2102.09544 [ cs.LG ].
- ↑ Mirhoseini, Azalia; Goldie, Anna; Yazgan, Mustafa; Jiang, Joe Wenjie; Songhori, Ebrahim; Wang, Shen; Lee, Young-Joon; Johnson, Eric; Pathak, Omkar; Nazi, Azade; Pak, Jiwoo; Tong, Andy; Srinivasa, Kavya; Hang, William; Tuncer, Emre; Le, Quoc V.; Laudon, James; Ho, Richard; Carpenter, Roger; Dean, Jeff (2021). "Una metodología de colocación de grafos para el diseño rápido de chips". Nature . 594 (7862): 207– 212. Bibcode : 2021Natur.594..207M . doi : 10.1038/s41586-021-03544-w . PMID 34108699 . S2CID 235395490 .
- ↑ Gasse, Maxime; Chételat, Didier; Ferroni, Nicola; Charlin, Laurent; Lodi, Andrea (2019). "Optimización combinatoria exacta con redes neuronales convolucionales de grafos". arXiv : 1906.01629 [ cs.LG ].
- ↑ Wang, Su; Wang, Zhiliang; Zhou, Tao; Sun, Hongbin; Yin, Xia; Han, Dongqi; Zhang, Han; Shi, Xingang; Yang, Jiahai (2022). "Threatrace: Detección y rastreo de amenazas basadas en el host a nivel de nodo mediante el aprendizaje de grafos de procedencia" . IEEE Transactions on Information Forensics and Security . 17 : 3972–3987 . arXiv : 2111.04333 . Bibcode : 2022ITIF...17.3972W . doi : 10.1109/TIFS.2022.3208815 . ISSN 1556-6021 . S2CID 243847506 .
- ↑ Wang, Qi; Hassan, Wajih Ul; Li, Ding; Jee, Kangkook; Yu, Xiao (2020). "Eres lo que haces: Detección de malware sigiloso mediante análisis de procedencia de datos" . Simposio sobre seguridad en redes y sistemas distribuidos . doi : 10.14722/ndss.2020.24167 . ISBN 978-1-891562-61-7. S2CID 211267791 .
- ↑ King, Isaiah J.; Huang, H. Howie (2022). "Euler: Detección de movimiento lateral de red mediante predicción escalable de enlaces temporales" (PDF) . En Actas del 29.º Simposio sobre seguridad de redes y sistemas distribuidos . doi : 10.14722/ndss.2022.24107 . S2CID 248221601 .
- ↑ Zanfei, Ariele; et al. (2022). "Redes neuronales recurrentes convolucionales gráficas para la previsión de la demanda de agua" . Water Resources Research . 58 (7) e2022WR032299. AGU. Bibcode : 2022WRR....5832299Z . doi : 10.1029/2022WR032299 . Consultado el 11 de junio de 2024 .
- ↑ Zanfei, Ariele; et al. (2023). "¿Debemos usar siempre modelos hidráulicos? Un metamodelo de red neuronal gráfica para la calibración de sistemas de agua y la evaluación de la incertidumbre" . Water Research . 242 120264. Bibcode : 2023WatRe.24220264Z . doi : 10.1016/j.watres.2023.120264 . PMID 37393807 .
- ↑ Han, Kai; Wang, Yunhe; Guo, Jianyuan; Tang, Yehui; Wu, Enhua (2022). "Vision GNN: una imagen vale un gráfico de nodos". arXiv : 2206.00272 [ cs.CV ].
- ^ Zhou, Jie; Cui, Ganqu; Hu, Shengding; Zhang, Zhengyan; Yang, Cheng; Liu, Zhiyuan; Wang, Lifeng; Li, Changcheng; Sun, Maosong (1 de enero de 2020). "Graficar redes neuronales: una revisión de métodos y aplicaciones" . IA abierta . 1 : 57– 81. doi : 10.1016/j.aiopen.2021.01.001 . ISSN 2666-6510 .
- ^ Schütt, Kristof T.; Kindermans, Pieter-Jan; Sauceda, Huziel E.; Chmiela, Stefan; Tkatchenko, Alexandre; Müller, Klaus-Robert (2017). SchNet: una red neuronal convolucional de filtro continuo para modelar interacciones cuánticas . Avances en los sistemas de procesamiento de información neuronal. vol. 30. arXiv : 1706.08566 .
- ↑ Gasteiger, Johannes; Groß, Janek; Günnemann, Stephan (2020). Paso de mensajes direccional para grafos moleculares . Conferencia internacional sobre representaciones de aprendizaje. arXiv : 2003.03123 .
- ↑ Batzner, Simon; Musaelian, Albert; Sun, Lixin; Geiger, Mario; Mailoa, Jonathan P.; Kornbluth, Mordechai; Molinari, Nicola; Smidt, Tess E.; Kozinsky, Boris (2022). "Redes neuronales gráficas E(3)-equivariantes para potenciales interatómicos precisos y eficientes en datos" . Nature Communications . 13 (1) 2453. arXiv : 2101.03164 . Bibcode : 2022NatCo..13.2453B . doi : 10.1038/ s41467-022-29939-5 . PMC 9068745. PMID 35508450 .
- ^ Batatia, Ilyes; Kovács, Dávid Péter; Simm, Gregor NC; Ortner, Christoph; Csányi, Gábor (2022). "MACE: Mensaje equivalente de orden superior que pasa por redes neuronales para campos de fuerza rápidos y precisos" . Avances en los sistemas de procesamiento de información neuronal. vol. 35. págs. 11423–11436 . arXiv : 2206.07697 .
- ↑ Chanussot, Lowik; Das, Abhishek; Goyal, Siddharth; Lavril, Thibaut; Shuaibi, Muhammed; Riviere, Morgane; Tran, Kevin; Heras-Domingo, Javier; Ho, Caleb; Hu, Weihua; Palizhati, Aini; Sriram, Anuroop; Wood, Brandon; Yoon, Junwoong; Parikh, Devi; Zitnick, C. Lawrence; Ulissi, Zachary (2021). "Open Catalyst 2020 (OC20) Dataset and Community Challenges". ACS Catalysis . 11 (10): 6059– 6072. arXiv : 2010.09990 . doi : 10.1021/acscatal.0c04525 .
- ↑ Deng, Bowen; Zhong, Peichen; Jun, KyuJung; Riebesell, Janosh; Han, Kevin; Barber, Christopher J.; Ceder, Gerbrand (2023). "CHGNet como potencial de red neuronal universal preentrenada para modelado atomístico con información de carga". Nature Machine Intelligence . 5 (9): 1031– 1041. arXiv : 2302.14231 . Bibcode : 2023NatMI...5.1031D . doi : 10.1038/s42256-023-00716-3 .
- ↑ Chen, Chi; Ong, Shyue Ping (2022). "Un potencial interatómico de aprendizaje profundo de grafos universal para la tabla periódica". Nature Computational Science . 2 (11): 718– 728. arXiv : 2202.02450 . doi : 10.1038/s43588-022-00349-3 . PMID 38177366 .
- ^ Madera, Brandon M.; Dzamba, Misko; Fu, Xiang; Gao, Meng; Shuaibi, Mahoma; Barroso-Luque, Luis; et al. (2025). "UMA: una familia de modelos universales para átomos". arXiv : 2506.23971 [ cs.LG ].
- ↑ Merchant, Amil; Batzner, Simon; Schoenholz, Samuel S.; Aykol, Muratahan; et al. (2023). "Escalando el aprendizaje profundo para el descubrimiento de materiales" . Nature . 624 (7990): 80– 85. Bibcode : 2023Natur.624...80M . doi : 10.1038/ s41586-023-06735-9 . PMC 10700138. PMID 37968396 .
Enlaces externos
- Una introducción sencilla a las redes neuronales gráficas
- Página principal de "Aprendizaje profundo geométrico"
- Arquitecturas de redes neuronales
- Aprendizaje semisupervisado
- Aprendizaje supervisado
- Aprendizaje no supervisado
- Redes neuronales artificiales
- Algoritmos de grafos
- 2009 en inteligencia artificial