
Una red de coexpresión génica (GCN) es un grafo no dirigido , donde cada nodo corresponde a un gen , y un par de nodos se conecta mediante una arista si existe una relación de coexpresión significativa entre ellos. [ 1 ] Al disponer de perfiles de expresión génica de varios genes para diversas muestras o condiciones experimentales, se puede construir una red de coexpresión génica buscando pares de genes que muestren un patrón de expresión similar en todas las muestras, ya que los niveles de transcripción de dos genes coexpresados aumentan y disminuyen conjuntamente en todas las muestras. Las redes de coexpresión génica son de interés biológico, ya que los genes coexpresados están controlados por el mismo programa regulador transcripcional, están relacionados funcionalmente o pertenecen a la misma vía o complejo proteico. [ 2 ]
La dirección y el tipo de relaciones de coexpresión no están determinados en las redes de coexpresión génica; mientras que en una red reguladora génica (GRN) una arista dirigida conecta dos genes, representando un proceso bioquímico como una reacción, transformación, interacción, activación o inhibición. [ 3 ] En comparación con una GRN, una GCN no intenta inferir las relaciones de causalidad entre genes y en una GCN las aristas representan solo una relación de correlación o dependencia entre genes. [ 4 ] Los módulos o subgrafos altamente conectados en las redes de coexpresión génica corresponden a grupos de genes que tienen una función similar o participan en un proceso biológico común que causa muchas interacciones entre ellos. [ 3 ]

Las redes de coexpresión génica se construyen habitualmente utilizando conjuntos de datos generados por tecnologías de perfilado de expresión génica de alto rendimiento, como microarrays o RNA-Seq . Estas redes se utilizan para analizar datos de RNA-Seq de células individuales, con el fin de caracterizar mejor las relaciones entre genes en una cohorte de células de un tipo celular específico. [ 5 ]
Historia
El concepto de redes de coexpresión génica fue introducido por primera vez por Butte y Kohane en 1999 como redes de relevancia . [ 6 ] Recopilaron datos de medición de pruebas de laboratorio médico (p. ej., nivel de hemoglobina ) para varios pacientes y calcularon la correlación de Pearson entre los resultados de cada par de pruebas. Los pares de pruebas que mostraron una correlación superior a un cierto nivel se conectaron en la red (p. ej., nivel de insulina con glucosa en sangre). Butte y Kohane utilizaron este enfoque más tarde, empleando la información mutua como medida de coexpresión y datos de expresión génica para construir la primera red de coexpresión génica. [ 7 ]
Construcción de redes de coexpresión génica
Se han desarrollado numerosos métodos para construir redes de coexpresión génica. En principio, todos siguen un enfoque de dos pasos: calcular la medida de coexpresión y seleccionar un umbral de significancia. En el primer paso, se selecciona una medida de coexpresión y se calcula un índice de similitud para cada par de genes utilizando dicha medida. A continuación, se determina un umbral y los pares de genes con un índice de similitud superior a este umbral se consideran con una relación de coexpresión significativa y se conectan mediante una arista en la red.

Los datos de entrada para construir una red de coexpresión génica suelen representarse como una matriz. Si disponemos de los valores de expresión génica de m genes para n muestras (condiciones), los datos de entrada serían una matriz m×n , denominada matriz de expresión. Por ejemplo, en un experimento de microarrays, se miden los valores de expresión de miles de genes para varias muestras. En el primer paso, se calcula una puntuación de similitud (medida de coexpresión) entre cada par de filas de la matriz de expresión. La matriz resultante es una matriz m×m llamada matriz de similitud. Cada elemento de esta matriz muestra la similitud con la que cambian los niveles de expresión de dos genes. En el segundo paso, los elementos de la matriz de similitud que superan un cierto umbral (es decir, que indican una coexpresión significativa) se reemplazan por 1 y los elementos restantes por 0. La matriz resultante, denominada matriz de adyacencia , representa el grafo de la red de coexpresión génica construida. En esta matriz, cada elemento indica si dos genes están conectados en la red (elementos 1) o no (elementos 0).
Medida de coexpresión
Los valores de expresión de un gen para diferentes muestras se pueden representar como un vector, por lo que calcular la medida de coexpresión entre un par de genes es lo mismo que calcular la medida seleccionada para dos vectores de números.
El coeficiente de correlación de Pearson , la información mutua , el coeficiente de correlación de rangos de Spearman y la distancia euclidiana son las cuatro medidas de coexpresión más utilizadas para construir redes de coexpresión génica. La distancia euclidiana mide la distancia geométrica entre dos vectores, y por lo tanto considera tanto la dirección como la magnitud de los vectores de valores de expresión génica. La información mutua mide cuánto reduce el conocimiento de los niveles de expresión de un gen la incertidumbre sobre los niveles de expresión de otro. El coeficiente de correlación de Pearson mide la tendencia de dos vectores a aumentar o disminuir juntos, dando una medida de su correspondencia general. La correlación de rangos de Spearman es la correlación de Pearson calculada para los rangos de los valores de expresión génica en un vector de expresión génica . [ 2 ] También se han utilizado otras medidas como la correlación parcial , [ 8 ] la regresión , [ 9 ] y la combinación de correlación parcial e información mutua [ 10 ] .
Cada una de estas medidas tiene sus propias ventajas y desventajas. La distancia euclidiana no es apropiada cuando los niveles absolutos de genes funcionalmente relacionados son muy diferentes. Además, si dos genes tienen niveles de expresión consistentemente bajos pero están correlacionados aleatoriamente, aún podrían aparecer cerca en el espacio euclidiano. [ 2 ] Una ventaja de la información mutua es que puede detectar relaciones no lineales; sin embargo, esto puede convertirse en una desventaja debido a que detecta relaciones no lineales sofisticadas que no parecen biológicamente significativas. Además, para calcular la información mutua se debe estimar la distribución de los datos, lo que requiere un gran número de muestras para una buena estimación. El coeficiente de correlación de rangos de Spearman es más robusto a los valores atípicos, pero por otro lado es menos sensible a los valores de expresión y en conjuntos de datos con un número pequeño de muestras puede detectar muchos falsos positivos.
El coeficiente de correlación de Pearson es la medida de coexpresión más utilizada para construir redes de coexpresión génica. Este coeficiente toma un valor entre -1 y 1, donde los valores absolutos cercanos a 1 indican una fuerte correlación. Los valores positivos corresponden a un mecanismo de activación, en el que la expresión de un gen aumenta con el aumento de la expresión de su gen coexpresado, y viceversa. Cuando la expresión de un gen disminuye con el aumento de la expresión de su gen coexpresado, esto corresponde a un mecanismo de supresión subyacente y presenta una correlación negativa.
La medida de correlación de Pearson presenta dos desventajas: solo detecta relaciones lineales y es sensible a valores atípicos. Además, asume que los datos de expresión génica siguen una distribución normal . Song et al. [ 11 ] propusieron la correlación media ponderada (bicor) como una buena alternativa a la correlación de Pearson. "Bicor es una medida de correlación basada en la mediana, más robusta que la correlación de Pearson y, a menudo, más potente que la correlación de Spearman". Asimismo, se ha demostrado que "la mayoría de los pares de genes presentan relaciones lineales o monótonas", lo que indica que "las redes de información mutua pueden reemplazarse con seguridad por redes de correlación al medir relaciones de coexpresión en datos estacionarios [ 11 ] ".
Selección de umbral
Se han utilizado varios métodos para seleccionar un umbral en la construcción de redes de coexpresión génica. Un método de umbralización simple consiste en elegir un punto de corte de coexpresión y seleccionar relaciones cuya coexpresión supere dicho punto de corte. Otro enfoque es utilizar la transformación Z de Fisher , que calcula una puntuación Z para cada correlación en función del número de muestras. Esta puntuación Z se convierte luego en un valor p para cada correlación y se establece un punto de corte en dicho valor p. Algunos métodos permutan los datos y calculan una puntuación Z utilizando la distribución de correlaciones encontradas entre genes en el conjunto de datos permutado. [ 2 ] También se han utilizado otros enfoques, como la selección de umbrales basada en el coeficiente de agrupamiento [ 12 ] o la teoría de matrices aleatorias . [ 13 ]
El problema con los métodos basados en el valor p es que el umbral final del valor p se elige en función de rutinas estadísticas (por ejemplo, un valor p de 0,01 o 0,05 se considera significativo), y no en función de un conocimiento biológico.
WGCNA es un marco para la construcción y el análisis de redes de coexpresión génica ponderadas . [ 14 ] El método WGCNA selecciona el umbral para la construcción de la red basándose en la topología libre de escala de las redes de coexpresión génica. Este método construye la red para varios umbrales y selecciona el que da como resultado una red con topología libre de escala . Además, el método WGCNA construye una red ponderada, lo que significa que aparecen todos los enlaces posibles en la red, pero cada enlace tiene un peso que muestra la importancia de la relación de coexpresión correspondiente. Cabe destacar que la selección del umbral tiene como objetivo forzar a las redes a adoptar una topología libre de escala. Sin embargo, la premisa subyacente de que las redes biológicas son libres de escala es controvertida. [ 15 ] [ 16 ] [ 17 ]
lmQCM es una alternativa a WGCNA que logra el mismo objetivo de análisis de redes de coexpresión génica. lmQCM [ 18 ] significa Fusión de Cuasi-Clique Máxima Local, y busca explotar las estructuras localmente densas en la red, permitiendo así la extracción de módulos más pequeños y densamente coexpresados mediante la superposición de módulos. El algoritmo lmQCM cuenta con su paquete de R y módulo de Python (incluido en Biolearns). El tamaño generalmente menor de los módulos extraídos también puede generar resultados de enriquecimiento de ontología génica (GO) más significativos.
Desafíos
Las redes de coexpresión intentan estimar las correlaciones directas y, a veces, indirectas entre pares de genes. Sin embargo, un gen individual puede estar controlado por múltiples reguladores. [ 19 ] En segundo lugar, como se analizó en las secciones anteriores, cada medida computacional de coexpresión está diseñada específicamente para capturar una característica única que no necesariamente es óptima para representar todos los tipos de interrelación transcripcional gen-a-gen, por ejemplo, la correlación de Pearson para relaciones lineales, la de Spearman para la clasificación de los genes, etc. En tercer y último lugar, el cálculo de las redes de coexpresión gen-a-gen para todo el genoma da como resultado matrices muy grandes que contienen una cantidad considerable de ruido, lo que plantea una dificultad significativa para explorar su diferenciación entre cohortes. Estos desafíos deben tenerse en cuenta al aplicar métodos avanzados de coexpresión a datos de expresión génica.
Aplicaciones
- Secuenciación de células individuales : las redes de coexpresión genética generadas a partir de datos de RNA-Seq masivos se han utilizado para aumentar la relación señal/ruido en escenarios de células individuales, con el fin de obtener mejores predicciones de la presencia de mutaciones específicas en células individuales, utilizando perfiles de expresión genética como variables independientes [ 20 ].
- Ingeniería inversa de redes genéticas : existen cientos de métodos para inferir redes reguladoras genéticas, y varias docenas se basan actualmente en análisis de coexpresión, correlación simple, información mutua o métodos bayesianos. [ 21 ]
- Biología vegetal : Los análisis de coexpresión se han utilizado ampliamente para buscar genes novedosos involucrados en vías metabólicas específicas de las plantas. Un ejemplo es la síntesis de la pared celular: la caracterización de los eslabones perdidos en este mecanismo metabólico fue posible gracias al descubrimiento de nuevos genes de celulosa sintasa (CESA), cuyos perfiles de expresión se correlacionan con miembros de la vía metabólica previamente conocidos. [ 22 ]
Véase también
Referencias
- ↑ Stuart, Joshua M; Segal, Eran; Koller, Daphne; Kim, Stuart K (2003). "Una red de coexpresión génica para el descubrimiento global de módulos genéticos conservados". Science . 302 (5643): 249– 55. Bibcode : 2003Sci...302..249S . CiteSeerX 10.1.1.119.6331 . doi : 10.1126/science.1087447 . PMID 12934013 . S2CID 3131371 .
- 1 2 3 4 Weirauch, Matthew T (2011). "Redes de coexpresión génica para el análisis de datos de microarrays de ADN". Applied Statistics for Network Biology: Methods in Systems Biology . pp. 215–250 . doi : 10.1002/9783527638079.ch11 . ISBN 978-3-527-63807-9.
- 1 2 Roy, Swarup; Bhattacharyya, Dhruba K; Kalita, Jugal K (2014). "Reconstrucción de la red de coexpresión génica a partir de datos de microarrays utilizando patrones de expresión local" . BMC Bioinformatics . 15 (Supl . 7): S10. doi : 10.1186/1471-2105-15-s7-s10 . PMC 4110735. PMID 25079873 .
- ↑ De Smet, Riet; Marchal, Kathleen (2010). "Ventajas y limitaciones de los métodos actuales de inferencia de redes". Nature Reviews Microbiology . 8 (10): 717– 29. doi : 10.1038/nrmicro2419 . PMID 20805835 . S2CID 27629033 .
- ↑ Su, Chang; Xu, Zichun; Shan, Xinning; Cai, Biao; Zhao, Hongyu; Zhang, Jingfei (2023-08-10). "Inferencia de coexpresión específica de tipo celular a partir de datos de secuenciación de ARN de células individuales" . Nature Communications . 14 (1): 4846. doi : 10.1038/s41467-023-40503-7 . ISSN 2041-1723 . PMC 10415381. PMID 37563115 .
- ↑ Butte, Atul J; Kohane, Isaac S (1999). "Descubrimiento de conocimiento no supervisado en bases de datos médicas mediante redes de relevancia" . Actas del Simposio AMIA : 711–715 . PMC 2232846. PMID 10566452 .
- ↑ Butte, Atul J; Kohane, Isaac S (2000). "Redes de relevancia de información mutua: agrupamiento genómico funcional mediante mediciones de entropía por pares". Pac Symp Biocomput . 5 .
- ↑ Villa-Vialaneix, Nathalie; Liaubet, Laurence; Laurent, Thibault; Cherel, Pierre; Gamot, Adrien; SanCristobal, Magali (2013). " La estructura de una red de coexpresión génica revela funciones biológicas subyacentes a los eQTL" . PLOS ONE . 8 (4) 60045. Bibcode : 2013PLoSO...860045V . doi : 10.1371/journal.pone.0060045 . PMC 3618335. PMID 23577081 .
- ↑ Persson, Staffan; Wei, Hairong; Milne, Jennifer; Page, Grier P; Somerville, Christopher R (2005). "Identificación de genes necesarios para la síntesis de celulosa mediante análisis de regresión de conjuntos de datos de microarrays públicos" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 102 (24): 8633– 8. Bibcode : 2005PNAS..102.8633P . doi : 10.1073/pnas.0503392102 . PMC 1142401. PMID 15932943 .
- ↑ Reverter, Antonio; Chan, Eva KF (2008). "Combinación de correlación parcial y un enfoque de teoría de la información para la ingeniería inversa de redes de coexpresión génica" . Bioinformatics . 24 (21): 2491– 2497. doi : 10.1093/bioinformatics/btn482 . PMID 18784117 .
- 1 2 Song, Lin; Langfelder, Peter; Horvath, Steve (2012). "Comparación de medidas de coexpresión: información mutua, correlación e índices basados en modelos" . BMC Bioinformatics . 13 (1): 328. doi : 10.1186/1471-2105-13-328 . PMC 3586947. PMID 23217028 .
- ↑ Elo, Laura L; Järvenpää, Henna; Orešič, Matej; Lahesmaa, Riitta; Aittokallio, Tero (2007). "Construcción sistemática de redes de coexpresión génica con aplicaciones al proceso de diferenciación de células T colaboradoras humanas" . Bioinformatics . 23 (16): 2096– 2103. doi : 10.1093/bioinformatics/btm309 . PMID 17553854 .
- ↑ Luo, Feng; Yang, Yunfeng; Zhong, Jianxin; Gao, Haichun; Khan, Latifur; Thompson, Dorothea K; Zhou, Jizhong (2007). "Construcción de redes de coexpresión génica y predicción de funciones de genes desconocidos mediante la teoría de matrices aleatorias" . BMC Bioinformatics . 8 (1): 299. doi : 10.1186/1471-2105-8-299 . PMC 2212665. PMID 17697349 .
- ↑ Zhang, Bin; Horvath, Steve (2005). "Un marco general para el análisis de redes de coexpresión génica ponderadas". Aplicaciones estadísticas en genética y biología molecular . 4 (1): Artículo 17. CiteSeerX 10.1.1.471.9599 . doi : 10.2202/1544-6115.1128 . PMID 16646834. S2CID 7756201 .
- ↑ Khanin, R.; Wit, E. (2006). "Qué tan libres de escala son las redes biológicas". Journal of Computational Biology . 13 (3): 810– 8. CiteSeerX 10.1.1.104.5347 . doi : 10.1089/cmb.2006.13.810 . PMID 16706727 .
- ↑ Broido, Anna D.; Clauset, Aaron (2019). " Las redes libres de escala son raras" . Nature Communications . 10 (1): 1017. arXiv : 1801.03400 . Bibcode : 2019NatCo..10.1017B . doi : 10.1038/ s41467-019-08746-5 . PMC 6399239. PMID 30833554. S2CID 24825063 .
- ↑ Clote, P. (2020). "¿Son las redes de ARN libres de escala?" . Journal of Mathematical Biology . 80 (5): 1291– 1321. doi : 10.1007/s00285-019-01463-z . PMC 7052049 . PMID 31950258 .
- ↑ Zhang, Jie; Huang, Kun (2014). "ImQCM normalizado: un algoritmo para detectar cuasi-cliques débiles en grafos ponderados con aplicaciones en el descubrimiento de módulos de coexpresión genética en cánceres" . Cancer Informatics . 13 (3): 137–46 . doi : 10.4137/CIN.S14021 . PMC 4962959. PMID 27486298 .
- ↑ Alon, Uri (2006). Principios de diseño de circuitos biológicos . doi : 10.1201/9781420011432 . ISBN 978-0-429-09279-4.
- ↑ Mercatelli, Daniele; Ray, Forest; Giorgi, Federico M. (2019). "Modelado pancáncer y unicelular de alteraciones genómicas a través de la expresión génica" . Frontiers in Genetics . 10 : 671. doi : 10.3389/fgene.2019.00671 . ISSN 1664-8021 . PMC 6657420. PMID 31379928 .
- ↑ Mercatelli, Daniele; Scalambra, Laura; Triboli, Luca; Ray, Forest; Giorgi, Federico M. (2020). "Recursos de inferencia de redes reguladoras de genes: una visión general práctica". Biochimica et Biophysica Acta (BBA) - Gene Regulatory Mechanisms . 1863 (6) 194430. doi : 10.1016/j.bbagrm.2019.194430 . ISSN 1874-9399 . PMID 31678629 . S2CID 207895066 .
- ↑ Usadel, Bjoern; Obayashi, Takeshi; Mutwil, Marek; Giorgi, Federico M.; Bassel, George W.; Tanimoto, Mimi; Chow, Amanda; Steinhauser, Dirk; Persson, Staffan; Provart, Nicholas J. (2009). "Herramientas de coexpresión para la biología vegetal: oportunidades para la generación de hipótesis y advertencias" . Plant, Cell & Environment . 32 (12): 1633– 1651. doi : 10.1111/j.1365-3040.2009.02040.x . ISSN 0140-7791 . PMID 19712066 .
- Biología computacional
- Biología de sistemas
- Bioinformática