En bioinformática , el sistema de clasificación PANTHER ( análisis de proteínas mediante relaciones evolutivas ) es una gran base de datos biológica curada de familias de genes/proteínas y sus subfamilias funcionalmente relacionadas que se puede utilizar para clasificar e identificar la función de los productos génicos. [ 1 ] PANTHER forma parte del Proyecto de Referencia del Genoma de Ontología Génica [ 2 ] diseñado para clasificar proteínas y sus genes para análisis de alto rendimiento .
El proyecto consta de curación manual y algoritmos bioinformáticos. [ 3 ] Las proteínas se clasifican según la familia (y subfamilia), la función molecular, el proceso biológico y la vía metabólica. Es una de las bases de datos que alimentan la base de datos InterPro del Instituto Europeo de Bioinformática . [ 4 ] —Aplicación de PANTHER— La aplicación más importante de PANTHER es inferir con precisión la función de genes no caracterizados de cualquier organismo basándose en sus relaciones evolutivas con genes con funciones conocidas. [ 3 ] Al combinar la función genética, la ontología , las vías metabólicas y las herramientas de análisis estadístico, PANTHER permite a los biólogos analizar datos genómicos a gran escala obtenidos de la tecnología avanzada actual, incluyendo: secuenciación, proteómica o experimentos de expresión génica . [ 5 ] En breve, utilizando los datos y las herramientas de PANTHER, los usuarios podrán: [ 6 ]
- Obtenga información sobre un gen de interés en particular.
- Descubre familias y subfamilias de proteínas, vías metabólicas, procesos biológicos, funciones moleculares y componentes celulares.
- Cree listas de genes relacionados con una familia/subfamilia de proteínas, una función molecular, un proceso biológico o una vía metabólica en particular.
- Analizar listas de genes, proteínas o transcripciones.
Historia de las PANTERAS
- 1998: El proyecto se puso en marcha en el Grupo de Aplicaciones Moleculares.
- 1999: Adquirida por Celera Genomics.
- 2000: PANTHER 1 se lanzó en Celera Discovery Systems (CDS).
- 2001: Se publica PANTHER 2, que se utiliza en la anotación del primer genoma humano publicado, Celera.
- 2002: Se lanza PANTHER 3. Las anotaciones de PANTHER se integran en FlyBase . Se traslada a ABI.
- 2003: Se lanza PANTHER 4 junto con el lanzamiento público del Sistema de Clasificación PANTHER.
- 2005: Se lanza PANTHER 5 con la herramienta de análisis y ruta de señalización PANTHER. Se establece una colaboración con InterPro.
- 2006: Se estrena PANTHER 6. Se traslada a SRI.
- 2010: Se estrena PANTHER 7.
- 2011: Traslado a la USC.
- 2012: Se estrena PANTHER 8.
- 2014: PANTHER 9 se estrenó. [ 6 ]
- 2015: Se estrenó PANTHER 10.
- 2016: PANTHER 11 lanzado. [ 7 ]
Árbol filogenético
En PANTHER hay un árbol filogenético para cada una de las familias de proteínas. La anotación del árbol se realiza en función de los siguientes criterios:
- Cada nodo está anotado por atributos genéticos que incluyen “pertenencia a subfamilia”, “clase de proteína”, “función genética”. Estos atributos son heredables. [ 3 ] Los nombres de proteínas de Swiss-Prot se utilizan habitualmente para nombrar subfamilias. [ 8 ] Dado que PANTHER forma parte del proyecto de genoma de referencia GO, [ 2 ] [ 9 ] los términos de Gene Ontology [ 10 ] (GO) se utilizan para la función genética. Los términos de la ontología PANTHER/X se utilizan para la clase de proteína.
- Cada nodo interno está anotado por eventos evolutivos como “ especiación ”, “ duplicación genética ” y “ transferencia genética horizontal ”. [ 3 ]
Para generar árboles filogenéticos, PANTHER utiliza el algoritmo GIGA. GIGA emplea un árbol de especies para la construcción del árbol. En cada iteración, intenta conciliar el árbol en forma de eventos de especiación y duplicación genética.
Proceso de generación de datos de la biblioteca PANTHER
El proceso de generación de datos se divide en tres pasos:
- Agrupamiento familiar
- Construcción de árboles pitogénicos
- Anotación de los nodos del árbol
Agrupamiento familiar
Conjunto de secuencias
Los árboles PANTHER representan la evolución de familias de genes a partir de una amplia selección de genomas completamente secuenciados. PANTHER cuenta con una secuencia por gen, lo que permite que el árbol represente eventos ocurridos durante el curso de la evolución, como la duplicación y la especiación. El conjunto de genomas PANTHER se selecciona según los siguientes criterios:
- El conjunto debe incluir un organismo modelo experimental importante , lo que ayudará a representar información funcional del organismo que ha sido menos estudiada.
- El conjunto debería incluir una amplia gama taxonómica de otros genomas, preferiblemente completamente secuenciados y anotados, lo que ayudará a relacionarlos con organismos modelo experimentales.
grupos familiares
A continuación se detallan los requisitos para ser considerados grupos familiares en PANTHER:
- La familia debe contener al menos cinco miembros, entre los cuales al menos un gen debe provenir de un genoma de referencia GO.
- Para poder realizar inferencias filogenéticas, la familia debe contener una alineación de secuencias de alta calidad .
- La evaluación de secuencias alineadas múltiples se realiza evaluando la longitud de la secuencia alineada, con al menos 30 sitios alineados en el 75% o más de los miembros de la familia.
Construcción de árboles filogenéticos
Para cada familia, se alinean múltiples secuencias utilizando la configuración predeterminada de MAFFT . Se elimina cualquier columna que represente menos del 75 % de la secuencia alineada. Estos datos se utilizan como entrada para el programa GIGA. El árbol resultante de GIGA se etiqueta. Cada nodo interno se etiqueta indicando si el evento de divergencia ocurrió como especiación o duplicación génica.
Anotación de los nodos del árbol
Cada nodo en el árbol PANTHER está anotado con un atributo heredable. Este atributo puede ser de tres tipos: pertenencia a una subfamilia, función génica y pertenencia a una clase de proteína. Estas anotaciones de los nodos se aplican a la secuencia primaria utilizada para construir el árbol. Al aplicar estas anotaciones a la secuencia primaria, se utiliza un principio evolutivo simple, es decir, la anotación de cada nodo se propaga a través de su nodo descendiente. [ 3 ]
Componentes PANTHER
PANTHER/LIB (Biblioteca PANTHER): La biblioteca consta de una colección de libros. Cada uno de estos libros representa una familia de proteínas. Hay un modelo oculto de Markov (HMM), un alineamiento de secuencias múltiples (MSA) y un árbol genealógico para cada familia de proteínas en la biblioteca. [ 1 ]
PANTHER/X (índice PANTEHR): Este índice contiene una ontología abreviada que facilita la síntesis y la comprensión de la función molecular y biológica. Si bien la ontología PANTHER/X presenta una organización jerárquica , se trata de un grafo dirigido acíclico , por lo que, cuando está biológicamente justificado, las categorías hijas aparecen bajo más de un padre. PANTHER/X se ha mapeado a GO y se ha organizado de manera diferente para facilitar el análisis a gran escala de proteínas. [ 1 ]
Senderos PANTHER
PANTHER incluye 176 rutas metabólicas utilizando la herramienta CellDesigner. Las rutas metabólicas de PANTHER se pueden descargar en los siguientes formatos de archivo.
- Lenguaje de marcado de biología de sistemas ( SBML )
- Notación gráfica de biología de sistemas (SBGN-ML)
- BioPAX [ 3 ]
Versiones recientes de PANTHER, sus estadísticas y actualizaciones.
Versión 6.0
La versión 6 utiliza secuencias UniProt [ 11 ] como secuencias de entrenamiento. Hay 19132 secuencias de entrenamiento UniProt asociadas directamente con los componentes de la vía metabólica. Esta versión tiene ~1500 reacciones en 130 vías metabólicas, y se amplió el número de vías asociadas con subfamilias. PANTHER se convirtió en miembro del Consorcio InterPro. Se mejoró la disponibilidad de los datos de PANTHER (los HMM se pueden descargar por FTP ). La versión 6.1 de PANTHER/LIB contiene 221609 secuencias UniProt de 53 organismos, agrupadas en 5546 familias y 24561 subfamilias. [ 12 ] (2006)
Versión 7.0
En esta versión, los árboles filogenéticos representan eventos de especiación y duplicación génica. Es posible la identificación de ortólogos génicos . Se ofrece mayor soporte para identificadores de bases de datos alternativos para genes, proteínas y sondas de microarrays . La versión 7 de PANTHER utiliza el estándar SBGN para representar las vías biológicas. Incluye 48 conjuntos de genomas. Para definir las nuevas familias y en colaboración con el grupo InterPro del Instituto Europeo de Bioinformática, [ 4 ] se añadieron aproximadamente 1000 familias de genomas no animales en esta versión. Las fuentes de los conjuntos de genes incluyeron bases de datos de organismos modelo, anotación genómica de Ensembl [ 13 ] y Entrez Gene. [ 14 ] Desde esta versión, se utiliza un identificador estable para cada nodo del árbol. Este identificador estable es un número de nueve dígitos con el prefijo PTN (que significa Nodo del Árbol PANTHER). [ 3 ] [ 15 ] (2009)
Versión 8.0 (2012)
El conjunto de proteoma de referencia [ 16 ] mantenido por el recurso UniProt se utiliza en esta versión de PANTHER, por lo que la fuente de los conjuntos de genes es UniProt. Incluye 82 conjuntos de genomas (aproximadamente el doble que en la versión 7) y 991985 genes codificadores de proteínas, de los cuales 642319 genes (64,75%) se han utilizado para agrupaciones familiares. El sitio web de PANTHER se ha rediseñado para facilitar el flujo de trabajo común del usuario. [ 3 ]
Versión 9.0 (2014)
Esta versión contiene 7180 familias de proteínas, divididas en 52 768 subfamilias de proteínas funcionalmente distintas. La versión 9.0 tiene los genomas de los 85 organismos. [ 17 ] [ 6 ]
Versión 11.1 (2016)
Esta versión contiene 78.442 subfamilias y 1.064.054 genes anotados.
Sitio web de PANTHER
La página principal del sitio web de PANTHER muestra varias pestañas para las principales funciones, entre las que se incluyen: análisis de listas de genes, exploración, búsqueda de secuencias, puntuación de cSNP y búsqueda por palabras clave. A continuación se detallan las características de cada una de estas funciones.
Análisis de la lista de genes
Esta pestaña está seleccionada por defecto, ya que es la opción más utilizada. Puede introducir identificadores válidos en el recuadro o cargar un archivo, seleccionar el tipo de lista, elegir el organismo de interés y seleccionar el tipo de análisis.
Un ejemplo práctico: Probemos este flujo de trabajo con una pequeña lista de genes que contiene tres genes: AKT1, AKT2 y AKT3. Primero, escribimos los nombres de estos genes en el cuadro y los separamos con comas (o espacios). Seleccionamos "Lista de ID" como tipo de lista, "Homo sapiens" (humano) como organismo y "Clasificación funcional vista en la lista de genes" como tipo de operación; luego hacemos clic en enviar. Esto nos proporciona la información de los tres genes, que son:
- Identificadores de genes de Ensembl e identificadores de proteínas de Uniprot: en este ejemplo, debería ver "ENSG00000142208" y "P31749".
- Identificadores mapeados: estos son simplemente los nombres de los genes que se han mapeado a su consulta (AKT1, AKT2 y AKT3).
- Nombres de genes, símbolos de genes y ortólogos: los ortólogos son interactivos y, al hacer clic en ellos, se puede ver la lista de otros organismos y sus identificadores, así como el tipo de ortólogos ("LDO" para el ortólogo menos divergente, "O" para otros que son ortólogos más divergentes y "P" para parálogos).
- Familia y subfamilia PANTHER: Aquí se muestra el nombre de la familia y subfamilia de sus genes. Hay enlaces, por ejemplo, al árbol genealógico, que es interactivo. Finalmente, se muestran los genes de diferentes especies asignados a esa subfamilia. En este ejemplo, la subfamilia PANTHER es "PTHR24352:SF30" para AKT1.
- Función molecular GO: Esto le indica cuáles son las funciones de su gen de consulta; por ejemplo, AKT1 tiene actividad de proteína quinasa y puede interactuar de forma selectiva y no covalente con iones de calcio, calmodulina y fosfolípidos.
- Proceso biológico GO: Al observar esta columna, comprenderá en qué procesos biológicos está involucrado el gen; por ejemplo, AKT1 tiene un papel en la generación de gametos, la apoptosis, el ciclo celular, etc.
- Componente celular GO: Indica en qué parte de la célula se encuentra la proteína consultada. En nuestro ejemplo, la información no está disponible, pero si prueba con otros ejemplos (como el gen p53), verá algunos componentes celulares como "núcleo", "citoplasma", "cromosomas", etc.
- Clase de proteína PANTHER: esto muestra los nombres e identificadores de la clase de proteína PANTHER para cada uno de los genes; por ejemplo, AKT1 pertenece a la clase de proteína PANTHER "cinasa de serina/treonina no receptora" con el identificador de clase "PC00167". También puede ver su linaje parental e descendiente.
- Rutas metabólicas: Se mostrará una lista de nombres en los que se puede hacer clic para las rutas metabólicas en las que existe el gen consultado; por ejemplo, AKT1 está involucrado en varias rutas metabólicas como "Respuesta a la hipoxia a través de HIF", "Ruta de señalización de la apoptosis", "Ruta de la PI3 quinasa", etc.
- Especie: Este es el nombre de la especie que ha elegido; en este caso, hemos elegido "Homo sapiens".
Navegar
Mediante esta pestaña de carpetas y seleccionando la ontología de su interés, puede explorar diferentes clasificaciones. También es posible seleccionar más de una ontología; en este caso, los resultados cumplirán los criterios de todas las selecciones. Podrá observar la relación entre los términos de la ontología y las familias, subfamilias y secuencias de entrenamiento de PANTHER.
Búsqueda de secuencias
Al introducir la secuencia de proteínas en el cuadro de búsqueda de secuencias, PANTHER realizará una búsqueda en una biblioteca de modelos ocultos de Markov (HMM) de familias y subfamilias, y devolverá la subfamilia que mejor coincida con la secuencia. Si hace clic en el nombre de la subfamilia, se mostrarán algunos detalles, como los genes relacionados con ella y la posibilidad de visualizar la subfamilia dentro de un árbol genealógico más amplio. Al descargar la herramienta de puntuación de PANTHER desde la página de descargas, podrá evaluar numerosas secuencias con los HMM de PANTHER.
puntuación cSNP
Mediante esta pestaña, puede realizar análisis de evolución de SNP codificantes . Debe introducir una secuencia de proteína en el primer cuadro y las sustituciones relativas a esta secuencia de proteína en el segundo cuadro; estas sustituciones deben introducirse en el formato estándar de sustitución de aminoácidos, por ejemplo, L46P. PANTHER utilizará una alineación de proteínas evolutivamente relacionadas, calculará la conservación evolutiva específica de la posición de sustitución (subPSEC) y estimará la probabilidad de que este SNP codificante no sinónimo genere un efecto funcional en la proteína. Esta herramienta utiliza datos de la versión 6.1 de PANTHER por razones técnicas. Una de las nuevas funciones de PANTHER es que, si desea analizar muchos SNP, puede ir a la página de descargas y descargar la herramienta de análisis de SNP codificantes de PANTHER.
Búsqueda por palabras clave
Al introducir un término de búsqueda en el cuadro de búsqueda por palabras clave, PANTHER le mostrará el número de registros que coinciden con su palabra clave para genes, familias, rutas metabólicas y términos de ontología. Puede filtrarlos determinando la especie de interés o refinando la búsqueda con otros criterios. Para ver los detalles del gen, debe hacer clic en su identificador.
Referencias
- 1 2 3 Thomas, PD.; Kejariwal, A.; Campbell, MJ.; Mi, H.; Diemer, K.; Guo, N.; Ladunga, I.; Ulitsky-Lazareva, B.; et al. (enero de 2003). "PANTHER: una base de datos navegable de productos genéticos organizada por función biológica, utilizando una clasificación curada de familias y subfamilias de proteínas" . Nucleic Acids Res . 31 (1): 334– 41. doi : 10.1093 / nar/gkg115 . PMC 165562. PMID 12520017 .
- 1 2 "Proyecto de Anotación del Genoma de Referencia GO" .
- 1 2 3 4 5 6 7 8 Mi, H.; Muruganujan, A.; Thomas, PD. (enero de 2013). "PANTHER en 2013: modelado de la evolución de la función genética y otros atributos genéticos en el contexto de árboles filogenéticos" . Nucleic Acids Res . 41 (número especial de bases de datos): D377–86. doi : 10.1093 / nar/gks1118 . PMC 3531194. PMID 23193289 .
- 1 2 Hunter, S.; Jones, P.; Mitchell, A.; Apweiler, R.; Attwood, TK.; Bateman, A.; Bernard, T.; Binns, D.; et al. (enero de 2012). "InterPro en 2011: nuevos desarrollos en la base de datos de predicción de familias y dominios" . Nucleic Acids Res . 40 (número especial de bases de datos): D306–12. doi : 10.1093/nar/ gkr948 . PMC 3245097. PMID 22096229 .
- ↑ Mi, H.; Muruganujan, A.; Thomas, PD. (agosto de 2013). "Análisis de la función genética a gran escala con el sistema de clasificación PANTHER" . Nucleic Acids Res . 8 (8): 1551– 66. doi : 10.1038/nprot.2013.092 . PMC 6519453. PMID 23868073 .
- 1 2 3 "PANTHERdb" .
- ↑ Mi, H; Huang, X; Muruganujan, A; Tang, H; Mills, C; Kang, D; Thomas, PD (29 de noviembre de 2016). "PANTHER versión 11: datos de anotación ampliados de Gene Ontology y vías de Reactome, y mejoras en la herramienta de análisis de datos" . Nucleic Acids Research . 45 (D1): D183– D189. doi : 10.1093/nar/gkw1138 . PMC 5210595. PMID 27899595 .
- ↑ El Consorcio UniProt (enero de 2012). " Reorganizando el espacio de proteínas en el Recurso Universal de Proteínas (UniProt)" . Nucleic Acids Res . 40 (D1): D71– D75. doi : 10.1093/nar/gkr981 . PMC 3245120. PMID 22102590 .
- ↑ Gaudet, P.; Livstone, MS; Lewis, SE; Thomas, PD (septiembre de 2011). "Propagación basada en filogenia de anotaciones funcionales dentro del consorcio Gene Ontology" . Brief Bioinform . 12 (5): 449–62 . doi : 10.1093/bib/bbr042 . PMC 3178059. PMID 21873635 .
- ↑ Gene Ontology Consortium (enero de 2012). "The Gene Ontology: mejoras para 2011" . Nucleic Acids Res . 40 (D1): D559– D564. doi : 10.1093 / nar/gkr1028 . PMC 3245151. PMID 22102568 .
- ↑ Wu, CH; Apweiler, R.; Bairoch, A.; Natale, DA; Barker, WC; Boeckmann, B.; Ferro, S.; Gasteiger, E.; et al. (enero de 2006). "El recurso universal de proteínas (UniProt): un universo en expansión de información sobre proteínas" . Nucleic Acids Res . 34 (número especial de bases de datos): D187– D191 . doi : 10.1093/nar/gkj161 . PMC 1347523. PMID 16381842 .
- ↑ Mi, H.; Guo, N.; Thomas, PD (enero de 2007). "PANTHER versión 6: datos de evolución de secuencia y función de proteínas con representación ampliada de vías biológicas" . Nucleic Acids Res . 35 (número especial de bases de datos): D247– D252. doi : 10.1093/nar/ gkl869 . PMC 1716723. PMID 17130144 .
- ↑ Flicek, P.; Amode, MR; Barrell, D.; Beal, K.; Brent, S.; Chen, Y.; Clapham, P.; Coates, G.; et al. (enero de 2011). "Ensembl" . Nucleic Acids Res . 39 (número especial de bases de datos): D800– D806 . doi : 10.1093/nar/gkq1064 . PMC 3013672. PMID 21045057 .
- ↑ Maglott, D.; Ostell, J.; Pruitt, KD; Tatusova, T. (enero de 2011). "Entrez Gene: información centrada en genes en NCBI" . Nucleic Acids Res . 39 (número especial de bases de datos): D52– D57. doi : 10.1093/nar/gkq1237 . PMC 3013746. PMID 21115458 .
- ↑ Mi, H.; Dong, Q.; Muruganujan, A.; Gaudet, P.; Lewis, S.; Thomas, PD (enero de 2010). "PANTHER versión 7: árboles filogenéticos mejorados, ortólogos y colaboración con el Consorcio de Ontología Génica" . Nucleic Acids Res . 38 (número especial de bases de datos): D204– D210 . doi : 10.1093/nar/gkp1019 . PMC 2808919. PMID 20015972 .
- ↑ "proteoma de referencia" .
- ↑ Los detalles en las estadísticas de PANTHER 9 se pueden encontrar aquí ( http://www.pantherdb.org/panther/summaryStats.jsp )
- bases de datos genéticas