El perfil filogenético es una técnica bioinformática que utiliza la presencia o ausencia conjunta de dos rasgos en un gran número de especies para inferir una conexión biológica significativa, como la participación de dos proteínas diferentes en la misma vía biológica . Junto con el análisis de la sintenia conservada , la estructura conservada del operón o las fusiones de dominios de la "Piedra Rosetta" , la comparación de perfiles filogenéticos es una técnica denominada "posthomología", ya que el cálculo esencial para este método comienza después de determinar qué proteínas son homólogas entre sí. Varias de estas técnicas fueron desarrolladas por David Eisenberg y sus colegas; la comparación de perfiles filogenéticos fue introducida en 1999 por Pellegrini et al. [ 1 ].
Método
Actualmente , más de 2000 especies de bacterias , arqueas y eucariotas están representadas por secuencias genómicas completas de ADN . Normalmente, cada gen en un genoma codifica una proteína que puede asignarse a una familia de proteínas específica en función de su homología . Para una familia de proteínas dada, su presencia o ausencia en cada genoma (en la formulación binaria original) se representa con 1 (presente) o 0 (ausente). En consecuencia, la distribución filogenética de la familia de proteínas puede representarse mediante un número binario largo, con un dígito para cada genoma; estas representaciones binarias se comparan fácilmente entre sí para buscar distribuciones filogenéticas correlacionadas. El gran número de genomas completos hace que estos perfiles sean ricos en información. La ventaja de utilizar solo genomas completos es que los valores 0, que representan la ausencia de un rasgo, tienden a ser fiables.
Teoría
Se esperaría que las especies estrechamente relacionadas tuvieran conjuntos de genes muy similares. Sin embargo, los cambios se acumulan entre especies más distantemente relacionadas mediante procesos que incluyen la transferencia horizontal de genes y la pérdida de genes. Las proteínas individuales tienen funciones moleculares específicas, como llevar a cabo una única reacción enzimática o servir como una subunidad de un complejo proteico mayor. Un proceso biológico como la fotosíntesis , la metanogénesis o la biosíntesis de histidina puede requerir la acción concertada de muchas proteínas. Si se pierde alguna proteína crucial para un proceso, otras proteínas dedicadas a ese proceso se volverían inútiles; la selección natural hace improbable que estas proteínas inútiles se conserven a lo largo del tiempo evolutivo. Por lo tanto, si dos familias de proteínas diferentes tienden a estar presentes o ausentes juntas de forma consistente, una hipótesis probable es que las dos proteínas cooperen en algún proceso biológico.
Avances y desafíos
El perfil filogenético ha dado lugar a numerosos descubrimientos en biología, incluyendo enzimas previamente desconocidas en vías metabólicas , factores de transcripción que se unen a sitios reguladores conservados y explicaciones de las funciones de ciertas mutaciones en enfermedades humanas . [ 2 ] Mejorar el método en sí es un área activa de investigación científica porque el método en sí presenta varias limitaciones. Primero, la coocurrencia de dos familias de proteínas a menudo representa un ancestro común reciente de dos especies en lugar de una relación funcional conservada; desambiguar estas dos fuentes de correlación puede requerir métodos estadísticos mejorados. Segundo, las proteínas agrupadas como homólogas pueden diferir en función, o las proteínas conservadas en función pueden no registrarse como homólogas; mejorar los métodos para ajustar el tamaño de cada familia de proteínas para reflejar la conservación funcional conducirá a mejores resultados.
Herramientas
Entre las herramientas se incluyen PLEX (Protein Link Explorer) [ 3 ] (actualmente fuera de servicio) y JGI IMG (Integrated Microbial Genomes) Phylogenetic Profiler (tanto para genes individuales como para casetes de genes ) [ 4 ] .
Notas
- ↑ Pellegrini, Matteo; Marcotte, Edward M; Thompson, Michael J; Eisenberg, David; Yeates, Todd O (1999). "Asignación de funciones proteicas mediante análisis comparativo del genoma: perfiles filogenéticos de proteínas" . Actas de la Academia Nacional de Ciencias de EE. UU . 96 ( 8): 4285– 4288. doi : 10.1073/pnas.96.8.4285 . PMC 16324. PMID 10200254 .
- ^ Kensche, Philip R; van Noort, Vera; Dutilh, Bas E; Huynen, Martijn A (2008). "Avances prácticos y teóricos en la predicción de la función de una proteína por su distribución filogenética" . Revista de la interfaz de la Royal Society . 5 (19): 151– 170. doi : 10.1098/rsif.2007.1047 . PMC 2405902 . PMID 17535793 .
- ↑ Date, Shailesh V.; Marcotte, Edward M. (15 de mayo de 2005). "Predicción de la función de las proteínas mediante Protein Link EXplorer (PLEX)" . Bioinformatics . 21 (10): 2558–2559 . doi : 10.1093/bioinformatics/bti313 . ISSN 1367-4803 . PMID 15701682 .
- ↑ Chen, I.-Min A.; Chu, Ken; Palaniappan, Krishna; Pillay, Manoj; Ratner, Anna; Huang, Jinghua; Huntemann, Marcel; Varghese, Neha; White, James R. (2018-10-05). "IMG/M v.5.0: un sistema integrado de gestión de datos y análisis comparativo para genomas microbianos y microbiomas" . Nucleic Acids Research . 47 (D1): D666– D677. doi : 10.1093 / nar/gky901 . ISSN 1362-4962 . PMC 6323987. PMID 30289528 .
- Bioinformática