En filogenética molecular , las relaciones entre individuos se determinan mediante rasgos característicos, como ADN , ARN o proteínas , que pueden obtenerse utilizando diversas tecnologías de secuenciación . La secuenciación de alto rendimiento de nueva generación se ha convertido en una técnica popular en transcriptómica , que representa una instantánea de la expresión génica. En eucariotas , realizar inferencias filogenéticas utilizando ARN se complica por el empalme alternativo , que produce múltiples transcritos a partir de un solo gen . Por lo tanto, se pueden utilizar diversos enfoques para mejorar la inferencia filogenética utilizando datos transcriptómicos obtenidos mediante RNA-Seq y procesados mediante filogenética computacional .
Adquisición de secuencias
Se han utilizado varias tecnologías transcriptómicas para recopilar información de secuencias en transcriptomas . Sin embargo, la más utilizada es RNA-Seq .
Secuenciación de ARN
Las lecturas de ARN se pueden obtener utilizando diversos métodos de secuenciación de ARN (RNA-seq).
Bases de datos públicas
Existen varias bases de datos públicas que contienen datos de secuenciación de ARN (RNA-Seq) disponibles gratuitamente.
Asamblea
Ensamblaje de secuencias
Los datos de RNA-Seq se pueden ensamblar directamente en transcripciones mediante el ensamblaje de secuencias . A menudo se distinguen dos categorías principales de ensamblaje de secuencias :
- Ensamblaje de transcriptoma de novo : especialmente importante cuandono se dispone de un genoma de referencia para una especie determinada .
- El ensamblaje guiado por genoma (a veces denominado mapeo o ensamblaje guiado por referencia) es capaz de utilizar una referencia preexistente para guiar el ensamblaje de transcripciones.
Ambos métodos intentan generar construcciones de isoformas biológicamente representativas a partir de datos de RNA-seq y, por lo general, buscan asociar las isoformas con una construcción a nivel genético. Sin embargo, la identificación adecuada de construcciones a nivel genético puede verse dificultada por duplicaciones recientes , parálogos , empalme alternativo o fusiones génicas . Estas complicaciones también pueden causar problemas posteriores durante la inferencia de ortólogos. Al seleccionar o generar datos de secuencia, es fundamental considerar el tipo de tejido, la etapa de desarrollo y las condiciones ambientales de los organismos. Dado que el transcriptoma representa una instantánea de la expresión génica , cambios menores en estas condiciones pueden afectar significativamente qué transcritos se expresan. Esto puede afectar negativamente la detección de ortólogos posterior. [ 1 ]
Bases de datos públicas
El ARN también puede obtenerse de bases de datos públicas, como GenBank , RefSeq , 1000 Plants (1KP) y 1KITE . Estas bases de datos públicas ofrecen secuencias seleccionadas que pueden mejorar la calidad de la inferencia y evitar la carga computacional asociada al ensamblaje de secuencias .
Inferencia de la ortología/paralogía de pares de genes
Aproches
La inferencia de ortología o paralogía requiere una evaluación de la homología de secuencias , generalmente mediante alineación de secuencias . Los análisis filogenéticos y la alineación de secuencias a menudo se consideran conjuntamente, ya que los análisis filogenéticos que utilizan ADN o ARN requieren alineación de secuencias y las alineaciones en sí mismas suelen representar alguna hipótesis de homología . Dado que la identificación adecuada de ortólogos es fundamental para los análisis filogenéticos, existen diversos métodos disponibles para inferir ortólogos y parálogos . [ 2 ]
Estos métodos generalmente se distinguen como algoritmos basados en grafos o algoritmos basados en árboles. Algunos ejemplos de métodos basados en grafos incluyen InParanoid, [ 3 ] MultiParanoid, [ 4 ] OrthoMCL, [ 5 ] HomoloGene [ 6 ] y OMA. [ 7 ] Los algoritmos basados en árboles incluyen programas como OrthologID o RIO. [ 8 ] [ 2 ]
A menudo se utilizan diversos métodos BLAST para detectar ortólogos entre especies como parte de algoritmos basados en grafos, como MegaBLAST, BLASTALL u otras formas de BLAST de todo contra todo, y pueden ser alineaciones basadas en nucleótidos o proteínas . [ 9 ] [ 10 ] RevTrans [ 11 ] incluso utiliza datos de proteínas para informar las alineaciones de ADN, lo que puede ser beneficioso para resolver relaciones filogenéticas más distantes. Estos enfoques a menudo asumen que los mejores resultados recíprocos que pasan alguna métrica umbral, como identidad, valor E o porcentaje de alineación, representan ortólogos y pueden verse afectados por una clasificación de linajes incompleta . [ 12 ] [ 13 ]
Bases de datos y herramientas
Es importante tener en cuenta que las relaciones de ortología en las bases de datos públicas suelen representar la ortología a nivel genético y no proporcionan información sobre variantes de empalme alternativas conservadas .
Las bases de datos que contienen y/o detectan relaciones de ortología incluyen:
- DIOPT
- Ensembl Compara
- GreenPhylDB
- HaMStR
- Homogene
- InParanoid archivado el 3 de mayo de 2021 en Wayback Machine
- Multiparanoide
- OMA
- OrthoDB
- OrthoFinder
- OrthologID
- OrthoMCL
- Base de datos ortopédica
- PhylomeDB
- TreeFam
- ponche de huevo
- metaPhOrs
Dado que la transcripción eucariota es un proceso complejo mediante el cual se pueden generar múltiples transcripciones a partir de un solo gen a través del empalme alternativo con expresión variable , la utilización del ARN es más complicada que la del ADN. Sin embargo, los transcriptomas son más baratos de secuenciar que los genomas completos y pueden obtenerse sin utilizar un genoma de referencia preexistente . [ 1 ]
No es raro traducir secuencias de ARN a secuencias de proteínas al utilizar datos transcriptómicos, especialmente al analizar taxones altamente divergentes. Este es un paso intuitivo, ya que se espera que muchos (pero no todos) los transcritos codifiquen isoformas de proteínas . Entre los beneficios potenciales se incluyen la reducción de sesgos mutacionales y un menor número de caracteres, lo que puede acelerar los análisis. Sin embargo, esta reducción de caracteres también puede resultar en la pérdida de caracteres potencialmente informativos. [ 1 ]
Existen diversas herramientas para el alineamiento de secuencias múltiples . Cada una presenta sus propias ventajas y desventajas, y pueden estar especializadas para distintos tipos de secuencias (ADN, ARN o proteínas). Por ejemplo, un alineador que tenga en cuenta el empalme puede ser ideal para alinear secuencias de ARN, mientras que un alineador que considere la estructura de las proteínas o las tasas de sustitución de residuos puede ser preferible para datos de secuencias de ARN traducidas.
Oportunidades y limitaciones
El uso de ARN para el análisis filogenético conlleva un conjunto único de ventajas y desventajas.
Ventajas
- gran conjunto de personajes
- rentable
- no depende de un genoma de referencia
Desventajas
- gastos de un muestreo taxonómico extenso
- dificultad en la identificación de transcripciones completas de copia única y ortólogos
- posible error en el ensamblaje de las transcripciones (especialmente cuando hay duplicados)
- datos faltantes como producto del transcriptoma que representa una instantánea de la expresión o clasificación de linaje incompleta [ 14 ]
Véase también
- EXPLOSIÓN
- Región de codificación
- Filogenética computacional
- Montaje del transcriptoma de novo
- Exoma
- secuenciación del exoma
- Etiqueta de secuencia expresada
- expresión génica
- Homología
- Lista de software filogenético
- Filogenética
- Árbol filogenético
- ARN
- Secuenciación de ARN
- Alineación de secuencias
- Sustitución sinónima
- Sistemática
- Transcriptoma
- UniGene
Referencias
- 1 2 3 Hörandl, Elvira; Appelhans, Mark (2015). Secuenciación de nueva generación en sistemática vegetal . Koeltz Scientific Books. ISBN 978-3-87429-492-8.
- 1 2 Salichos, Leonidas; Rokas, Antonis; Fairhead, Cecile (13 de abril de 2011). "Evaluación de algoritmos de predicción de ortólogos en un clado modelo de levadura" . PLOS ONE . 6 (4) e18755. Bibcode : 2011PLoSO...618755S . doi : 10.1371/journal.pone.0018755 . PMC 3076445. PMID 21533202 .
- ↑ Ostlund, G.; Schmitt, T.; Forslund, K.; Kostler, T.; Messina, DN; Roopra, S.; Frings, O.; Sonnhammer, ELL (5 de noviembre de 2009). "InParanoid 7: nuevos algoritmos y herramientas para el análisis de ortología eucariota" . Nucleic Acids Research . 38 (Base de datos): D196– D203. doi : 10.1093/nar/gkp931 . PMC 2808972. PMID 19892828 .
- ↑ Alexeyenko, A.; Tamas, I.; Liu, G.; Sonnhammer, ELL (27 de julio de 2006). "Agrupación automática de ortólogos e inparálogos compartidos por múltiples proteomas" . Bioinformatics . 22 (14): e9– e15. doi : 10.1093/bioinformatics/btl213 . PMID 16873526 .
- ↑ Li, L. (1 de septiembre de 2003). "OrthoMCL: Identificación de grupos de ortólogos para genomas eucariotas" . Genome Research . 13 (9): 2178– 2189. doi : 10.1101/gr.1224503 . PMC 403725. PMID 12952885 .
- ^ Sayers, EW; Barrett, T.; Benson, DA; Bolton, E.; Bryant, SH; Canese, K.; Chetvernin, V.; Iglesia, DM; DiCuccio, M.; Federhen, S.; Feolo, M.; Fingerman, mensajería instantánea; Geer, LY; Helmberg, W.; Kapustin, Y.; Landsman, D.; Lipman, DJ; Lu, Z.; Enloquecer, TL; Madej, T.; Maglott, DR ; Marchler-Bauer, A.; Molinero, V.; Mizrachi, I.; Ostell, J.; Panchenko, A.; Phan, L.; Pruitt, KD; Schuler, GD; Sequeira, E.; Jerez, ST; Shumway, M.; Sirotkin, K.; Slotta, D.; Souvorov, A.; Starchenko, G.; Tatusova, TA; Wagner, L.; Wang, Y.; Wilbur, WJ; Yaschenko, E.; Ye, J. (21 de noviembre de 2010). "Recursos de bases de datos del Centro Nacional de Información Biotecnológica" . Nucleic Acids Research . 39 (Base de datos): D38– D51. doi : 10.1093/nar/gkq1172 . PMC 3013733. PMID 21097890 .
- ↑ Altenhoff, AM; kunca, N.; Glover, N.; Train, C.-M.; Sueki, A.; Pili ota, I.; Gori, K.; Tomiczek, B.; Muller, S.; Redestig, H.; Gonnet, GH; Dessimoz, C. (15 de noviembre de 2014). "La base de datos de ortología OMA en 2015: predicciones de funciones, mejor soporte de plantas, vista de sintenia y otras mejoras" . Nucleic Acids Research . 43 (D1): D240– D249. doi : 10.1093 / nar/gku1158 . PMC 4383958. PMID 25399418 .
- ↑ Zmasek, Christian M; Eddy, Sean R (2002). "RIO: Análisis de proteomas mediante filogenómica automatizada utilizando inferencia remuestreada de ortólogos" . BMC Bioinformatics . 3 (1): 14. doi : 10.1186/1471-2105-3-14 . PMC 116988. PMID 12028595 .
- ↑ Barker, MS; Vogel, H.; Schranz, ME (5 de octubre de 2009). "Paleopoliploidía en las Brassicales: los análisis del transcriptoma del cleoma dilucidan la historia de las duplicaciones del genoma en Arabidopsis y otras Brassicales" . Genome Biology and Evolution . 1 : 391–399 . doi : 10.1093/gbe/evp040 . PMC 2817432. PMID 20333207 .
- ↑ Yang, Xu; Cheng, Yu-Fu; Deng, Cao; Ma, Yan; Wang, Zhi-Wen; Chen, Xue-Hao; Xue, Lin-Bao (2014). "Análisis comparativo del transcriptoma de la berenjena (Solanum melongena L.) y la baya de pavo (Solanum torvum Sw.): filogenómica y análisis de resistencia a enfermedades" . BMC Genomics . 15 (1): 412. doi : 10.1186/1471-2164-15-412 . PMC 4070557. PMID 24885385 .
- ↑ Wernersson, R. (1 de julio de 2003). "RevTrans: alineación múltiple de ADN codificante a partir de secuencias de aminoácidos alineadas" . Nucleic Acids Research . 31 (13): 3537– 3539. doi : 10.1093/nar/gkg609 . PMC 169015. PMID 12824361 .
- ↑ Moreno-Hagelsieb, G.; Latimer, K. (26 de noviembre de 2007). "Elección de opciones BLAST para una mejor detección de ortólogos como mejores coincidencias recíprocas" . Bioinformatics . 24 (3): 319– 324. doi : 10.1093/bioinformatics/btm585 . PMID 18042555 .
- ↑ Castillo-Ramírez, Santiago; González, Víctor (2008). "Factores que afectan la concordancia entre árboles de genes ortólogos y árboles de especies en bacterias" . BMC Evolutionary Biology . 8 (1): 300. Bibcode : 2008BMCEE...8..300C . doi : 10.1186/1471-2148-8-300 . PMC 2614993. PMID 18973688 .
- ↑ Wen, Jun; Xiong, Zhiqiang; Nie, Ze-Long; Mao, Likai; Zhu, Yabing; Kan, Xian-Zhao; Ickert-Bond, Stefanie M.; Gerrath, Jean; Zimmer, Elizabeth A.; Fang, Xiao-Dong; Candela, Hector (17 de septiembre de 2013). "Las secuencias del transcriptoma resuelven profundas relaciones de la familia de la vid" . PLOS ONE . 8 (9) e74394. Bibcode : 2013PLoSO...874394W . doi : 10.1371/journal.pone.0074394 . PMC 3775763. PMID 24069307 .
Enlaces externos
- 1 COMETA
- 1000 plantas (1KP)
- DIOPT
- ponche de huevo
- Ensembl Compara
- Banco GenBank
- GreenPhylDB
- HaMStR
- Homogene
- InParanoid archivado el 3 de mayo de 2021 en Wayback Machine
- Multiparanoide
- metaPhOrs
- NCBI_BLAST
- OMA
- OrthoDB
- OrthologID
- OrthoMCL
- Base de datos ortopédica
- PhylomeDB
- RefSeq
- RevTrans_2.0
- TreeFam
- Trinity_de_novo_assembler
- Filogenética computacional
- Técnicas genéticas