T-Coffee ( Función Objetivo de Consistencia Basada en Árboles para la Evaluación de Alineamientos ) es un software de alineamiento de secuencias múltiples que utiliza un enfoque progresivo. [ 1 ] Genera una biblioteca de alineamientos por pares para guiar el alineamiento de secuencias múltiples. También puede combinar alineamientos de secuencias múltiples obtenidos previamente y, en las versiones más recientes, puede utilizar información estructural de archivos del Protein Data Bank (PDB) (3D-Coffee). Cuenta con funciones avanzadas para evaluar la calidad de los alineamientos y cierta capacidad para identificar la ocurrencia de motivos (Mocca). Produce alineamientos en formato aln ( Clustal ) por defecto, pero también puede producir formatos PIR, MSF y FASTA . Se admiten los formatos de entrada más comunes ( FASTA , Protein Information Resource (PIR)).
Algoritmo
El algoritmo T-Coffee consta de dos características principales: la primera, mediante el uso de fuentes de datos heterogéneas, proporciona medios sencillos y flexibles para generar alineamientos múltiples. T-Coffee puede calcular alineamientos múltiples utilizando una biblioteca generada a partir de una combinación de alineamientos locales y globales por pares. [ 1 ]
El segundo es el "Método de Optimización", utilizado para encontrar el alineamiento múltiple que mejor se ajuste a los alineamientos por pares en la biblioteca de entrada mediante una estrategia progresiva comparable a la empleada en Clustal W. El Método de Optimización tiene la ventaja de ser rápido y robusto. La información de la biblioteca se utiliza para realizar alineamientos progresivos, lo que facilita la consideración de los alineamientos entre todos los pares durante cada paso del alineamiento múltiple progresivo. [ 1 ]
Generación de una biblioteca primaria de alineamientos
La biblioteca incorpora un conjunto de alineamientos por pares entre todas las secuencias que se van a alinear; no es necesario que los alineamientos sean consistentes. Dentro de la biblioteca, se puede encontrar información sobre cada una de las N(N-1)/2secuencias, donde N es el número de secuencias. Se utilizan dos fuentes de alineamiento para cada par de secuencias, una de ellas clasificada como local y la otra como global. [ 1 ]
Los alineamientos globales se construyen utilizando Clustal W sobre las secuencias, de dos en dos, y se utilizan para generar un alineamiento completo entre cada par de secuencias. Los alineamientos locales son los diez alineamientos locales no intersecantes con mayor puntuación, recopilados mediante el programa Lalign del paquete FASTA . [ 1 ]
Cada alineación se representa en la biblioteca como una lista de coincidencias de residuos por pares; cada par constituye una restricción. Sin embargo, algunas restricciones son más relevantes que otras. La importancia de cada restricción depende de la probabilidad de que sean correctas. Al calcular las alineaciones múltiples, se da prioridad a los pares de residuos más fiables mediante un esquema de ponderación. [ 1 ]
Combinación de las bibliotecas
La combinación eficiente de información de alineación local y global es un factor importante de T-Coffee. Mediante el uso de las bibliotecas primarias Clustal W y Lalign, esto se puede lograr con un proceso de suma. Cualquier par duplicado entre ambas bibliotecas se fusiona en una sola entrada con el peso de la suma total de ambos pares. De lo contrario, se crea una nueva entrada para el par. Los pares con un peso de cero no se representarán. [ 1 ] Para cada par de residuos alineados en la biblioteca, es posible asignar un peso que corresponde al grado en que esos residuos se alinean de manera consistente. Esto se denomina extensión de biblioteca.
Comparaciones con otros programas de alineación
Si bien la salida predeterminada tiene un formato similar a Clustal, es lo suficientemente diferente de la salida de ClustalW/X como para que muchos programas que admiten el formato Clustal no puedan leerla; afortunadamente, ClustalX puede importar la salida de T-Coffee, por lo que la solución más sencilla para este problema suele ser importar la salida de T-Coffee a ClustalX y luego volver a exportarla. Otra posibilidad es solicitar el formato de salida estricto de ClustalW con la opción " -output=clustalw_aln".
Una característica importante de T-Coffee es su capacidad para combinar diferentes métodos y tipos de datos. En su última versión, T-Coffee permite combinar secuencias y estructuras de proteínas, así como secuencias y estructuras de ARN. También puede ejecutar y combinar los resultados de los paquetes de alineación de secuencias y estructuras más comunes.
T-Coffee incluye una sofisticada utilidad de reformateo de secuencias llamada seq_reformat. Hay disponible una amplia documentación en línea.
Variaciones
- M-Coffee: un modo especial de T-Coffee que permite combinar la salida de los paquetes de alineación de secuencias múltiples más comunes (Muscle, ClustalW, Mafft, ProbCons, etc.). Las alineaciones resultantes son ligeramente mejores que las individuales, pero lo más importante es que el programa indica las regiones de alineación donde coinciden los distintos paquetes. Las regiones de alta concordancia suelen estar bien alineadas. [ 2 ]
- Espresso y 3D-Coffee: estos son modos especiales de T-Coffee que permiten combinar secuencias y estructuras en una alineación. Las alineaciones basadas en estructuras se pueden realizar utilizando los alineadores estructurales más comunes, como TMalign, Mustang y sap. [ 3 ] [ 4 ] [ 5 ] [ 6 ]
- R-Coffee: un modo especial de T-Coffee que permite alinear secuencias de ARN utilizando información de estructura secundaria. [ 7 ] [ 8 ]
- PSI-Coffee: alinea proteínas distantemente relacionadas mediante extensión de homología (lento y preciso) [ 9 ] [ 10 ]
- TM-Coffee: alinea proteínas transmembrana mediante extensión de homología [ 11 ]
- Pro-Coffee: alinea regiones promotoras homólogas [ 12 ]
- Preciso: combina automáticamente los modos más precisos para ADN, ARN y proteínas (experimental). [ 13 ]
Evaluación
El Índice de Consistencia Transitiva (TCS) es una versión extendida del esquema de puntuación T-Coffee. [ 14 ] Utiliza bibliotecas T-Coffee de alineamientos por pares para evaluar cualquier MSA de terceros. Las proyecciones por pares se pueden generar utilizando métodos rápidos o lentos, lo que permite un equilibrio entre velocidad y precisión. Se ha demostrado que TCS produce estimaciones significativamente mejores de la precisión estructural y árboles filogenéticos más precisos en comparación con Heads-or-Tails, GUIDANCE, Gblocks y trimAl. [ 15 ]
Véase también
Referencias
- 1 2 3 4 5 6 7 8 Notredame C, Higgins DG , Heringa J (2000-09-08). "T-Coffee: Un nuevo método para el alineamiento múltiple de secuencias rápido y preciso". J Mol Biol . 302 (1): 205– 217. doi : 10.1006/jmbi.2000.4042 . PMID 10964570 . S2CID 10189971 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Wallace, Iain M.; O'Sullivan, Orla; Higgins, Desmond G.; Notredame, Cedric (2006). "M-Coffee: combinación de métodos de alineación de secuencias múltiples con T-Coffee" . Nucleic Acids Research . 34 (6): 1692– 1699. doi : 10.1093/nar/gkl091 . ISSN 1362-4962 . PMC 1410914. PMID 16556910 .
- ↑ Armougom, Fabrice; Moretti, Sébastien; Poirot, Olivier; Audic, Stéphane; Dumas, Pierre; Schaeli, Basile; Keduas, Vladimir; Notredame, Cedric (2006-07-01). "Expresso: incorporación automática de información estructural en alineamientos de secuencias múltiples usando 3D-Coffee" . Nucleic Acids Research . 34 (número especial de servidor web): W604–608. doi : 10.1093/nar/gkl092 . ISSN 1362-4962 . PMC 1538866. PMID 16845081 .
- ↑ Zhang, Yang; Skolnick, Jeffrey (2005). "TM-align: un algoritmo de alineación de estructuras proteicas basado en la puntuación TM" . Nucleic Acids Research . 33 (7): 2302– 2309. doi : 10.1093/nar/gki524 . ISSN 1362-4962 . PMC 1084323. PMID 15849316 .
- ↑ Konagurthu, Arun S.; Whisstock, James C.; Stuckey, Peter J.; Lesk, Arthur M. (2006-08-15). "MUSTANG: un algoritmo de alineación estructural múltiple". Proteins . 64 (3): 559– 574. doi : 10.1002/prot.20921 . ISSN 1097-0134 . PMID 16736488 . S2CID 14074658 .
- ↑ Sun, Zheng; Tian, Weidong (2012). "SAP: un programa de mapeo y análisis de secuencias para la alineación de lecturas de secuencias largas y el descubrimiento preciso de variantes" . PLOS ONE . 7 (8) e42887. Bibcode : 2012PLoSO...742887S . doi : 10.1371/journal.pone.0042887 . ISSN 1932-6203 . PMC 3413671. PMID 22880129 .
- ↑ Wilm, Andreas; Higgins, Desmond G.; Notredame, Cédric (mayo de 2008). "R-Coffee: un método para el alineamiento múltiple de ARN no codificante" . Nucleic Acids Research . 36 (9): e52. doi : 10.1093 / nar/gkn174 . ISSN 1362-4962 . PMC 2396437. PMID 18420654 .
- ↑ Moretti, Sébastien; Wilm, Andreas; Higgins, Desmond G.; Xenarios, Ioannis; Notredame, Cédric (2008-07-01). "R-Coffee: un servidor web para alinear con precisión secuencias de ARN no codificante" . Nucleic Acids Research . 36 (número especial de servidores web): W10–13. doi : 10.1093/nar/gkn278 . ISSN 1362-4962 . PMC 2447777. PMID 18483080 .
- 1 2 Di Tommaso P, Moretti S, Xenarios I, Orobitg M, Montanyola A, Chang JM, Taly JF, Notredame C (julio de 2011). "T-Coffee: un servidor web para el alineamiento de secuencias múltiples de secuencias de proteínas y ARN utilizando información estructural y extensión de homología" . Nucleic Acids Res . 39 (número especial de servidores web): W13–7. doi : 10.1093/nar/gkr245 . PMC 3125728. PMID 21558174 .
- ↑ Kemena C, Notredame C (2009-10-01). "Próximos desafíos para los métodos de alineación de secuencias múltiples en la era de alto rendimiento" . Bioinformatics . 25 (19): 2455– 65. doi : 10.1093/bioinformatics/btp452 . PMC 2752613. PMID 19648142 .
- ↑ Chang JM, Di Tommaso P, Taly JF, Notredame C (2012-03-28). "Alineación precisa de secuencias múltiples de proteínas transmembrana con PSI-Coffee" . BMC Bioinformatics . 13 (Supl. 4) S1. doi : 10.1186/1471-2105-13-S4-S1 . PMC 3303701. PMID 22536955 .
- ^ Erb I, González-Vallinas JR, Bussotti G, Blanco E, Eyras E, Notredame C (abril de 2012). "Uso de datos de ChIP-Seq para el diseño de un método de alineación de promotores múltiples" . Ácidos nucleicos Res . 40 (7): e52. doi : 10.1093/nar/gkr1292 . PMC 3326335 . PMID 22230796 .
- ↑ "Servidor T-Coffee" . tcoffee.crg.eu . Consultado el 26 de diciembre de 2023 .
- ↑ Chang, JM; Di Tommaso, P; Lefort, V; Gascuel, O; Notredame, C (1 de julio de 2015). "TCS: un servidor web para la evaluación de alineamientos de secuencias múltiples y reconstrucción filogenética" . Nucleic Acids Research . 43 (W1): W3-6. doi : 10.1093/nar/gkv310 . PMC 4489230. PMID 25855806 .
- ↑ Chang, JM; Di Tommaso, P.; Notredame, C. (junio de 2014). "TCS: una nueva medida de confiabilidad de alineación de secuencias múltiples para estimar la precisión de la alineación y mejorar la reconstrucción del árbol filogenético" . Biología molecular y evolución . 31 (6): 1625–37 . doi : 10.1093/molbev/msu117 . PMID 24694831 .
Enlaces externos
- Sitio web oficial
- Servidor alineador T-Coffee
- Página de descarga de T-Coffee
- Documentación técnica
- Tutorial
- Lista de alineadores de terceros compatibles con T-Coffee
- Papeles originales de T-coffee
- Software de filogenética