
Clustal es un programa informático utilizado para el alineamiento de secuencias múltiples en bioinformática . [ 2 ] Es uno de los programas informáticos de bioinformática más citados, con dos de sus publicaciones académicas entre los 100 artículos más citados de todos los tiempos, según Nature en 2014. [ 3 ]
Desde su primera publicación en 1988, el software y sus algoritmos han pasado por varias iteraciones, siendo ClustalΩ (Omega) la versión más reciente a fecha de 2011.Está disponible como software independiente, a través de una interfaz web y mediante un servidor alojado por el Instituto Europeo de Bioinformática .
Historia
El árbol guía en las versiones iniciales de Clustal se construyó mediante un análisis de clúster UPGMA de los alineamientos por pares, de ahí el nombre CLUSTAL. [ 4 ] cf. [ 5 ] Las primeras cuatro versiones de Clustal se numeraron usando números arábigos (1 a 4), mientras que la quinta versión usa el número romano V. [ 4 ] cf. [ 6 ] [ 7 ] Las siguientes dos versiones proceden alfabéticamente usando el alfabeto latino, donde W significa ponderado y X para X Window para representar los cambios introducidos. [ 4 ] cf. [ 8 ] [ 9 ] El nombre Omega fue elegido para marcar un cambio con respecto a las iteraciones anteriores. [ 4 ]
Historial de versiones
- Clustal : El software original para alineamientos de secuencias múltiples, creado por Des Higgins en 1988, se basaba en derivar un árbol guía a partir de secuencias de pares de aminoácidos o nucleótidos . [ 10 ]
- ClustalV : La segunda generación de Clustal, lanzada en 1992. Introdujo la capacidad de crear nuevos alineamientos a partir de alineamientos existentes en un proceso conocido como reconstrucción de árboles filogenéticos. ClustalV también añadió la opción de crear árboles utilizando el método de unión de vecinos . [ 7 ]
- ClustalW : La tercera generación, lanzada en 1994. Mejoró el algoritmo de alineación progresiva, incluyendo opciones de ponderación de secuencias basadas en similitud y divergencia . Además, añadió la opción de ejecutar Clustal en modo por lotes desde la línea de comandos . [ 11 ]
- ClustalX : Lanzada en 1997, esta fue la primera versión en tener una interfaz gráfica de usuario. [ 9 ]
- Clustal2 : Esta actualización supuso una mejora tanto de ClustalW como de ClustalX, con mayor precisión y eficiencia en 2007. [ 12 ]
- ClustalΩ (Omega) : La versión actual, lanzada en 2011. [ 13 ] [ 14 ]
Función

Clustal alinea secuencias mediante una heurística que construye progresivamente una alineación múltiple a partir de un conjunto de alineaciones por pares. Este método funciona analizando las secuencias en su conjunto y utilizando el método UPGMA/neighbor-joining para generar una matriz de distancias . Se calcula un árbol guía a partir de las puntuaciones de las secuencias en la matriz, que posteriormente se utiliza para construir la alineación múltiple alineando progresivamente las secuencias en orden de similitud. [ 15 ]
Clustal crea alineamientos de secuencias múltiples a través de tres pasos principales:
- Realice una alineación por pares utilizando el método de alineación progresiva.
- Cree un árbol guía (o utilice un árbol definido por el usuario).
- Utilice el árbol guía para realizar una alineación múltiple.
Estos pasos se realizan automáticamente mediante la función "Realizar alineación completa". Otras opciones son "Realizar alineación a partir del árbol guía y la filogenia" y "Generar solo el árbol guía".
Entrada/salida
Este programa acepta una amplia gama de formatos de entrada, incluidos NBRF/ PIR , FASTA , EMBL/ Swiss-Prot , Clustal, GCC/MSF, GCG9 RSF y GDE.
El formato de salida puede ser uno o varios de los siguientes: Clustal, NBRF/ PIR , GCG /MSF, PHYLIP , GDE o NEXUS.
Se muestran los mismos símbolos tanto para los alineamientos de ADN / ARN como para los alineamientos de proteínas , por lo que, si bien los símbolos * (asterisco) son útiles para ambos, los demás símbolos de consenso deben ignorarse para los alineamientos de ADN/ARN.
Ajustes
Los parámetros de penalización por apertura de hueco y penalización por extensión de hueco pueden ser ajustados por el usuario.
Clustal y ClustalV
El software original Clustal se desarrolló en 1988 como un método computacional para generar alineamientos de secuencias múltiples en computadoras personales . ClustalV se lanzó 4 años después, y fue una reescritura completa, escrita en C en lugar de Fortran .
Algoritmo
Ambas versiones utilizan el mismo algoritmo rápido y aproximado para calcular las puntuaciones de similitud entre secuencias, lo que a su vez produce los alineamientos por pares. El algoritmo funciona calculando las puntuaciones de similitud como el número de coincidencias de k-tuplas entre dos secuencias, teniendo en cuenta una penalización por huecos. Cuanto más similares sean las secuencias, mayor será la puntuación. Una vez puntuadas las secuencias, se genera un dendrograma mediante UPGMA para generar un ordenamiento del alineamiento múltiple de secuencias. Las secuencias se alinean en orden descendente según el orden establecido. Este algoritmo permite trabajar con conjuntos de datos muy grandes y es rápido. Sin embargo, la velocidad depende del rango de coincidencias de k-tuplas seleccionado para el tipo de secuencia en particular. [ 16 ]
Mejoras notables en ClustalV
Algunas de las adiciones más notables en ClustalV son las alineaciones de perfiles y las opciones completas de la interfaz de línea de comandos. La capacidad de usar alineaciones de perfiles permite al usuario alinear dos o más alineaciones o secuencias anteriores a una nueva alineación y mover las secuencias desalineadas (puntuación baja) más abajo en el orden de alineación. Esto le da al usuario la opción de crear gradualmente y metódicamente alineaciones de secuencias múltiples con más control que la opción básica. [ 15 ] La opción de ejecutar desde la línea de comandos acelera el proceso de alineación de secuencias múltiples. Las secuencias se pueden ejecutar con un comando simple,
clustalv nombre_de_archivo.secuenciao
clustalv / infile = nombre_del_archivo.secuenciaEl programa determinará el tipo de secuencia que está analizando. Una vez finalizado el programa, el resultado del alineamiento de secuencias múltiples y el dendrograma se guardan en archivos con las extensiones .aln y .dnd, respectivamente. La interfaz de línea de comandos utiliza los parámetros predeterminados y no permite otras opciones. [ 16 ]
ClustalW

ClustalW utiliza métodos de alineación progresiva, que priorizan las secuencias para la alineación según su similitud hasta obtener una alineación global. Además, es un algoritmo basado en matrices , mientras que herramientas como T-Coffee y Dialign se basan en la consistencia . Este programa requiere tres o más secuencias para calcular una alineación global. Para la alineación de secuencias binarias, se deben utilizar otras herramientas como EMBOSS o LALIGN.

Algoritmo
ClustalW utiliza algoritmos de alineación progresiva. En estos, las secuencias se alinean de mayor a menor puntuación de alineación. Esta heurística es necesaria para limitar la complejidad temporal y de memoria requerida para encontrar la solución óptima global .
Primero, el algoritmo calcula una matriz de distancias por pares entre todos los pares de secuencias ( alineamiento de secuencias por pares ). A continuación, un método de unión de vecinos utiliza el enraizamiento del punto medio para crear un árbol guía general. [ 17 ] A la derecha se muestra un diagrama de este método. Finalmente, el árbol guía se utiliza como plantilla aproximada para generar un alineamiento global.
complejidad temporal
ClustalW tiene una complejidad temporal dedebido a su uso del método de unión de vecinos.
ClustalW2 añadió una opción para usar UPGMA, que es más rápida para tamaños de entrada grandes. El indicador de línea de comandos para usarlo en lugar de neighbor-joining es:
- agrupamiento = UPGMAComo ejemplo aproximado, mientras que una entrada de 10.000 secuencias tardaría más de una hora en el algoritmo de unión de vecinos, UPGMA se completaría en menos de un minuto.
ClustalW2 también incorporó una precisión de alineación iterativa. Esta opción no aumenta la eficiencia, pero sí permite incrementar la precisión de la alineación. Esto puede resultar especialmente útil para conjuntos de datos pequeños.
Las siguientes banderas activan la alineación iterativa:
- Iteración = Alineación - Iteración = Árbol - numeradoresLa primera opción refina la alineación final. La segunda opción incorpora el esquema en el paso de alineación progresiva. La tercera especifica el número de ciclos de iteración, cuyo valor predeterminado es 3. [ 18 ]
Precisión y resultados
El algoritmo que utiliza ClustalW es casi óptimo. Resulta más eficaz para conjuntos de datos con un alto grado de varianza. En este tipo de conjuntos de datos, el proceso de generación del árbol guía es menos sensible al ruido. ClustalW fue uno de los primeros algoritmos de alineación de secuencias múltiples en combinar la alineación por pares y la alineación global para aumentar la velocidad, pero esta decisión reduce la precisión de los resultados.
Cuando se compararon varios algoritmos de alineación de secuencias en 2014, ClustalW fue uno de los más rápidos que pudo producir resultados con el nivel de precisión deseado. Sin embargo, no fue tan preciso como sus competidores basados en consistencia, como T-Coffee. [ 19 ] De MAFFT, T-Coffee y Clustal Omega, ClustalW tiene la menor precisión para secuencias completas, pero su precisión aún se considera aceptable. Además, ClustalW fue el algoritmo más eficiente en memoria de los estudiados. [ 19 ] Las continuas actualizaciones del software han hecho que ClustalW2 sea más preciso manteniendo esta velocidad. [ 18 ]
Clustal Omega

ClustalΩ (también escrito como Clustal O y Clustal Omega) está escrito en C y C++ . Utiliza árboles guía con semillas y un nuevo motor HMM que se centra en dos perfiles para generar estos alineamientos. [ 20 ] [ 21 ] El programa requiere tres o más secuencias para calcular el alineamiento de secuencias múltiples . Clustal Omega se basa en la consistencia y es ampliamente considerado como una de las implementaciones en línea más rápidas de todas las herramientas de alineamiento de secuencias múltiples, y aún se encuentra entre los algoritmos más precisos, tanto en comparación con los basados en consistencia como con los basados en matrices.
Algoritmo

Clustal Omega tiene cinco pasos principales para generar el alineamiento de secuencias múltiples .
- Se produce una alineación por pares utilizando el método de k-tuplas. Este es un método heurístico que no garantiza encontrar una solución óptima, pero es más eficiente que utilizar la programación dinámica .
- Las secuencias se agrupan utilizando el método mBed modificado. [ 22 ] El método mBed calcula la distancia por pares utilizando la incrustación de secuencias.
- Se aplica el método de agrupamiento k -means.
- Se construye un árbol guía utilizando el método UPGMA . En la figura de la derecha, esto se muestra como múltiples pasos que conducen a la construcción de un árbol guía final debido a la naturaleza aglomerativa de UPGMA. En cada paso (rombos en el diagrama de flujo), se combinan los dos clústeres más cercanos. Este proceso se repite hasta que se puede evaluar un árbol global final.
- El alineamiento múltiple de secuencias final se produce con el paquete HHAlign de HH-Suite utilizando dos HMM de perfil . Un HMM de perfil es una máquina de estados lineal que consta de una serie de nodos, cada uno de los cuales corresponde aproximadamente a una posición (columna) en el alineamiento a partir del cual se construyó. [ 23 ]
complejidad temporal
La complejidad temporal de calcular exactamente una alineación óptima desecuencias de longitudes lo cual resulta prohibitivo incluso para un número pequeño de secuencias. Para gestionar esto, Clustal Omega utiliza una versión modificada de mBed que tiene una complejidad de[ 22 ] [ 24 ] y produce árboles guía tan precisos como los de los métodos convencionales. La velocidad y precisión de los árboles guía en Clustal Omega se atribuyen a la implementación de un algoritmo mBed modificado. Además, reduce el tiempo de cálculo y los requisitos de memoria para completar alineaciones en grandes conjuntos de datos.
Precisión y resultados
La precisión de Clustal Omega en un número reducido de secuencias es, en promedio, muy similar a la de los alineadores de secuencias considerados de alta calidad. En conjuntos de datos extremadamente grandes con cientos de miles de secuencias de entrada, Clustal Omega supera a todos los demás algoritmos en tiempo, memoria y precisión de los resultados. [ 25 ] Es capaz de procesar más de 100 000 secuencias en un solo procesador en pocas horas.
Clustal Omega utiliza el paquete HHAlign de HH-Suite, que alinea dos modelos ocultos de Markov de perfil en lugar de una comparación perfil-perfil. Esto mejora significativamente la calidad de la sensibilidad y la alineación. [ 25 ] Esto, combinado con el método mBed, le confiere a Clustal Omega una ventaja sobre otros alineadores de secuencias.
En conjuntos de datos con bases terminales no conservadas, Clustal Omega puede ser más preciso que Probcons o T-Coffee , a pesar de que ambos son algoritmos basados en la consistencia. En una prueba de eficiencia con programas que producen puntuaciones de alta precisión, MAFFT fue el más rápido, seguido de cerca por Clustal Omega. Ambos fueron más rápidos que T-Coffee; sin embargo, MAFFT y Clustal Omega requirieron más memoria para ejecutarse. [ 19 ]
Clustal2 (ClustalW/ClustalX)
Clustal2 es la versión empaquetada de ClustalW (de línea de comandos) y Clustal X (gráfico). No se trata de herramientas nuevas, sino de versiones actualizadas y mejoradas de las implementaciones anteriores. Ambas descargas vienen precompiladas para diversos sistemas operativos como Linux, Mac OS X y Windows (XP y Vista). Esta versión se diseñó para que el sitio web fuera más organizado y fácil de usar, además de actualizar los códigos fuente a sus versiones más recientes. Clustal2 es la versión 2 de ClustalW y ClustalX, de ahí su nombre. Si bien las versiones anteriores aún se pueden encontrar en el sitio web, todas las precompilaciones están ahora actualizadas.
Véase también
Referencias
- ↑ Véase el archivo COPYING, en el archivo fuente.Archivado el 12 de junio de 2021 en Wayback Machine . Consultado el 15 de enero de 2014.
- ↑ Chenna R, Sugawara H, Koike T, Lopez R, Gibson TJ , Higgins DG , Thompson JD (julio de 2003). " Alineamiento de secuencias múltiples con la serie de programas Clustal" . Nucleic Acids Research . 31 (13): 3497–500 . doi : 10.1093/nar/gkg500 . PMC 168907. PMID 12824352 .
- ↑ Van Noorden R, Maher B, Nuzzo R (octubre de 2014). "Los 100 mejores artículos" . Nature . 514 (7524): 550–3 . Bibcode : 2014Natur.514..550V . doi : 10.1038/514550a . PMID 25355343 .
- 1 2 3 4 Des Higgins, presentación en la conferencia SMBE 2012 en Dublín.
- ↑ Higgins DG, Sharp PM (diciembre de 1988). "CLUSTAL: un paquete para realizar alineamiento de secuencias múltiples en un microordenador". Gene . 73 (1): 237–44 . doi : 10.1016/0378-1119(88)90330-7 . PMID 3243435 .
- ↑ Higgins DG, Sharp PM (abril de 1989). "Alineamientos de secuencias múltiples rápidos y sensibles en un microordenador". Aplicaciones informáticas en las biociencias . 5 (2): 151–3 . doi : 10.1093/bioinformatics/5.2.151 . PMID 2720464 .
- 1 2 Higgins DG, Bleasby AJ, Fuchs R (abril de 1992). "CLUSTAL V: software mejorado para alineación de secuencias múltiples". Computer Applications in the Biosciences . 8 (2): 189– 91. doi : 10.1093/bioinformatics/8.2.189 . PMID 1591615 .
- ↑ Thompson JD, Higgins DG, Gibson TJ (noviembre de 1994). "CLUSTAL W: mejora de la sensibilidad del alineamiento progresivo de secuencias múltiples mediante ponderación de secuencias, penalizaciones de huecos específicas de posición y elección de matriz de ponderación" . Nucleic Acids Research . 22 (22): 4673–80 . doi : 10.1093/nar/22.22.4673 . PMC 308517. PMID 7984417 .
- 1 2 Thompson JD, Gibson TJ , Plewniak F, Jeanmougin F, Higgins DG (diciembre de 1997). "La interfaz de Windows CLUSTAL_X: estrategias flexibles para el alineamiento de secuencias múltiples asistidas por herramientas de análisis de calidad" . Nucleic Acids Research . 25 (24): 4876–82 . doi : 10.1093/nar/25.24.4876 . PMC 147148. PMID 9396791 .
- ↑ Higgins DG, Sharp PM (diciembre de 1988). "CLUSTAL: un paquete para realizar alineamiento de secuencias múltiples en un microordenador". Gene . 73 (1): 237–44 . doi : 10.1016/0378-1119(88)90330-7 . PMID 3243435 .
- ↑ Thompson, JD; Higgins, DG; Gibson, TJ (1994-11-11). "CLUSTAL W: mejora de la sensibilidad del alineamiento progresivo de secuencias múltiples mediante ponderación de secuencias, penalizaciones de huecos específicas de posición y elección de matriz de ponderación" . Nucleic Acids Research . 22 (22): 4673– 4680. doi : 10.1093 / nar/22.22.4673 . ISSN 0305-1048 . PMC 308517. PMID 7984417 .
- ↑ Dineen, David. "Clustal W y Clustal X Alineamiento de secuencias múltiples" . www.clustal.org . Archivado del original el 16 de abril de 2018. Consultado el 24 de abril de 2018 .
- ↑ Sievers F, Higgins DG (2014-01-01). "Clustal Omega, Alineación precisa de un gran número de secuencias". En Russell DJ (ed.). Métodos de alineación de secuencias múltiples . Métodos en biología molecular. Vol. 1079. Humana Press. pp. 105–116 . doi : 10.1007/978-1-62703-646-7_6 . ISBN 9781627036450. PMID 24170397 .
- ↑ Sievers F, Higgins DG (1 de enero de 2002). Clustal Omega . Vol. 48. John Wiley & Sons, Inc. pp. 3.13.1–16. doi : 10.1002/0471250953.bi0313s48 . ISBN 9780471250951. PMID 25501942 . S2CID 1762688 .
{{cite book}}:|journal=ignorado ( ayuda ) - 1 2 "Algoritmo CLUSTAL W" . Archivado del original el 1 de diciembre de 2016. Consultado el 24 de abril de 2018 .
- 1 2 Higgins, Des (junio de 1991). "Clustal V Alineamientos de secuencias múltiples. Documentación (instalación y uso)" . www.aua.gr. Archivado del original el 12 de abril de 2023. Recuperado el 27 de agosto de 2022 .
- ↑ "Acerca de CLUSTALW" . www.megasoftware.net . Archivado del original el 24 de abril de 2018. Consultado el 24 de abril de 2018 .
- 1 2 Larkin, MA; Blackshields, G.; Brown, NP; Chenna, R.; McGettigan, PA; McWilliam, H.; Valentin, F.; Wallace, IM; Wilm, A. (2007-09-10). "Clustal W y Clustal X versión 2.0" . Bioinformatics . 23 (21): 2947– 2948. doi : 10.1093/bioinformatics/btm404 . ISSN 1367-4803 . PMID 17846036 .
- 1 2 3 Pais FS, Ruy PC, Oliveira G, Coimbra RS (marzo de 2014). "Evaluación de la eficiencia de los programas de alineación de secuencias múltiples" . Algorithms for Molecular Biology . 9 (1) 4. doi : 10.1186/1748-7188-9-4 . PMC 4015676. PMID 24602402 .
- ↑ EMBL-EBI. " Clustal Omega < Alineamiento de secuencias múltiples < EMBL-EBI" . www.ebi.ac.uk. Archivado del original el 29 de abril de 2018. Consultado el 18 de abril de 2018 .
- ↑ Dineen, David. "Clustal Omega, ClustalW y ClustalX Alineamiento de secuencias múltiples" . www.clustal.org . Archivado del original el 29 de mayo de 2010. Consultado el 18 de abril de 2018 .
- 1 2 Blackshields G, Sievers F, Shi W, Wilm A, Higgins DG (mayo de 2010). "Incrustación de secuencias para la construcción rápida de árboles guía para el alineamiento de secuencias múltiples" . Algorithms for Molecular Biology . 5 21. doi : 10.1186/1748-7188-5-21 . PMC 2893182. PMID 20470396 .
- ↑ "Análisis HMM de perfil" . www.biology.wustl.edu . Archivado del original el 24 de julio de 2019. Consultado el 1 de mayo de 2018 .
- ↑ Sievers F, Wilm A, Dineen D, Gibson TJ, Karplus K, Li W, Lopez R, McWilliam H, Remmert M, Söding J, Thompson JD, Higgins DG (octubre de 2011). "Generación rápida y escalable de alineamientos de secuencias múltiples de proteínas de alta calidad utilizando Clustal Omega" . Molecular Systems Biology . 7 (1) 539. doi : 10.1038/msb.2011.75 . PMC 3261699. PMID 21988835 .
- 1 2 Daugelaite J, O' Driscoll A, Sleator RD (2013). "Una visión general de los alineamientos de secuencias múltiples y la computación en la nube en bioinformática" . ISRN Biomathematics . 2013 : 1–14 . doi : 10.1155/2013/615630 . ISSN 2090-7702 .
Enlaces externos
- Página principal de Clustal (descarga gratuita para Unix/Linux, Mac y Windows)
- Espejo Clustal Omega en el EBI
- Software de filogenética
- Software bioinformático gratuito
- Software libre programado en C++