Articulo de referencia

MAFFT

The base MAFFT software is distributed under one of the [[BSD licenses]], while versions for Microsoft Windows are licensed under a [[GNU General Public License]]. Some distribu...

En bioinformática , MAFFT ( alineamiento múltiple mediante la transformada rápida de Fourier ) es un programa que se utiliza para crear alineamientos de secuencias múltiples de aminoácidos o nucleótidos . Publicada en 2002, la primera versión utilizaba un algoritmo basado en el alineamiento progresivo , en el que las secuencias se agrupaban con la ayuda de la transformada rápida de Fourier . [ 2 ] Las versiones posteriores de MAFFT han añadido otros algoritmos y modos de funcionamiento, [ 3 ] incluyendo opciones para un alineamiento más rápido de un gran número de secuencias, [ 4 ] alineamientos de mayor precisión, [ 5 ] alineamiento de secuencias de ARN no codificante , [ 6 ] y la adición de nuevas secuencias a alineamientos existentes. [ 7 ]

Historia

Han existido muchas variantes del software MAFFT, algunas de las cuales se enumeran a continuación:

Cronología que resume las diferentes versiones de MAFFT desde 2002. Incluye breves descripciones de cada generación destacada del software.
  • MAFFT – La primera versión, creada por Kazutaka Katoh en 2002, utilizaba un algoritmo basado en alineación progresiva , en el que las secuencias se agrupaban con la ayuda de la transformada rápida de Fourier . [ 2 ]
  • MAFFT v5 – El software de segunda generación, lanzado en 2005, fue una reescritura del software original. [ 3 ] Esta generación introdujo un sistema de puntuación simplificado que funciona bien para reducir el tiempo de CPU y aumentar la precisión de los alineamientos incluso para secuencias con grandes inserciones o extensiones, así como secuencias distantemente relacionadas de longitud similar. [ 2 ]
  • MAFFT v6 – La tercera generación, lanzada en 2006, mejoró nuevamente las versiones anteriores. [ 3 ] Implementó la alineación de grupo a grupo, árboles guía que tenían un algoritmo de construcción de árboles aproximado pero más rápido O ( N log N ), e hizo que la versión fuera utilizable con conjuntos de datos más grandes de ~50 000 secuencias.
  • MAFFT v7 – La cuarta generación, lanzada en 2012, mejoró sustancialmente la velocidad y la precisión. [ 3 ]
  • MAFFT v7.511 – Una versión más reciente, lanzada en diciembre de 2022, mejoró la versión 7 con varias correcciones de errores. Una de las más notables fue una revisión de la --mergeopción, que ahora incluye la habilitación del refinamiento iterativo , la creación de un único MSA a partir de múltiples sub-MSA, así como la combinación de --mergey --seed. También hubo varias mejoras menores en la velocidad y precisión de MAFFT v7.

Algoritmo

El algoritmo MAFFT funciona siguiendo estos 5 pasos: Alineación por pares, Cálculo de distancias, Construcción del árbol guía, Alineación progresiva, Refinamiento iterativo. [ 8 ]

  • Alineamiento por pares : este paso se utiliza para identificar las regiones similares entre las secuencias introducidas. El algoritmo comienza utilizando las secuencias introducidas y realiza alineamientos por pares en todas ellas. La complejidad temporal de este paso es O(L²) donde L es la secuencia. [ 9 ]
  • Árbol guía : utilizando la matriz de distancias, se construye un árbol guía que representa jerárquicamente los clústeres (cada nodo es un clúster) y cuyas ramas representan la distancia entre ellos. La complejidad temporal para la construcción del árbol guía es O(N^2L) [ 10 ] , donde N es el número de secuencias.
  • Alineamiento progresivo : utilizando el árbol guía, el alineamiento progresivo [ 9 ] se realiza desde las hojas hasta la raíz. El algoritmo utiliza las secuencias de entrada y alinea los nodos hijos para calcular un alineamiento de consenso para el nodo padre. Este paso se repite hasta que se recorre todo el árbol para obtener un alineamiento múltiple de secuencias final. La complejidad temporal del método de alineamiento progresivo es O(N²L) + O(NL²). [ 10 ] Esto se debe a que el primer término corresponde al cálculo del árbol guía mencionado anteriormente, junto con el segundo término que corresponde al alineamiento de grupo a grupo.
  • Alineamiento iterativo : El paso de refinamiento iterativo repite todo el proceso con ajustes en las posiciones de los huecos e inserciones para mejorar la precisión del alineamiento. [ 9 ] La complejidad temporal del alineamiento iterativo depende del número de iteraciones que se produzcan. Pero, en general, la complejidad temporal de este método es O(N²L) + O(NL²) [ 10 ] donde N es el número de secuencias y L es la longitud de la secuencia.

Entrada/salida

Formulario web

Aporte

Pasos para usar MAFFT con otros programas para ver un MSA

Este programa puede recibir como entrada múltiples secuencias, las cuales pueden ingresarse de dos maneras:

Ventana de entrada de secuencia
Aquí tienes un ejemplo de formato FASTA. Para ver más formatos disponibles, haz clic en el siguiente enlace: https://www.ebi.ac.uk/seqdb/confluence/display/JDSAT/Multiple+Sequence+Alignment+Tool+Input+Examples

El usuario puede introducir directamente tres o más secuencias en la ventana de entrada en cualquiera de los siguientes formatos: GCG , FASTA , EMBL (solo nucleótidos), GenBank , PIR , NBRF , PHYLIP o UniProtKB/Swiss-Prot (solo proteínas). No se aceptan secuencias parcialmente formateadas, y añadir un salto de línea al final de la secuencia puede ayudar a ciertas aplicaciones a interpretar la entrada. También se recomienda evitar el uso de datos procedentes de procesadores de texto, ya que pueden contener caracteres ocultos o de control. [ 11 ]

Carga de archivo de secuencia

El usuario puede cargar un archivo que contenga tres o más secuencias válidas en cualquiera de los formatos mencionados anteriormente. Los archivos de procesador de texto pueden generar resultados impredecibles debido a la presencia de caracteres ocultos/de control, por lo que es recomendable guardar los archivos con la opción de formato Unix para evitar los caracteres ocultos de Windows . Una vez cargado el archivo, se puede utilizar como entrada para el alineamiento de secuencias múltiples. [ 11 ]

Producción

El usuario tendrá la opción de solicitar que el alineamiento de secuencias múltiples (MSA) se genere en uno de los dos formatos disponibles:

Ejemplo de salida de ClustalW

El valor predeterminado es: Pearson/FASTA [fasta]

Ajustes

Existen muchos parámetros que influyen en el funcionamiento del algoritmo MAFFT. Ajustar estos parámetros según las necesidades es la mejor manera de obtener resultados precisos y significativos. Los parámetros más importantes que se deben comprender son: la matriz de puntuación, la penalización por apertura de hueco y la penalización por extensión de hueco.

  • Matriz de puntuación : los programas de búsqueda de similitud de secuencias de proteínas como BLASTP, SSEARCH (UNIDAD 3.10) y FASTA utilizan matrices de puntuación diseñadas para identificar relaciones evolutivas distantes (BLOSUM62 para BLAST, BLOSUM50 para SEARCH y FASTA). Diferentes matrices de puntuación de similitud son más efectivas en diferentes distancias evolutivas. Las matrices de puntuación "profundas" como BLOSUM62 y BLOSUM50 apuntan a alineaciones con 20-30% de identidad, mientras que las matrices de puntuación "superficiales" (por ejemplo, VTML10-VTML80) apuntan a alineaciones que comparten 90-50% de identidad, lo que refleja un cambio evolutivo mucho menor." [ 12 ] En MAFFT original, la ecuación de puntuación se muestra a continuación.
  • Penalización por hueco abierto : Una penalización por hueco es una puntuación negativa asignada a un hueco en una alineación. Puede ser constante, donde se cobra un coste fijo por el hueco, o lineal, donde se cobra un coste fijo por cada símbolo insertado o eliminado. Una penalización por hueco afín combina ambas, cobrando una penalización constante por el primer símbolo de un hueco y otra penalización constante por cada símbolo adicional insertado o eliminado. [ 13 ]
  • Penalización por extensión de huecos : La penalización por extensión de huecos es una puntuación de coste asignada por cada símbolo de hueco adicional en una región de huecos en la alineación de secuencias. Se utiliza para desalentar la formación de regiones de huecos largas. Normalmente es menor que la penalización por apertura de huecos. [ 14 ]

Precisión y resultados

MAFFT es ampliamente considerado como una de las herramientas más precisas y versátiles para el alineamiento de secuencias múltiples en bioinformática . De hecho, estudios han demostrado que MAFFT funciona excepcionalmente bien en comparación con otros algoritmos populares como Clustal W y T-Coffee , particularmente para conjuntos de datos más grandes y secuencias con altos grados de divergencia. [ 15 ] Por ejemplo, en un estudio que comparó el rendimiento de varios algoritmos de alineamiento en longitudes de secuencia crecientes, se encontró que el algoritmo FFT-NS-2 de MAFFT era el programa más rápido para todos los tamaños de secuencia probados. Esto se debe a su uso de algoritmos de transformada rápida de Fourier (FFT), que permiten un alineamiento rápido y preciso incluso de secuencias altamente divergentes. Debido al uso de la transformada rápida de Fourier (FFT), el algoritmo se ejecuta en O(n^2) u O(n) dependiendo del conjunto de datos dado. MAFFT requiere menos tiempo de ejecución de CPU que otros algoritmos que tienen precisiones iguales o similares, especialmente T-Coffee, Clustal W y Needleman-Wunsch . [ 2 ]

Las versiones posteriores de MAFFT han añadido otros algoritmos y modos de operación, incluyendo opciones para una alineación más rápida de un gran número de secuencias, [ 9 ] alineaciones de mayor precisión, [ 16 ] alineación de secuencias de ARN no codificante, [ 17 ] y la adición de nuevas secuencias a alineaciones existentes. [ 18 ]

MAFFT se distingue de otros algoritmos populares como Clustal W y T-Coffee por su alta precisión, versatilidad y variedad de funciones. Ofrece diversos métodos y estrategias de alineación, incluyendo refinamiento iterativo y enfoques basados ​​en la consistencia, que mejoran aún más la precisión y robustez de las alineaciones. Como resultado, MAFFT es ampliamente reconocido como una herramienta poderosa para la alineación de secuencias múltiples y es muy apreciado por la comunidad científica. [ 19 ]

Véase también

Referencias

  1. El software base de MAFFT se distribuye bajo una de las licencias BSD , mientras que las versiones para Microsoft Windows tienen licencia GNU General Public License . Algunas distribuciones de MAFFT contienen software con otras licencias https://mafft.cbrc.jp/alignment/software/
  2. 1 2 3 4 Katoh, Kazutaka; Misawa, Kazuharu; Kuma, Kei-ichi; Miyata, Takashi (2002). "MAFFT: un nuevo método para el alineamiento rápido de secuencias múltiples basado en la transformada rápida de Fourier" . Nucleic Acids Research . 30 (14): 3059– 66. doi : 10.1093/nar/gkf436 . PMC 135756. PMID 12136088 .  
  3. 1 2 3 4 "MAFFT ver.7 - un programa de alineación de secuencias múltiples" . mafft.cbrc.jp . Consultado el 28 de abril de 2021 .
  4. Katoh, K.; Toh, H. (2006). "PartTree: Un algoritmo para construir un árbol aproximado a partir de un gran número de secuencias no alineadas" . Bioinformatics . 23 (3): 372–4 . doi : 10.1093/bioinformatics/btl592 . PMID 17118958 . 
  5. Katoh, K.; Kuma, K.; Miyata, T.; Toh, H. (2005). "Mejora en la precisión del programa de alineación de secuencias múltiples MAFFT". Genome Informatics. Conferencia Internacional sobre Genome Informatics . 16 (1): 22– 33. PMID 16362903 . 
  6. Katoh, Kazutaka; Toh, Hiroyuki (2008). " Mejora de la precisión del alineamiento de múltiples ncRNA mediante la incorporación de información estructural en un marco basado en MAFFT" . BMC Bioinformatics . 9 : 212. doi : 10.1186/1471-2105-9-212 . PMC 2387179. PMID 18439255 .  
  7. Katoh, Kazutaka; Frith, Martin C (2012). "Adding unaligned sequences into an existing alignment using MAFFT and LAST" . Bioinformatics . 28 (23): 3144– 6. doi : 10.1093/bioinformatics/bts578 . PMC 3516148. PMID 23023983 .  
  8. El software base de MAFFT se publica bajo una de las licencias BSD , mientras que las versiones para Microsoft Windows se publican bajo una Licencia Pública General GNU . Algunas distribuciones de MAFFT contienen software con otras licencias https://mafft.cbrc.jp/alignment/software/
  9. 1 2 3 4 5 6 Katoh, K.; Standley, DM (abril de 2013). "MAFFT Multiple Sequence Alignment Software Versión 7: Mejoras en el rendimiento y la usabilidad" . Molecular Biology and Evolution . 30 (4): 772– 780. doi : 10.1093/molbev/mst010 . PMC 3603318. PMID 23329690 .  
  10. 1 2 3 Katoh, Kazutaka; Toh, Hiroyuki (julio de 2008). "Desarrollos recientes en el programa de alineación de secuencias múltiples MAFFT" . Briefings in Bioinformatics . 9 (4): 286– 298. doi : 10.1093/bib/bbn013 . PMID 18372315 . 
  11. 1 2 "MAFFT Ayuda y documentación - Herramientas de análisis de secuencias del despachador de trabajos - EMBL-EBI" . www.ebi.ac.uk. Consultado el 24 de abril de 2023 .
  12. Pearson, William R. (octubre de 2013). "Selección de la matriz de puntuación de similitud adecuada" . Current Protocols in Bioinformatics . 43 (1): 3.5.1–3.5.9. doi : 10.1002/0471250953.bi0305s43 . PMC 3848038. PMID 24509512 .  
  13. "ROSALIND: Glosario: Penalización por hueco" .
  14. Carroll, Hyrum; Clement, Mark; Ridge, Perry; Snell, Quinn (octubre de 2006). "Efectos de las penalizaciones por apertura y extensión de brechas" . Publicaciones de la facultad .
  15. Edgar, Robert; Batzoglou, Serafim (junio de 2006). "Alineamiento de secuencias múltiples". Current Opinion in Structural Biology . 16 (3): 368– 373. doi : 10.1016/j.sbi.2006.04.004 . PMID 16679011 . 
  16. Katoh, Kazutaka (28-04-2010). "Paralelización del programa de alineación de secuencias múltiples MAFFT" . Bioinformática . 26 ( 15): 1899–1900 . doi : 10.1093/bioinformatics/btq224 . PMC 2905546. PMID 20427515 .  
  17. Kazunori, Yamada (4 de julio de 2016). "Aplicación del programa de alineación de secuencias MAFFT a grandes conjuntos de datos: reevaluación de la utilidad de los árboles guía encadenados" . Bioinformatics . 32 ( 21): 3246–3251 . doi : 10.1093/bioinformatics/btw412 . PMC 5079479. PMID 27378296 .  
  18. Kazutaka, Katoh (27 de septiembre de 2012). " Agregar secuencias no alineadas a una alineación existente usando MAFFT y LAST" . Bioinformatics . 28 (23): 3144– 3146. doi : 10.1093/bioinformatics/bts578 . PMC 3516148. PMID 23023983 .  
  19. Edgar, RC (8 de marzo de 2004). "MUSCLE: alineación de secuencias múltiples con alta precisión y alto rendimiento" . Nucleic Acids Research . 32 (5): 1792– 1797. doi : 10.1093/nar/gkh340 . PMC 390337. PMID 15034147 .  
  • Sitio web oficial
  • Servidor en línea MAFFT
  • Servidor MAFFT en EBI
  • Alineamiento de secuencias múltiples mediante MAFFT: ClustalW, MAFFT, PRRN en GenomeNet
  • SIB MyHits: ClustalW, T-Coffee, MAFFT