Articulo de referencia

Alineación de secuencias

En bioinformática , un alineamiento de secuencias es una forma de organizar las secuencias de ADN , ARN o proteínas para identificar regiones de similitud que pueden ser consecu...

Escucha este artículo

En bioinformática , un alineamiento de secuencias es una forma de organizar las secuencias de ADN , ARN o proteínas para identificar regiones de similitud que pueden ser consecuencia de relaciones funcionales, estructurales o evolutivas entre las secuencias. [ 1 ] Las secuencias alineadas de residuos de nucleótidos o aminoácidos se representan típicamente como filas dentro de una matriz . Se insertan huecos entre los residuos para que los caracteres idénticos o similares se alineen en columnas sucesivas. Los alineamientos de secuencias también se utilizan para secuencias no biológicas, como el cálculo del costo de distancia entre cadenas en un lenguaje natural o para mostrar datos financieros.

Alineamiento de secuencias, producido por ClustalO , de proteínas histonas de mamíferos. Las secuencias corresponden a los aminoácidos de los residuos 120-180 de las proteínas. Los residuos conservados en todas las secuencias se resaltan en gris. Debajo de las secuencias de proteínas se encuentra una clave que indica secuencias conservadas (*), mutaciones conservativas (:), mutaciones semiconservativas (.) y mutaciones no conservativas ( ). [ 2 ]

Interpretación

Si dos secuencias en una alineación comparten un ancestro común, las discrepancias pueden interpretarse como mutaciones puntuales y los huecos como indels (es decir, mutaciones de inserción o deleción) introducidos en uno o ambos linajes en el tiempo transcurrido desde que divergieron entre sí. En las alineaciones de secuencias de proteínas, el grado de similitud entre los aminoácidos que ocupan una posición particular en la secuencia puede interpretarse como una medida aproximada de cuán conservada está una región o motivo de secuencia particular entre los linajes. La ausencia de sustituciones, o la presencia de solo sustituciones muy conservadoras (es decir, la sustitución de aminoácidos cuyas cadenas laterales tienen propiedades bioquímicas similares) en una región particular de la secuencia, sugiere [ 3 ] que esta región tiene importancia estructural o funcional. Aunque las bases nucleotídicas del ADN y del ARN son más similares entre sí que los aminoácidos, la conservación de los pares de bases puede indicar una función o función estructural similar.

Métodos de alineación

Las secuencias muy cortas o muy similares se pueden alinear manualmente. Sin embargo, la mayoría de los problemas interesantes requieren la alineación de secuencias largas, altamente variables o extremadamente numerosas que no se pueden alinear únicamente mediante el esfuerzo humano. Se idearon varios algoritmos para producir alineaciones de secuencias de alta calidad y, ocasionalmente, para ajustar los resultados finales para reflejar patrones que son difíciles de representar algorítmicamente (especialmente en el caso de secuencias de nucleótidos). Los enfoques computacionales para la alineación de secuencias generalmente se dividen en dos categorías: alineaciones globales y alineaciones locales . Calcular una alineación global es una forma de optimización global que "fuerza" la alineación a abarcar toda la longitud de todas las secuencias de consulta. Por el contrario, las alineaciones locales identifican regiones de similitud dentro de secuencias largas que a menudo son muy divergentes en general. Las alineaciones locales suelen ser preferibles, pero pueden ser más difíciles de calcular debido al desafío adicional de identificar las regiones de similitud. [ 4 ] Se han aplicado varios algoritmos computacionales al problema de la alineación de secuencias. Estos incluyen métodos lentos pero formalmente correctos como la programación dinámica . Entre ellos se incluyen algoritmos heurísticos eficientes o métodos probabilísticos diseñados para la búsqueda en bases de datos a gran escala, que no garantizan encontrar las mejores coincidencias.

Representaciones

Las alineaciones se representan comúnmente tanto gráficamente como en formato de texto. En casi todas las representaciones de alineaciones de secuencias, estas se escriben en filas dispuestas de manera que los residuos alineados aparezcan en columnas sucesivas. En los formatos de texto, las columnas alineadas que contienen caracteres idénticos o similares se indican con un sistema de símbolos de conservación. Como en la imagen superior, se utiliza un asterisco o una barra vertical para mostrar la identidad entre dos columnas; otros símbolos menos comunes incluyen dos puntos para sustituciones conservativas y un punto para sustituciones semiconservativas. Muchos programas de visualización de secuencias también utilizan el color para mostrar información sobre las propiedades de los elementos individuales de la secuencia; en las secuencias de ADN y ARN, esto equivale a asignar un color a cada nucleótido. En las alineaciones de proteínas, como la de la imagen superior, el color se utiliza a menudo para indicar las propiedades de los aminoácidos y así ayudar a evaluar la conservación de una sustitución de aminoácido determinada. Para secuencias múltiples, la última fila de cada columna suele ser la secuencia consenso determinada por la alineación; la secuencia consenso también se representa a menudo en formato gráfico con un logotipo de secuencia en el que el tamaño de cada nucleótido o letra de aminoácido corresponde a su grado de conservación. [ 5 ]

Los alineamientos de secuencias se pueden almacenar en una amplia variedad de formatos de archivo basados ​​en texto, muchos de los cuales se desarrollaron originalmente junto con un programa o implementación de alineamiento específico. La mayoría de las herramientas web permiten un número limitado de formatos de entrada y salida, como el formato FASTA y el formato GenBank , y la salida no es fácilmente editable. Existen varios programas de conversión que proporcionan interfaces gráficas y/o de línea de comandos, como READSEQ [ 6 ] y EMBOSS . También hay varios paquetes de programación que proporcionan esta funcionalidad de conversión, como BioPython , BioRuby y BioPerl . Los archivos SAM/BAM utilizan el formato de cadena CIGAR (Compact Idiosyncratic Gapped Alignment Report) para representar un alineamiento de una secuencia con una referencia mediante la codificación de una secuencia de eventos (por ejemplo, coincidencia/discrepancia, inserciones, eliminaciones). [ 7 ]

Formato CIGARRO

Ref.:  GTCGTAGAATA Lectura : CACGTAG—TA CIGAR: 2S5M2D2M donde: 2S = 2 recortes suaves (podrían ser desajustes o una lectura más larga que la secuencia coincidente) 5M = 5 coincidencias o desajustes 2D = 2 deleciones 2M = 2 coincidencias o desajustes

El formato CIGAR original del programa de alineación de exonerados no distinguía entre coincidencias o desajustes con el carácter M.

El documento de especificación SAMv1 define códigos CIGAR más recientes. En la mayoría de los casos, se prefiere usar los caracteres '=' y 'X' para indicar coincidencias o discrepancias, en lugar del antiguo carácter 'M', que resulta ambiguo.

  • "Consumes query" y "consumes reference" indican si la operación CIGAR provoca que la alineación avance a lo largo de la secuencia de consulta y la secuencia de referencia, respectivamente.
  • H solo puede estar presente como primera y/o última operación.
  • S solo puede tener operaciones H entre ellos y los extremos de la cadena CIGAR.
  • En el alineamiento de ARNm con el genoma, la operación N representa un intrón. Para otros tipos de alineamientos, la interpretación de N no está definida.
  • La suma de las longitudes de las operaciones M/I/S/=/X será igual a la longitud de SEQ.

Alineaciones globales y locales

Los alineamientos globales, que intentan alinear cada residuo en cada secuencia, son más útiles cuando las secuencias del conjunto de consulta son similares y de tamaño aproximadamente igual. (Esto no significa que los alineamientos globales no puedan comenzar y/o terminar en huecos). Una técnica general de alineamiento global es el algoritmo de Needleman-Wunsch , que se basa en programación dinámica. Los alineamientos locales son más útiles para secuencias disímiles que se sospecha que contienen regiones de similitud o motivos de secuencia similares dentro de su contexto de secuencia más amplio. El algoritmo de Smith-Waterman es un método general de alineamiento local basado en el mismo esquema de programación dinámica, pero con opciones adicionales para comenzar y terminar en cualquier lugar. [ 4 ]

Los métodos híbridos, conocidos como métodos semiglobales o "glocales" (abreviatura de glo bal-lo cal ), buscan la mejor alineación parcial posible de las dos secuencias (es decir, se indica que se alinea una combinación de uno o ambos inicios y uno o ambos extremos). Esto puede ser especialmente útil cuando la parte descendente de una secuencia se superpone con la parte ascendente de la otra secuencia. En este caso, ni la alineación global ni la local son del todo apropiadas: una alineación global intentaría forzar la alineación para que se extienda más allá de la región de superposición, mientras que una alineación local podría no cubrir completamente la región de superposición. [ 8 ] Otro caso en el que la alineación semiglobal es útil es cuando una secuencia es corta (por ejemplo, una secuencia genética) y la otra es muy larga (por ejemplo, una secuencia cromosómica). En ese caso, la secuencia corta debe alinearse globalmente (completamente), pero solo se desea una alineación local (parcial) para la secuencia larga.

La rápida expansión de los datos genéticos pone a prueba la velocidad de los algoritmos actuales de alineación de secuencias de ADN. La necesidad de un método eficiente y preciso para el descubrimiento de variantes de ADN exige enfoques innovadores para el procesamiento paralelo en tiempo real. Se han sugerido enfoques de computación óptica como alternativas prometedoras a las implementaciones eléctricas actuales, pero su aplicabilidad aún debe ser probada..

Alineación por pares

Los métodos de alineación de secuencias por pares se utilizan para encontrar las alineaciones por partes (locales o globales) que mejor coinciden entre dos secuencias de consulta. Las alineaciones por pares solo se pueden usar entre dos secuencias a la vez, pero son eficientes en su cálculo y se utilizan a menudo para métodos que no requieren una precisión extrema (como la búsqueda en una base de datos de secuencias con alta similitud a una consulta). Los tres métodos principales para producir alineaciones por pares son los métodos de matriz de puntos, la programación dinámica y los métodos de palabras; [ 1 ] sin embargo, las técnicas de alineación de secuencias múltiples también pueden alinear pares de secuencias. Aunque cada método tiene sus fortalezas y debilidades individuales, los tres métodos de alineación por pares tienen dificultades con secuencias altamente repetitivas de bajo contenido de información , especialmente cuando el número de repeticiones difiere en las dos secuencias que se van a alinear.

Coincidencia única máxima

Una forma de cuantificar la utilidad de una alineación por pares dada es la " coincidencia única máxima " (MUM), o la subsecuencia más larga que aparece en ambas secuencias de consulta. Las secuencias MUM más largas suelen reflejar una relación más estrecha [ 9 ] en la alineación de secuencias múltiples de genomas en biología computacional . La identificación de MUM y otros anclajes potenciales es el primer paso en sistemas de alineación más grandes como MUMmer . Los anclajes son las áreas entre dos genomas donde son altamente similares. Para entender qué es una MUM, podemos desglosar cada palabra del acrónimo. Coincidencia implica que la subcadena aparece en ambas secuencias que se van a alinear. Único significa que la subcadena aparece solo una vez en cada secuencia. Finalmente, máximo indica que la subcadena no forma parte de otra cadena más larga que cumpla ambos requisitos anteriores. La idea detrás de esto es que las secuencias largas que coinciden exactamente y aparecen solo una vez en cada genoma son casi con certeza parte de la alineación global.

Más precisamente:

"Dados dos genomas A y B, la subcadena de coincidencia única máxima (MUM) es una subcadena común de A y B de longitud mayor que una longitud mínima especificada d (por defecto d= 20) tal que

  • es máximo, es decir, no se puede extender en ninguno de los extremos sin incurrir en un desajuste; y
  • es único en ambas secuencias" [ 10 ]

Métodos de matriz de puntos

El método de matriz de puntos, que produce implícitamente una familia de alineamientos para regiones de secuencia individuales, es cualitativo y conceptualmente simple, aunque requiere mucho tiempo para analizar a gran escala. En ausencia de ruido, puede ser fácil identificar visualmente ciertas características de la secuencia, como inserciones, deleciones, repeticiones o repeticiones invertidas , a partir de un gráfico de matriz de puntos. Para construir un gráfico de matriz de puntos , las dos secuencias se escriben en la fila superior y la columna más a la izquierda de una matriz bidimensional y se coloca un punto en cualquier punto donde los caracteres de las columnas correspondientes coincidan; este es un gráfico de recurrencia típico . Algunas implementaciones varían el tamaño o la intensidad del punto según el grado de similitud de los dos caracteres, para acomodar sustituciones conservadoras. Los gráficos de puntos de secuencias muy relacionadas aparecerán como una sola línea a lo largo de la diagonal principal de la matriz .

Los problemas que presentan los diagramas de puntos como técnica de visualización de información incluyen: ruido, falta de claridad, poca intuición, dificultad para extraer estadísticas de resumen de coincidencias y posiciones de coincidencia en las dos secuencias. También se desperdicia mucho espacio, ya que los datos de coincidencia se duplican inherentemente en la diagonal y la mayor parte del área real del gráfico está ocupada por espacio vacío o ruido. Finalmente, los diagramas de puntos se limitan a dos secuencias. Ninguna de estas limitaciones se aplica a los diagramas de alineación de Miropeats, pero estos tienen sus propios defectos particulares.

Los diagramas de puntos también pueden utilizarse para evaluar la repetitividad en una secuencia. Una secuencia se puede representar gráficamente sobre sí misma, y ​​las regiones que comparten similitudes significativas aparecerán como líneas que se desvían de la diagonal principal. Este efecto se produce cuando una proteína consta de múltiples dominios estructurales similares .

Programación dinámica

La técnica de programación dinámica se puede aplicar para producir alineamientos globales mediante el algoritmo de Needleman-Wunsch y alineamientos locales mediante el algoritmo de Smith-Waterman . En el uso típico, los alineamientos de proteínas utilizan una matriz de sustitución para asignar puntuaciones a las coincidencias o desajustes de aminoácidos, y una penalización por hueco cuando un aminoácido de una secuencia coincide con un hueco en la otra. Los alineamientos de ADN y ARN pueden utilizar una matriz de puntuación, pero en la práctica a menudo simplemente asignan una puntuación de coincidencia positiva, una puntuación de desajuste negativa y una penalización por hueco negativa. (En la programación dinámica estándar, la puntuación de cada posición de aminoácido es independiente de la identidad de sus vecinos, por lo que no se tienen en cuenta los efectos de apilamiento de bases . Sin embargo, es posible tener en cuenta dichos efectos modificando el algoritmo). Una extensión común a los costos de hueco lineales estándar son los costos de hueco afines. Aquí se aplican dos penalizaciones de hueco diferentes para abrir un hueco y para extender un hueco. Normalmente, la primera es mucho mayor que la segunda, por ejemplo, -10 para la apertura del hueco y -2 para la extensión del hueco. Esto da como resultado menos huecos en una alineación y los residuos y los huecos se mantienen juntos, características más representativas de las secuencias biológicas. El algoritmo de Gotoh implementa costos de huecos afines mediante el uso de tres matrices. [ 11 ] [ 12 ]

La programación dinámica puede ser útil para alinear secuencias de nucleótidos con secuencias de proteínas, una tarea complicada por la necesidad de tener en cuenta las mutaciones de cambio de marco (generalmente inserciones o deleciones). El método framesearch produce una serie de alineamientos globales o locales por pares entre una secuencia de nucleótidos de consulta y un conjunto de secuencias de proteínas de búsqueda, o viceversa. Su capacidad para evaluar cambios de marco desplazados por un número arbitrario de nucleótidos hace que el método sea útil para secuencias que contienen un gran número de inserciones/deleciones, que pueden ser muy difíciles de alinear con métodos heurísticos más eficientes. En la práctica, el método requiere una gran cantidad de potencia de cálculo o un sistema cuya arquitectura esté especializada en programación dinámica. Los paquetes BLAST y EMBOSS proporcionan herramientas básicas para crear alineamientos traducidos (aunque algunos de estos enfoques aprovechan los efectos secundarios de las capacidades de búsqueda de secuencias de las herramientas). Hay métodos más generales disponibles en software de código abierto como GeneWise .

El método de programación dinámica garantiza encontrar una alineación óptima dada una función de puntuación específica; sin embargo, identificar una buena función de puntuación suele ser una cuestión empírica más que teórica. Si bien la programación dinámica se puede extender a más de dos secuencias, resulta excesivamente lenta para un gran número de secuencias o secuencias extremadamente largas.

Métodos de palabras

Los métodos de palabras, también conocidos como métodos de k -tuplas, son métodos heurísticos que no garantizan encontrar una solución de alineación óptima, pero son significativamente más eficientes que la programación dinámica. Estos métodos son especialmente útiles en búsquedas en bases de datos a gran escala, donde se entiende que una gran proporción de las secuencias candidatas no tendrán prácticamente ninguna coincidencia significativa con la secuencia de consulta. Los métodos de palabras son más conocidos por su implementación en las herramientas de búsqueda de bases de datos FASTA y la familia BLAST . [ 1 ] Los métodos de palabras identifican una serie de subsecuencias cortas y no superpuestas ("palabras") en la secuencia de consulta que luego se comparan con secuencias candidatas de la base de datos. Las posiciones relativas de la palabra en las dos secuencias que se comparan se restan para obtener un desplazamiento; esto indicará una región de alineación si varias palabras distintas producen el mismo desplazamiento. Solo si se detecta esta región, estos métodos aplican criterios de alineación más sensibles; de esta manera, se eliminan muchas comparaciones innecesarias con secuencias sin similitud apreciable.

En el método FASTA, el usuario define un valor k que se utilizará como longitud de palabra para buscar en la base de datos. Este método es más lento, pero más sensible con valores bajos de k , que también se prefieren para búsquedas que involucran una secuencia de consulta muy corta. La familia de métodos de búsqueda BLAST proporciona varios algoritmos optimizados para tipos de consultas particulares, como la búsqueda de coincidencias de secuencias distantemente relacionadas. BLAST se desarrolló para proporcionar una alternativa más rápida a FASTA sin sacrificar mucha precisión; al igual que FASTA, BLAST utiliza una búsqueda de palabras de longitud k , pero evalúa solo las coincidencias de palabras más significativas, en lugar de todas las coincidencias de palabras como hace FASTA. La mayoría de las implementaciones de BLAST utilizan una longitud de palabra predeterminada fija que está optimizada para el tipo de consulta y base de datos, y que se cambia solo en circunstancias especiales, como cuando se busca con secuencias de consulta repetitivas o muy cortas. Se pueden encontrar implementaciones a través de varios portales web, como EMBL FASTA y NCBI BLAST .

Alineamiento de secuencias múltiples

Alineación de 27 secuencias de proteínas de hemaglutinina de influenza aviar coloreadas según la conservación de residuos (arriba) y las propiedades de los residuos (abajo).

El alineamiento de secuencias múltiples es una extensión del alineamiento por pares para incorporar más de dos secuencias a la vez. Los métodos de alineamiento múltiple intentan alinear todas las secuencias en un conjunto de consulta dado. Los alineamientos múltiples se utilizan a menudo para identificar regiones de secuencia conservadas en un grupo de secuencias que se hipotetiza que están relacionadas evolutivamente. Dichos motivos de secuencia conservados se pueden utilizar junto con información estructural y mecanicista para localizar los sitios catalíticos activos de las enzimas . Los alineamientos también se utilizan para ayudar a establecer relaciones evolutivas mediante la construcción de árboles filogenéticos . Los alineamientos de secuencias múltiples son computacionalmente difíciles de producir y la mayoría de las formulaciones del problema conducen a problemas de optimización combinatoria NP-completos . [ 13 ] [ 14 ] Sin embargo, la utilidad de estos alineamientos en bioinformática ha llevado al desarrollo de una variedad de métodos adecuados para alinear tres o más secuencias.

Programación dinámica

La técnica de programación dinámica es teóricamente aplicable a cualquier número de secuencias; sin embargo, debido a su elevado coste computacional en tiempo y memoria , rara vez se utiliza para más de tres o cuatro secuencias en su forma más básica. Este método requiere la construcción del equivalente n -dimensional de la matriz de secuencias formada a partir de dos secuencias, donde n es el número de secuencias en la consulta. La programación dinámica estándar se aplica primero a todos los pares de secuencias de consulta y, a continuación, se rellena el "espacio de alineación" considerando posibles coincidencias o huecos en posiciones intermedias, construyendo finalmente una alineación esencialmente entre cada alineación de dos secuencias. Aunque esta técnica es computacionalmente costosa, su garantía de una solución óptima global resulta útil en casos donde solo se necesita alinear con precisión unas pocas secuencias. Un método para reducir las exigencias computacionales de la programación dinámica, que se basa en la función objetivo de "suma de pares" , se ha implementado en el paquete de software MSA . [ 15 ]

Métodos progresivos

Los métodos progresivos, jerárquicos o de árbol generan un alineamiento múltiple de secuencias alineando primero las secuencias más similares y luego agregando secuencias o grupos sucesivamente menos relacionados al alineamiento hasta que todo el conjunto de consulta se haya incorporado a la solución. El árbol inicial que describe la relación entre las secuencias se basa en comparaciones por pares que pueden incluir métodos heurísticos de alineamiento por pares similares a FASTA . Los resultados del alineamiento progresivo dependen de la elección de las secuencias "más relacionadas" y, por lo tanto, pueden ser sensibles a las imprecisiones en los alineamientos por pares iniciales. La mayoría de los métodos progresivos de alineamiento múltiple de secuencias ponderan adicionalmente las secuencias en el conjunto de consulta según su relación, lo que reduce la probabilidad de realizar una mala elección de secuencias iniciales y, por lo tanto, mejora la precisión del alineamiento.

Se utilizan muchas variantes de la implementación progresiva de Clustal [ 16 ] [ 17 ] [ 18 ] para el alineamiento de secuencias múltiples, la construcción de árboles filogenéticos y como entrada para la predicción de la estructura de proteínas . Una variante más lenta pero más precisa del método progresivo se conoce como T-Coffee . [ 19 ]

Métodos iterativos

Los métodos iterativos intentan mejorar la fuerte dependencia de la precisión de los alineamientos iniciales por pares, que es el punto débil de los métodos progresivos. Los métodos iterativos optimizan una función objetivo basada en un método de puntuación de alineamiento seleccionado, asignando un alineamiento global inicial y luego realineando subconjuntos de secuencias. Estos subconjuntos realineados se alinean a su vez para producir el alineamiento múltiple de secuencias de la siguiente iteración. En [ 20 ] se revisan diversas formas de seleccionar los subgrupos de secuencias y la función objetivo.

Búsqueda de motivos

La búsqueda de motivos, también conocida como análisis de perfiles, construye alineamientos múltiples de secuencias globales que intentan alinear motivos de secuencia cortos y conservados entre las secuencias del conjunto de consulta. Esto generalmente se realiza construyendo primero un alineamiento múltiple de secuencias global general, luego aislando las regiones altamente conservadas y usándolas para construir un conjunto de matrices de perfil. La matriz de perfil para cada región conservada está organizada como una matriz de puntuación, pero sus recuentos de frecuencia para cada aminoácido o nucleótido en cada posición se derivan de la distribución de caracteres de la región conservada en lugar de una distribución empírica más general. Luego, las matrices de perfil se usan para buscar ocurrencias del motivo que caracterizan en otras secuencias. En los casos en que el conjunto de datos original contenía un número pequeño de secuencias, o solo secuencias altamente relacionadas, se agregan pseudocuentas para normalizar las distribuciones de caracteres representadas en el motivo.

Técnicas inspiradas en la informática

Un modelo HMM de perfil para una alineación de secuencias múltiples

Una variedad de algoritmos de optimización general comúnmente utilizados en ciencias de la computación también se han aplicado al problema de alineación de secuencias múltiples. Los modelos ocultos de Markov se han utilizado para producir puntuaciones de probabilidad para una familia de posibles alineaciones de secuencias múltiples para un conjunto de consulta dado; aunque los primeros métodos basados ​​en HMM produjeron un rendimiento poco impresionante, aplicaciones posteriores han encontrado que son especialmente efectivos para detectar secuencias remotamente relacionadas porque son menos susceptibles al ruido creado por sustituciones conservadoras o semiconservadoras. [ 21 ] Los algoritmos genéticos y el recocido simulado también se han utilizado para optimizar las puntuaciones de alineación de secuencias múltiples según lo juzgado por una función de puntuación como el método de suma de pares. Se pueden encontrar detalles más completos y paquetes de software en el artículo principal alineación de secuencias múltiples .

La transformada de Burrows-Wheeler se ha aplicado con éxito a la alineación rápida de lecturas cortas en herramientas populares como Bowtie y BWA. Véase FM-index .

Alineación estructural

Los alineamientos estructurales, que suelen ser específicos para secuencias de proteínas y, a veces, de ARN, utilizan información sobre la estructura secundaria y terciaria de la molécula de proteína o ARN para ayudar a alinear las secuencias. Estos métodos pueden utilizarse para dos o más secuencias y normalmente producen alineamientos locales; sin embargo, debido a que dependen de la disponibilidad de información estructural, solo pueden utilizarse para secuencias cuyas estructuras correspondientes se conocen (generalmente mediante cristalografía de rayos X o espectroscopia de RMN ). Dado que tanto la estructura de la proteína como la del ARN están más conservadas evolutivamente que la secuencia, [ 22 ] los alineamientos estructurales pueden ser más fiables entre secuencias que están muy distantemente relacionadas y que han divergido tan extensamente que la comparación de secuencias no puede detectar de forma fiable su similitud.

Los alineamientos estructurales se utilizan como el "estándar de oro" para evaluar alineamientos en la predicción de la estructura de proteínas basada en homología [ 23 ] porque alinean explícitamente regiones de la secuencia de proteínas que son estructuralmente similares, en lugar de depender exclusivamente de la información de la secuencia. Sin embargo, es evidente que los alineamientos estructurales no pueden utilizarse en la predicción de la estructura porque al menos una secuencia del conjunto de consulta es la secuencia objetivo que se va a modelar, cuya estructura se desconoce. Se ha demostrado que, dada la alineación estructural entre una secuencia objetivo y una secuencia plantilla, se pueden producir modelos muy precisos de la secuencia de la proteína objetivo; un obstáculo importante en la predicción de la estructura basada en homología es la producción de alineamientos estructuralmente precisos a partir únicamente de la información de la secuencia. [ 23 ]

DALI

El método DALI, o alineación de matriz de distancias , es un método basado en fragmentos para construir alineaciones estructurales basadas en patrones de similitud de contacto entre hexapéptidos sucesivos en las secuencias de consulta. [ 24 ] Puede generar alineaciones por pares o múltiples e identificar los vecinos estructurales de una secuencia de consulta en el Protein Data Bank (PDB). Se ha utilizado para construir la base de datos de alineación estructural FSSP (Clasificación de pliegues basada en la alineación estructura-estructura de proteínas, o familias de proteínas estructuralmente similares). Se puede acceder a un servidor web DALI en DALI y la FSSP se encuentra en The Dali Database .

SSAP

SSAP (programa de alineación de estructuras secuenciales) es un método de alineación estructural basado en programación dinámica que utiliza vectores átomo a átomo en el espacio estructural como puntos de comparación. Se ha ampliado desde su descripción original para incluir alineaciones múltiples y por pares, [ 25 ] y se ha utilizado en la construcción de la base de datos jerárquica CATH (Clase, Arquitectura, Topología, Homología) para la clasificación de plegamientos de proteínas. [ 26 ] Se puede acceder a la base de datos CATH en Clasificación de Estructuras de Proteínas CATH .

Extensión combinatoria

El método de extensión combinatoria de alineación estructural genera una alineación estructural por pares utilizando la geometría local para alinear fragmentos cortos de las dos proteínas que se analizan y luego ensambla estos fragmentos en una alineación más grande. [ 27 ] Basándose en medidas como la distancia cuadrática media de cuerpo rígido , las distancias entre residuos, la estructura secundaria local y las características del entorno circundante, como la hidrofobicidad de los residuos vecinos , se generan alineaciones locales llamadas "pares de fragmentos alineados" y se utilizan para construir una matriz de similitud que representa todas las posibles alineaciones estructurales dentro de criterios de corte predefinidos. Luego se traza una ruta desde un estado estructural de proteína al otro a través de la matriz extendiendo la alineación creciente un fragmento a la vez. La ruta óptima define la alineación de extensión combinatoria. Un servidor web que implementa el método y proporciona una base de datos de alineaciones por pares de estructuras en el Protein Data Bank se encuentra en el sitio web de Combinatorial Extension .

Análisis filogenético

La filogenética y el alineamiento de secuencias son campos estrechamente relacionados debido a la necesidad compartida de evaluar la relación entre secuencias. [ 28 ] El campo de la filogenética utiliza ampliamente los alineamientos de secuencias en la construcción e interpretación de árboles filogenéticos , que se utilizan para clasificar las relaciones evolutivas entre genes homólogos representados en los genomas de especies divergentes. El grado en que las secuencias en un conjunto de consulta difieren está cualitativamente relacionado con la distancia evolutiva de las secuencias entre sí. En términos generales, una alta identidad de secuencia sugiere que las secuencias en cuestión tienen un ancestro común más reciente relativamente joven , mientras que una baja identidad sugiere que la divergencia es más antigua. Esta aproximación, que refleja la hipótesis del " reloj molecular " de que una tasa aproximadamente constante de cambio evolutivo puede usarse para extrapolar el tiempo transcurrido desde que dos genes divergieron por primera vez (es decir, el tiempo de coalescencia ), asume que los efectos de la mutación y la selección son constantes a través de los linajes de secuencias. Por lo tanto, no tiene en cuenta las posibles diferencias entre organismos o especies en las tasas de reparación del ADN ni la posible conservación funcional de regiones específicas en una secuencia. (En el caso de las secuencias de nucleótidos, la hipótesis del reloj molecular en su forma más básica también descarta la diferencia en las tasas de aceptación entre mutaciones silenciosas que no alteran el significado de un codón dado y otras mutaciones que dan como resultado la incorporación de un aminoácido diferente a la proteína). Los métodos estadísticamente más precisos permiten que la tasa evolutiva varíe en cada rama del árbol filogenético, lo que produce mejores estimaciones de los tiempos de coalescencia para los genes.

Las técnicas de alineación múltiple progresiva generan necesariamente un árbol filogenético, ya que incorporan secuencias a la alineación en crecimiento en orden de parentesco. Otras técnicas que ensamblan alineaciones de secuencias múltiples y árboles filogenéticos primero puntúan y ordenan los árboles, y calculan una alineación de secuencias múltiples a partir del árbol con la puntuación más alta. Los métodos comúnmente utilizados para la construcción de árboles filogenéticos son principalmente heurísticos , dado que el problema de seleccionar el árbol óptimo, al igual que el problema de seleccionar la alineación de secuencias múltiples óptima, es NP-difícil . [ 29 ]

Evaluación de la importancia

En bioinformática, los alineamientos de secuencias son útiles para identificar similitudes, generar árboles filogenéticos y desarrollar modelos de homología de estructuras proteicas. Sin embargo, su relevancia biológica no siempre es clara. A menudo se asume que los alineamientos reflejan cierto grado de cambio evolutivo entre secuencias descendientes de un ancestro común; no obstante, es posible que la evolución convergente produzca una similitud aparente entre proteínas evolutivamente no relacionadas, pero que desempeñan funciones similares y poseen estructuras parecidas.

En búsquedas en bases de datos como BLAST, los métodos estadísticos permiten determinar la probabilidad de que una alineación particular entre secuencias o regiones de secuencias surja por casualidad, considerando el tamaño y la composición de la base de datos consultada. Estos valores pueden variar significativamente según el espacio de búsqueda. En particular, la probabilidad de encontrar una alineación determinada por casualidad aumenta si la base de datos consta únicamente de secuencias del mismo organismo que la secuencia de consulta. Las secuencias repetitivas en la base de datos o en la consulta también pueden distorsionar tanto los resultados de la búsqueda como la evaluación de la significación estadística; BLAST filtra automáticamente dichas secuencias repetitivas en la consulta para evitar coincidencias aparentes que sean artefactos estadísticos.

En la literatura se encuentran disponibles métodos de estimación de significancia estadística para alineamientos de secuencias con huecos. [ 28 ] [ 30 ] [ 31 ] [ 32 ] [ 33 ] [ 34 ] [ 35 ] [ 36 ]

Evaluación de la credibilidad

La significación estadística indica la probabilidad de que una alineación de una calidad determinada pueda surgir por casualidad, pero no indica cuán superior es una alineación dada con respecto a otras alineaciones de las mismas secuencias. Las medidas de credibilidad de la alineación indican el grado de similitud entre las alineaciones con mejor puntuación para un par de secuencias dado. En la literatura existen métodos para estimar la credibilidad de la alineación en el caso de alineaciones de secuencias con huecos. [ 37 ]

Funciones de puntuación

La elección de una función de puntuación que refleje observaciones biológicas o estadísticas sobre secuencias conocidas es fundamental para obtener alineamientos precisos. Las secuencias de proteínas se alinean frecuentemente mediante matrices de sustitución que reflejan las probabilidades de sustituciones de caracteres específicas. Una serie de matrices denominadas matrices PAM (matrices de mutación de punto aceptado, definidas originalmente por Margaret Dayhoff y a veces denominadas "matrices de Dayhoff") codifican explícitamente aproximaciones evolutivas sobre las tasas y probabilidades de mutaciones de aminoácidos particulares. Otra serie común de matrices de puntuación, conocida como BLOSUM (matriz de sustitución de bloques), codifica probabilidades de sustitución derivadas empíricamente. Se utilizan variantes de ambos tipos de matrices para detectar secuencias con distintos niveles de divergencia, lo que permite a los usuarios de BLAST o FASTA restringir las búsquedas a coincidencias más cercanas o ampliarlas para detectar secuencias más divergentes. Las penalizaciones por huecos tienen en cuenta la introducción de un hueco —en el modelo evolutivo, una mutación de inserción o deleción— tanto en secuencias de nucleótidos como de proteínas, por lo que los valores de penalización deben ser proporcionales a la tasa esperada de dichas mutaciones. Por lo tanto, la calidad de los alineamientos producidos depende de la calidad de la función de puntuación.

Puede resultar muy útil e instructivo probar la misma alineación varias veces con diferentes valores para la matriz de puntuación o la penalización por huecos, y comparar los resultados. A menudo, se pueden identificar las regiones donde la solución es débil o no única observando qué regiones de la alineación son robustas ante variaciones en los parámetros de alineación.

Otros usos biológicos

El ARN secuenciado, como las etiquetas de secuencia expresada y los ARNm de longitud completa, se puede alinear con un genoma secuenciado para encontrar dónde hay genes y obtener información sobre el empalme alternativo [ 38 ] y la edición de ARN . [ 39 ] La alineación de secuencias también forma parte del ensamblaje del genoma , donde las secuencias se alinean para encontrar solapamientos y así poder formar contigs (largos tramos de secuencia). [ 40 ] Otro uso es el análisis de SNP , donde las secuencias de diferentes individuos se alinean para encontrar pares de bases individuales que suelen ser diferentes en una población. [ 41 ]

Usos no biológicos

Los métodos utilizados para la alineación de secuencias biológicas también han encontrado aplicaciones en otros campos, sobre todo en el procesamiento del lenguaje natural y en las ciencias sociales , donde el algoritmo de Needleman-Wunsch se suele denominar coincidencia óptima . [ 42 ] Las técnicas que generan el conjunto de elementos a partir de los cuales se seleccionarán las palabras en los algoritmos de generación de lenguaje natural han tomado prestadas técnicas de alineación de secuencias múltiples de la bioinformática para producir versiones lingüísticas de pruebas matemáticas generadas por ordenador . [ 43 ] En el campo de la lingüística histórica y comparada , la alineación de secuencias se ha utilizado para automatizar parcialmente el método comparativo mediante el cual los lingüistas reconstruyen tradicionalmente los idiomas. [ 44 ] La investigación empresarial y de marketing también ha aplicado técnicas de alineación de secuencias múltiples en el análisis de series de compras a lo largo del tiempo. [ 45 ]

Software

Una lista más completa del software disponible, categorizado por algoritmo y tipo de alineación, está disponible en el sitio web de software de alineación de secuencias . Sin embargo, las herramientas de software comunes para tareas generales de alineación de secuencias incluyen ClustalW2 [ 46 ] y T-coffee [ 47 ] para alineación, y BLAST [ 48 ] y FASTA3x [ 49 ] para búsqueda en bases de datos. También están disponibles herramientas comerciales como DNASTAR Lasergene , Geneious y PatternHunter . Las herramientas que realizan alineación de secuencias se encuentran en el registro bio.tools .

Los algoritmos y el software de alineación se pueden comparar directamente entre sí utilizando un conjunto estandarizado de alineamientos de secuencias múltiples de referencia conocido como BAliBASE. [ 50 ] El conjunto de datos consta de alineamientos estructurales, que pueden considerarse un estándar con el que se comparan los métodos puramente basados ​​en secuencias. El rendimiento relativo de muchos métodos de alineación comunes en problemas de alineación frecuentes se ha tabulado y los resultados seleccionados se han publicado en línea en BAliBASE. [ 51 ] [ 52 ] Una lista completa de puntuaciones de BAliBASE para muchas (actualmente 12) herramientas de alineación diferentes se puede calcular dentro del entorno de trabajo de proteínas STRAP. [ 53 ]

Véase también

Referencias

  1. 1 2 3 Mount DM. (2004). Bioinformática: Análisis de secuencias y genomas (2.ª  ed.). Cold Spring Harbor Laboratory Press: Cold Spring Harbor, NY. ISBN 978-0-87969-608-5.
  2. "Preguntas frecuentes sobre símbolos de Clustal" . Clustal . Archivado del original el 24 de octubre de 2016. Consultado el 8 de diciembre de 2014 .
  3. Ng PC; Henikoff S (mayo de 2001). "Predicción de sustituciones de aminoácidos deletéreas" . Genome Res . 11 (5): 863–74 . doi : 10.1101/gr.176601 . PMC 311071. PMID 11337480 .  
  4. 1 2 Polyanovsky, VO; Roytberg, MA; Tumanyan, VG (2011). "Análisis comparativo de la calidad de un algoritmo global y un algoritmo local para el alineamiento de dos secuencias" . Algorithms for Molecular Biology . 6 (1): 25. doi : 10.1186/1748-7188-6-25 . PMC 3223492. PMID 22032267. S2CID 2658261 .   
  5. Schneider TD; Stephens RM (1990). "Logotipos de secuencia: una nueva forma de mostrar secuencias de consenso" . Nucleic Acids Res . 18 (20): 6097– 6100. doi : 10.1093/nar/18.20.6097 . PMC 332411. PMID 2172928 .  
  6. SECUENCIA DE LECTURA
  7. "Especificación del formato de alineación/mapa de secuencias" (PDF) .
  8. Brudno M; Malde S; Poliakov A; Do CB; Couronne O; Dubchak I; Batzoglou S (2003). "Alineamiento glocal: detección de reordenamientos durante el alineamiento". Bioinformatics . 19. Suppl 1 (90001): i54–62. doi : 10.1093/bioinformatics/btg1005 . PMID 12855437 . 
  9. Delcher, AL; Kasif, S.; Fleishmann, RD; Peterson, J.; White, O.; Salzberg, SL (1999). "Alineación de genomas completos" . Nucleic Acids Research . 27 (11): 2369– 2376. doi : 10.1093/ nar /30.11.2478 . PMC 148804. PMID 10325427 .  
  10. Wing-Kin, Sung (2010). Algoritmos en bioinformática: una introducción práctica (Primera ed.). Boca Raton: Chapman & Hall/CRC Press. ISBN  978-1-4200-7033-0.
  11. Gotoh, Osamu (15 de diciembre de 1982). "Un algoritmo mejorado para la comparación de secuencias biológicas" . Journal of Molecular Biology . 162 (3): 705– 708. Bibcode : 1982JMBio.162..705G . doi : 10.1016/0022-2836(82)90398-9 . ISSN 0022-2836 . PMID 7166760 .  
  12. Gotoh, Osamu (1 de enero de 1999). "Alineamiento de secuencias múltiples: algoritmos y aplicaciones" . Advances in Biophysics . 36 : 159–206 . doi : 10.1016/S0065-227X(99)80007-0 . ISSN 0065-227X . PMID 10463075 .  
  13. Wang L; Jiang T. (1994). "Sobre la complejidad del alineamiento de secuencias múltiples". J Comput Biol . 1 (4): 337– 48. Bibcode : 1994JCoB....1..337W . CiteSeerX 10.1.1.408.894 . doi : 10.1089/cmb.1994.1.337 . PMID 8790475 .  
  14. Elias, Isaac (2006). "Resolviendo la intratabilidad del alineamiento múltiple". J Comput Biol . 13 (7): 1323– 1339. CiteSeerX 10.1.1.6.256 . doi : 10.1089/cmb.2006.13.1323 . PMID 17037961 .  
  15. Lipman DJ; Altschul SF; Kececioglu JD (1989). "Una herramienta para el alineamiento de secuencias múltiples" . Proc Natl Acad Sci USA . 86 ( 12): 4412– 5. Bibcode : 1989PNAS...86.4412L . doi : 10.1073/pnas.86.12.4412 . PMC 287279. PMID 2734293 .  
  16. Higgins DG , Sharp PM (1988). "CLUSTAL: un paquete para realizar alineamiento de secuencias múltiples en un microordenador". Gene . 73 (1): 237–44 . doi : 10.1016/0378-1119(88)90330-7 . PMID 3243435 . 
  17. Thompson JD; Higgins DG ; Gibson TJ. (1994). "CLUSTAL W: mejora de la sensibilidad del alineamiento progresivo de secuencias múltiples mediante ponderación de secuencias, penalizaciones de huecos específicas de posición y elección de matriz de ponderación" . Nucleic Acids Res . 22 (22): 4673–80 . doi : 10.1093/nar/22.22.4673 . PMC 308517. PMID 7984417 .  
  18. Chenna R; Sugawara H; Koike T; Lopez R; Gibson TJ; Higgins DG; Thompson JD. (2003). " Alineamiento de secuencias múltiples con la serie de programas Clustal" . Nucleic Acids Res . 31 (13): 3497– 500. doi : 10.1093/nar/gkg500 . PMC 168907. PMID 12824352 .  
  19. Notredame C; Higgins DG ; Heringa J. (2000). "T-Coffee: Un nuevo método para el alineamiento múltiple de secuencias rápido y preciso". J Mol Biol . 302 (1): 205–17 . doi : 10.1006/jmbi.2000.4042 . PMID 10964570. S2CID 10189971 .  
  20. Hirosawa M; Totoki Y; Hoshida M; Ishikawa M. (1995). "Estudio exhaustivo sobre algoritmos iterativos de alineación de secuencias múltiples". Comput Appl Biosci . 11 (1): 13– 8. doi : 10.1093/bioinformatics/11.1.13 . PMID 7796270 . 
  21. Karplus K; Barrett C; Hughey R. (1998). "Modelos ocultos de Markov para detectar homologías proteicas remotas" . Bioinformatics . 14 (10): 846– 856. CiteSeerX 10.1.1.57.2762 . doi : 10.1093/bioinformatics/14.10.846 . PMID 9927713 .  
  22. Chothia C; Lesk AM. (abril de 1986). " La relación entre la divergencia de secuencia y estructura en las proteínas" . EMBO J. 5 ( 4): 823–6 . doi : 10.1002/j.1460-2075.1986.tb04288.x . PMC 1166865. PMID 3709526 .  
  23. 1 2 Zhang Y; Skolnick J. (2005). "El problema de la predicción de la estructura de proteínas podría resolverse utilizando la biblioteca PDB actual" . Proc Natl Acad Sci USA . 102 (4): 1029– 34. Bibcode : 2005PNAS..102.1029Z . doi : 10.1073/pnas.0407152101 . PMC 545829. PMID 15653774 .  
  24. Holm L; Sander C (1996). "Mapeando el universo de las proteínas". Science . 273 (5275): 595– 603. Bibcode : 1996Sci...273..595H . doi : 10.1126/science.273.5275.595 . PMID 8662544 . S2CID 7509134 .  
  25. Taylor WR; Flores TP; Orengo CA. (1994). "Alineamiento de múltiples estructuras proteicas" . Protein Sci . 3 (10): 1858– 70. doi : 10.1002/pro.5560031025 . PMC 2142613. PMID 7849601 .  
  26. Orengo CA; Michie AD; Jones S; Jones DT; Swindells MB; Thornton JM (1997). "CATH: una clasificación jerárquica de las estructuras de dominios proteicos" . Structure . 5 (8): 1093–108 . doi : 10.1016/S0969-2126(97)00260-8 . PMID 9309224 . 
  27. Shindyalov IN; Bourne PE. (1998). "Alineación de la estructura de proteínas mediante extensión combinatoria incremental (CE) de la ruta óptima". Protein Eng . 11 (9): 739–47 . doi : 10.1093/protein/11.9.739 . PMID 9796821 . 
  28. 1 2 Ortet P; Bastien O (2010). "¿De dónde proviene la forma de la distribución de la puntuación de alineación?" . Bioinformática Evolutiva . 6 EBO.S5875: 159– 187. doi : 10.4137/EBO.S5875 . PMC 3023300 . PMID 21258650 .  
  29. Felsenstein J. (2004). Inferir filogenias . Asociados de Sinauer: Sunderland, MA. ISBN 978-0-87893-177-4.
  30. Altschul SF; Gish W (1996). "Estadísticas de alineación local". Métodos informáticos para el análisis de secuencias macromoleculares . Métodos en enzimología. Vol. 266. págs. 460–480 . doi : 10.1016/S0076-6879(96)66029-7 . ISBN   978-0-12-182167-8. PMID 8743700 . 
  31. Hartmann AK (2002). "Muestreo de eventos raros: estadísticas de alineamientos de secuencias locales". Phys. Rev. E . 65 (5) 056102. arXiv : cond-mat/0108201 . Bibcode : 2002PhRvE..65e6102H . doi : 10.1103/PhysRevE.65.056102 . PMID 12059642 . S2CID 193085 .  
  32. Newberg LA (2008). "Importancia de los alineamientos de secuencias con huecos" . J Comput Biol . 15 (9): 1187– 1194. doi : 10.1089/cmb.2008.0125 . PMC 2737730. PMID 18973434 .  
  33. Eddy SR; Rost, Burkhard (2008). Rost, Burkhard (ed.). "Un modelo probabilístico de alineación de secuencias locales que simplifica la estimación de la significación estadística" . PLOS Comput Biol . 4 (5) e1000069. Bibcode : 2008PLSCB...4E0069E . doi : 10.1371/journal.pcbi.1000069 . PMC 2396288. PMID 18516236. S2CID 15640896 .   
  34. Bastien O; Aude JC; Roy S; Marechal E (2004). "Fundamentos de alineamientos automáticos masivos por pares de secuencias de proteínas: significado teórico de las estadísticas del valor Z" . Bioinformatics . 20 (4): 534– 537. CiteSeerX 10.1.1.602.6979 . doi : 10.1093/bioinformatics/btg440 . PMID 14990449 .  
  35. Agrawal A; Huang X (2011). "Significación estadística por pares de la alineación de secuencias locales utilizando matrices de sustitución específicas de secuencia y de posición". IEEE/ACM Transactions on Computational Biology and Bioinformatics . 8 (1): 194– 205. Bibcode : 2011ITCBB...8..194A . doi : 10.1109/TCBB.2009.69 . PMID 21071807 . S2CID 6559731 .  
  36. Agrawal A; Brendel VP; Huang X (2008). "Significación estadística por pares y determinación empírica de penalizaciones efectivas de apertura de huecos para el alineamiento de secuencias locales de proteínas" . International Journal of Computational Biology and Drug Design . 1 (4): 347– 367. doi : 10.1504/IJCBDD.2008.022207 . PMID 20063463 . {{cite journal}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  37. Newberg LA; Lawrence CE (2009). "Cálculo exacto de distribuciones en enteros, con aplicación al alineamiento de secuencias" . J Comput Biol . 16 (1): 1– 18. doi : 10.1089/cmb.2008.0137 . PMC 2858568. PMID 19119992 .  
  38. Kim N; Lee C (2008). "Detección bioinformática del empalme alternativo". Bioinformática . Métodos en biología molecular. Vol. 452. pp. 179–97 . doi : 10.1007/978-1-60327-159-2_9 . ISBN   978-1-58829-707-5. PMID 18566765 . 
  39. Li JB, Levanon EY, Yoon JK, et al. (mayo de 2009). "Identificación a nivel genómico de sitios de edición de ARN humano mediante captura y secuenciación de ADN en paralelo". Science . 324 ( 5931): 1210– 3. Bibcode : 2009Sci...324.1210L . doi : 10.1126/science.1170995 . PMID 19478186. S2CID 31148824 .   
  40. Blazewicz J, Bryja M, Figlerowicz M, et al. (junio de 2009). "Ensamblaje del genoma completo a partir de la salida de la secuenciación 454 mediante un concepto de grafo de ADN modificado". Comput Biol Chem . 33 (3): 224–30 . doi : 10.1016/j.compbiolchem.2009.04.005 . PMID 19477687 .  
  41. Duran C; Appleby N; Vardy M; Imelfort M; Edwards D; Batley J (mayo de 2009). "Descubrimiento de polimorfismos de un solo nucleótido en cebada usando autoSNPdb" . Plant Biotechnol. J. 7 ( 4): 326–33 . Bibcode : 2009PBioJ...7..326D . doi : 10.1111/j.1467-7652.2009.00407.x . PMID 19386041 . 
  42. Abbott A.; Tsay A. (2000). "Análisis de secuencias y métodos de emparejamiento óptimo en sociología: revisión y perspectivas". Sociological Methods and Research . 29 (1): 3– 33. doi : 10.1177/0049124100029001001 . S2CID 121097811 . 
  43. Barzilay R; Lee L. (2002). "Bootstrapping lexical choice via multiple-sequence alignment" (PDF) . Actas de la conferencia ACL-02 sobre métodos empíricos en el procesamiento del lenguaje natural - EMNLP '02 . Vol. 10. págs. 164–171 . arXiv : cs/0205065 . Bibcode : 2002cs........5065B . doi : 10.3115/1118693.1118715 . S2CID 7521453 .   
  44. Kondrak, Grzegorz (2002). Algoritmos para la reconstrucción del lenguaje (PDF) (Tesis). Universidad de Toronto. Archivado del original (PDF) el 17 de diciembre de 2008. Recuperado el 21 de enero de 2007 .
  45. Prinzie A.; D. Van den Poel (2006). "Incorporación de información secuencial en modelos de clasificación tradicionales mediante el uso de un SAM sensible a elementos/posiciones" . Decision Support Systems . 42 (2): 508– 526. doi : 10.1016/j.dss.2005.02.004 .Véase también el artículo de Prinzie y Van den Poel Prinzie, A; Vandenpoel, D (2007). "Predicción de secuencias de adquisición de electrodomésticos: Markov/Markov para discriminación y análisis de supervivencia para modelar información secuencial en modelos NPTB" . Decision Support Systems . 44 (1): 28– 45. doi : 10.1016/j.dss.2007.02.008 .
  46. EMBL-EBI. "ClustalW2 < Alineamiento de secuencias múltiples < EMBL-EBI" . www.EBI.ac.uk. Consultado el 12 de junio de 2017 .
  47. T-coffee
  48. "BLAST: Herramienta básica de búsqueda de alineación local" . blast.ncbi.nlm.NIH.gov . Consultado el 12 de junio de 2017 .
  49. "Servidor FASTA de la UVA" . fasta.bioch.Virginia.edu . Consultado el 12 de junio de 2017 .
  50. Thompson JD; Plewniak F; Poch O (1999). "BAliBASE: una base de datos de alineación de referencia para la evaluación de programas de alineación múltiple" . Bioinformatics . 15 (1): 87–8 . doi : 10.1093/bioinformatics/15.1.87 . PMID 10068696 . 
  51. BAliBASE
  52. Thompson JD; Plewniak F; Poch O. (1999). "Una comparación exhaustiva de programas de alineación de secuencias múltiples" . Nucleic Acids Res . 27 (13): 2682– 90. doi : 10.1093/nar/27.13.2682 . PMC 148477. PMID 10373585 .  
  53. "Alineamiento de secuencias múltiples: Strap" . 3d-alignment.eu . Consultado el 12 de junio de 2017 .
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la alineación de secuencias en Wikimedia Commons.