
El alineamiento estructural intenta establecer homología entre dos o más estructuras poliméricas basándose en su forma y conformación tridimensional . Este proceso se aplica generalmente a las estructuras terciarias de las proteínas , pero también puede utilizarse para moléculas de ARN grandes . A diferencia de la simple superposición estructural, donde se conocen al menos algunos residuos equivalentes de las dos estructuras, el alineamiento estructural no requiere conocimiento previo de posiciones equivalentes. El alineamiento estructural es una herramienta valiosa para la comparación de proteínas con baja similitud de secuencia, donde las relaciones evolutivas entre proteínas no pueden detectarse fácilmente mediante técnicas estándar de alineamiento de secuencias . Por lo tanto, el alineamiento estructural puede utilizarse para inferir relaciones evolutivas entre proteínas que comparten muy poca secuencia común. Dichas relaciones pueden caracterizarse mediante filogenética estructural . Sin embargo, debe tenerse precaución al interpretar cualquier resultado como evidencia de ascendencia evolutiva compartida debido a los posibles efectos de confusión de la evolución convergente , por la cual secuencias de aminoácidos no relacionadas o distantemente relacionadas convergen en una estructura terciaria común .
Los alineamientos estructurales pueden comparar dos secuencias o múltiples secuencias . Dado que estos alineamientos dependen de información sobre todas las conformaciones tridimensionales de las secuencias de consulta, el método solo puede utilizarse en secuencias cuyas estructuras se conocen. Estas se suelen encontrar mediante cristalografía de rayos X o espectroscopia de RMN . Es posible realizar un alineamiento estructural en estructuras producidas por métodos de predicción de estructuras . De hecho, la evaluación de dichas predicciones a menudo requiere un alineamiento estructural entre el modelo y la estructura conocida real para evaluar la calidad del modelo. [ 1 ] Los alineamientos estructurales son especialmente útiles en el análisis de datos de proyectos de genómica estructural y proteómica , y pueden utilizarse como puntos de comparación para evaluar alineamientos producidos por métodos bioinformáticos puramente basados en secuencias . [ 2 ] [ 3 ] [ 4 ]
El resultado de un alineamiento estructural es una superposición de los conjuntos de coordenadas atómicas y una desviación cuadrática media ( RMSD ) mínima entre las estructuras. La RMSD de dos estructuras alineadas indica su divergencia. El alineamiento estructural puede complicarse por la existencia de múltiples dominios proteicos dentro de una o más de las estructuras de entrada, ya que los cambios en la orientación relativa de los dominios entre dos estructuras a alinear pueden aumentar artificialmente la RMSD.
Datos producidos por alineación estructural
La información mínima que se obtiene de una alineación estructural exitosa es un conjunto de residuos que se consideran equivalentes entre las estructuras. Este conjunto de equivalencias se utiliza normalmente para superponer las coordenadas tridimensionales de cada estructura de entrada. (Cabe destacar que un elemento de entrada puede fijarse como referencia y, por lo tanto, sus coordenadas superpuestas no cambian). Las estructuras ajustadas pueden utilizarse para calcular los valores de RMSD mutuos, así como otras medidas más sofisticadas de similitud estructural, como la prueba de distancia global (GDT, [ 5 ] la métrica utilizada en CASP ). La alineación estructural también implica una alineación de secuencia unidimensional correspondiente, a partir de la cual se puede calcular una identidad de secuencia, o el porcentaje de residuos idénticos entre las estructuras de entrada, como medida de la cercanía de la relación entre las dos secuencias.
Tipos de comparaciones
Debido a que las estructuras proteicas están compuestas por aminoácidos cuyas cadenas laterales están unidas por una cadena principal proteica común, se pueden utilizar varios subconjuntos posibles de los átomos que componen una macromolécula proteica para producir una alineación estructural y calcular los valores RMSD correspondientes. Al alinear estructuras con secuencias muy diferentes, los átomos de las cadenas laterales generalmente no se tienen en cuenta porque sus identidades difieren entre muchos residuos alineados. Por esta razón, es común que los métodos de alineación estructural utilicen por defecto solo los átomos de la cadena principal incluidos en el enlace peptídico . Para simplificar y optimizar el proceso, a menudo solo se consideran las posiciones de los carbonos alfa , ya que el enlace peptídico tiene una conformación planar mínimamente variable . Solo cuando las estructuras que se van a alinear son muy similares o incluso idénticas, tiene sentido alinear las posiciones de los átomos de las cadenas laterales, en cuyo caso el RMSD refleja no solo la conformación de la cadena principal proteica, sino también los estados rotaméricos de las cadenas laterales. Otros criterios de comparación que reducen el ruido y refuerzan las coincidencias positivas incluyen la asignación de la estructura secundaria , los mapas de contacto nativos o los patrones de interacción de residuos, las medidas de empaquetamiento de las cadenas laterales y las medidas de retención de enlaces de hidrógeno . [ 6 ]
Superposición estructural
La comparación más básica posible entre estructuras proteicas no intenta alinear las estructuras de entrada y requiere una alineación precalculada como entrada para determinar qué residuos de la secuencia se considerarán en el cálculo de RMSD. La superposición estructural se usa comúnmente para comparar múltiples conformaciones de la misma proteína (en cuyo caso no es necesaria la alineación, ya que las secuencias son las mismas) y para evaluar la calidad de las alineaciones producidas utilizando solo información de secuencia entre dos o más secuencias cuyas estructuras se conocen. Este método tradicionalmente utiliza un algoritmo simple de ajuste por mínimos cuadrados, en el que las rotaciones y traslaciones óptimas se encuentran minimizando la suma de las distancias al cuadrado entre todas las estructuras en la superposición. [ 7 ] Más recientemente, los métodos de máxima verosimilitud y bayesianos han aumentado considerablemente la precisión de las rotaciones, traslaciones y matrices de covarianza estimadas para la superposición. [ 8 ] [ 9 ]
Se han desarrollado algoritmos basados en rotaciones multidimensionales y cuaterniones modificados para identificar relaciones topológicas entre estructuras proteicas sin necesidad de una alineación predeterminada. Dichos algoritmos han identificado con éxito plegamientos canónicos como el haz de cuatro hélices . [ 10 ] El método SuperPose ( archivado el 31/10/2015 en Wayback Machine) es suficientemente extensible como para corregir rotaciones de dominio relativas y otros problemas estructurales. [ 11 ]
Evaluar la similitud
A menudo, el propósito de buscar una superposición estructural no es tanto la superposición en sí, sino una evaluación de la similitud de dos estructuras o una confianza en una alineación remota. [ 1 ] [ 2 ] [ 3 ] Una distinción sutil pero importante de la superposición estructural máxima es la conversión de una alineación en una puntuación de similitud significativa. [ 12 ] [ 13 ] La mayoría de los métodos producen algún tipo de "puntuación" que indica la calidad de la superposición. [ 5 ] [ 14 ] [ 15 ] [ 12 ] [ 13 ] Sin embargo, lo que realmente se desea no es simplemente una "puntuación Z" estimada o un valor E estimado de ver la superposición observada por casualidad, sino que se desea que el valor E estimado esté estrechamente correlacionado con el verdadero valor E. Es fundamental destacar que, incluso si el valor E estimado de un método es preciso en promedio , si carece de una desviación estándar baja en su proceso de generación de valores estimados, entonces el orden de clasificación de las similitudes relativas de una proteína de consulta con un conjunto de comparación rara vez coincidirá con el orden "verdadero". [ 12 ] [ 13 ]
Los distintos métodos superpondrán diferentes cantidades de residuos porque utilizan diferentes garantías de calidad y diferentes definiciones de "superposición"; algunos solo incluyen residuos que cumplen múltiples criterios de superposición locales y globales, y otros son más voraces, flexibles y promiscuos. Una mayor cantidad de átomos superpuestos puede significar una mayor similitud, pero no siempre produce el mejor valor E que cuantifica la improbabilidad de la superposición y, por lo tanto, no es tan útil para evaluar la similitud, especialmente en homólogos distantes. [ 1 ] [ 2 ] [ 3 ] [ 4 ]
Complejidad algorítmica
Solución óptima
Se ha demostrado que el " enhebrado " óptimo de una secuencia de proteína en una estructura conocida y la producción de una alineación múltiple de secuencias óptima es NP-completo . [ 16 ] [ 17 ] Sin embargo, esto no implica que el problema de alineación estructural sea NP-completo. Estrictamente hablando, una solución óptima al problema de alineación de la estructura de proteínas solo se conoce para ciertas medidas de similitud de la estructura de proteínas, como las medidas utilizadas en experimentos de predicción de la estructura de proteínas, GDT_TS [ 5 ] y MaxSub. [ 14 ] Estas medidas pueden optimizarse rigurosamente utilizando un algoritmo capaz de maximizar el número de átomos en dos proteínas que pueden superponerse bajo un umbral de distancia predefinido. [ 15 ] Desafortunadamente, el algoritmo para la solución óptima no es práctico, ya que su tiempo de ejecución depende no solo de las longitudes sino también de la geometría intrínseca de las proteínas de entrada.
Solución aproximada
Se han desarrollado algoritmos aproximados de tiempo polinomial para el alineamiento estructural que producen una familia de soluciones "óptimas" dentro de un parámetro de aproximación para una función de puntuación dada. [ 15 ] [ 18 ] Aunque estos algoritmos clasifican teóricamente el problema del alineamiento aproximado de la estructura de proteínas como "tratable", siguen siendo computacionalmente demasiado costosos para el análisis de estructuras de proteínas a gran escala. En consecuencia, no existen algoritmos prácticos que converjan a las soluciones globales del alineamiento, dada una función de puntuación. Por lo tanto, la mayoría de los algoritmos son heurísticos, pero se han desarrollado algoritmos que garantizan la convergencia al menos a maximizadores locales de las funciones de puntuación y que son prácticos. [ 19 ]
Representación de estructuras
Las estructuras proteicas deben representarse en algún espacio independiente de coordenadas para que sean comparables. Esto se logra típicamente mediante la construcción de una matriz de secuencia a secuencia o una serie de matrices que abarcan métricas comparativas: en lugar de distancias absolutas relativas a un espacio de coordenadas fijo. Una representación intuitiva es la matriz de distancias , que es una matriz bidimensional que contiene todas las distancias por pares entre un subconjunto de átomos en cada estructura (como los carbonos alfa ). La matriz aumenta en dimensionalidad a medida que aumenta el número de estructuras que se alinearán simultáneamente. Reducir la proteína a una métrica gruesa como elementos de estructura secundaria (SSE) o fragmentos estructurales también puede producir alineaciones sensatas, a pesar de la pérdida de información al descartar distancias, ya que también se descarta el ruido . [ 20 ] Elegir una representación que facilite el cálculo es fundamental para desarrollar un mecanismo de alineación eficiente.
Métodos
Las técnicas de alineación estructural se han utilizado para comparar estructuras individuales o conjuntos de estructuras, así como para la creación de bases de datos de comparación "de todo a todo" que miden la divergencia entre cada par de estructuras presentes en el Protein Data Bank (PDB). Dichas bases de datos se utilizan para clasificar las proteínas según su plegamiento .
DALI

Un método común y popular de alineación estructural es el método DALI, o método de alineación de matriz de distancias, que divide las estructuras de entrada en fragmentos de hexapéptidos y calcula una matriz de distancias evaluando los patrones de contacto entre fragmentos sucesivos. [ 21 ] Las características de la estructura secundaria que involucran residuos contiguos en la secuencia aparecen en la diagonal principal de la matriz ; las demás diagonales de la matriz reflejan contactos espaciales entre residuos que no están cerca entre sí en la secuencia. Cuando estas diagonales son paralelas a la diagonal principal, las características que representan son paralelas; cuando son perpendiculares, sus características son antiparalelas. Esta representación requiere mucha memoria porque las características en la matriz cuadrada son simétricas (y por lo tanto redundantes) con respecto a la diagonal principal.
Cuando las matrices de distancias de dos proteínas comparten características iguales o similares en posiciones aproximadamente iguales, se puede decir que tienen plegamientos similares con bucles de longitud similar que conectan sus elementos de estructura secundaria. El proceso de alineación real de DALI requiere una búsqueda de similitud después de que se construyen las matrices de distancias de las dos proteínas; esto normalmente se lleva a cabo a través de una serie de submatrices superpuestas de tamaño 6x6. Las coincidencias de submatrices se reensamblan luego en una alineación final a través de un algoritmo estándar de maximización de puntuación : la versión original de DALI usaba una simulación de Monte Carlo para maximizar una puntuación de similitud estructural que es una función de las distancias entre átomos putativos correspondientes. En particular, los átomos más distantes dentro de las características correspondientes se ponderan exponencialmente a la baja para reducir los efectos del ruido introducido por la movilidad de bucles, torsiones de hélice y otras variaciones estructurales menores. [ 20 ] Debido a que DALI se basa en una matriz de distancias de todos a todos, puede tener en cuenta la posibilidad de que las características alineadas estructuralmente puedan aparecer en diferentes órdenes dentro de las dos secuencias que se están comparando.
El método DALI también se ha utilizado para construir una base de datos conocida como FSSP (Clasificación de plegamiento basada en la alineación estructura-estructura de proteínas o familias de proteínas estructuralmente similares), en la que todas las estructuras proteicas conocidas se alinean entre sí para determinar sus vecinos estructurales y su clasificación de plegamiento. Existe una base de datos consultable basada en DALI, así como un programa descargable y una búsqueda web basados en una versión independiente conocida como DaliLite.
Extensión combinatoria
El método de extensión combinatoria (CE) es similar a DALI en que también divide cada estructura del conjunto de consulta en una serie de fragmentos que luego intenta reensamblar para formar una alineación completa. Se utiliza una serie de combinaciones de fragmentos por pares, denominadas pares de fragmentos alineados (AFP), para definir una matriz de similitud a través de la cual se genera una ruta óptima para identificar la alineación final. Solo se incluyen en la matriz los AFP que cumplen con los criterios de similitud local dados, con el fin de reducir el espacio de búsqueda necesario y, por lo tanto, aumentar la eficiencia. [ 22 ] Es posible utilizar varias métricas de similitud; la definición original del método CE incluía solo superposiciones estructurales y distancias entre residuos, pero desde entonces se ha ampliado para incluir propiedades ambientales locales como la estructura secundaria, la exposición al disolvente, los patrones de enlaces de hidrógeno y los ángulos diedros . [ 22 ]
Una ruta de alineación se calcula como la ruta óptima a través de la matriz de similitud progresando linealmente a través de las secuencias y extendiendo la alineación con el siguiente par AFP de puntuación alta posible. El par AFP inicial que nuclea la alineación puede ocurrir en cualquier punto de la matriz de secuencias. Las extensiones luego proceden con el siguiente AFP que cumple con los criterios de distancia dados restringiendo la alineación a tamaños de brecha pequeños. El tamaño de cada AFP y el tamaño máximo de brecha son parámetros de entrada requeridos, pero generalmente se establecen en valores determinados empíricamente de 8 y 30 respectivamente. [ 22 ] Al igual que DALI y SSAP, CE se ha utilizado para construir una base de datos de clasificación de pliegues de todos a todos Archivado el 03-12-1998 en Wayback Machine a partir de las estructuras de proteínas conocidas en el PDB.
El RCSB PDB ha publicado recientemente una versión actualizada de CE, Mammoth y FATCAT como parte de la herramienta de comparación de proteínas del RCSB PDB . Proporciona una nueva variante de CE que puede detectar permutaciones circulares en estructuras proteicas. [ 23 ]
Mamut
MAMMOTH [ 12 ] aborda el problema de alineación desde un objetivo diferente al de casi todos los demás métodos. En lugar de intentar encontrar una alineación que superponga al máximo el mayor número de residuos, busca el subconjunto de la alineación estructural con menor probabilidad de ocurrir por azar. Para ello, marca una alineación de motivos locales con indicadores que señalan qué residuos satisfacen simultáneamente criterios más estrictos: 1) Solapamiento de estructura local, 2) Estructura secundaria regular, 3) Superposición 3D, 4) Mismo orden en la secuencia primaria. Convierte las estadísticas del número de residuos con coincidencias de alta confianza y el tamaño de la proteína para calcular un valor esperado para el resultado por azar. Destaca en la coincidencia de homólogos remotos, en particular estructuras generadas por predicción de estructura ab initio a familias de estructuras como SCOP, porque enfatiza la extracción de una subalineación estadísticamente fiable y no en lograr la alineación de secuencia máxima o la superposición 3D máxima. [ 2 ] [ 3 ]
Para cada ventana superpuesta de 7 residuos consecutivos, calcula el conjunto de vectores unitarios de dirección de desplazamiento entre residuos C-alfa adyacentes. Los motivos locales de todos contra todos se comparan en función de la puntuación URMS. Estos valores se convierten en las entradas de puntuación de alineación de pares para la programación dinámica, que produce una alineación de residuos por pares semilla. La segunda fase utiliza un algoritmo MaxSub modificado: se utiliza un único par alineado de 7 residuos en cada proteína para orientar las dos estructuras proteicas completas para superponer al máximo estos 7 C-alfa, luego, en esta orientación, busca cualquier par alineado adicional que esté cerca en 3D. Reorienta las estructuras para superponer este conjunto expandido e itera hasta que no haya más pares que coincidan en 3D. Este proceso se reinicia para cada ventana de 7 residuos en la alineación semilla. La salida es el número máximo de átomos encontrados a partir de cualquiera de estas semillas iniciales. Esta estadística se convierte en un valor E calibrado para la similitud de las proteínas.
Mammoth no intenta reiterar la alineación inicial ni extender el subconjunto de alta calidad. Por lo tanto, la alineación semilla que muestra no se puede comparar de manera justa con DALI o TM-align, ya que se formó simplemente como una heurística para podar el espacio de búsqueda. (Se puede usar si se desea una alineación basada únicamente en la similitud de estructura-motivo local, independientemente de la alineación atómica de cuerpo rígido de largo alcance). Debido a esa misma parsimonia, es más de diez veces más rápido que DALI, CE y TM-align. [ 24 ] A menudo se usa junto con estas herramientas más lentas para preseleccionar grandes bases de datos y extraer solo las mejores estructuras relacionadas con el valor E para una superposición más exhaustiva o cálculos costosos. [ 25 ] [ 26 ]
Ha tenido un éxito particular en el análisis de estructuras "señuelo" de la predicción de estructura ab initio. [ 1 ] [ 2 ] [ 3 ] Estos señuelos son conocidos por obtener correctamente la estructura del motivo del fragmento local y formar algunos núcleos de la estructura terciaria 3D correcta, pero obtener incorrectamente la estructura terciaria de longitud completa. En este régimen crepuscular de homología remota, se ha demostrado que los valores E de Mammoth para la evaluación de predicción de estructura de proteínas CASP [ 1 ] están significativamente más correlacionados con la clasificación humana que SSAP o DALI. [ 12 ] La capacidad de Mammoth para extraer las superposiciones parciales multicriterio con proteínas de estructura conocida y clasificarlas con valores E apropiados, combinada con su velocidad, facilita el escaneo de grandes cantidades de modelos señuelo contra la base de datos PDB para identificar los señuelos correctos más probables en función de su homología remota con proteínas conocidas. [ 2 ]
SSAP
El método SSAP (Programa de Alineamiento Estructural Secuencial) utiliza programación dinámica doble para generar un alineamiento estructural basado en vectores átomo a átomo en el espacio estructural. En lugar de los carbonos alfa que se utilizan habitualmente en el alineamiento estructural, SSAP construye sus vectores a partir de los carbonos beta de todos los residuos, excepto la glicina. Este método tiene en cuenta el estado rotamérico de cada residuo, así como su ubicación a lo largo de la cadena principal. SSAP funciona construyendo primero una serie de vectores de distancia entre residuos, entre cada residuo y sus vecinos no contiguos más cercanos en cada proteína. A continuación, se construye una serie de matrices que contienen las diferencias vectoriales entre vecinos para cada par de residuos para los que se construyeron vectores. La programación dinámica aplicada a cada matriz resultante determina una serie de alineamientos locales óptimos, que luego se suman en una matriz "resumen" a la que se aplica de nuevo programación dinámica para determinar el alineamiento estructural global.
SSAP originalmente solo producía alineamientos por pares, pero desde entonces se ha extendido también a alineamientos múltiples. [ 27 ] Se ha aplicado de forma integral para producir un esquema de clasificación de plegamiento jerárquico conocido como CATH (Clase, Arquitectura, Topología, Homología), [ 28 ] que se ha utilizado para construir la base de datos de clasificación de estructura de proteínas CATH .
Métodos alfabéticos
Un tipo especial de programas de alineación estructural de proteínas convierte la estructura de entrada en una secuencia de letras que la describe. Esto permite aplicar métodos de alineación de secuencias a este campo para lograr búsquedas más eficientes y, en algunas implementaciones, también para alinear y superponer en un espacio 3D real.
- El método más simple solo considera la posición del esqueleto. La entrada se divide en grupos de cuatro residuos y cada grupo se describe mediante el descriptor de una letra más cercano. Para reutilizar aún más las herramientas basadas en proteínas, se eligen 20 letras. [ 29 ]
- Foldseek utiliza el alfabeto de interacción 3D (3Di), que clasifica la relación entre el átomo Cα de un residuo y su residuo espacialmente más cercano en 20 letras. Cada residuo de la estructura de entrada recibe una letra. Las similitudes entre las letras se definen mediante una matriz de sustitución . Foldseek ofrece una alta sensibilidad similar a la del alineamiento estructural típico, pero es cientos de veces más rápido. Es capaz de buscar, alinear y superponer. [ 30 ]
- Reseek representa cada residuo y su contexto estructural en un vector de características discreto, creando efectivamente un alfabeto de 10¹¹ letras . La similitud entre cada vector de características se define componente a componente utilizando datos recopilados previamente. Este método también permite la alineación de múltiples estructuras (MUSCLE-3D). [ 31 ]
Novedades recientes
Las mejoras en los métodos de alineación estructural constituyen un área activa de investigación, y con frecuencia se proponen métodos nuevos o modificados que, según se afirma, ofrecen ventajas sobre las técnicas más antiguas y extendidas. Un ejemplo reciente, TM-align, utiliza un método novedoso para ponderar su matriz de distancias, a la que luego se aplica programación dinámica estándar . [ 32 ] [ 13 ] Se propone que la ponderación acelere la convergencia de la programación dinámica y corrija los efectos derivados de las longitudes de alineación. En un estudio comparativo, se ha informado que TM-align mejora tanto en velocidad como en precisión con respecto a DALI y CE. [ 32 ]
Otros métodos prometedores de alineación estructural son los métodos de alineación estructural local. Estos proporcionan una comparación de partes preseleccionadas de proteínas (por ejemplo, sitios de unión, motivos estructurales definidos por el usuario) [ 33 ] [ 34 ] [ 35 ] con sitios de unión o bases de datos estructurales de proteínas completas. Los servidores MultiBind y MAPPIS [ 35 ] [ 36 ] permiten la identificación de disposiciones espaciales comunes de propiedades fisicoquímicas como donador de enlaces de hidrógeno, aceptor, alifático, aromático o hidrofóbico en un conjunto de sitios de unión de proteínas proporcionados por el usuario definidos por interacciones con moléculas pequeñas (MultiBind) o en un conjunto de interfaces proteína-proteína proporcionadas por el usuario (MAPPIS). Otros proporcionan una comparación de estructuras de proteínas completas [ 37 ] con varias estructuras enviadas por el usuario o con una gran base de datos de estructuras de proteínas en un tiempo razonable ( ProBiS [ 38 ] ). A diferencia de los enfoques de alineación global, los enfoques de alineación estructural local son adecuados para la detección de patrones localmente conservados de grupos funcionales, que a menudo aparecen en sitios de unión y tienen una participación significativa en la unión de ligandos. [ 36 ] Como ejemplo, comparamos G-Losa, [ 39 ] una herramienta de alineación de estructuras locales, con TM-align, un método basado en la alineación de estructuras globales. Si bien G-Losa predice las posiciones de los ligandos similares a fármacos en proteínas diana de cadena simple con mayor precisión que TM-align, la tasa de éxito general de TM-align es mejor. [ 40 ]
Sin embargo, a medida que las mejoras algorítmicas y el rendimiento informático han eliminado las deficiencias puramente técnicas de los enfoques anteriores, se ha hecho evidente que no existe un criterio universal para la alineación estructural "óptima". TM-align, por ejemplo, es particularmente robusto para cuantificar comparaciones entre conjuntos de proteínas con grandes disparidades en la longitud de sus secuencias, pero solo captura indirectamente la conservación de los enlaces de hidrógeno o del orden de la estructura secundaria, que podrían ser mejores métricas para la alineación de proteínas evolutivamente relacionadas. Por lo tanto, los desarrollos recientes se han centrado en optimizar atributos particulares como la velocidad, la cuantificación de puntuaciones, la correlación con estándares de referencia alternativos o la tolerancia a la imperfección en los datos estructurales o los modelos estructurales ab initio. Una metodología alternativa que está ganando popularidad consiste en utilizar el consenso de varios métodos para determinar las similitudes estructurales de las proteínas. [ 41 ]
Alineación estructural del ARN
Las técnicas de alineación estructural se han aplicado tradicionalmente de forma exclusiva a las proteínas, como macromoléculas biológicas primarias que adoptan estructuras tridimensionales características. Sin embargo, las grandes moléculas de ARN también forman estructuras terciarias características , mediadas principalmente por enlaces de hidrógeno formados entre pares de bases , así como por el apilamiento de bases . Las moléculas de ARN no codificante funcionalmente similares pueden ser especialmente difíciles de extraer de los datos genómicos porque la estructura se conserva más que la secuencia tanto en el ARN como en las proteínas, [ 43 ] y el alfabeto más limitado del ARN disminuye el contenido de información de cualquier nucleótido en cualquier posición dada.
Sin embargo, debido al creciente interés en las estructuras de ARN y al aumento del número de estructuras de ARN 3D determinadas experimentalmente, se han desarrollado recientemente pocos métodos de similitud de estructuras de ARN. Uno de estos métodos es, por ejemplo, SETTER [ 44 ] , que descompone cada estructura de ARN en partes más pequeñas llamadas unidades de estructura secundaria general (GSSU). Posteriormente, las GSSU se alinean y estas alineaciones parciales se combinan en la alineación final de la estructura de ARN y se puntúan. El método se ha implementado en el servidor web de SETTER [ 45 ] .
Recientemente se ha publicado e implementado en el programa FOLDALIGN un método para el alineamiento estructural por pares de secuencias de ARN con baja identidad de secuencia . [ 46 ] Sin embargo, este método no es realmente análogo a las técnicas de alineamiento estructural de proteínas, ya que predice computacionalmente las estructuras de las secuencias de ARN de entrada en lugar de requerir estructuras determinadas experimentalmente como entrada. Aunque la predicción computacional del proceso de plegamiento de proteínas no ha tenido mucho éxito hasta la fecha, las estructuras de ARN sin pseudonudos a menudo se pueden predecir razonablemente utilizando métodos de puntuación basados en la energía libre que tienen en cuenta el apareamiento y el apilamiento de bases. [ 47 ]
Software
Seleccionar una herramienta de software para la alineación estructural puede ser un desafío debido a la gran variedad de paquetes disponibles, que difieren significativamente en metodología y fiabilidad. En [ 41 ] se presentó una solución parcial a este problema , la cual se puso a disposición del público a través del servidor web ProCKSI. Una lista más completa del software de alineación estructural disponible y de libre distribución se puede encontrar en el sitio web de software de alineación estructural .
Las propiedades de algunos servidores y paquetes de software de alineación estructural se resumen y se prueban con ejemplos en Herramientas de alineación estructural en Proteopedia.Org .
Véase también
Referencias
- 1 2 3 4 5 Kryshtafovych A, Monastyrskyy B, Fidelis K (2016). "Estadísticas CASP11 y el sistema de evaluación del centro de predicción." . Proteins . 84 (Suppl 1): (Suppl 1):15–19. doi : 10.1002/prot.25005 . PMC 5479680 . PMID 26857434 .
- 1 2 3 4 5 6 Lars Malmström Michael Riffle; Charlie EM Strauss; Dylan Chivian; Trisha N Davis; Richard Bonneau; David Baker (2007). " Asignaciones de superfamilias para el proteoma de levadura a través de la integración de la predicción de estructura con la ontología genética" . PLOS Biol . 5 (4): e76autor correspondiente1, 2. doi : 10.1371/journal.pbio.0050076 . PMC 1828141. PMID 17373854 .
- 1 2 3 4 5 David E. Kim; Dylan Chivian; David Baker (2004). "Predicción y análisis de la estructura de proteínas utilizando el servidor Robetta" . Nucleic Acids Research . 32(Número especial de servidores web): W526–W531 (Número especial de servidores web): W526– W531 . doi : 10.1093/nar/gkh468 . PMC 441606. PMID 15215442 .
- 1 2 Zhang Y, Skolnick J (2005). "El problema de la predicción de la estructura de proteínas podría resolverse utilizando la biblioteca PDB actual" . Proc Natl Acad Sci USA . 102 (4): 1029– 34. Bibcode : 2005PNAS..102.1029Z . doi : 10.1073/pnas.0407152101 . PMC 545829. PMID 15653774 .
- 1 2 3 Zemla A. (2003). "LGA: un método para encontrar similitudes 3D en estructuras proteicas" . Nucleic Acids Research . 31 (13): 3370– 3374. doi : 10.1093/nar/gkg571 . PMC 168977. PMID 12824330 .
- ↑ Godzik A (1996). "La alineación estructural entre dos proteínas: ¿Existe una respuesta única?" . Protein Science . 5 (7): 1325– 38. doi : 10.1002/pro.5560050711 . PMC 2143456 . PMID 8819165 .
- ↑ Martin ACR (1982). "Comparación rápida de estructuras proteicas". Acta Crystallogr A . 38 (6): 871– 873. Bibcode : 1982AcCrA..38..871M . doi : 10.1107/S0567739482001806 .
- ↑ Theobald DL, Wuttke DS (2006). "Modelos jerárquicos bayesianos empíricos para regularizar la estimación de máxima verosimilitud en el problema de Procrustes gaussiano matricial" . Actas de la Academia Nacional de Ciencias . 103 (49): 18521– 18527. Bibcode : 2006PNAS..10318521T . doi : 10.1073/pnas.0508445103 . PMC 1664551. PMID 17130458 .
- ↑ Theobald DL, Wuttke DS (2006). " THESEUS: Superposición de máxima verosimilitud y análisis de estructuras macromoleculares" . Bioinformatics . 22 (17): 2171– 2172. doi : 10.1093/bioinformatics/btl332 . PMC 2584349. PMID 16777907 .
- ↑ Diederichs K. (1995). "Superposición estructural de proteínas con alineación desconocida y detección de similitud topológica mediante un algoritmo de búsqueda de seis dimensiones" . Proteins . 23 (2): 187– 95. doi : 10.1002/prot.340230208 . PMID 8592700. S2CID 3469775 .
- ↑ Maiti R, Van Domselaar GH, Zhang H, Wishart DS (2004). "SuperPose: un servidor simple para superposición estructural sofisticada" . Nucleic Acids Res . 32 (número especial de servidores web): W590–4. doi : 10.1093/nar/gkh477 . PMC 441615. PMID 15215457 .
- 1 2 3 4 5 Ortiz, AR; Strauss CE; Olmea O. (2002). "MAMMOTH (matching molecular models obtain from theory): an automated method for model comparison" . Protein Science . 11 (11): 2606–2621 . doi : 10.1110/ps.0215902 . PMC 2373724. PMID 12381844 .
- 1 2 3 4 Zhang Y, Skolnick J (2004). "Función de puntuación para la evaluación automatizada de la calidad de la plantilla de estructura proteica". Proteins . 57 (4): 702– 710. doi : 10.1002/prot.20264 . PMID 15476259 . S2CID 7954787 .
- 1 2 Siew N, Elofsson A, Rychlewsk L, Fischer D (2000). "MaxSub: una medida automatizada para la evaluación de la calidad de la predicción de la estructura de proteínas" . Bioinformatics . 16 (9): 776–85 . doi : 10.1093/bioinformatics/16.9.776 . PMID 11108700 .
- 1 2 3 Poleksic A (2009). "Algoritmos para la alineación óptima de la estructura de proteínas" . Bioinformatics . 25 (21): 2751– 2756. doi : 10.1093/bioinformatics/btp530 . PMID 19734152 .
- ↑ Lathrop RH. (1994). "El problema del enhebrado de proteínas con preferencias de interacción de aminoácidos de secuencia es NP-completo". Protein Eng . 7 (9): 1059– 68. CiteSeerX 10.1.1.367.9081 . doi : 10.1093/protein/7.9.1059 . PMID 7831276 .
- ↑ Wang L, Jiang T (1994). "Sobre la complejidad del alineamiento de secuencias múltiples". Journal of Computational Biology . 1 (4): 337– 48. CiteSeerX 10.1.1.408.894 . doi : 10.1089/cmb.1994.1.337 . PMID 8790475 .
- ↑ Kolodny R, Linial N (2004). "Alineación estructural aproximada de proteínas en tiempo polinomial" . PNAS . 101 ( 33): 12201– 12206. doi : 10.1073/pnas.0404383101 . PMC 514457. PMID 15304646 .
- ↑ Martinez L, Andreani, R, Martinez, JM. (2007). "Algoritmos convergentes para la alineación estructural de proteínas" . BMC Bioinformatics . 8 : 306. doi : 10.1186/1471-2105-8-306 . PMC 1995224. PMID 17714583 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - 1 2 Mount DM. (2004). Bioinformática: Análisis de secuencias y genomas, 2.ª ed. Cold Spring Harbor Laboratory Press: Cold Spring Harbor, NY ISBN 0879697121
- ↑ Holm L, Sander C (1996). "Mapeando el universo de las proteínas". Science . 273 (5275): 595– 603. Bibcode : 1996Sci...273..595H . doi : 10.1126/science.273.5275.595 . PMID 8662544 . S2CID 7509134 .
- 1 2 3 Shindyalov, IN; Bourne PE (1998). "Alineación de la estructura de proteínas mediante extensión combinatoria incremental (CE) de la ruta óptima" . Protein Engineering . 11 (9): 739– 747. doi : 10.1093/protein/11.9.739 . PMID 9796821 .
- ↑ Prlic A, Bliven S, Rose PW, Bluhm WF, Bizon C, Godzik A, Bourne PE (2010). "Alineaciones de estructuras proteicas precalculadas en el sitio web RCSB PDB" . Bioinformatics . 26 (23): 2983– 2985. doi : 10.1093/bioinformatics/btq572 . PMC 3003546. PMID 20937596 .
- ↑ Pin-Hao Chi; Bin Pang; Dmitry Korkin; Chi-Ren Shyu (2009). "Clasificación y recuperación eficientes de pliegues SCOP utilizando alineaciones de subestructuras proteicas basadas en índices" . Bioinformatics . 25 (19): 2559– 2565. doi : 10.1093/bioinformatics/btp474 . PMID 19667079 .
- ↑ Sara Cheek; Yuan Qi; Sri Krishna; Lisa N Kinch; Nick V Grishin (2004). "SCOPmap: Asignación automatizada de estructuras proteicas a superfamilias evolutivas" . BMC Bioinformatics . 5 (197): 197. doi : 10.1186/1471-2105-5-197 . PMC 544345. PMID 15598351 .
- ↑ Kai Wang; Ram Samudrala (2005). "FSSA: un nuevo método para identificar firmas funcionales a partir de alineamientos estructurales" . Bioinformatics . 21 (13): 2969– 2977. doi : 10.1093/bioinformatics/bti471 . PMID 15860561 .
- ↑ Taylor WR, Flores TP, Orengo CA (1994). "Alineación de múltiples estructuras proteicas" . Protein Sci . 3 (10): 1858– 70. doi : 10.1002/pro.5560031025 . PMC 2142613. PMID 7849601 .
- ↑ Orengo CA, Michie AD, Jones S, Jones DT, Swindells MB, Thornton JM (1997). "CATH: Una clasificación jerárquica de las estructuras de dominios proteicos" . Structure . 5 (8): 1093– 1108. doi : 10.1016/S0969-2126(97)00260-8 . PMID 9309224 .
- ↑ Le, Q; Pollastri, G; Koehl, P (27 de marzo de 2009). "Alfabetos estructurales para la clasificación de la estructura de proteínas: un estudio comparativo" . Journal of Molecular Biology . 387 (2): 431– 50. doi : 10.1016/j.jmb.2008.12.044 . PMC 2772874. PMID 19135454 .
- ↑ van Kempen, Michel; Kim, Stephanie S.; Tumescheit, Charlotte; Mirdita, Milot; Lee, Jeongjae; Gilchrist, Cameron LM; Söding, Johannes; Steinegger, Martin (febrero de 2024). "Búsqueda rápida y precisa de la estructura de proteínas con Foldseek" . Nature Biotechnology . 42 (2): 243– 246. doi : 10.1038/s41587-023-01773-0 . PMC 10869269. PMID 37156916 .
- ↑ Edgar, Robert C (1 de noviembre de 2024). "La alineación de la estructura de proteínas mediante Reseek mejora la sensibilidad a los homólogos remotos" . Bioinformatics . 40 (11) btae687. doi : 10.1093/bioinformatics/btae687 . PMC 11601161. PMID 39546374 .
- 1 2 Zhang Y, Skolnick J (2005). "TM-align: Un algoritmo de alineación de estructuras proteicas basado en la puntuación TM" . Nucleic Acids Research . 33 (7): 2302– 2309. doi : 10.1093/nar/gki524 . PMC 1084323. PMID 15849316 .
- ↑ Stefano Angaran; Mary Ellen Bock ; Claudio Garutti; Concettina Guerra1 (2009). "MolLoc: una herramienta web para el alineamiento estructural local de superficies moleculares" . Nucleic Acids Research . 37 (número especial de servidor web): W565–70. doi : 10.1093/nar/gkp405 . PMC 2703929. PMID 19465382 .
{{cite journal}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ Gaëlle Debret; Arnaud Martel; Philippe Cuniasse (2009). "RASMOT-3D PRO: un servidor web de búsqueda de motivos 3D" . Nucleic Acids Research . 37 (número especial de servidores web): W459–64. doi : 10.1093/nar/gkp304 . PMC 2703991. PMID 19417073 .
- 1 2 Alexandra Shulman-Peleg; Maxim Shatsky; Ruth Nussinov; Haim J. Wolfson (2008). "MultiBind y MAPPIS: servidores web para el alineamiento múltiple de sitios de unión 3D de proteínas y sus interacciones" . Nucleic Acids Research . 36 (número especial de servidores web): W260–4. doi : 10.1093/nar/gkn185 . PMC 2447750. PMID 18467424 .
- 1 2 Alexandra Shulman-Peleg; Maxim Shatsky; Ruth Nussinov; Haim J Wolfson (2007). "Conservación química espacial de las interacciones de puntos calientes en complejos proteína-proteína" . BMC Biology . 5 (43): 43. doi : 10.1186/1741-7007-5-43 . PMC 2231411. PMID 17925020 .
- ↑ Gabriele Ausiello; Pier Federico Gherardini; Paolo Marcatili; Anna Tramontano; Allegra Vía; Manuela Helmer-Citterich (2008). "FunClust: un servidor web para la identificación de motivos estructurales en un conjunto de estructuras proteicas no homólogas" . Biología BMC . 9 (Suplemento 2): T2. doi : 10.1186/1471-2105-9-S2-S2 . PMC 2323665 . PMID 18387204 .
- ↑ Janez Konc; Dušanka Janežič (2010). "Algoritmo ProBiS para la detección de sitios de unión de proteínas estructuralmente similares mediante alineación estructural local" . Bioinformatics . 26 ( 9): 1160– 1168. doi : 10.1093/bioinformatics/btq100 . PMC 2859123. PMID 20305268 .
- ↑ Hui Sun Lee; Wonpil Im (2012). "Identificación de plantillas de ligandos mediante alineación de estructura local para el diseño de fármacos basado en la estructura" . Journal of Chemical Information and Modeling . 52 (10): 2784– 2795. doi : 10.1021/ci300178e . PMC 3478504. PMID 22978550 .
- ↑ Hui Sun Lee; Wonpil Im (2013). "Detección del sitio de unión del ligando mediante alineación de la estructura local y su complementariedad de rendimiento" . Journal of Chemical Information and Modeling . 53 (9): 2462– 2470. doi : 10.1021/ci4003602 . PMC 3821077. PMID 23957286 .
- 1 2 Barthel D., Hirst JD, Blazewicz J., Burke EK y Krasnogor N. (2007). "ProCKSI: un sistema de apoyo a la toma de decisiones para la comparación, el conocimiento, la similitud y la información de la estructura de proteínas" . BMC Bioinformatics . 8 : 416. doi : 10.1186/1471-2105-8-416 . PMC 2222653. PMID 17963510 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Sippl, M.; Wiederstein, M. (2012). " Detección de correlaciones espaciales en estructuras proteicas y complejos moleculares" . Structure . 20 (4): 718– 728. doi : 10.1016/j.str.2012.01.024 . PMC 3320710. PMID 22483118 .
- ↑ Torarinsson E, Sawera M, Havgaard JH, Fredholm M, Gorodkin J (2006). "Miles de regiones genómicas correspondientes de humanos y ratones que no se pueden alinear en la secuencia primaria contienen una estructura de ARN común" . Genome Res . 16 (7): 885–9 . doi : 10.1101/gr.5226606 . PMC 1484455. PMID 16751343 .
- ↑ Hoksza D, Svozil D (2012). "Comparación eficiente de la estructura por pares de ARN mediante el método SETTER" . Bioinformatics . 28 (14): 1858–1864 . doi : 10.1093/bioinformatics/bts301 . PMID 22611129 .
- ↑ Cech P, Svozil D, Hoksza D (2012). "SETTER: servidor web para la comparación de la estructura del ARN" . Nucleic Acids Research . 40 (W1): W42– W48. doi : 10.1093/nar/gks560 . PMC 3394248. PMID 22693209 .
- ↑ Havgaard JH, Lyngso RB, Stormo GD, Gorodkin J (2005). "Alineamiento estructural local por pares de secuencias de ARN con similitud de secuencia inferior al 40 %" . Bioinformatics . 21 (9): 1815–24 . doi : 10.1093/bioinformatics/bti279 . PMID 15657094 .
- ↑ Mathews DH, Turner DH (2006). "Predicción de la estructura secundaria del ARN mediante la minimización de la energía libre". Curr Opin Struct Biol . 16 (3): 270–8 . doi : 10.1016/j.sbi.2006.05.010 . PMID 16713706 .
Lecturas adicionales
- Bourne PE, Shindyalov IN. (2003): Comparación y alineación de estructuras . En: Bourne, PE, Weissig, H. (Eds): Bioinformática estructural . Hoboken NJ: Wiley-Liss. ISBN 0-471-20200-2
- Yuan X, Bystroff C. (2004) "Alineaciones no secuenciales basadas en la estructura revelan arreglos de empaquetamiento central independientes de la topología en proteínas", Bioinformatics . 5 de noviembre de 2004
- Jung J, Lee B (2000). "Alineación de la estructura de proteínas mediante perfiles ambientales" . Protein Eng . 13 (8): 535– 543. doi : 10.1093/protein/13.8.535 . PMID 10964982 .
- Ye Y, Godzik A (2005). "Alineación de estructuras flexibles múltiples mediante grafos de orden parcial" . Bioinformatics . 21 (10): 2362– 2369. doi : 10.1093/bioinformatics/bti353 . PMID 15746292 .
- Sippl M, Wiederstein M (2008). "Una nota sobre problemas difíciles de alineación de estructuras" . Bioinformatics . 24 (3): 426– 427. doi : 10.1093/bioinformatics/btm622 . PMID 18174182 .
- Métodos de proteínas
- problemas NP-completos