
La predicción de la estructura de las proteínas consiste en inferir la estructura tridimensional de una proteína a partir de su secuencia de aminoácidos ; es decir, predecir su estructura secundaria y terciaria a partir de su estructura primaria . La predicción de la estructura es diferente del problema inverso del diseño de proteínas .
La predicción de la estructura de las proteínas es uno de los objetivos más importantes de la biología computacional y aborda la paradoja de Levinthal . La predicción precisa de la estructura tiene importantes aplicaciones en medicina (por ejemplo, en el diseño de fármacos ) y biotecnología (por ejemplo, en el diseño de nuevas enzimas ).
Desde 1994, el rendimiento de los métodos actuales se evalúa cada dos años en el experimento de Evaluación Crítica de la Predicción de Estructuras ( CASP ). El proyecto comunitario Evaluación Automatizada Continua de Modelos ( CAMEO3D ) realiza una evaluación continua de los servidores web de predicción de estructuras de proteínas .
Estructura y terminología de las proteínas
Las proteínas son cadenas de aminoácidos unidas por enlaces peptídicos . Esta cadena puede adoptar numerosas conformaciones debido a la rotación de la cadena principal alrededor de los dos ángulos de torsión φ y ψ en el átomo de carbono alfa. Esta flexibilidad conformacional es la responsable de las diferencias en la estructura tridimensional de las proteínas.

Los enlaces peptídicos en la cadena son polares, es decir, tienen cargas positivas y negativas separadas (cargas parciales) en el grupo carbonilo , que puede actuar como aceptor de enlaces de hidrógeno, y en el grupo NH, que puede actuar como donador de enlaces de hidrógeno. Por lo tanto, estos grupos pueden interactuar en la estructura de la proteína. Las proteínas están compuestas principalmente por 20 tipos diferentes de L-α-aminoácidos (los aminoácidos proteinogénicos ). Estos se pueden clasificar según la química de la cadena lateral, que también desempeña un papel estructural importante. La glicina ocupa una posición especial, ya que tiene la cadena lateral más pequeña, con solo un átomo de hidrógeno, y por lo tanto puede aumentar la flexibilidad local en la estructura de la proteína. La cisteína, en cambio, puede reaccionar con otro residuo de cisteína para formar una cistina y, de este modo, formar un enlace cruzado que estabiliza toda la estructura.
La estructura de las proteínas surge de una secuencia de elementos de estructura secundaria, como las hélices α y las láminas β . En las estructuras secundarias, se forman patrones regulares de enlaces de hidrógeno entre los grupos NH y CO de la cadena principal de aminoácidos espacialmente vecinos, y los aminoácidos tienen ángulos Φ y ψ similares . [ 1 ]

La formación de estas estructuras secundarias satisface eficazmente la capacidad de los enlaces peptídicos para formar enlaces de hidrógeno. Estas estructuras secundarias pueden estar compactadas en el núcleo de la proteína, en un entorno hidrofóbico, pero también pueden estar presentes en una superficie polar de la proteína. Cada cadena lateral de aminoácido tiene un volumen limitado que ocupar y un número limitado de posibles interacciones con otras cadenas laterales cercanas, una situación que debe tenerse en cuenta en el modelado molecular y los alineamientos. [ 2 ] [ 3 ]
hélice α

La hélice α es el tipo de estructura secundaria más abundante en las proteínas. Cada vuelta de la hélice α consta de 3,6 aminoácidos, con un enlace de hidrógeno entre cada cuatro residuos. Su longitud promedio es de 10 aminoácidos (3 vueltas) o 10 Å , pero varía de 5 a 40 (de 1,5 a 11 vueltas). La alineación de los enlaces de hidrógeno genera un momento dipolar en la hélice, con una carga parcial positiva resultante en el extremo amino. Debido a que esta región posee grupos NH₂ libres , interactúa con grupos cargados negativamente, como los fosfatos. La ubicación más común de las hélices α es en la superficie de los núcleos proteicos, donde proporcionan una interfaz con el medio acuoso. El lado interno de la hélice tiende a tener aminoácidos hidrofóbicos, mientras que el lado externo presenta aminoácidos hidrofílicos. Por lo tanto, cada tercio de los cuatro aminoácidos a lo largo de la cadena tiende a ser hidrofóbico, un patrón que se puede detectar con bastante facilidad. En el motivo de cremallera de leucina, un patrón repetitivo de leucinas en los lados enfrentados de dos hélices adyacentes es altamente predictivo del motivo. Un diagrama de rueda helicoidal puede usarse para mostrar este patrón repetido. Otras α-hélices enterradas en el núcleo de la proteína o en las membranas celulares tienen una distribución más alta y regular de aminoácidos hidrofóbicos, y son altamente predictivas de tales estructuras. Las hélices expuestas en la superficie tienen una menor proporción de aminoácidos hidrofóbicos. El contenido de aminoácidos puede ser predictivo de una región α-helicoidal. Las regiones más ricas en alanina (A), ácido glutámico (E), leucina (L) y metionina (M) y más pobres en prolina (P), glicina (G), tirosina (Y) y serina (S) tienden a formar una α-hélice. La prolina desestabiliza o rompe una α-hélice pero puede estar presente en hélices más largas, formando una curvatura.
lámina β
Las láminas β se forman mediante enlaces de hidrógeno entre un promedio de 5 a 10 aminoácidos consecutivos en una porción de la cadena y otros 5 a 10 más abajo. Las regiones de interacción pueden ser adyacentes, con un pequeño bucle entre ellas, o distantes, con otras estructuras intercaladas. Cada cadena puede discurrir en la misma dirección para formar una lámina paralela, o en la dirección opuesta para formar una lámina antiparalela, o bien pueden formar una lámina mixta. El patrón de enlaces de hidrógeno difiere en las configuraciones paralelas y antiparalelas. Cada aminoácido en las hebras internas de la lámina forma dos enlaces de hidrógeno con aminoácidos vecinos, mientras que cada aminoácido en las hebras externas forma solo un enlace con una hebra interna. Si se observa la lámina perpendicularmente a las hebras, las hebras más distantes giran ligeramente en sentido antihorario, formando una torsión levógira. Los átomos Cα se alternan por encima y por debajo de la lámina en una estructura plegada, y los grupos laterales R de los aminoácidos se alternan por encima y por debajo de los pliegues. Los ángulos Φ y Ψ de los aminoácidos en las láminas varían considerablemente en una región del diagrama de Ramachandran . Resulta más difícil predecir la ubicación de las láminas β que la de las hélices α. La situación mejora ligeramente al considerar la variación de aminoácidos en los alineamientos de secuencias múltiples.
Deltas
Partes de la proteína pueden tener una estructura tridimensional fija sin estructuras regulares. No deben confundirse con segmentos desordenados o desplegados de proteínas ni con la estructura aleatoria , una cadena polipeptídica desplegada que carece de una estructura tridimensional fija. Estas partes se denominan frecuentemente " deltas " ( Δ ) porque conectan láminas β y hélices α. Los deltas suelen estar ubicados en la superficie de la proteína, por lo que las mutaciones de sus residuos se toleran con mayor facilidad. Un mayor número de sustituciones, inserciones y deleciones en una región determinada de una alineación de secuencias puede indicar la presencia de algún delta. La posición de los intrones en el ADN genómico puede correlacionarse con la ubicación de los bucles en la proteína codificada . Los deltas también tienden a tener aminoácidos cargados y polares, y con frecuencia forman parte de los sitios activos.
Clasificación de proteínas
Las proteínas pueden clasificarse según su similitud estructural y secuencial. Para la clasificación estructural, se comparan los tamaños y la disposición espacial de las estructuras secundarias descritas en el párrafo anterior en estructuras tridimensionales conocidas. Históricamente, la clasificación basada en la similitud de secuencia fue la primera en utilizarse. Inicialmente, se realizó una comparación de similitud basada en alineaciones de secuencias completas. Posteriormente, las proteínas se clasificaron según la presencia de patrones de aminoácidos conservados. Existen bases de datos que clasifican las proteínas mediante uno o más de estos esquemas. Al considerar los esquemas de clasificación de proteínas, es importante tener en cuenta varias observaciones. En primer lugar, dos secuencias de proteínas completamente diferentes, de distintos orígenes evolutivos, pueden plegarse en una estructura similar. Por el contrario, la secuencia de un gen antiguo para una estructura dada puede haber divergido considerablemente en diferentes especies, manteniendo al mismo tiempo las mismas características estructurales básicas. Reconocer cualquier similitud de secuencia restante en tales casos puede ser una tarea muy difícil. En segundo lugar, dos proteínas que comparten un grado significativo de similitud de secuencia, ya sea entre sí o con una tercera secuencia, también comparten un origen evolutivo y deberían compartir algunas características estructurales. Sin embargo, la duplicación de genes y los reordenamientos genéticos durante la evolución pueden dar lugar a nuevas copias de genes, que luego pueden evolucionar en proteínas con nueva función y estructura. [ 2 ]
Términos utilizados para clasificar estructuras y secuencias de proteínas.
A continuación se enumeran los términos más comunes para describir las relaciones evolutivas y estructurales entre proteínas. Existen muchos otros términos que se utilizan para referirse a diversos tipos de características estructurales presentes en las proteínas. Puede encontrar descripciones de estos términos en el sitio web de CATH, en el sitio web de la Clasificación Estructural de Proteínas (SCOP) y en un tutorial de Glaxo Wellcome en el sitio web suizo de bioinformática Expasy.
- Sitio activo
- Una combinación localizada de grupos laterales de aminoácidos dentro de la estructura terciaria (tridimensional) o cuaternaria (subunidad proteica) que puede interactuar con un sustrato químicamente específico y que confiere a la proteína actividad biológica. Proteínas con secuencias de aminoácidos muy diferentes pueden plegarse en una estructura que produce el mismo sitio activo.
- Arquitectura
- es la orientación relativa de las estructuras secundarias en una estructura tridimensional sin tener en cuenta si comparten o no una estructura de bucle similar.
- Plegado (topología)
- un tipo de arquitectura que también posee una estructura de bucle conservada.
- Bloques
- Se trata de un patrón de secuencia de aminoácidos conservado en una familia de proteínas. Este patrón incluye una serie de coincidencias posibles en cada posición de las secuencias representadas, pero no contiene posiciones insertadas ni eliminadas. En contraste, los perfiles de secuencia son un tipo de matriz de puntuación que representa un conjunto similar de patrones, incluyendo inserciones y eliminaciones.
- Clase
- Término utilizado para clasificar dominios proteicos según su contenido y organización estructural secundaria. Levitt y Chothia (1976) reconocieron originalmente cuatro clases , y posteriormente se añadieron varias más a la base de datos SCOP. La base de datos CATH incluye tres clases: principalmente α, principalmente β y α–β, donde la clase α–β abarca estructuras α/β alternantes y α+β.
- Centro
- La porción de una molécula proteica plegada que comprende el interior hidrofóbico de las hélices α y las láminas β. La estructura compacta agrupa los grupos laterales de aminoácidos lo suficientemente cerca como para que puedan interactuar. Al comparar estructuras proteicas, como en la base de datos SCOP, el núcleo es la región común a la mayoría de las estructuras que comparten un plegamiento común o que pertenecen a la misma superfamilia. En la predicción de estructuras, el núcleo se define a veces como la disposición de estructuras secundarias que probablemente se conserve durante el cambio evolutivo.
- Dominio (contexto de secuencia)
- Un segmento de una cadena polipeptídica puede plegarse en una estructura tridimensional independientemente de la presencia de otros segmentos de la cadena. Los distintos dominios de una proteína pueden interactuar extensamente o estar unidos únicamente por un segmento de la cadena polipeptídica. Una proteína con varios dominios puede utilizarlos para interactuar funcionalmente con diferentes moléculas.
- Familia (contexto de secuencia)
- Un grupo de proteínas con funciones bioquímicas similares que presentan más del 50 % de identidad al alinearse. Este mismo umbral lo sigue utilizando el Protein Information Resource (PIR). Una familia de proteínas comprende proteínas con la misma función en diferentes organismos (secuencias ortólogas), pero también puede incluir proteínas del mismo organismo (secuencias parálogas) derivadas de la duplicación y reordenamiento de genes. Si un alineamiento múltiple de secuencias de una familia de proteínas revela un nivel común de similitud a lo largo de toda la longitud de las proteínas, el PIR la denomina familia homeomórfica. La región alineada se denomina dominio homeomórfico, y esta región puede comprender varios dominios de homología más pequeños que se comparten con otras familias. Las familias pueden subdividirse en subfamilias o agruparse en superfamilias según sus respectivos niveles de similitud de secuencia. La base de datos SCOP registra 1296 familias y la base de datos CATH (versión 1.7 beta), 1846 familias.
- Al examinar con mayor detalle las secuencias de proteínas con la misma función, se observa que algunas comparten una alta similitud de secuencia. Según los criterios mencionados, pertenecen claramente a la misma familia. Sin embargo, otras presentan una similitud de secuencia muy baja, o incluso insignificante, con otros miembros de la familia. En estos casos, la relación familiar entre dos miembros distantes, A y C, a menudo se puede demostrar encontrando un miembro adicional, B, que comparte una similitud significativa con ambos. De esta forma, B establece un vínculo entre A y C. Otro enfoque consiste en examinar alineaciones distantes en busca de coincidencias altamente conservadas.
- Con un grado de identidad del 50%, es probable que las proteínas tengan la misma estructura tridimensional, y los átomos idénticos en el alineamiento de secuencias se superpondrán aproximadamente a 1 Å en el modelo estructural. Por lo tanto, si se conoce la estructura de un miembro de una familia, se puede realizar una predicción fiable para un segundo miembro de la misma familia, y cuanto mayor sea el grado de identidad, más fiable será la predicción. El modelado estructural de proteínas se puede realizar examinando qué tan bien se ajustan las sustituciones de aminoácidos al núcleo de la estructura tridimensional.
- Familia (contexto estructural)
- tal como se utiliza en la base de datos FSSP ( Familias de proteínas estructuralmente similares ) y en el sitio web DALI/FSSP, dos estructuras que tienen un nivel significativo de similitud estructural pero no necesariamente una similitud de secuencia significativa.
- Doblar
- De forma similar a un motivo estructural, incluye una combinación más amplia de unidades estructurales secundarias en la misma configuración. Por lo tanto, las proteínas que comparten el mismo plegamiento tienen la misma combinación de estructuras secundarias conectadas por bucles similares. Un ejemplo es el plegamiento de Rossmann, que comprende varias hélices α alternadas y hebras β paralelas. En las bases de datos SCOP, CATH y FSSP, las estructuras proteicas conocidas se han clasificado en niveles jerárquicos de complejidad estructural, siendo el plegamiento un nivel básico de clasificación.
- Dominio homólogo (contexto de secuencia)
- Un patrón de secuencia extendido, generalmente detectado mediante métodos de alineación de secuencias, indica un origen evolutivo común entre las secuencias alineadas. Un dominio de homología suele ser más largo que los motivos. El dominio puede abarcar toda una secuencia de proteína o solo una parte de ella. Algunos dominios son complejos y están formados por varios dominios de homología más pequeños que se unieron para formar uno mayor durante la evolución. Un dominio que abarca toda una secuencia se denomina dominio homeomórfico según PIR ( Protein Information Resource ).
- Módulo
- Una región de patrones de aminoácidos conservados que comprende uno o más motivos y se considera una unidad fundamental de estructura o función. La presencia de un módulo también se ha utilizado para clasificar las proteínas en familias.
- Motivo (contexto de secuencia)
- Un patrón conservado de aminoácidos se encuentra en dos o más proteínas. En el catálogo Prosite , un motivo es un patrón de aminoácidos presente en un grupo de proteínas con actividad bioquímica similar, y que suele estar cerca del sitio activo de la proteína. Ejemplos de bases de datos de motivos de secuencia son el catálogo Prosite y la base de datos de motivos de Stanford. [ 4 ]
- Motivo (contexto estructural)
- Una combinación de varios elementos estructurales secundarios se produce por el plegamiento de secciones adyacentes de la cadena polipeptídica en una configuración tridimensional específica. Un ejemplo es el motivo hélice-bucle-hélice. Los motivos estructurales también se conocen como superestructuras secundarias y pliegues.
- Matriz de puntuación específica de la posición (contexto de secuencia, también conocida como matriz de ponderación o de puntuación)
- representa una región conservada en un alineamiento de secuencias múltiples sin huecos. Cada columna de la matriz representa la variación encontrada en una columna del alineamiento de secuencias múltiples.
- Matriz de puntuación específica de la posición —3D (contexto estructural)
- Representa la variación de aminoácidos encontrada en una alineación de proteínas que pertenecen a la misma clase estructural. Las columnas de la matriz representan la variación de aminoácidos encontrada en una posición específica de aminoácidos en las estructuras alineadas.
- Estructura primaria
- la secuencia lineal de aminoácidos de una proteína, que químicamente es una cadena polipeptídica compuesta por aminoácidos unidos por enlaces peptídicos.
- Perfil (contexto de secuencia)
- Una matriz de puntuación que representa un alineamiento múltiple de secuencias de una familia de proteínas. El perfil se obtiene generalmente de una región bien conservada en un alineamiento múltiple de secuencias. El perfil tiene la forma de una matriz donde cada columna representa una posición en el alineamiento y cada fila uno de los aminoácidos. Los valores de la matriz indican la probabilidad de cada aminoácido en la posición correspondiente del alineamiento. El perfil se desplaza a lo largo de la secuencia objetivo para localizar las regiones con mejor puntuación mediante un algoritmo de programación dinámica. Se permiten huecos durante la coincidencia y, en este caso, se incluye una penalización por hueco como puntuación negativa cuando no se encuentra ningún aminoácido coincidente. Un perfil de secuencia también puede representarse mediante un modelo oculto de Markov , denominado HMM de perfil.
- Perfil (contexto estructural)
- Una matriz de puntuación que representa qué aminoácidos deberían encajar bien y cuáles mal en posiciones secuenciales de una estructura proteica conocida. Las columnas del perfil representan las posiciones secuenciales en la estructura, y las filas representan los 20 aminoácidos. Al igual que con un perfil de secuencia, el perfil estructural se desplaza a lo largo de una secuencia objetivo para encontrar la puntuación de alineación más alta posible mediante un algoritmo de programación dinámica. Se pueden incluir huecos, los cuales reciben una penalización. La puntuación resultante indica si la proteína objetivo podría adoptar dicha estructura.
- Estructura cuaternaria
- la configuración tridimensional de una molécula de proteína que comprende varias cadenas polipeptídicas independientes.
- Estructura secundaria
- las interacciones que se producen entre los grupos C, O y NH de los aminoácidos en una cadena polipeptídica para formar hélices α, láminas β, giros, bucles y otras formas, y que facilitan el plegamiento en una estructura tridimensional.
- Superfamilia
- Un grupo de familias de proteínas de longitudes iguales o diferentes que están relacionadas por una similitud de secuencia distante pero detectable. Los miembros de una superfamilia dada tienen, por lo tanto, un origen evolutivo común. Originalmente, Dayhoff definió el umbral para el estado de superfamilia como la probabilidad de que las secuencias no estén relacionadas de 10⁶, basándose en una puntuación de alineación (Dayhoff et al. 1978). Las proteínas con pocas identidades en una alineación de las secuencias, pero con un número convincentemente común de características estructurales y funcionales, se colocan en la misma superfamilia. A nivel de estructura tridimensional, las proteínas de superfamilia compartirán características estructurales comunes, como un plegamiento común, pero también puede haber diferencias en el número y la disposición de las estructuras secundarias. El recurso PIR utiliza el término superfamilias homeomórficas para referirse a superfamilias que están compuestas por secuencias que se pueden alinear de extremo a extremo, lo que representa que comparten un único dominio de homología de secuencia, una región de similitud que se extiende a lo largo de la alineación. Este dominio también puede comprender dominios de homología más pequeños que se comparten con otras familias y superfamilias de proteínas. Si bien una secuencia de proteína dada puede contener dominios presentes en varias superfamilias, lo que indica una historia evolutiva compleja, las secuencias se asignarán a una sola superfamilia homeomórfica según la presencia de similitud a lo largo de un alineamiento múltiple de secuencias. El alineamiento de superfamilias también puede incluir regiones que no se alinean ni dentro ni en los extremos del alineamiento. Por el contrario, las secuencias de la misma familia se alinean correctamente a lo largo de todo el alineamiento.
- Estructura supersecundaria
- un término con un significado similar a un motivo estructural. La estructura terciaria es la estructura tridimensional o globular formada por el empaquetamiento o plegamiento de las estructuras secundarias de una cadena polipeptídica. [ 2 ]
Estructura secundaria
La predicción de la estructura secundaria es un conjunto de técnicas bioinformáticas que buscan predecir las estructuras secundarias locales de las proteínas basándose únicamente en el conocimiento de su secuencia de aminoácidos . Para las proteínas, una predicción consiste en asignar regiones de la secuencia de aminoácidos como posibles hélices alfa , láminas beta (a menudo denominadas conformaciones extendidas ) o giros . El éxito de una predicción se determina comparándola con los resultados del algoritmo DSSP (o similar, por ejemplo, STRIDE ) aplicado a la estructura cristalina de la proteína. Se han desarrollado algoritmos especializados para la detección de patrones específicos bien definidos, como hélices transmembrana y estructuras de hélice enrollada en proteínas. [ 2 ]
Se afirmó que los mejores métodos modernos de predicción de la estructura secundaria en proteínas alcanzan una precisión del 80 % después de usar aprendizaje automático y alineamientos de secuencias ; [ 5 ] esta alta precisión permite usar las predicciones como características que mejoran el reconocimiento de plegamiento y la predicción de la estructura de proteínas ab initio , la clasificación de motivos estructurales y el refinamiento de alineamientos de secuencias . La precisión de los métodos actuales de predicción de la estructura secundaria de proteínas se evalúa en pruebas comparativas semanales como LiveBench y EVA .
Fondo
Los primeros métodos de predicción de la estructura secundaria, introducidos en las décadas de 1960 y principios de 1970, [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] se centraron en identificar hélices alfa probables y se basaron principalmente en modelos de transición hélice-bobina . [ 11 ] En la década de 1970 se introdujeron predicciones significativamente más precisas que incluían láminas beta y se basaron en evaluaciones estadísticas basadas en parámetros de probabilidad derivados de estructuras resueltas conocidas. Estos métodos, aplicados a una sola secuencia, suelen tener como máximo una precisión de alrededor del 60-65%, y a menudo subestiman las láminas beta. [ 2 ] Desde la década de 1980, se han aplicado redes neuronales artificiales a la predicción de estructuras de proteínas. [ 12 ] [ 13 ] La conservación evolutiva de las estructuras secundarias puede explotarse evaluando simultáneamente muchas secuencias homólogas en un alineamiento de secuencias múltiples , calculando la propensión neta a la estructura secundaria de una columna alineada de aminoácidos. En combinación con bases de datos más grandes de estructuras de proteínas conocidas y métodos modernos de aprendizaje automático como redes neuronales y máquinas de vectores de soporte , estos métodos pueden alcanzar hasta un 80 % de precisión general en proteínas globulares . [ 14 ] El límite superior teórico de precisión es alrededor del 90 %, [ 14 ] debido en parte a idiosincrasias en la asignación de DSSP cerca de los extremos de las estructuras secundarias, donde las conformaciones locales varían en condiciones nativas pero pueden verse obligadas a asumir una única conformación en cristales debido a restricciones de empaquetamiento. Además, los métodos típicos de predicción de estructura secundaria no tienen en cuenta la influencia de la estructura terciaria en la formación de la estructura secundaria; por ejemplo, una secuencia predicha como una hélice probable aún puede adoptar una conformación de hebra beta si se encuentra dentro de una región de lámina beta de la proteína y sus cadenas laterales se empaquetan bien con sus vecinas. Los cambios conformacionales drásticos relacionados con la función o el entorno de la proteína también pueden alterar la estructura secundaria local.
Perspectiva histórica
Hasta la fecha, se han desarrollado más de 20 métodos diferentes de predicción de la estructura secundaria. Uno de los primeros algoritmos fue el método de Chou-Fasman , que se basa principalmente en parámetros de probabilidad determinados a partir de las frecuencias relativas de aparición de cada aminoácido en cada tipo de estructura secundaria. [ 15 ] Los parámetros originales de Chou-Fasman, determinados a partir de la pequeña muestra de estructuras resueltas a mediados de la década de 1970, producen resultados deficientes en comparación con los métodos modernos, aunque la parametrización se ha actualizado desde su primera publicación. El método de Chou-Fasman tiene una precisión aproximada del 50-60% en la predicción de estructuras secundarias. [ 2 ]
El siguiente programa notable fue el método GOR , un método basado en la teoría de la información . Utiliza la técnica probabilística más potente de la inferencia bayesiana . [ 16 ] El método GOR tiene en cuenta no solo la probabilidad de que cada aminoácido tenga una estructura secundaria particular, sino también la probabilidad condicional de que el aminoácido asuma cada estructura dadas las contribuciones de sus vecinos (no asume que los vecinos tengan la misma estructura). El enfoque es más sensible y más preciso que el de Chou y Fasman porque las propensiones estructurales de los aminoácidos solo son fuertes para un pequeño número de aminoácidos, como la prolina y la glicina . Las contribuciones débiles de cada uno de muchos vecinos pueden acumularse para producir efectos fuertes en general. El método GOR original tenía una precisión aproximada del 65 % y es mucho más exitoso en la predicción de hélices alfa que de láminas beta, que frecuentemente predecía erróneamente como bucles o regiones desorganizadas. [ 2 ]
Otro gran avance fue el uso de métodos de aprendizaje automático . Primero se utilizaron métodos de redes neuronales artificiales . Como conjuntos de entrenamiento, utilizan estructuras resueltas para identificar motivos de secuencia comunes asociados con disposiciones particulares de estructuras secundarias. Estos métodos tienen una precisión superior al 70 % en sus predicciones, aunque las hebras beta todavía se subestiman con frecuencia debido a la falta de información estructural tridimensional que permitiría evaluar los patrones de enlaces de hidrógeno que pueden promover la formación de la conformación extendida requerida para la presencia de una lámina beta completa. [ 2 ] PSIPRED y JPRED son algunos de los programas más conocidos basados en redes neuronales para la predicción de la estructura secundaria de proteínas. A continuación, las máquinas de vectores de soporte han demostrado ser particularmente útiles para predecir las ubicaciones de los giros , que son difíciles de identificar con métodos estadísticos. [ 17 ] [ 18 ]
Las extensiones de las técnicas de aprendizaje automático intentan predecir propiedades locales más detalladas de las proteínas, como los ángulos diedros del esqueleto en regiones no asignadas. Tanto las máquinas de vectores de soporte (SVM) [ 19 ] como las redes neuronales [ 20 ] se han aplicado a este problema. [ 17 ] Más recientemente, los ángulos de torsión de valor real pueden predecirse con precisión mediante SPINE-X y se han empleado con éxito para la predicción de estructuras ab initio. [ 21 ]
Otras mejoras
Se ha informado que, además de la secuencia de proteínas, la formación de la estructura secundaria depende de otros factores. Por ejemplo, se ha informado que las tendencias de la estructura secundaria también dependen del entorno local, [ 22 ] la accesibilidad al solvente de los residuos, [ 23 ] la clase estructural de la proteína, [ 24 ] e incluso el organismo del que se obtienen las proteínas. [ 25 ] Con base en estas observaciones, algunos estudios han demostrado que la predicción de la estructura secundaria puede mejorarse mediante la adición de información sobre la clase estructural de la proteína, [ 26 ] el área de superficie accesible de los residuos [ 27 ] [ 28 ] y también información sobre el número de contactos . [ 29 ]
Estructura terciaria
El papel práctico de la predicción de la estructura de las proteínas es ahora más importante que nunca. [ 30 ] Los modernos proyectos de secuenciación de ADN a gran escala , como el Proyecto Genoma Humano , generan enormes cantidades de datos de secuencias de proteínas . A pesar de los esfuerzos de toda la comunidad en genómica estructural , la producción de estructuras de proteínas determinadas experimentalmente —normalmente mediante cristalografía de rayos X o espectroscopia de RMN , que son procesos largos y relativamente costosos— está muy por detrás de la producción de secuencias de proteínas.
La predicción de la estructura de las proteínas sigue siendo una tarea extremadamente difícil y sin resolver. Los dos problemas principales son el cálculo de la energía libre de la proteína y la búsqueda del mínimo global de esta energía. Un método de predicción de la estructura de las proteínas debe explorar el espacio de posibles estructuras proteicas, que es astronómicamente grande . Estos problemas pueden sortearse parcialmente en los métodos de modelado comparativo o por homología y de reconocimiento de plegamiento , en los que el espacio de búsqueda se reduce asumiendo que la proteína en cuestión adopta una estructura cercana a la estructura determinada experimentalmente de otra proteína homóloga. En cambio, los métodos de predicción de la estructura de proteínas de novo deben resolver explícitamente estos problemas. Zhang ha revisado los avances y desafíos en la predicción de la estructura de las proteínas. [ 31 ]
Antes de modelar
La mayoría de los métodos de modelado de estructura terciaria, como Rosetta, están optimizados para modelar la estructura terciaria de dominios proteicos individuales. Generalmente, primero se realiza un paso llamado análisis de dominios o predicción de límites de dominio para dividir una proteína en dominios estructurales potenciales. Al igual que con el resto de la predicción de la estructura terciaria, esto puede hacerse comparativamente a partir de estructuras conocidas [ 32 ] o ab initio con solo la secuencia (generalmente mediante aprendizaje automático , asistido por covariación). [ 33 ] Las estructuras de los dominios individuales se acoplan en un proceso llamado ensamblaje de dominios para formar la estructura terciaria final. [ 34 ] [ 35 ]
modelado de proteínas ab initio
Métodos basados en energía y fragmentos
Los métodos de modelado de proteínas ab initio (o de novo ) buscan construir modelos tridimensionales de proteínas "desde cero", es decir, basándose en principios físicos en lugar de (directamente) en estructuras previamente resueltas. Existen muchos procedimientos posibles que intentan imitar el plegamiento de proteínas o aplican algún método estocástico para buscar posibles soluciones (es decir, optimización global de una función de energía adecuada). Estos procedimientos suelen requerir enormes recursos computacionales y, por lo tanto, solo se han llevado a cabo para proteínas pequeñas. Para predecir la estructura de proteínas de novo para proteínas más grandes se requerirán mejores algoritmos y mayores recursos computacionales, como los que ofrecen las supercomputadoras potentes (como Blue Gene o MDGRAPE-3 ) o la computación distribuida (como Folding@home , el Proyecto de Plegado del Proteoma Humano y Rosetta@Home ). Aunque estas barreras computacionales son enormes, los beneficios potenciales de la genómica estructural (mediante métodos predictivos o experimentales) hacen de la predicción de estructuras ab initio un campo de investigación activo. [ 31 ]
En 2009, una proteína de 50 residuos podía simularse átomo por átomo en una supercomputadora durante 1 milisegundo. [ 36 ] En 2012, se podía realizar un muestreo de estado estable comparable en una computadora de escritorio estándar con una nueva tarjeta gráfica y algoritmos más sofisticados. [ 37 ] Se pueden lograr escalas de tiempo de simulación mucho mayores utilizando modelos de grano grueso . [ 38 ] [ 39 ]
Covariación evolutiva para predecir contactos 3D
A medida que la secuenciación se generalizó en la década de 1990, varios grupos utilizaron alineaciones de secuencias de proteínas para predecir mutaciones correlacionadas , con la esperanza de que estos residuos coevolucionados pudieran usarse para predecir la estructura terciaria (utilizando la analogía con las restricciones de distancia de procedimientos experimentales como la RMN ). Se asume que cuando las mutaciones de un solo residuo son ligeramente perjudiciales, pueden ocurrir mutaciones compensatorias para reestabilizar las interacciones residuo-residuo. Este trabajo inicial utilizó lo que se conoce como métodos locales para calcular mutaciones correlacionadas a partir de secuencias de proteínas, pero adolecía de correlaciones falsas indirectas que resultan de tratar cada par de residuos como independiente de todos los demás pares. [ 40 ] [ 41 ] [ 42 ]
In 2011, a different, and this time global statistical approach, demonstrated that predicted coevolved residues were sufficient to predict the 3D fold of a protein, providing there are enough sequences available (>1,000 homologous sequences are needed).[43] The method, EVfold, uses no homology modeling, threading or 3D structure fragments and can be run on a standard personal computer even for proteins with hundreds of residues. The accuracy of the contacts predicted using this and related approaches has now been demonstrated on many known structures and contact maps,[44][45][46] including the prediction of experimentally unsolved transmembrane proteins.[47]
Comparative protein modeling
Comparative protein modeling uses previously solved structures as starting points, or templates. This is effective because it appears that although the number of actual proteins is vast, there is a limited set of tertiarystructural motifs to which most proteins belong. It has been suggested that there are only around 2,000 distinct protein folds in nature, though there are many millions of different proteins. The comparative protein modeling can combine with the evolutionary covariation in the structure prediction.[48]
These methods may also be split into two groups:[31]
- Homology modeling is based on the reasonable assumption that two homologous proteins will share very similar structures. Because a protein's fold is more evolutionarily conserved than its amino acid sequence, a target sequence can be modeled with reasonable accuracy on a very distantly related template, provided that the relationship between target and template can be discerned through sequence alignment. It has been suggested that the primary bottleneck in comparative modelling arises from difficulties in alignment rather than from errors in structure prediction given a known-good alignment.[49] Unsurprisingly, homology modelling is most accurate when the target and template have similar sequences.
- El método de alineación de secuencias de proteínas [ 50 ] compara la secuencia de aminoácidos de una estructura desconocida con una base de datos de estructuras resueltas. En cada caso, se utiliza una función de puntuación para evaluar la compatibilidad de la secuencia con la estructura, lo que permite obtener posibles modelos tridimensionales. Este método también se conoce como reconocimiento de plegamiento 3D-1D debido a su análisis de compatibilidad entre estructuras tridimensionales y secuencias lineales de proteínas. Asimismo, ha dado lugar a métodos que realizan una búsqueda de plegamiento inverso, evaluando la compatibilidad de una estructura dada con una amplia base de datos de secuencias y prediciendo así qué secuencias tienen el potencial de producir un plegamiento determinado.
Modelado de conformaciones de cadenas laterales
El empaquetamiento preciso de las cadenas laterales de aminoácidos representa un problema independiente en la predicción de la estructura de las proteínas. Entre los métodos que abordan específicamente la predicción de la geometría de las cadenas laterales se incluyen la eliminación de extremos y los métodos de campo medio autoconsistente . Las conformaciones de las cadenas laterales con baja energía se determinan generalmente sobre el esqueleto rígido del polipéptido y mediante un conjunto de conformaciones discretas de las cadenas laterales, conocidas como rotámeros . Estos métodos buscan identificar el conjunto de rotámeros que minimiza la energía total del modelo.
Estos métodos utilizan bibliotecas de rotámeros, que son colecciones de conformaciones favorables para cada tipo de residuo en las proteínas. Las bibliotecas de rotámeros pueden contener información sobre la conformación, su frecuencia y las desviaciones estándar de los ángulos diedros medios, que pueden utilizarse en el muestreo. [ 51 ] Las bibliotecas de rotámeros se derivan de la bioinformática estructural u otro análisis estadístico de las conformaciones de las cadenas laterales en estructuras experimentales conocidas de proteínas, como por ejemplo, agrupando las conformaciones observadas para los carbonos tetraédricos cerca de los valores escalonados (60°, 180°, −60°).
Las bibliotecas de rotámeros pueden ser independientes de la estructura principal, dependientes de la estructura secundaria o dependientes de la estructura principal. Las bibliotecas de rotámeros independientes de la estructura principal no hacen referencia a la conformación de la estructura principal y se calculan a partir de todas las cadenas laterales disponibles de un tipo determinado (por ejemplo, el primer ejemplo de una biblioteca de rotámeros, realizado por Ponder y Richards en Yale en 1987). [ 52 ] Las bibliotecas dependientes de la estructura secundaria presentan diferentes ángulos diedros y/o frecuencias de rotámeros para-hélice,-estructuras secundarias de lámina o espiral. [ 53 ] Las bibliotecas de rotámeros dependientes del esqueleto presentan conformaciones y/o frecuencias que dependen de la conformación local del esqueleto definida por los ángulos diedros del esqueleto.y, independientemente de la estructura secundaria. [ 54 ]
Las versiones modernas de estas bibliotecas, tal como se utilizan en la mayoría del software, se presentan como distribuciones multidimensionales de probabilidad o frecuencia, donde los picos corresponden a las conformaciones de ángulo diedro consideradas como rotámeros individuales en las listas. Algunas versiones se basan en datos cuidadosamente seleccionados y se utilizan principalmente para la validación de estructuras, [ 55 ] mientras que otras enfatizan las frecuencias relativas en conjuntos de datos mucho más grandes y son la forma utilizada principalmente para la predicción de estructuras, como las bibliotecas de rotámeros de Dunbrack . [ 56 ]
Los métodos de empaquetamiento de cadenas laterales son más útiles para analizar el núcleo hidrofóbico de la proteína , donde las cadenas laterales están más compactas; tienen más dificultades para abordar las restricciones más laxas y la mayor flexibilidad de los residuos de superficie, que a menudo ocupan múltiples conformaciones de rotámeros en lugar de solo una. [ 57 ] [ 58 ]
Estructura cuaternaria
En el caso de complejos de dos o más proteínas , donde se conocen o pueden predecirse con alta precisión las estructuras proteicas, se pueden utilizar métodos de acoplamiento proteína-proteína para predecir la estructura del complejo. La información sobre el efecto de las mutaciones en sitios específicos sobre la afinidad del complejo ayuda a comprender su estructura y a orientar los métodos de acoplamiento.
Software
Existe una gran cantidad de herramientas de software para la predicción de la estructura de proteínas. Los enfoques incluyen el modelado por homología , el alineamiento de proteínas , los métodos ab initio , la predicción de la estructura secundaria y la predicción de hélices transmembrana y péptidos señal. En particular, el aprendizaje profundo basado en memoria a corto y largo plazo se ha utilizado para este propósito desde 2007, cuando se aplicó con éxito a la detección de homología de proteínas [ 59 ] y a la predicción de la localización subcelular de proteínas [ 60 ] . Algunos métodos recientes exitosos basados en los experimentos CASP incluyen I-TASSER , HHpred y AlphaFold . En 2021, se informó que AlphaFold tenía el mejor rendimiento [ 61 ] .
Conocer la estructura de una proteína a menudo permite predecir su función. Por ejemplo, el colágeno se pliega formando una larga cadena fibrosa, lo que lo convierte en una proteína fibrosa. Recientemente, se han desarrollado diversas técnicas para predecir el plegamiento de proteínas y, por lo tanto, su estructura, como Itasser y AlphaFold.
métodos de IA
AlphaFold fue una de las primeras IA en predecir estructuras de proteínas. Fue presentada por DeepMind de Google en la 13.ª competición CASP, celebrada en 2018. [ 61 ] AlphaFold se basa en un enfoque de red neuronal , que predice directamente las coordenadas 3D de todos los átomos que no son de hidrógeno para una proteína dada utilizando la secuencia de aminoácidos y secuencias homólogas alineadas . La red AlphaFold consta de un tronco que procesa las entradas a través de capas repetidas y un módulo de estructura que introduce una estructura 3D explícita. [ 61 ] Las redes neuronales anteriores para la predicción de la estructura de proteínas utilizaban LSTM . [ 59 ] [ 60 ]


Dado que AlphaFold genera directamente las coordenadas de las proteínas, produce predicciones en minutos de unidad de procesamiento gráfico (GPU) a horas de GPU, dependiendo de la longitud de la secuencia de proteínas. [ 61 ]
El Instituto Europeo de Bioinformática junto con DeepMind han construido la base de datos AlphaFold – EBI [ 62 ] para estructuras de proteínas predichas. [ 63 ]
Métodos de IA actuales y bases de datos de estructuras proteicas predichas
AlphaFold2 se introdujo en CASP14 y es capaz de predecir estructuras proteicas con una precisión casi experimental. [ 64 ] A AlphaFold le siguió rápidamente RoseTTAFold [ 65 ] y más tarde OmegaFold y el Atlas Metagenómico ESM. [ 66 ]
En un estudio, Sommer et al. 2022 demostraron la aplicación de la predicción de la estructura de proteínas en la anotación del genoma, específicamente en la identificación de isoformas de proteínas funcionales utilizando estructuras predichas computacionalmente, disponibles en https://www.isoform.io . [ 67 ] Este estudio resalta el potencial de la predicción de la estructura de proteínas como herramienta de anotación del genoma y presenta un enfoque práctico, guiado por la estructura, que puede utilizarse para mejorar la anotación de cualquier genoma.
En 2024, David Baker y Demis Hassabis (junto con John M. Jumper ) recibieron el Premio Nobel de Química [ 68 ] por sus contribuciones al modelado computacional de proteínas, incluido el desarrollo de AlphaFold2, un modelo basado en IA para la predicción de la estructura de proteínas. La precisión de AlphaFold2 se ha evaluado comparándola con estructuras de proteínas determinadas experimentalmente utilizando métricas como la desviación cuadrática media (RMSD). [ 69 ] La RMSD mediana entre diferentes estructuras experimentales de la misma proteína es aproximadamente 0,6 Å, mientras que la RMSD mediana entre las predicciones de AlphaFold2 y las estructuras experimentales es alrededor de 1 Å. Para las regiones donde AlphaFold2 asigna alta confianza, la RMSD mediana es alrededor de 0,6 Å, comparable a la variabilidad observada entre diferentes estructuras experimentales. Sin embargo, en regiones de baja confianza, la RMSD puede superar los 2 Å, lo que indica mayores desviaciones. En proteínas con múltiples dominios conectados por enlaces flexibles, AlphaFold2 predice con precisión las estructuras de dominios individuales, pero puede asignar posiciones relativas aleatorias a estos dominios. Además, AlphaFold2 no tiene en cuenta restricciones estructurales como el plano de la membrana, lo que a veces sitúa los dominios proteicos en posiciones que chocarían físicamente con la membrana. [ 70 ]
Evaluación de servidores de predicción automática de estructuras
CASP , acrónimo de Critical Assessment of Techniques for Protein Structure Prediction (Evaluación Crítica de Técnicas para la Predicción de la Estructura de Proteínas), es un experimento comunitario para la predicción de la estructura de proteínas que se lleva a cabo cada dos años desde 1994. CASP ofrece la oportunidad de evaluar la calidad de la metodología humana no automatizada disponible (categoría humana) y de los servidores automáticos para la predicción de la estructura de proteínas (categoría de servidores, introducida en CASP7). [ 71 ]
El servidor de evaluación continua automatizada de modelos CAMEO3D evalúa semanalmente los servidores automatizados de predicción de estructuras de proteínas mediante predicciones ciegas para las estructuras de proteínas recién publicadas. CAMEO publica los resultados en su sitio web.
Véase también
- Diseño de proteínas
- predicción de la función de las proteínas
- predicción de la interacción proteína-proteína
- Filogenia estructural de proteínas
- Predicción genética
- Software de predicción de la estructura de proteínas
- Predicción de la estructura de proteínas de novo
- Software de diseño molecular
- Software de modelado molecular
- Modelado de sistemas biológicos
- Bibliotecas de fragmentos
- Proteínas reticulares
- Potencial estadístico
- Atlas de la estructura del genoma humano
- Banco de datos de dicroísmo circular de proteínas
Referencias
- ↑ Iupac-Iub Comm. On Biochem. Nomenclature (1 de septiembre de 1970). "Comisión IUPAC-IUB sobre Nomenclatura Bioquímica. Abreviaturas y símbolos para la descripción de la conformación de cadenas polipeptídicas. Reglas tentativas (1969)". Biochemistry . 9 (18): 3471– 3479. doi : 10.1021/bi00820a001 . PMID 5509841 . S2CID 196933 .
- 1 2 3 4 5 6 7 8 Mount DM (2004). Bioinformática: Análisis de secuencias y genomas . Vol. 2. Cold Spring Harbor Laboratory Press. ISBN 978-0-87969-712-9.
- ↑ Yousif, Ragheed Hussam, et al. "Explorando las interacciones moleculares entre la neoculina y los receptores del gusto dulce humanos a través de enfoques computacionales." Sains Malaysiana 49.3 (2020): 517-525.
- ↑ Huang JY, Brutlag DL (enero de 2001). "La base de datos EMOTIF" . Nucleic Acids Research . 29 (1): 202– 4. doi : 10.1093 / nar/29.1.202 . PMC 29837. PMID 11125091 .
- ↑ Pirovano W, Heringa J (2010). "Predicción de la estructura secundaria de proteínas". Técnicas de minería de datos para las ciencias de la vida . Métodos en biología molecular. Vol. 609. pp. 327–48 . doi : 10.1007/978-1-60327-241-4_19 . ISBN 978-1-60327-240-7. PMID 20221928 .
- ↑ Guzzo AV (noviembre de 1965). "La influencia de la secuencia de aminoácidos en la estructura de las proteínas" . Biophysical Journal . 5 (6): 809– 22. Bibcode : 1965BpJ.....5..809G . doi : 10.1016/ S0006-3495 (65)86753-4 . PMC 1367904. PMID 5884309 .
- ↑ Prothero JW (mayo de 1966). "Correlación entre la distribución de aminoácidos y hélices alfa" . Biophysical Journal . 6 (3): 367– 70. Bibcode : 1966BpJ.....6..367P . doi : 10.1016/ S0006-3495 (66)86662-6 . PMC 1367951. PMID 5962284 .
- ↑ Schiffer M, Edmundson AB (marzo de 1967). "Uso de ruedas helicoidales para representar las estructuras de las proteínas e identificar segmentos con potencial helicoidal" . Biophysical Journal . 7 (2): 121– 35. Bibcode : 1967BpJ.....7..121S . doi : 10.1016/ S0006-3495 (67)86579-2 . PMC 1368002. PMID 6048867 .
- ↑ Kotelchuck D, Scheraga HA (enero de 1969). "La influencia de las interacciones de corto alcance en la conformación de las proteínas. II. Un modelo para predecir las regiones alfa-helicoidales de las proteínas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 62 ( 1): 14– 21. Bibcode : 1969PNAS...62...14K . doi : 10.1073/pnas.62.1.14 . PMC 285948. PMID 5253650 .
- ↑ Lewis PN, Go N, Go M, Kotelchuck D, Scheraga HA (abril de 1970). "Perfiles de probabilidad de hélice de proteínas desnaturalizadas y su correlación con estructuras nativas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 65 (4): 810– 5. Bibcode : 1970PNAS...65..810L . doi : 10.1073/pnas.65.4.810 . PMC 282987. PMID 5266152 .
- ↑ Froimowitz M, Fasman GD (1974). "Predicción de la estructura secundaria de las proteínas utilizando la teoría de la transición hélice-bobina". Macromolecules . 7 (5): 583– 9. Bibcode : 1974MaMol...7..583F . doi : 10.1021/ma60041a009 . PMID 4371089 .
- ↑ Qian, Ning; Sejnowski, Terry J. (1988). "Predicción de la estructura secundaria de proteínas globulares mediante modelos de redes neuronales" (PDF) . Journal of Molecular Biology . 202 (4): 865– 884. doi : 10.1016/0022-2836(88)90564-5 . PMID 3172241. Qian1988.
- ↑ Rost, Burkhard ; Sander, Chris (1993). "Predicción de la estructura secundaria de proteínas con una precisión superior al 70%" (PDF) . Journal of Molecular Biology . 232 (2): 584–599 . doi : 10.1006/jmbi.1993.1413 . PMID 8345525. Rost1993. Archivado del original (PDF) el 31 de enero de 2019. Recuperado el 20 de abril de 2023 .
- 1 2 Dor O, Zhou Y (marzo de 2007). "Lograr una precisión del 80 % en la validación cruzada de diez pliegues para la predicción de la estructura secundaria mediante entrenamiento a gran escala". Proteins . 66 (4): 838– 45. doi : 10.1002/prot.21298 . PMID 17177203 . S2CID 14759081 .
- ↑ Chou PY, Fasman GD (enero de 1974). "Predicción de la conformación de proteínas". Biochemistry . 13 (2): 222– 45. doi : 10.1021/bi00699a002 . PMID 4358940 .
- ↑ Garnier J, Osguthorpe DJ, Robson B (marzo de 1978). "Análisis de la precisión e implicaciones de métodos simples para predecir la estructura secundaria de proteínas globulares". Journal of Molecular Biology . 120 (1): 97– 120. doi : 10.1016/0022-2836(78)90297-8 . PMID 642007 .
- 1 2 Pham TH, Satou K, Ho TB (abril de 2005). "Máquinas de vectores de soporte para la predicción y el análisis de giros beta y gamma en proteínas". Journal of Bioinformatics and Computational Biology . 3 (2): 343– 58. doi : 10.1142/S0219720005001089 . PMID 15852509 .
- ↑ Zhang Q, Yoon S, Welsh WJ (mayo de 2005). "Método mejorado para predecir giros beta utilizando máquinas de vectores de soporte". Bioinformatics . 21 (10): 2370–4 . doi : 10.1093/bioinformatics/bti358 . PMID 15797917 .
- ↑ Zimmermann O, Hansmann UH (diciembre de 2006). "Máquinas de vectores de soporte para la predicción de regiones de ángulo diedro". Bioinformatics . 22 (24): 3009– 15. doi : 10.1093/bioinformatics/btl489 . PMID 17005536 .
- ↑ Kuang R, Leslie CS, Yang AS (julio de 2004). "Predicción del ángulo del esqueleto proteico con enfoques de aprendizaje automático" . Bioinformatics . 20 (10): 1612–21 . doi : 10.1093/bioinformatics/bth136 . PMID 14988121 .
- ↑ Faraggi E, Yang Y, Zhang S, Zhou Y (noviembre de 2009). "Predicción de la estructura local continua y el efecto de su sustitución por la estructura secundaria en la predicción de la estructura de proteínas sin fragmentos" . Structure . 17 ( 11): 1515–27 . doi : 10.1016/j.str.2009.09.006 . PMC 2778607. PMID 19913486 .
- ↑ Zhong L, Johnson WC (mayo de 1992). "El entorno afecta la preferencia de los aminoácidos por la estructura secundaria" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 89 (10): 4462– 5. Bibcode : 1992PNAS...89.4462Z . doi : 10.1073/pnas.89.10.4462 . PMC 49102. PMID 1584778 .
- ↑ Macdonald JR, Johnson WC (junio de 2001). " Las características ambientales son importantes para determinar la estructura secundaria de las proteínas" . Protein Science . 10 (6): 1172–7 . doi : 10.1110/ps.420101 . PMC 2374018. PMID 11369855 .
- ↑ Costantini S, Colonna G, Facchiano AM (abril de 2006). "Las propensiones de los aminoácidos a las estructuras secundarias están influenciadas por la clase estructural de la proteína". Biochemical and Biophysical Research Communications . 342 (2): 441– 51. Bibcode : 2006BBRC..342..441C . doi : 10.1016/j.bbrc.2006.01.159 . PMID 16487481 .
- ↑Marashi SA, Behrouzi R, Pezeshk H (January 2007). "Adaptation of proteins to different environments: a comparison of proteome structural properties in Bacillus subtilis and Escherichia coli". Journal of Theoretical Biology. 244 (1): 127–32. Bibcode:2007JThBi.244..127M. doi:10.1016/j.jtbi.2006.07.021. PMID 16945389.
- ↑Costantini S, Colonna G, Facchiano AM (October 2007). "PreSSAPro: a software for the prediction of secondary structure by amino acid properties". Computational Biology and Chemistry. 31 (5–6): 389–92. doi:10.1016/j.compbiolchem.2007.08.010. PMID 17888742.
- ↑Momen-Roknabadi A, Sadeghi M, Pezeshk H, Marashi SA (August 2008). "Impact of residue accessible surface area on the prediction of protein secondary structures". BMC Bioinformatics. 9 357. doi:10.1186/1471-2105-9-357. PMC 2553345. PMID 18759992.
- ↑Adamczak R, Porollo A, Meller J (May 2005). "Combining prediction of secondary structure and solvent accessibility in proteins". Proteins. 59 (3): 467–75. doi:10.1002/prot.20441. PMID 15768403. S2CID 13267624.
- ↑Lakizadeh A, Marashi SA (2009). "Addition of contact number information can improve protein secondary structure prediction by neural networks"(PDF). Excli J. 8: 66–73.
- ↑Dorn, Márcio; e Silva, Mariel Barbachan; Buriol, Luciana S.; Lamb, Luis C. (2014-12-01). "Three-dimensional protein structure prediction: Methods and computational strategies". Computational Biology and Chemistry. 53: 251–276. doi:10.1016/j.compbiolchem.2014.10.001. ISSN 1476-9271. PMID 25462334.
- 1 2 3 Zhang Y (junio de 2008). "Avances y desafíos en la predicción de la estructura de proteínas" . Current Opinion in Structural Biology . 18 (3): 342– 8. doi : 10.1016/j.sbi.2008.02.004 . PMC 2680823. PMID 18436442 .
- ↑ Ovchinnikov S, Kim DE, Wang RY, Liu Y, DiMaio F, Baker D (septiembre de 2016). "Mejora de la predicción de la estructura de novo en CASP11 mediante la incorporación de información de coevolución en Rosetta" . Proteins . 84 (Supl . 1): 67–75 . doi : 10.1002/prot.24974 . PMC 5490371. PMID 26677056 .
- ↑ Hong SH, Joo K, Lee J (noviembre de 2018). "ConDo: predicción de límites de dominios proteicos mediante información coevolutiva". Bioinformatics . 35 (14): 2411– 2417. doi : 10.1093/bioinformatics/bty973 . PMID 30500873 .
- ↑ Wollacott AM, Zanghellini A, Murphy P, Baker D (febrero de 2007). "Predicción de estructuras de proteínas multidominio a partir de estructuras de dominios individuales" . Protein Science . 16 (2): 165–75 . doi : 10.1110/ps.062270707 . PMC 2203296. PMID 17189483 .
- ↑ Xu D, Jaroszewski L, Li Z, Godzik A (julio de 2015). "AIDA: ensamblaje de dominios ab initio para la predicción automatizada de la estructura de proteínas multidominio y la predicción de la interacción dominio-dominio" . Bioinformatics . 31 (13): 2098–105 . doi : 10.1093/bioinformatics/btv092 . PMC 4481839. PMID 25701568 .
- ↑ Shaw DE, Dror RO, Salmon JK, Grossman JP, Mackenzie KM, Bank JA, Young C, Deneroff MM, Batson B, Bowers KJ, Chow E (2009). Simulaciones de dinámica molecular a escala de milisegundos en Anton . Actas de la Conferencia sobre Computación de Alto Rendimiento, Redes, Almacenamiento y Análisis – SC '09. pág. 1. doi : 10.1145/1654059.1654126 . ISBN 978-1-60558-744-8.
- ↑ Pierce LC, Salomon-Ferrer R, de Oliveira CA, McCammon JA, Walker RC (septiembre de 2012). "Acceso rutinario a eventos en escala de tiempo de milisegundos con dinámica molecular acelerada" . Journal of Chemical Theory and Computation . 8 (9): 2997–3002 . doi : 10.1021/ct300284c . PMC 3438784. PMID 22984356 .
- ^ Kmiecik S, Gront D, Kolinski M, Wieteska L, Dawid AE, Kolinski A (julio de 2016). "Modelos de proteínas de grano grueso y sus aplicaciones" . Reseñas químicas . 116 (14): 7898– 936. doi : 10.1021/acs.chemrev.6b00163 . PMID 27333362 .
- ↑ Cheung NJ, Yu W (noviembre de 2018). "Predicción de la estructura de proteínas de novo mediante simulación de dinámica molecular ultrarrápida" . PLOS ONE . 13 (11) e0205819. Bibcode : 2018PLoSO..1305819C . doi : 10.1371/journal.pone.0205819 . PMC 6245515. PMID 30458007 .
- ↑ Göbel U, Sander C, Schneider R, Valencia A (abril de 1994). "Mutaciones correlacionadas y contactos de residuos en proteínas". Proteins . 18 ( 4): 309– 17. doi : 10.1002/prot.340180402 . PMID 8208723. S2CID 14978727 .
- ↑ Taylor WR, Hatrick K (marzo de 1994). "Cambios compensatorios en alineamientos de secuencias múltiples de proteínas". Protein Engineering . 7 (3): 341–8 . doi : 10.1093/protein/7.3.341 . PMID 8177883 .
- ↑ Neher E (enero de 1994). "¿Con qué frecuencia se producen cambios correlacionados en familias de secuencias de proteínas?" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 91 (1): 98– 102. Bibcode : 1994PNAS...91...98N . doi : 10.1073/pnas.91.1.98 . PMC 42893 . PMID 8278414 .
- ↑ Marks DS, Colwell LJ, Sheridan R, Hopf TA, Pagnani A, Zecchina R, Sander C (2011). " Estructura 3D de proteínas calculada a partir de la variación de secuencia evolutiva" . PLOS ONE . 6 (12) e28766. Bibcode : 2011PLoSO...628766M . doi : 10.1371/journal.pone.0028766 . PMC 3233603. PMID 22163331 .
- ↑ Burger L, van Nimwegen E (enero de 2010). "Disentangling direct from indirect co-evolution of wastes in protein alignments" . PLOS Computational Biology . 6 (1) e1000633. Bibcode : 2010PLSCB...6E0633B . doi : 10.1371/journal.pcbi.1000633 . PMC 2793430. PMID 20052271 .
- ↑ Morcos F, Pagnani A, Lunt B, Bertolino A, Marks DS, Sander C, Zecchina R, Onuchic JN, Hwa T, Weigt M (diciembre de 2011). "El análisis de acoplamiento directo de la coevolución de residuos captura contactos nativos en muchas familias de proteínas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 108 (49): E1293-301. arXiv : 1110.5223 . Bibcode : 2011PNAS..108E1293M . doi : 10.1073/pnas.1111471108 . PMC 3241805. PMID 22106262 .
- ↑ Nugent T, Jones DT (junio de 2012). "Predicción precisa de la estructura de novo de grandes dominios de proteínas transmembrana mediante ensamblaje de fragmentos y análisis de mutaciones correlacionadas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 109 (24): E1540-7. Bibcode : 2012PNAS..109E1540N . doi : 10.1073/pnas.1120036109 . PMC 3386101. PMID 22645369 .
- ↑ Hopf TA, Colwell LJ, Sheridan R, Rost B, Sander C, Marks DS (junio de 2012). "Estructuras tridimensionales de proteínas de membrana a partir de secuenciación genómica" . Cell . 149 ( 7): 1607–21 . doi : 10.1016/j.cell.2012.04.012 . PMC 3641781. PMID 22579045 .
- ↑ Jin, Shikai; Chen, Mingchen; Chen, Xun; Bueno, Carlos; Lu, Wei; Schafer, Nicholas P.; Lin, Xingcheng; Onuchic, José N.; Wolynes, Peter G. (9 de junio de 2020). "Predicción de la estructura de proteínas en CASP13 usando AWSEM-Suite". Journal of Chemical Theory and Computation . 16 (6): 3977– 3988. doi : 10.1021/acs.jctc.0c00188 . PMID 32396727 . S2CID 218618842 .
- ↑ Zhang Y, Skolnick J (enero de 2005). "El problema de la predicción de la estructura de proteínas podría resolverse utilizando la biblioteca PDB actual" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 102 (4): 1029–34 . Bibcode : 2005PNAS..102.1029Z . doi : 10.1073/pnas.0407152101 . PMC 545829. PMID 15653774 .
- ↑ Bowie JU, Lüthy R, Eisenberg D (julio de 1991). "Un método para identificar secuencias de proteínas que se pliegan en una estructura tridimensional conocida". Science . 253 (5016): 164– 70. Bibcode : 1991Sci...253..164B . doi : 10.1126/science.1853201 . PMID 1853201 .
- ↑ Dunbrack RL (agosto de 2002). "Bibliotecas de rotámeros en el siglo XXI". Current Opinion in Structural Biology . 12 (4): 431– 40. doi : 10.1016/S0959-440X(02)00344-5 . PMID 12163064 .
- ↑ Ponder JW, Richards FM (febrero de 1987). "Plantillas terciarias para proteínas. Uso de criterios de empaquetamiento en la enumeración de secuencias permitidas para diferentes clases estructurales". Journal of Molecular Biology . 193 (4): 775– 91. doi : 10.1016/0022-2836(87)90358-5 . PMID 2441069 .
- ↑ Lovell SC, Word JM, Richardson JS, Richardson DC (agosto de 2000). "La penúltima biblioteca de rotámeros". Proteins . 40 (3): 389– 408. doi : 10.1002/1097-0134(20000815)40:3 < 389::AID-PROT50 > 3.0.CO ; 2-2 . PMID 10861930 . S2CID 3055173 .
- ↑ Shapovalov MV, Dunbrack RL (junio de 2011). "Una biblioteca de rotámeros suavizada dependiente de la estructura principal para proteínas derivada de estimaciones de densidad de kernel adaptativas y regresiones" . Structure . 19 ( 6): 844–58 . doi : 10.1016/j.str.2011.03.019 . PMC 3118414. PMID 21645855 .
- ↑ Chen VB, Arendall WB, Headd JJ, Keedy DA, Immormino RM, Kapral GJ, Murray LW, Richardson JS, Richardson DC (enero de 2010). "MolProbity: validación de la estructura de todos los átomos para la cristalografía macromolecular" . Acta Crystallographica. Sección D, Cristalografía biológica . 66 (Pt 1): 12–21 . Bibcode : 2010AcCrD..66...12C . doi : 10.1107/ S0907444909042073 . PMC 2803126. PMID 20057044 .
- ↑ Bower MJ, Cohen FE, Dunbrack RL (abril de 1997). "Predicción de rotámeros de cadenas laterales de proteínas a partir de una biblioteca de rotámeros dependiente del esqueleto: una nueva herramienta de modelado por homología". Journal of Molecular Biology . 267 (5): 1268–82 . doi : 10.1006/jmbi.1997.0926 . PMID 9150411 .
- ↑ Voigt CA, Gordon DB, Mayo SL (junio de 2000). "Intercambiando precisión por velocidad: una comparación cuantitativa de algoritmos de búsqueda en el diseño de secuencias de proteínas". Journal of Molecular Biology . 299 (3): 789– 803. CiteSeerX 10.1.1.138.2023 . doi : 10.1006/jmbi.2000.3758 . PMID 10835284 .
- ↑ Krivov GG, Shapovalov MV, Dunbrack RL (diciembre de 2009). "Predicción mejorada de conformaciones de cadenas laterales de proteínas con SCWRL4" . Proteins . 77 (4): 778–95 . doi : 10.1002/prot.22488 . PMC 2885146. PMID 19603484 .
- 1 2 Hochreiter, S.; Heusel, M.; Obermayer, K. (2007). "Detección rápida de homología de proteínas basada en modelos sin alineación" . Bioinformatics . 23 (14): 1728– 1736. doi : 10.1093/bioinformatics/btm247 . PMID 17488755 .
- 1 2 Thireou, T.; Reczko, M. (2007). "Redes bidireccionales de memoria a corto y largo plazo para predecir la localización subcelular de proteínas eucariotas". IEEE/ACM Transactions on Computational Biology and Bioinformatics . 4 (3): 441– 446. Bibcode : 2007ITCBB...4..441T . doi : 10.1109/tcbb.2007.1015 . PMID 17666763 . S2CID 11787259 .
- 1 2 3 4 Jumper, John; Evans, Richard; Pritzel, Alexander; Green, Tim; Figurnov, Michael; Ronneberger, Olaf; Tunyasuvunakool, Kathryn; Bates, Russ; Žídek, Augustin; Potapenko, Anna; Bridgland, Alex (agosto de 2021). "Predicción de estructura de proteínas de alta precisión con AlphaFold" . Nature . 596 (7873): 583– 589. Bibcode : 2021Natur.596..583J . doi : 10.1038/s41586-021-03819-2 . ISSN 1476-4687 . PMC 8371605. PMID 34265844 .
- ↑ "Base de datos de estructuras de proteínas AlphaFold" . EMBL-EBI . Consultado el 30 de noviembre de 2022 .
- ↑ Varadi M, Anyango S, Deshpande M, Nair S, Natassia C, Yordanova G, et al. (enero de 2022). "AlphaFold Protein Structure Database: expansión masiva de la cobertura estructural del espacio de secuencias de proteínas con modelos de alta precisión" . Nucleic Acids Res . 50 (D1): D439– D444. doi : 10.1093/nar/gkab1061 . PMC 8728224. PMID 34791371 .
- ↑ Jumper J, Evans R, Pritzel A, Green T, Figurnov M, Ronneberger O, et al. (agosto de 2021). "Predicción de la estructura de proteínas de alta precisión con AlphaFold" . Nature . 596 (7873): 583– 589. Bibcode : 2021Natur.596..583J . doi : 10.1038/s41586-021-03819-2 . PMC 8371605. PMID 34265844 .
- ↑ Baek M, DiMaio F, Anishchenko I, Dauparas J, Ovchinnikov S, Lee GR, et al. (agosto de 2021). "Predicción precisa de estructuras e interacciones de proteínas mediante una red neuronal de tres vías" . Science . 373 (6557): 871– 876. Bibcode : 2021Sci...373..871B . doi : 10.1126/science.abj8754 . PMC 7612213. PMID 34282049 .
- ↑ Callaway E (noviembre de 2022). "¿ El nuevo rival de AlphaFold? Meta AI predice la forma de 600 millones de proteínas". Nature . 611 (7935): 211– 212. Bibcode : 2022Natur.611..211C . doi : 10.1038/d41586-022-03539-1 . PMID 36319775. S2CID 253257926 .
- ↑ Sommer, Markus J.; Cha, Sooyoung; Varabyou, Ales; Rincon, Natalia; Park, Sukhwan; Minkin, Ilia; Pertea, Mihaela; Steinegger, Martin; Salzberg, Steven L. (2022-12-15). "Identificación de isoformas guiada por la estructura para el transcriptoma humano" . eLife . 11 e82556. doi : 10.7554/eLife.82556 . PMC 9812405. PMID 36519529 .
- ↑ "Premio Nobel de Química 2024" . NobelPrize.org . Consultado el 3 de febrero de 2025 .
- ↑ "Diseño computacional de proteínas y predicción de la estructura de proteínas" (PDF) .
- ↑ EMBL-EBI. "¿Qué tan precisas son las predicciones de estructura de AlphaFold2? | AlphaFold" . Consultado el 3 de febrero de 2025 .
- ↑ Battey JN, Kopp J, Bordoli L, Read RJ, Clarke ND, Schwede T (2007). "Predicciones automatizadas del servidor en CASP7" . Proteins . 69 ( Supl. 8): 68–82 . doi : 10.1002/prot.21761 . PMID 17894354. S2CID 29879391 .
Lecturas adicionales
- Majorek K, Kozłowski L, Jąkalski M, Bujnicki JM (18 de diciembre de 2008). «Capítulo 2: Primeros pasos en la predicción de la estructura de proteínas» (PDF) . En Bujnicki J (ed.). Predicción de estructuras, funciones e interacciones de proteínas . John Wiley & Sons, Ltd. pp. 39–62 . doi : 10.1002/9780470741894.ch2 . ISBN 978-0-470-51767-3.
- Baker D, Sali A (octubre de 2001). "Predicción de la estructura de proteínas y genómica estructural". Science . 294 ( 5540): 93– 6. Bibcode : 2001Sci...294...93B . doi : 10.1126/science.1065659 . PMID 11588250. S2CID 7193705 .
- Kelley LA, Sternberg MJ (2009). "Predicción de la estructura de proteínas en la web: un estudio de caso utilizando el servidor Phyre" ( PDF) . Nature Protocols . 4 (3): 363– 71. doi : 10.1038/nprot.2009.2 . hdl : 10044/1/18157 . PMID 19247286. S2CID 12497300 .
- Kryshtafovych A, Fidelis K (abril de 2009). " Predicción de la estructura de proteínas y evaluación de la calidad del modelo" . Drug Discovery Today . 14 ( 7–8 ): 386–93 . doi : 10.1016/j.drudis.2008.11.010 . PMC 2808711. PMID 19100336 .
- Qu X, Swanson R, Day R, Tsai J (junio de 2009). "Una guía para la predicción de estructuras basada en plantillas". Current Protein & Peptide Science . 10 (3): 270– 85. doi : 10.2174/138920309788452182 . PMID 19519455 .
- Daga PR, Patel RY, Doerksen RJ (2010). "Modelado de proteínas basado en plantillas: avances metodológicos recientes" . Current Topics in Medicinal Chemistry . 10 (1): 84– 94. doi : 10.2174/156802610790232314 . PMC 5943704. PMID 19929829 .
- Fiser, A. (2010). «Modelado de la estructura de proteínas basado en plantillas». Biología Computacional . Métodos en Biología Molecular. Vol. 673. pp. 73–94 . doi : 10.1007/978-1-60761-842-3_6 . ISBN 978-1-60761-841-6. PMC 4108304 . PMID 20835794 .
- Cozzetto D, Tramontano A (diciembre de 2008). "Avances y dificultades en la predicción de la estructura de proteínas". Current Protein & Peptide Science . 9 (6): 567–77 . doi : 10.2174/138920308786733958 . PMID 19075747 .
- Nayeem A, Sitkoff D, Krystek S (abril de 2006). "Un estudio comparativo del software disponible para el modelado de homología de alta precisión: desde alineamientos de secuencias hasta modelos estructurales" . Protein Science . 15 (4): 808–24 . doi : 10.1110/ps.051892906 . PMC 2242473. PMID 16600967 .
Enlaces externos
- Sitio web oficial , Centro de Predicción de Estructuras de Proteínas, experimentos CASP
- Herramientas de proteómica de ExPASy : lista de herramientas y servidores de predicción.
- Bioinformática
- Estructura de las proteínas
- Métodos de proteínas