Articulo de referencia

Predicción de la estructura de proteínas de novo

En biología computacional , la predicción de la estructura de proteínas de novo se refiere a un proceso algorítmico mediante el cual se predice la estructura terciaria de una pr...

En biología computacional , la predicción de la estructura de proteínas de novo se refiere a un proceso algorítmico mediante el cual se predice la estructura terciaria de una proteína a partir de su secuencia primaria de aminoácidos . El problema en sí ha ocupado a científicos destacados durante décadas, sin que se haya resuelto aún. Según Science , sigue siendo uno de los 125 problemas más importantes de la ciencia moderna. [ 1 ] Actualmente, algunos de los métodos más exitosos tienen una probabilidad razonable de predecir los plegamientos de proteínas pequeñas de un solo dominio con una precisión de 1,5 angstroms en toda la estructura. [ 2 ]

Los métodos de novo , término acuñado por primera vez por William DeGrado , [ 3 ] tienden a requerir vastos recursos computacionales y, por lo tanto, solo se han aplicado a proteínas relativamente pequeñas. El modelado de la estructura de proteínas de novo se distingue del modelado basado en plantillas (TBM) por el hecho de que no se utiliza ningún homólogo resuelto de la proteína de interés, lo que hace que los esfuerzos por predecir la estructura de la proteína a partir de la secuencia de aminoácidos sean extremadamente difíciles. La predicción de la estructura de proteínas de novo para proteínas más grandes requerirá mejores algoritmos y mayores recursos computacionales, como los que ofrecen las supercomputadoras potentes (como Blue Gene o MDGRAPE-3) o los proyectos de computación distribuida (como Folding@home , Rosetta@home , el Proyecto de Plegado del Proteoma Humano o Nutritious Rice for the World ). Aunque las barreras computacionales son enormes, los beneficios potenciales de la genómica estructural (mediante métodos predictivos o experimentales) para campos como la medicina y el diseño de fármacos hacen de la predicción de la estructura de novo un campo de investigación activo.

Fondo

Actualmente, la brecha entre las secuencias de proteínas conocidas y las estructuras de proteínas confirmadas es inmensa. A principios de 2008, solo alrededor del 1 % de las secuencias listadas en la base de datos UniProtKB correspondían a estructuras en el Protein Data Bank (PDB), dejando una brecha entre secuencia y estructura de aproximadamente cinco millones. [ 4 ] Las técnicas experimentales para determinar la estructura terciaria se han enfrentado a serios cuellos de botella en su capacidad para determinar estructuras de proteínas específicas. Por ejemplo, mientras que la cristalografía de rayos X ha tenido éxito en cristalizar aproximadamente 80 000 proteínas citosólicas, ha tenido mucho menos éxito en cristalizar proteínas de membrana : aproximadamente 280. [ 5 ] En vista de las limitaciones experimentales, se cree que diseñar programas informáticos eficientes para cerrar la brecha entre la secuencia conocida y la estructura es la única opción viable. [ 5 ]

Los métodos de predicción de la estructura de proteínas de novo intentan predecir estructuras terciarias a partir de secuencias basándose en principios generales que rigen la energética del plegamiento de proteínas y/o las tendencias estadísticas de las características conformacionales que adquieren las estructuras nativas, sin el uso de plantillas explícitas . La investigación en predicción de la estructura de novo se ha centrado principalmente en tres áreas: representaciones alternativas de menor resolución de las proteínas, funciones de energía precisas y métodos de muestreo eficientes.

Un paradigma general para la predicción de novo implica el muestreo del espacio conformacional , guiado por funciones de puntuación y otros sesgos dependientes de la secuencia, de modo que se genera un gran conjunto de estructuras candidatas ("señuelo"). A continuación, se seleccionan conformaciones similares a las nativas de entre estos señuelos utilizando funciones de puntuación y agrupamiento de conformaciones. En ocasiones, se utiliza el refinamiento de alta resolución como paso final para ajustar con precisión las estructuras similares a las nativas. Existen dos clases principales de funciones de puntuación. Las funciones basadas en la física se basan en modelos matemáticos que describen aspectos de la física conocida de la interacción molecular. Las funciones basadas en el conocimiento se forman con modelos estadísticos que capturan aspectos de las propiedades de las conformaciones proteicas nativas. [ 6 ]

La secuencia de aminoácidos determina la estructura terciaria de la proteína.

Se han presentado varias líneas de evidencia a favor de la idea de que la secuencia primaria de proteínas contiene toda la información necesaria para la estructura tridimensional general de la proteína, lo que hace posible la predicción de proteínas de novo. Primero, las proteínas con diferentes funciones suelen tener secuencias de aminoácidos diferentes. Segundo, varias enfermedades humanas diferentes, como la distrofia muscular de Duchenne , pueden vincularse a la pérdida de la función proteica resultante de un cambio en un solo aminoácido en la secuencia primaria. Tercero, las proteínas con funciones similares en muchas especies diferentes a menudo tienen secuencias de aminoácidos similares. La ubiquitina , por ejemplo, es una proteína involucrada en la regulación de la degradación de otras proteínas; su secuencia de aminoácidos es casi idéntica en especies tan distantes como Drosophila melanogaster y Homo sapiens . Cuarto, mediante un experimento mental, se puede deducir que el plegamiento de las proteínas no debe ser un proceso completamente aleatorio y que la información necesaria para el plegamiento debe estar codificada dentro de la estructura primaria. Por ejemplo, si suponemos que cada uno de los 100 residuos de aminoácidos de un pequeño polipéptido puede adoptar, en promedio, 10 conformaciones diferentes, obtenemos 10¹⁰⁰ conformaciones distintas para el polipéptido. Si se probara una conformación posible cada 10⁻¹³ segundos, se tardarían aproximadamente 10⁷⁷ años en muestrear todas las conformaciones posibles. Sin embargo, las proteínas se pliegan correctamente en el organismo en intervalos de tiempo cortos de forma continua, lo que significa que el proceso no puede ser aleatorio y, por lo tanto, puede modelarse.

Una de las pruebas más contundentes de que toda la información relevante para codificar la estructura terciaria de las proteínas se encuentra en la secuencia primaria fue demostrada en la década de 1950 por Christian Anfinsen . En un experimento clásico, demostró que la ribonucleasa A podía desnaturalizarse completamente al sumergirla en una solución de urea (para romper los enlaces hidrofóbicos estabilizadores) en presencia de un agente reductor (para romper los enlaces disulfuro estabilizadores). Al retirar la proteína de este entorno, la ribonucleasa desnaturalizada e inactiva se recompuso espontáneamente y recuperó su función, demostrando que la estructura terciaria de las proteínas está codificada en la secuencia primaria de aminoácidos. Si la proteína se hubiera reformado aleatoriamente, se podrían haber formado más de cien combinaciones diferentes de cuatro enlaces disulfuro. Sin embargo, en la mayoría de los casos, las proteínas requieren la presencia de chaperonas moleculares dentro de la célula para un correcto plegamiento. La forma general de una proteína puede estar codificada en su estructura de aminoácidos, pero su plegamiento puede depender de chaperonas que ayuden en el proceso. [ 7 ]

Requisitos de modelado de novo exitosos

Los predictores de conformación de novo suelen funcionar generando conformaciones candidatas (señuelos) y luego eligiendo entre ellas en función de su estabilidad termodinámica y estado energético. La mayoría de los predictores exitosos tendrán en común los siguientes tres factores:

1) Una función de energía precisa que relaciona el estado termodinámicamente más estable con la estructura nativa de una proteína.

2) Un método de búsqueda eficiente capaz de identificar rápidamente estados de baja energía mediante búsqueda conformacional.

3) La capacidad de seleccionar modelos similares a los nativos de una colección de estructuras señuelo [ 4 ]

Los programas de novo explorarán el espacio tridimensional y, en el proceso, producirán conformaciones proteicas candidatas. A medida que una proteína se acerca a su estado nativo correctamente plegado, la entropía y la energía libre disminuirán. Utilizando esta información, los predictores de novo pueden discriminar entre conformaciones falsas. Específicamente, los programas de novo seleccionarán posibles conformaciones con energías libres más bajas, que tienen más probabilidades de ser correctas que aquellas estructuras con energías libres más altas. [ 2 ] [ 7 ] [ 8 ] Como afirma David A. Baker con respecto al funcionamiento de su predictor de novo Rosetta, “durante el plegamiento, cada segmento local de la cadena oscila entre un subconjunto diferente de conformaciones locales… el plegamiento a la estructura nativa ocurre cuando las conformaciones adoptadas por los segmentos locales y sus orientaciones relativas permiten… características de baja energía de las estructuras proteicas nativas. En el algoritmo Rosetta… el programa busca entonces la combinación de estas conformaciones locales que tenga la energía total más baja”. [ 9 ]

Sin embargo, algunos métodos de novo funcionan enumerando primero todo el espacio conformacional mediante una representación simplificada de la estructura de una proteína, y luego seleccionando las que tienen más probabilidades de ser similares a la conformación nativa. Un ejemplo de este enfoque es uno basado en la representación de los pliegues de proteínas mediante redes tetraédricas y la construcción de modelos de todos los átomos sobre todas las conformaciones posibles obtenidas con la representación tetraédrica. Este enfoque se utilizó con éxito en CASP3 para predecir un pliegue de proteína cuya topología no había sido observada previamente por el equipo de Michael Levitt . [ 10 ]

Mediante el desarrollo del programa QUARK, Xu y Zhang demostraron que la estructura ab initio de algunas proteínas puede construirse con éxito a través de un campo de fuerza basado en el conocimiento. [ 11 ] [ 12 ]

Correctly folded protein conformations (native structures) have lower free energies than partially folded or primary structures. Computers search for these conformations because they indicate correct folding.

Prediction strategies

If a protein of known tertiary structure shares at least 30% of its sequence with a potential homolog of undetermined structure, comparative methods that overlay the putative unknown structure with the known can be utilized to predict the likely structure of the unknown. However, below this threshold three other classes of strategy are used to determine possible structure from an initial model: ab initio protein prediction, fold recognition, and threading.

  1. Ab Initio Methods: In ab initio methods, an initial effort to elucidate secondary structures (alpha helix, beta sheet, beta turn, etc.) from primary structure is made by utilization of physicochemical parameters and neural net algorithms. From that point, algorithms predict tertiary folding. One drawback to this strategy is that it is not yet capable of incorporating the locations and orientation of amino acid side chains.
  2. Fold Prediction: In fold recognition strategies, a prediction of secondary structure is first made and then compared to either a library of known protein folds, such as CATH or SCOP, or what is known as a "periodic table" of possible secondary structure forms. A confidence score is then assigned to likely matches.
  3. Threading: In threading strategies, the fold recognition technique is expanded further. In this process, empirically based energy functions for the interaction of residue pairs are used to place the unknown protein onto a putative backbone as a best fit, accommodating gaps where appropriate. The best interactions are then accentuated in order to discriminate amongst potential decoys and to predict the most likely conformation.

The goal of both fold and threading strategies is to ascertain whether a fold in an unknown protein is similar to a domain in a known one deposited in a database, such as the protein databank (PDB). This is in contrast to de novo (ab initio) methods where structure is determined using a physics-base approach en lieu of comparing folds in the protein to structures in a data base.[13]

Limitations of de novo prediction methods

Una limitación importante de los métodos de predicción de proteínas de novo es la extraordinaria cantidad de tiempo de computación necesaria para determinar con éxito la conformación nativa de una proteína. Los métodos distribuidos, como Rosetta@home, han intentado mitigar este problema reclutando a personas que ofrecen voluntariamente tiempo de computación doméstico inactivo para procesar datos. Sin embargo, incluso estos métodos presentan desafíos. Por ejemplo, un equipo de investigadores de la Universidad de Washington y el Instituto Médico Howard Hughes utilizó un método distribuido para predecir la estructura terciaria de la proteína T0283 a partir de su secuencia de aminoácidos. En una prueba a ciegas que comparó la precisión de esta técnica distribuida con la estructura confirmada experimentalmente y depositada en el Protein Data Bank (PDB), el predictor mostró una excelente concordancia con la estructura depositada. Sin embargo, el tiempo y la cantidad de computadoras necesarios para esta hazaña fueron enormes: casi dos años y aproximadamente 70 000 computadoras domésticas, respectivamente. [ 14 ]

Un método propuesto para superar estas limitaciones implica el uso de modelos de Markov (véase Monte Carlo de cadena de Markov ). Una posibilidad es que estos modelos se construyan para ayudar con el cálculo de la energía libre y la predicción de la estructura de proteínas, quizás refinando las simulaciones computacionales. [ 15 ] Otra forma de sortear las limitaciones de potencia computacional es mediante el uso de modelos de grano grueso . Los modelos de proteínas de grano grueso permiten la predicción de la estructura de novo de proteínas pequeñas o fragmentos de proteínas grandes en un corto tiempo computacional. [ 16 ]

Predicción de la estructura de proteínas de novo

Another limitation of protein structure prediction software concerns a specific class of proteins, namely de novo proteins. Structure prediction software such as AlphaFold rely on co-evolutionary data derived from multiple sequence alignment (MSA) and homologous protein sequences to predict structures of proteins. However, per definition, de novo proteins lack homologous sequences, as they are evolutionarily new.[17] Thus, structure prediction software which relies on such homology can be expected to perform poorly in predicting structures of de novo proteins.[18] To improve accuracy of structure prediction for de novo proteins, new softwares have been developed. Namely, ESMFold is a newly developed large language model (LLM) for the prediction of protein structures based solely on their amino acid sequences. It can predict a 3D structure of a protein with atomic-level resolution with an input of a single amino acid sequence.[19]

An example of distributed computing (Rosetta) in predicting the 3D structure of a protein from its amino-acid sequence. The predicted structure (magenta) of a protein is overlaid with the experimentally determined crystal structure (blue) of that protein. The agreement between the two is very good.

Critical assessment of protein structure prediction

“Progress for all variants of computational protein structure prediction methods is assessed in the biannual, community wide Critical Assessment of Protein Structure Prediction (CASP) experiments. In the CASP experiments, research groups are invited to apply their prediction methods to amino acid sequences for which the native structure is not known but to be determined and to be published soon. Even though the number of amino acid sequences provided by the CASP experiments is small, these competitions provide a good measure to benchmark methods and progress in the field in an arguably unbiased manner.”[20]

Notes

  • Samudrala, R, Xia, Y, Huang, E.S., Levitt, M. Ab initio prediction of protein structure using a combined hierarchical approach. (1999). Proteins Suppl 3: 194-198.
  • Bradley, P.; Malmstrom, L.; Qian, B.; Schonbrun, J.; Chivian, D.; Kim, D. E.; Meiler, J.; Misura, K. M.; Baker, D. (2005). "Free modeling with Rosetta in CASP6". Proteins. 61 (Suppl 7): 128–34. doi:10.1002/prot.20729. PMID 16187354. S2CID 36366681.
  • Bonneau ; Baker, D (2001). "Predicción de la estructura de proteínas ab initio: progreso y perspectivas". Annu. Rev. Biophys. Biomol. Struct . 30 : 173–89 . doi : 10.1146/annurev.biophys.30.1.173 . PMID  11340057 .
  • J. Skolnick, Y. Zhang y A. Kolinski. Modelado ab initio. Genómica estructural y biología estructural de alto rendimiento. M. Sundsrom, M. Norin y A. Edwards, eds. 2006: 137-162.
  • J Lee, S Wu, Y Zhang. Predicción de la estructura de proteínas ab initio. De la estructura de las proteínas a la función con bioinformática, Capítulo 1, Editado por DJ Rigden, (Springer-Londres, 2009), Págs. 1-26.

Véase también

Referencias

  1. ^ "Editorial: Mucho más por saber" . Science . 309 (5731): 78– 102. 2005. doi : 10.1126/science.309.5731.78b . PMID 15994524 . 
  2. ^ a b Dill, Ken A. ; et al. (2007). "El problema del plegamiento de proteínas: ¿cuándo se resolverá?". Current Opinion in Structural Biology . 17 (3): 342– 346. doi : 10.1016/j.sbi.2007.06.001 . PMID 17572080 . 
  3. ^ Hutson, Matthew (18 de septiembre de 2020). "Los científicos avanzan en uno de los santos griales de la tecnología" . The New Yorker .
  4. ^ a b Rigden, Daniel J. De la estructura de las proteínas a la función con bioinformática. Springer Science. 2009. ISBN 978-1-4020-9057-8.
  5. ^ a b Yonath, Ada. La cristalografía de rayos X en el corazón de las ciencias de la vida. Current Opinion in Structural Biology. Volumen 21, número 5, octubre de 2011, páginas 622–626.
  6. ^ Samudrala, R; Moult, J (1998). "Una función discriminatoria de probabilidad condicional dependiente de la distancia de todos los átomos para la predicción de la estructura de proteínas". Journal of Molecular Biology . 275 (5): 893– 914. CiteSeerX 10.1.1.70.4101 . doi : 10.1006/jmbi.1997.1479 . PMID 9480776 .  
  7. ^ a b Nelson, David L. y Cox, Michael. Principios de bioquímica de Lehninger, 5.ª edición. MWH Freeman; 15 de junio de 2008. ISBN 1429224169.
  8. ^ "El Laboratorio Baker" . Archivado del original el 13 de noviembre de 2012.
  9. ^ "Artículo de noticias de Rosetta" .
  10. ^ Samudrala, R; Xia, Y; Huang, ES; Levitt, M ​​(1999). " Predicción ab initio de la estructura de proteínas mediante un enfoque jerárquico combinado". Proteins: Structure, Function, and Genetics . S3 (S3): 194– 198. doi : 10.1002/(SICI)1097-0134(1999)37:3+<194::AID-PROT24>3.0.CO;2-F . S2CID 1566472 . 
  11. ^ Xu D, Zhang Y (julio de 2012). "Ensamblaje de la estructura de proteínas ab initio utilizando fragmentos de estructura continua y un campo de fuerza optimizado basado en el conocimiento" . Proteins . 80 (7): 1715–35 . doi : 10.1002/prot.24065 . PMC 3370074. PMID 22411565 .  
  12. ^ Xu D, Zhang J, Roy A, Zhang Y (agosto de 2011). "Modelado automatizado de la estructura de proteínas en CASP9 mediante la canalización I-TASSER combinada con plegamiento ab initio basado en QUARK y refinamiento de la estructura basado en FG-MD" . Proteins . 79 (Supl . 10): 147–60 . doi : 10.1002/prot.23111 . PMC 3228277. PMID 22069036 .  
  13. ^ Gibson, Greg y Muse, Spencer V. Introducción a la ciencia del genoma, 3.ª edición. Sinauer Associates, Inc. 2009. ISBN 978-0-87893-236-8.
  14. ^ Qian et al. Predicción de estructura de alta resolución y el problema de la fase cristalográfica. (2007). Nature. Volumen 450.
  15. ^ Jayachandran, Guha et al. (2006). Uso de simulación masivamente paralela y modelos markovianos para estudiar el plegamiento de proteínas: Examinando la dinámica de la cabeza de la vilina. Publicado en línea.
  16. ^ Kmiecik, Sebastián; Gront, Dominik; Kolinski, Michal; Wieteska, Lukasz; Dawid, Aleksandra Elzbieta; Kolinski, Andrzej (22 de junio de 2016). "Modelos de proteínas de grano grueso y sus aplicaciones" . Reseñas químicas . 116 (14): 7898– 936. Código bibliográfico : 2016ChRv..116.7898K . doi : 10.1021/acs.chemrev.6b00163 . ISSN 0009-2665 . PMID 27333362 .  
  17. ^ Schmitz, Jonathan F; Bornberg-Bauer, Erich (2017-01-19). "Realidad o ficción: actualizaciones sobre cómo los genes codificadores de proteínas podrían surgir de novo a partir de ADN previamente no codificante" . F1000Research . 6 : 57. Bibcode : 2017JSPS....6...57S . doi : 10.12688/f1000research.10079.1 . ISSN 2046-1402 . PMC 5247788. PMID 28163910 .   
  18. ^ Middendorf, Lasse; Eicholt, Lars A. (junio de 2024). "Proteínas aleatorias, de novo y conservadas: cómo los predictores de estructura y desorden se desempeñan de manera diferente" . Proteins: Structure, Function, and Bioinformatics . 92 (6): 757– 767. doi : 10.1002/prot.26652 . ISSN 0887-3585 . PMID 38226524 .  
  19. ^ Lin, Zeming; Akin, Halil; Rao, Roshan; Hie, Brian; Zhu, Zhongkai; Lu, Wenting; dos Santos Costa, Allan; Fazel-Zarandi, Maryam; Sercu, Tom; Candido, Sal; Rives, Alexander (2023). "Predicción a escala evolutiva de la estructura de proteínas a nivel atómico con un modelo de lenguaje" . Science . 379 (6637): 1123– 1130. Bibcode : 2023Sci...379.1123L . bioRxiv 10.1101/2022.07.20.500902 . doi : 10.1126/science.ade2574 . PMID 36927031 .  
  20. ^ CA Floudas et al. Avances en la predicción de la estructura de proteínas y el diseño de proteínas de novo: una revisión. Chemical Engineering Science 61 (2006) 966 – 988.
  • CASP
  • Folding@Home archivado el 8 de septiembre de 2012 en Wayback Machine.
  • Proyecto HPF
  • Foldit archivado el 4 de abril de 2011 en la Wayback Machine.
  • UniProtKB
  • Banco de Datos de Proteínas (PDB)
  • Sistema experto de análisis de proteínas : enlaces a herramientas de predicción de proteínas.
Obtenido de " https://en.wikipedia.org/w/index.php?title=De_novo_protein_structure_prediction&oldid=1353423439 "