Articulo de referencia

Error de alineación previsto

El Error de Alineamiento Predicho ( PAE ) es un resultado cuantitativo producido por AlphaFold , un sistema de predicción de estructura de proteínas desarrollado por DeepMind [ ...

El Error de Alineamiento Predicho ( PAE ) es un resultado cuantitativo producido por AlphaFold , un sistema de predicción de estructura de proteínas desarrollado por DeepMind [ 1 ] , y otros programas similares. Durante el entrenamiento, el error de alineación entre dos residuos, i y j, se calcula alineando los átomos N, Cα y C predichos del residuo i con los mismos átomos en la estructura experimental de los datos de entrenamiento, y midiendo la distancia resultante entre la posición predicha del átomo Cα del residuo j y la posición experimental de ese átomo. La red se entrena para calcular una distribución de probabilidad sobre el error de alineación para cada par de residuos, a partir de la cual se puede calcular el PAE para cada par. Por lo tanto, el PAE estima el error posicional esperado para cada residuo en una estructura de proteína predicha, dada la alineación de la estructura predicha con la estructura experimental en un residuo diferente. Esta medición ayuda a los científicos a evaluar la confianza en las posiciones y orientaciones relativas de diferentes partes del modelo de proteína predicho. [ 2 ]

Cálculo y presentación

Las redes AlphaFold2 y AlphaFold3 están entrenadas para producir una distribución de probabilidad sobre el error alineado predicho en 64 intervalos,pagijb{\displaystyle p_{ij}^{b}}, de modo que los intervalos 1-64 cubren (0,0.5), (0.5,1.0),..., (31.0,31.5), (31.5-), donde el último intervalo cubre todas las distancias mayores que 31.5 Å. La suma sobre los 64 intervalos es 1.0:

b=164pagijb=1{\displaystyle \sum _{b=1}^{64}p_{ij}^{b}=1}

El PAE se calcula multiplicando cada probabilidad por el valor central de cada intervalo y sumando:

PAGAmiij=b=164pagijbΔb{\displaystyle PAE_{ij}=\sum _{b=1}^{64}p_{ij}^{b}\Delta _{b}}

dóndeΔb=(b0,5)/2{\displaystyle \Delta _{b}=(b-0.5)/2}.

El PAE se presenta como un gráfico interactivo bidimensional (2D) donde el color en las coordenadas (x, y)representa el error de posición predicho en el residuo xsi las estructuras predicha y verdadera se alinean en el residuo y. [ 3 ] Valores de PAE más bajos para pares de residuos de diferentes dominios sugieren posiciones y orientaciones relativas bien definidas en la predicción, mientras que valores de PAE más altos indican incertidumbre en las posiciones u orientaciones relativas. Los usuarios pueden descargar los datos brutos de PAE para todos los pares de residuos en un formato JSON personalizado para su posterior análisis o visualización utilizando un lenguaje de programación como Python . El formato del archivo JSON es el siguiente:

[ { "predicted_aligned_error": [[0, 1, 4, 7, 9, ...], ...], "max_predicted_aligned_error": 31.75 } ] 

En el archivo JSON, el campo predicted_aligned_errorproporciona el valor PAE para cada par de residuos (redondeado al entero más cercano), y el campo max_predicted_aligned_errorproporciona el valor PAE máximo posible, que está limitado a 31,75 Å. El PAE se mide en Ångströms.

Un visor 3D de PAE desarrollado por separado permite una visualización más intuitiva. [ 4 ]

Visor 3D de errores de alineación previstos

Interpretación

La interpretación de los valores PAE permite a los científicos comprender el nivel de confianza en la estructura predicha de una proteína: valores PAE más bajos entre pares de residuos de diferentes dominios indican que el modelo predice posiciones y orientaciones relativas bien definidas para esos dominios. Valores PAE más altos para dichos pares de residuos sugieren que las posiciones y/o orientaciones relativas de estos dominios en la estructura 3D son inciertas y no deben interpretarse. [ 5 ]

Advertencias

Aunque el PAE proporciona información valiosa, los usuarios deben tener en cuenta que es asimétrico; el valor del PAE para (x, y) puede diferir del valor para (y, x), particularmente entre regiones de bucle con orientaciones muy inciertas. [ 6 ] Además, si bien AlphaFold puede realizar predicciones útiles entre dominios, se espera que la precisión de la predicción dentro del dominio sea más confiable según la validación de CASP14 .

Métricas derivadas para cadenas proteicas y complejos proteicos

Para cadenas proteicas individuales o complejos completos, AlphaFold2 y AlphaFold3 calculan una puntuación de modelado de plantilla predicha opTM{\displaystyle \operatorname {pTM} }a partir de la distribución de probabilidad sobre los errores alineados. Se calcula alineando cada residuo (i=1,L), uno a la vez, calculando el valor promedio de la ecuación de puntuación TM sobre todos los residuos en la estructura y tomando el máximo de los promedios TM:

pTM=máximoi[1Lj=1Lb=164pagijb11+(Δbd0)2]{\displaystyle \operatorname {pTM} =\max _{i}\left[{\frac {1}{L}}\sum _{j=1}^{L}\sum _{b=1}^{64}p_{ij}^{b}{\frac {1}{1+\left({\frac {\Delta _{b}}{d_{0}}}\right)^{2}}}\right]}

donde ambosi{\displaystyle i}yj{\displaystyle j}abarca todos los residuos de la estructura,L{\displaystyle L}.d0{\displaystyle d_{0}}es un parámetro de escala ajustado para asegurar que la puntuación TM sea aproximadamente plana en función del tamaño de la estructura para proteínas no relacionadas (~0,15) [ 7 ]  :

d0(L)=1.24L1531.8{\displaystyle d_{0}(L)=1,24{\sqrt[{3}]{L-15}}-1,8}

AlphaFold-Multimer introdujo una puntuación llamadaipTM{\displaystyle \operatorname {ipTM} }(puntuación de modelado de plantilla predicha por la interfaz) para evaluar la precisión predicha de los complejos proteicos. A pesar del nombre,ipTM{\displaystyle \operatorname {ipTM} }Se calcula sobre cadenas completas, no solo sobre residuos de la interfaz.

Dado que PAE es asimétrico,ipTM{\displaystyle \operatorname {ipTM} }También puede ser asimétrico. La puntuación asimétrica se calcula alineando un residuo a la vez en una cadena, calculando la puntuación TM promedio para todos los residuos en la otra cadena y tomando el máximo entre los promedios TM:

ipTM(AB)=máximoiA[1LjBb=164pagijb11+(Δbd0)2]{\displaystyle \operatorname {ipTM} (A\to B)=\max _{i\in A}\left[{\frac {1}{L}}\sum _{j\in B}\sum _{b=1}^{64}p_{ij}^{b}{\frac {1}{1+\left({\frac {\Delta _{b}}{d_{0}}}\right)^{2}}}\right]}

El código AlphaFold calcula L como la suma de la longitud de las dos cadenas de proteínas yd0{\displaystyle d_{0}}comod0(L){\displaystyle d_{0}(L)}. La salidaipTM{\displaystyle \operatorname {ipTM} }es simplemente el máximo sobre todas las posibles alineaciones en ambas cadenas, o:

ipTM=máximo{ipTM(AB),ipTM(BA)}{\displaystyle \operatorname {ipTM} =\max \left\{\operatorname {ipTM} (A\to B),\operatorname {ipTM} (B\to A)\right\}}

Para un complejo multiproteico, el máximo se toma sobre todos los residuos en todas las cadenas (el conjunto C ) y las medias se toman sobre todos los residuos, j , que no están en la misma cadena que el residuo i , que se denotajdo(i){\displaystyle j\notin c(i)}. El valor de L utilizado para calculard0{\displaystyle d_{0}}es la suma de las longitudes de todas las proteínas del complejo:

ipTM=máximoido[1|jdo(i)|jdo(i)b=164pagijb11+(Δbd0)2]{\displaystyle \operatorname {ipTM} =\max _{i\in C}\left[{\frac {1}{|j\notin c(i)|}}\sum _{j\notin c(i)}\sum _{b=1}^{64}p_{ij}^{b}{\frac {1}{1+\left({\frac {\Delta _{b}}{d_{0}}}\right)^{2}}}\right]}

Se han derivado varias otras métricas para complejos proteicos a partir de la matriz PAE (o la distribución de probabilidad subyacente), incluyendo actifpTM [ 8 ] , pDockQ2 [ 9 ] , LIS [ 10 ] e ipSAE [ 11 ] . Estas últimas puntuaciones tienen en cuenta ciertas deficiencias en la puntuación ipTM original, incluyendo la ponderación igual a las regiones ordenadas y desordenadas y el escalado de los PAE por el tamaño de todo el sistema proteico [ 11 ] .

  • Visor 3D PAE

Referencias

  1. "Base de datos de estructura de proteínas AlphaFold" . alphafold.ebi.ac.uk . 12 de junio de 2023. Archivado del original el 13 de junio de 2023. Consultado el 12 de junio de 2023 .
  2. "Estimaciones de error de AlphaFold" . www.rbvi.ucsf.edu . Archivado del original el 13 de junio de 2023. Consultado el 12 de junio de 2023 .
  3. "Permitiendo la predicción de estructuras proteicas de alta precisión a escala del proteoma" . www.deepmind.com . 13 de junio de 2023. Archivado del original el 13 de junio de 2023. Consultado el 13 de junio de 2023 .
  4. Elfmann, Christoph; Stülke, Jörg (2023-05-04). "PAE viewer: un servidor web para la visualización interactiva del error de alineación predicho para predicciones de estructura de multímeros y enlaces cruzados" . Nucleic Acids Research . 51 (W1): W404– W410. doi : 10.1093/nar/gkad350 . ISSN 0305-1048 . PMC 10320053. PMID 37140053 .   
  5. ^ Varadi, Mihaly (13 de junio de 2023). "NIH: Biblioteca Nacional de Medicina: base de datos AlphaFold" . Investigación de ácidos nucleicos . 50 (D1): D439– D444. doi : 10.1093/nar/gkab1061 . PMC 8728224 . PMID 34791371 .  
  6. "¿Por qué el PAE (error de alineación predicho) de Alphafold no es simétrico?" . Matter Modeling Stack Exchange . 12/06/2023. Archivado del original el 13/06/2023 . Consultado el 12/06/2023 .
  7. Zhang, Y; Skolnick, J (1 de diciembre de 2004). "Función de puntuación para la evaluación automatizada de la calidad de la plantilla de estructura proteica". Proteins . 57 (4): 702–10 . doi : 10.1002/prot.20264 . PMID 15476259 . 
  8. Varga, JK; Ovchinnikov, S; Schueler-Furman, O (4 de marzo de 2025). "actifpTM: una métrica de confianza refinada de las predicciones de AlphaFold2 que involucran regiones flexibles" . Bioinformatics (Oxford, Inglaterra) . 41 (3) btaf107. doi : 10.1093/bioinformatics/btaf107 . PMC 11925850. PMID 40080667 .  
  9. Zhu, W; Shenoy, A; Kundrotas, P; Elofsson, A (1 de julio de 2023). "Evaluación de la predicción de multímeros AlphaFold en complejos proteicos de múltiples cadenas" . Bioinformatics (Oxford, Inglaterra) . 39 (7) btad424. doi : 10.1093/bioinformatics/btad424 . PMC 10348836. PMID 37405868 .  
  10. Kim, AR; Hu, Y; Comjean, A; Rodiger, J; Mohr, SE; Perrimon, N (21 de febrero de 2024). "Descubrimiento mejorado de interacciones proteína-proteína mediante AlphaFold-Multimer". bioRxiv 10.1101/2024.02.19.580970 . 
  11. 1 2 Dunbrack, RL (14 de febrero de 2025). "Rēs ipSAE loquuntur: ¿Qué falla en la puntuación ipTM de AlphaFold y cómo solucionarlo?". bioRxiv 10.1101/2025.02.10.637595 . 
Obtenido de " https://en.wikipedia.org/w/index.php?title=Predicted_Aligned_Error&oldid=1355132643 "