Articulo de referencia

Modelos gráficos para la estructura de las proteínas

Los modelos gráficos se han convertido en herramientas poderosas para la predicción de la estructura de proteínas , la interacción proteína-proteína y el cálculo de la energía l...

Los modelos gráficos se han convertido en herramientas poderosas para la predicción de la estructura de proteínas , la interacción proteína-proteína y el cálculo de la energía libre de las estructuras proteicas. El uso de un modelo gráfico para representar la estructura de una proteína permite resolver numerosos problemas, como la predicción de la estructura secundaria, las interacciones proteína-proteína, la interacción proteína-fármaco y el cálculo de la energía libre.

Existen dos enfoques principales para el uso de modelos gráficos en la modelización de la estructura de proteínas. El primero utiliza variables discretas para representar las coordenadas o los ángulos diedros de la estructura proteica. Estas variables son originalmente valores continuos y, para transformarlas en valores discretos, se suele aplicar un proceso de discretización. El segundo enfoque utiliza variables continuas para las coordenadas o los ángulos diedros.

Modelos gráficos discretos para la estructura de las proteínas

Los campos aleatorios de Markov , también conocidos como modelos gráficos no dirigidos, son representaciones comunes para este problema. Dado un grafo no dirigido G  =  ( V , E ), un conjunto de variables aleatorias X = ( X v ) vV indexadas por V , forman un campo aleatorio de Markov con respecto a G si satisfacen la propiedad de Markov por pares:   

incógnitaincógnitav|incógnitaV{,v}si {,v}mi.{\displaystyle X_{u}\perp \!\!\!\perp X_{v}|X_{V\setminus \{u,v\}}\quad {\text{si }}\{u,v\}\notin E.}

En el modelo discreto, las variables continuas se discretizan en un conjunto de valores discretos favorables. Si las variables elegidas son ángulos diedros , la discretización se realiza típicamente asignando a cada valor la conformación del rotámero correspondiente .

Modelo

Sea X = { X b , X s } las variables aleatorias que representan la estructura completa de la proteína. X b puede representarse mediante un conjunto de coordenadas tridimensionales de los átomos del esqueleto , o equivalentemente, mediante una secuencia de longitudes de enlace y ángulos diedros . La probabilidad de una conformación particular x puede escribirse entonces como:

pag(incógnita=incógnita|Θ)=pag(incógnitab=incógnitab)pag(incógnitas=incógnitas|incógnitab,Θ),{\displaystyle p(X=x|\Theta )=p(X_{b}=x_{b})p(X_{s}=x_{s}|X_{b},\Theta ),\,}

dóndeΘ{\displaystyle \Theta }representa cualquier parámetro utilizado para describir este modelo, incluyendo información de secuencia, temperatura, etc. Con frecuencia se supone que la cadena principal es rígida con una conformación conocida, y el problema se transforma entonces en un problema de colocación de cadenas laterales. La estructura del grafo también está codificada enΘ{\displaystyle \Theta }Esta estructura muestra qué dos variables son condicionalmente independientes. Por ejemplo, los ángulos de las cadenas laterales de dos residuos muy distantes pueden ser independientes dados todos los demás ángulos de la proteína. Para extraer esta estructura, los investigadores utilizan un umbral de distancia, y solo un par de residuos que se encuentran dentro de ese umbral se consideran conectados (es decir, tienen una arista entre ellos).

Dada esta representación, la probabilidad de una conformación particular de la cadena lateral x s dada la conformación de la cadena principal x b se puede expresar como

pag(incógnitas=incógnitas|incógnitab=incógnitab)=1Zdodo(GRAMO)Φdo(incógnitasdo,incógnitabdo){\displaystyle p(X_{s}=x_{s}|X_{b}=x_{b})={\frac {1}{Z}}\prod _{c\in C(G)}\Phi _{c}(x_{s}^{c},x_{b}^{c})}

donde C ( G ) es el conjunto de todas las camarillas en G ,Φ{\displaystyle \Phi }es una función potencial definida sobre las variables, y Z es la función de partición .

Para caracterizar completamente el MRF, es necesario definir la función potencial.Φ{\displaystyle \Phi }Para simplificar, las camarillas de un grafo generalmente se restringen solo a las camarillas de tamaño 2, lo que significa que la función potencial solo se define sobre pares de variables. En Goblin System , estas funciones por pares se definen como

Φ(incógnitasipag,incógnitabjq)=exp(mi(incógnitasipag,incógnitabjq)/KBT){\displaystyle \Phi (x_{s}^{i_{p}},x_{b}^{j_{q}})=\exp(-E(x_{s}^{i_{p}},x_{b}^{j_{q}})/K_{B}T)}

dóndemi(incógnitasipag,incógnitabjq){\displaystyle E(x_{s}^{i_{p}},x_{b}^{j_{q}})}es la energía de interacción entre el estado rotámero p del residuoincógnitais{\displaystyle X_{i}^{s}}y el estado rotámero q del residuoincógnitajs{\displaystyle X_{j}^{s}}ykB{\displaystyle k_{B}}es la constante de Boltzmann .

Utilizando un archivo PDB, se puede construir este modelo sobre la estructura de la proteína. A partir de este modelo, se puede calcular la energía libre.

Cálculo de la energía libre: propagación de creencias

Se ha demostrado que la energía libre de un sistema se calcula como

GRAMO=miTS{\displaystyle G=E-TS}

donde E es la entalpía del sistema, T la temperatura y S la entropía. Ahora bien, si asociamos una probabilidad a cada estado del sistema (p(x) para cada valor de conformación, x), G se puede reescribir como

GRAMO=incógnitapag(incógnita)mi(incógnita)Tincógnitapag(incógnita)ln(pag(incógnita)){\displaystyle G=\sum _{x}p(x)E(x)-T\sum _{x}p(x)\ln(p(x))\,}

El cálculo de p(x) en grafos discretos se realiza mediante el algoritmo de propagación de creencias generalizado . Este algoritmo calcula una aproximación a las probabilidades y no garantiza la convergencia a un conjunto de valores final. Sin embargo, en la práctica, se ha demostrado que converge con éxito en muchos casos.

Modelos gráficos continuos para estructuras de proteínas

Los modelos gráficos pueden utilizarse incluso cuando las variables de elección son continuas. En estos casos, la distribución de probabilidad se representa como una distribución de probabilidad multivariante sobre variables continuas. Cada familia de distribuciones impone ciertas propiedades al modelo gráfico. La distribución gaussiana multivariante es una de las más convenientes para este problema. Su forma sencilla y su relación directa con el modelo gráfico correspondiente la convierten en una opción popular entre los investigadores.

Modelos gráficos gaussianos de estructuras proteicas

Los modelos gráficos gaussianos son distribuciones de probabilidad multivariadas que codifican una red de dependencias entre variables.Θ=[θ1,θ2,,θnorte]{\displaystyle \Theta =[\theta _{1},\theta _{2},\dots ,\theta _{n}]}ser un conjunto denorte{\displaystyle n}variables, comonorte{\displaystyle n}ángulos diedros , y dejemosF(Θ=D){\displaystyle f(\Theta =D)}Sea D el valor de la función de densidad de probabilidad en un valor particular . Un modelo gráfico gaussiano multivariado define esta probabilidad de la siguiente manera:

F(Θ=D)=1Zexp{12(Dμ)TΣ1(Dμ)}{\displaystyle f(\Theta =D)={\frac {1}{Z}}\exp \left\{-{\frac {1}{2}}(D-\mu )^{T}\Sigma ^{-1}(D-\mu )\right\}}

DóndeZ=(2π)norte/2|Σ|1/2{\displaystyle Z=(2\pi )^{n/2}|\Sigma |^{1/2}}es la forma cerrada para la función de partición . Los parámetros de esta distribución sonμ{\displaystyle \mu }yΣ{\displaystyle \Sigma }.μ{\displaystyle \mu }es el vector de valores medios de cada variable, yΣ1{\displaystyle \Sigma ^{-1}}, la inversa de la matriz de covarianza , también conocida como matriz de precisión . La matriz de precisión contiene las dependencias por pares entre las variables. Un valor cero enΣ1{\displaystyle \Sigma ^{-1}}significa que, condicionado a los valores de las otras variables, las dos variables correspondientes son independientes entre sí.

Para aprender la estructura del grafo como un modelo gráfico gaussiano multivariado, podemos usar la regularización L-1 o algoritmos de selección de vecindario . Estos algoritmos aprenden simultáneamente una estructura de grafo y la fuerza de las aristas de los nodos conectados. Una fuerza de arista corresponde a la función potencial definida en la clique de dos nodos correspondiente . Usamos un conjunto de entrenamiento de varias estructuras PDB para aprender laμ{\displaystyle \mu }yΣ1{\displaystyle \Sigma ^{-1}}.

Una vez aprendido el modelo, podemos repetir el mismo paso que en el caso discreto para obtener las funciones de densidad en cada nodo y utilizar la forma analítica para calcular la energía libre. En este caso, la función de partición ya tiene una forma cerrada , por lo que la inferencia , al menos para los modelos gráficos gaussianos, es trivial. Si no se dispone de la forma analítica de la función de partición, se puede utilizar el filtrado de partículas o la propagación de expectativas para aproximar Z y, a continuación, realizar la inferencia y calcular la energía libre.

Referencias

  • Grafos no dirigidos variables en el tiempo, Shuheng Zhou, John D. Lafferty y Larry A. Wasserman, COLT 2008
  • Estimaciones de energía libre de estructuras proteicas de todos los átomos mediante propagación generalizada de creencias, Hetunandan Kamisetty, Eric P. Xing, Christopher J. Langmead, RECOMB 2008
  • http://www.liebertonline.com/doi/pdf/10.1089/cmb.2007.0131
  • https://web.archive.org/web/20110724225908/http://www.learningtheory.org/colt2008/81-Zhou.pdf
  • Liu Y; Carbonell J; Gopalakrishnan V (2009). "Modelos gráficos condicionales para el reconocimiento de motivos estructurales de proteínas". J. Comput. Biol . 16 (5): 639– 57. doi : 10.1089/cmb.2008.0176 . hdl : 1721.1 /62177 . PMID 19432536. S2CID 7035106 .  
  • Predicción de plegamientos de proteínas con repeticiones estructurales mediante un modelo de grafo de cadena