Los modelos gráficos se han convertido en herramientas poderosas para la predicción de la estructura de proteínas , la interacción proteína-proteína y el cálculo de la energía libre de las estructuras proteicas. El uso de un modelo gráfico para representar la estructura de una proteína permite resolver numerosos problemas, como la predicción de la estructura secundaria, las interacciones proteína-proteína, la interacción proteína-fármaco y el cálculo de la energía libre.
Existen dos enfoques principales para el uso de modelos gráficos en la modelización de la estructura de proteínas. El primero utiliza variables discretas para representar las coordenadas o los ángulos diedros de la estructura proteica. Estas variables son originalmente valores continuos y, para transformarlas en valores discretos, se suele aplicar un proceso de discretización. El segundo enfoque utiliza variables continuas para las coordenadas o los ángulos diedros.
Modelos gráficos discretos para la estructura de las proteínas
Los campos aleatorios de Markov , también conocidos como modelos gráficos no dirigidos, son representaciones comunes para este problema. Dado un grafo no dirigido G = ( V , E ), un conjunto de variables aleatorias X = ( X v ) v ∈ V indexadas por V , forman un campo aleatorio de Markov con respecto a G si satisfacen la propiedad de Markov por pares:
- Dos variables cualesquiera no adyacentes son condicionalmente independientes dadas todas las demás variables:
En el modelo discreto, las variables continuas se discretizan en un conjunto de valores discretos favorables. Si las variables elegidas son ángulos diedros , la discretización se realiza típicamente asignando a cada valor la conformación del rotámero correspondiente .
Modelo
Sea X = { X b , X s } las variables aleatorias que representan la estructura completa de la proteína. X b puede representarse mediante un conjunto de coordenadas tridimensionales de los átomos del esqueleto , o equivalentemente, mediante una secuencia de longitudes de enlace y ángulos diedros . La probabilidad de una conformación particular x puede escribirse entonces como:
dónderepresenta cualquier parámetro utilizado para describir este modelo, incluyendo información de secuencia, temperatura, etc. Con frecuencia se supone que la cadena principal es rígida con una conformación conocida, y el problema se transforma entonces en un problema de colocación de cadenas laterales. La estructura del grafo también está codificada enEsta estructura muestra qué dos variables son condicionalmente independientes. Por ejemplo, los ángulos de las cadenas laterales de dos residuos muy distantes pueden ser independientes dados todos los demás ángulos de la proteína. Para extraer esta estructura, los investigadores utilizan un umbral de distancia, y solo un par de residuos que se encuentran dentro de ese umbral se consideran conectados (es decir, tienen una arista entre ellos).
Dada esta representación, la probabilidad de una conformación particular de la cadena lateral x s dada la conformación de la cadena principal x b se puede expresar como
donde C ( G ) es el conjunto de todas las camarillas en G ,es una función potencial definida sobre las variables, y Z es la función de partición .
Para caracterizar completamente el MRF, es necesario definir la función potencial.Para simplificar, las camarillas de un grafo generalmente se restringen solo a las camarillas de tamaño 2, lo que significa que la función potencial solo se define sobre pares de variables. En Goblin System , estas funciones por pares se definen como
dóndees la energía de interacción entre el estado rotámero p del residuoy el estado rotámero q del residuoyes la constante de Boltzmann .
Utilizando un archivo PDB, se puede construir este modelo sobre la estructura de la proteína. A partir de este modelo, se puede calcular la energía libre.
Cálculo de la energía libre: propagación de creencias
Se ha demostrado que la energía libre de un sistema se calcula como
donde E es la entalpía del sistema, T la temperatura y S la entropía. Ahora bien, si asociamos una probabilidad a cada estado del sistema (p(x) para cada valor de conformación, x), G se puede reescribir como
El cálculo de p(x) en grafos discretos se realiza mediante el algoritmo de propagación de creencias generalizado . Este algoritmo calcula una aproximación a las probabilidades y no garantiza la convergencia a un conjunto de valores final. Sin embargo, en la práctica, se ha demostrado que converge con éxito en muchos casos.
Modelos gráficos continuos para estructuras de proteínas
Los modelos gráficos pueden utilizarse incluso cuando las variables de elección son continuas. En estos casos, la distribución de probabilidad se representa como una distribución de probabilidad multivariante sobre variables continuas. Cada familia de distribuciones impone ciertas propiedades al modelo gráfico. La distribución gaussiana multivariante es una de las más convenientes para este problema. Su forma sencilla y su relación directa con el modelo gráfico correspondiente la convierten en una opción popular entre los investigadores.
Modelos gráficos gaussianos de estructuras proteicas
Los modelos gráficos gaussianos son distribuciones de probabilidad multivariadas que codifican una red de dependencias entre variables.ser un conjunto devariables, comoángulos diedros , y dejemosSea D el valor de la función de densidad de probabilidad en un valor particular . Un modelo gráfico gaussiano multivariado define esta probabilidad de la siguiente manera:
Dóndees la forma cerrada para la función de partición . Los parámetros de esta distribución sony.es el vector de valores medios de cada variable, y, la inversa de la matriz de covarianza , también conocida como matriz de precisión . La matriz de precisión contiene las dependencias por pares entre las variables. Un valor cero ensignifica que, condicionado a los valores de las otras variables, las dos variables correspondientes son independientes entre sí.
Para aprender la estructura del grafo como un modelo gráfico gaussiano multivariado, podemos usar la regularización L-1 o algoritmos de selección de vecindario . Estos algoritmos aprenden simultáneamente una estructura de grafo y la fuerza de las aristas de los nodos conectados. Una fuerza de arista corresponde a la función potencial definida en la clique de dos nodos correspondiente . Usamos un conjunto de entrenamiento de varias estructuras PDB para aprender lay.
Una vez aprendido el modelo, podemos repetir el mismo paso que en el caso discreto para obtener las funciones de densidad en cada nodo y utilizar la forma analítica para calcular la energía libre. En este caso, la función de partición ya tiene una forma cerrada , por lo que la inferencia , al menos para los modelos gráficos gaussianos, es trivial. Si no se dispone de la forma analítica de la función de partición, se puede utilizar el filtrado de partículas o la propagación de expectativas para aproximar Z y, a continuación, realizar la inferencia y calcular la energía libre.
Referencias
- Grafos no dirigidos variables en el tiempo, Shuheng Zhou, John D. Lafferty y Larry A. Wasserman, COLT 2008
- Estimaciones de energía libre de estructuras proteicas de todos los átomos mediante propagación generalizada de creencias, Hetunandan Kamisetty, Eric P. Xing, Christopher J. Langmead, RECOMB 2008
Enlaces externos
- http://www.liebertonline.com/doi/pdf/10.1089/cmb.2007.0131
- https://web.archive.org/web/20110724225908/http://www.learningtheory.org/colt2008/81-Zhou.pdf
- Liu Y; Carbonell J; Gopalakrishnan V (2009). "Modelos gráficos condicionales para el reconocimiento de motivos estructurales de proteínas". J. Comput. Biol . 16 (5): 639– 57. doi : 10.1089/cmb.2008.0176 . hdl : 1721.1 /62177 . PMID 19432536. S2CID 7035106 .
- Predicción de plegamientos de proteínas con repeticiones estructurales mediante un modelo de grafo de cadena
- Modelos gráficos
- Métodos de proteínas
- Química computacional