Articulo de referencia

Matriz de ponderación de posición

Las PWM se suelen representar gráficamente como logotipos de secuencia . Una matriz de ponderación posicional (PWM) , también conocida como matriz de ponderación específica de p...

Las PWM se suelen representar gráficamente como logotipos de secuencia .

Una matriz de ponderación posicional (PWM) , también conocida como matriz de ponderación específica de posición (PSWM) o matriz de puntuación específica de posición (PSSM) , es una representación comúnmente utilizada de motivos (patrones) en secuencias biológicas.

Las matrices de pesos posicionales (PWM) suelen derivarse de un conjunto de secuencias alineadas que se consideran funcionalmente relacionadas y se han convertido en una parte importante de muchas herramientas de software para el descubrimiento computacional de motivos.

Fondo

Creación

Conversión de secuencia a matriz de probabilidad de posición

Una matriz de pesos posicionales (PWM) tiene una fila por cada símbolo del alfabeto (4 filas para nucleótidos en secuencias de ADN o 20 filas para aminoácidos en secuencias de proteínas ) y una columna por cada posición en el patrón. En el primer paso para construir una PWM, se crea una matriz de frecuencia de posición (PFM) básica contando las ocurrencias de cada nucleótido en cada posición. A partir de la PFM, se puede crear una matriz de probabilidad de posición (PPM) dividiendo ese recuento de nucleótidos en cada posición por el número de secuencias, normalizando así los valores. Formalmente, dado un conjunto X de N secuencias alineadas de longitud l , se calculan los elementos de la PPM M :

METROk,j=1nortei=1norteI(incógnitai,j=k),{\displaystyle M_{k,j}={\frac {1}{N}}\sum _{i=1}^{N}I(X_{i,j}=k),}

donde i (1,..., N ), j (1,..., l ), ​​k es el conjunto de símbolos en el alfabeto e I(a=k) es una función indicadora donde I(a=k) es 1 si a=k y 0 en caso contrario.{\displaystyle \in }{\displaystyle \in }

Por ejemplo, dadas las siguientes secuencias de ADN:

El PFM correspondiente es:

METRO=AdoGRAMOT[36100672122100211211710011514110101126].{\displaystyle M={\begin{matrix}A\\C\\G\\T\end{matrix}}{\begin{bmatrix}3&6&1&0&0&6&7&2&1\\2&2&1&0&0&2&1&1&2\\1&1&7&10&0&1&1&5&1\\4&1&1&0&10&1&1&2&6\end{bmatrix}}.}

Por lo tanto, el PPM resultante es: [ 1 ]

METRO=AdoGRAMOT[0,30,60.10.00.00,60,70,20.10,20,20.10.00.00,20.10.10,20.10.10,71.00.00.10.10,50.10,40.10.10.01.00.10.10,20,6].{\displaystyle M={\begin{matrix}A\\C\\G\\T\end{matrix}}{\begin{bmatrix}0.3&0.6&0.1&0.0&0.0&0.6&0.7&0.2&0.1\\0.2&0.2&0.1&0.0&0.0&0.2&0.1&0.1&0.2\\0.1&0.1&0.7&1.0&0.0&0.1&0.1&0.5&0.1\\0.4&0.1&0.1&0.0&1.0&0.1&0.1&0.2&0.6\end{bmatrix}}.}

Tanto los PPM como los PWM asumen independencia estadística entre las posiciones del patrón, ya que las probabilidades de cada posición se calculan independientemente de las demás. De la definición anterior, se deduce que la suma de los valores de una posición determinada (es decir, la suma de todos los símbolos) es 1. Por lo tanto, cada columna puede considerarse una distribución multinomial independiente . Esto facilita el cálculo de la probabilidad de una secuencia dada una PPM, multiplicando las probabilidades correspondientes en cada posición. Por ejemplo, la probabilidad de la secuencia S  = GAGGTAAAC dada la PPM M anterior se puede calcular de la siguiente manera: 

pag(S|METRO)=0.1×0,6×0,7×1.0×1.0×0,6×0,7×0,2×0,2=0,0007056.{\displaystyle p(S\vert M)=0.1\times 0.6\times 0.7\times 1.0\times 1.0\times 0.6\times 0.7\times 0.2\times 0.2=0.0007056.}

Los pseudocuentas (o estimadores de Laplace ) se aplican a menudo al calcular PPM cuando se basan en un conjunto de datos pequeño, para evitar que las entradas de la matriz tengan un valor de 0. [ 2 ] Esto es equivalente a multiplicar cada columna del PPM por una distribución de Dirichlet y permite calcular la probabilidad para secuencias nuevas (es decir, secuencias que no formaban parte del conjunto de datos original). En el ejemplo anterior, sin pseudocuentas, cualquier secuencia que no tuviera una G en la cuarta posición o una T en la quinta posición tendría una probabilidad de 0, independientemente de las demás posiciones.

Conversión de la matriz de probabilidad de posición a la matriz de ponderación de posición.

Por lo general, los elementos de los PWM se calculan como logaritmos de probabilidades. Es decir, los elementos de un PPM se transforman utilizando un modelo de fondo de manera que:b{\displaystyle b}

METROk,j=logramo2(METROk,j/bk).{\displaystyle M_{k,j}=\mathrm {log_{2}} \;(M_{k,j}/b_{k}).}

Describe cómo se puede calcular un elemento en el PWM (izquierda) . El modelo de fondo más simple supone que cada letra aparece con la misma frecuencia en el conjunto de datos. Es decir, el valor de para todos los símbolos del alfabeto (0,25 para nucleótidos y 0,05 para aminoácidos). Al aplicar esta transformación al PPM M anterior (sin agregar pseudocuentas) se obtiene:METROk,j{\displaystyle M_{k,j}}bk=1/|k|{\displaystyle b_{k}=1/\vert k\vert }

METRO=AdoGRAMOT[0,261.261.321.261.490,321.320,320,321.320,321.321.320,321.321.321.492.01.321.321.01.320,681.321.322.01.321.320,321.26].{\displaystyle M={\begin{matrix}A\\C\\G\\T\end{matrix}}{\begin{bmatrix}0.26&1.26&-1.32&-\infty &-\infty &1.26&1.49&-0.32&-1.32\\-0.32&-0.32&-1.32&-\infty &-\infty &-0.32&-1.32&-1.32&-0.32\\-1.32&-1.32&1.49&2.0&-\infty &-1.32&-1.32&1.0&-1.32\\0.68&-1.32&-1.32&-\infty &2.0&-1.32&-1.32&-0.32&1.26\end{bmatrix}}.}

Las entradas en la matriz dejan clara la ventaja de agregar pseudocuentas, especialmente cuando se utilizan conjuntos de datos pequeños para construir M. El modelo de fondo no necesita tener valores iguales para cada símbolo: por ejemplo, al estudiar organismos con un alto contenido de GC , los valores de C y G pueden aumentarse con una disminución correspondiente para los valores de A y T.{\displaystyle -\infty }

Cuando los elementos PWM se calculan utilizando logaritmos de verosimilitud, la puntuación de una secuencia se puede calcular sumando (en lugar de multiplicando) los valores relevantes en cada posición del PWM. La puntuación de la secuencia indica cuán diferente es la secuencia de una secuencia aleatoria. La puntuación es 0 si la secuencia tiene la misma probabilidad de ser un sitio funcional y de ser un sitio aleatorio. La puntuación es mayor que 0 si es más probable que sea un sitio funcional que un sitio aleatorio, y menor que 0 si es más probable que sea un sitio aleatorio que un sitio funcional. [ 1 ] La puntuación de la secuencia también se puede interpretar en un marco físico como la energía de enlace para esa secuencia.

Contenido informativo

El contenido de información (CI) de una PWM a veces resulta interesante, ya que indica cuán diferente es una PWM dada de una distribución uniforme .

La autoinformación que se obtiene al observar un símbolo particular en una posición particular del motivo es:

registro(pagi,j){\displaystyle -\log(p_{i,j})}

La autoinformación esperada (promedio) de un elemento particular en la matriz de pesos posicionales es entonces:

pagi,jregistro(pagi,j){\displaystyle -p_{i,j}\cdot \log(p_{i,j})}

Finalmente, el IC del PWM es entonces la suma de la autoinformación esperada de cada elemento:

i,jpagi,jregistro(pagi,j){\displaystyle \textstyle -\sum _{i,j}p_{i,j}\cdot \log(p_{i,j})}

A menudo, es más útil calcular el contenido de información con las frecuencias de letras de fondo de las secuencias que se están estudiando en lugar de asumir probabilidades iguales para cada letra (por ejemplo, el contenido de GC del ADN de bacterias termófilas varía de 65,3 a 70,8, [ 3 ] por lo que un motivo ATAT contendría mucha más información que un motivo CCGG). La ecuación para el contenido de información se convierte así en:

i,jpagi,jregistro(pagi,j/pagj){\displaystyle \textstyle -\sum _{i,j}p_{i,j}\cdot \log(p_{i,j}/p_{j})}

donde es la frecuencia de fondo para la letra . Esto corresponde a la divergencia de Kullback-Leibler o entropía relativa. Sin embargo, se ha demostrado que al usar PSSM para buscar secuencias genómicas (ver más abajo), esta corrección uniforme puede llevar a una sobreestimación de la importancia de las diferentes bases en un motivo, debido a la distribución desigual de n-meros en genomas reales, lo que conduce a un número significativamente mayor de falsos positivos. [ 4 ]pagj{\displaystyle p_{j}}j{\displaystyle j}

Usos

Existen diversos algoritmos para buscar coincidencias de PWM en secuencias. Un ejemplo es el algoritmo MATCH [ 5 ] , implementado en ModuleMaster [ 6 ] . En el software possumsearch se implementan algoritmos más sofisticados para la búsqueda rápida en bases de datos con PWM/PSSM de nucleótidos y aminoácidos [ 7 ] .

El modelo PWM/PSSM básico no puede manejar inserciones y eliminaciones. Un PSSM con probabilidades adicionales de inserción y eliminación en cada posición puede interpretarse como un modelo oculto de Markov . Este es el enfoque utilizado por Pfam . [ 8 ] [ 9 ]

Véase también

Referencias

  1. 1 2 Guigo, Roderic. "Una introducción a las matrices de puntuación específicas de posición" . bioinformatica.upf.edu . Recuperado el 12 de noviembre de 2013 .
  2. Nishida, K.; Frith, MC; Nakai, K. (23 de diciembre de 2008). "Pseudocuentas para sitios de unión de factores de transcripción" . Nucleic Acids Research . 37 (3): 939– 944. doi : 10.1093/nar/gkn1019 . PMC 2647310. PMID 19106141 .  
  3. Aleksandrushkina NI, Egorova LA (1978). "Composición de nucleótidos del ADN de bacterias termófilas del género Thermus". Microbiología . 47 (2): 250– 2. PMID 661633 . 
  4. Erill I, O'Neill MC (2009). "Una reevaluación de los métodos basados ​​en la teoría de la información para la identificación de sitios de unión al ADN" . BMC Bioinformatics . 10 : 57. doi : 10.1186/1471-2105-10-57 . PMC 2680408. PMID 19210776 .  
  5. Kel AE, et al. (2003). "MATCHTM: una herramienta para buscar sitios de unión de factores de transcripción en secuencias de ADN" . Nucleic Acids Research . 31 (13): 3576– 3579. doi : 10.1093/nar/ gkg585 . PMC 169193. PMID 12824369 .   
  6. ^ Wrzodek, Clemens; Schröder, Adrián; Dräger, Andreas; Wanke, Dierk; Berendzen, Kenneth W.; Kronfeld, Marcel; Harter, Klaus; Zell, Andreas (9 de octubre de 2009). "ModuleMaster: una nueva herramienta para descifrar redes reguladoras transcripcionales". Biosistemas . 99 (1): 79– 81. doi : 10.1016/j.biosystems.2009.09.005 . ISSN 0303-2647 . PMID 19819296 .  
  7. Beckstette, M.; et al. (2006). "Algoritmos y software rápidos basados ​​en índices para la comparación de matrices de puntuación específicas de posición" . BMC Bioinformatics . 7 : 389. doi : 10.1186/1471-2105-7-389 . PMC 1635428. PMID 16930469 .   
  8. Kim, Seyoung; Chikina, Maria. "PSC103 Primavera 2016 / HMMs y análisis de secuencias biológicas" (PDF) . csb.pitt.edu . Consultado el 14 de diciembre de 2023 .
  9. "¿Qué son los modelos ocultos de Markov de perfil?" . Pfam .
  • 3PFDB : una base de datos de los mejores perfiles PSSM representativos (BRP) de familias de proteínas, generados mediante un novedoso enfoque de minería de datos.
  • UGENE : diseño de matrices PSS, interfaz integrada con las bases de datos JASPAR, UniPROBE y SITECON.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Position_weight_matrix&oldid=1281175370 "