Articulo de referencia

BLOSUM

En la matriz BLOSUM62, los aminoácidos se han agrupado y coloreado según el esquema de clasificación de Margaret Dayhoff . Los valores positivos y cero se han resaltado. En bioi...

En la matriz BLOSUM62, los aminoácidos se han agrupado y coloreado según el esquema de clasificación de Margaret Dayhoff . Los valores positivos y cero se han resaltado.

En bioinformática , la matriz BLOSUM ( BLO cks SU bstitution Matriz ) es una matriz de sustitución utilizada para el alineamiento de secuencias de proteínas . Las matrices BLOSUM se utilizan para puntuar alineamientos entre secuencias de proteínas evolutivamente divergentes . Se basan en alineamientos locales. Las matrices BLOSUM fueron introducidas por primera vez en un artículo de Steven Henikoff y Jorja Henikoff. [ 1 ] Escanearon la base de datos BLOCKS para regiones muy conservadas de familias de proteínas (que no tienen huecos en el alineamiento de secuencias) y luego contaron las frecuencias relativas de aminoácidos y sus probabilidades de sustitución. Luego, calcularon una puntuación de log-odds para cada uno de los 210 pares de sustitución posibles de los 20 aminoácidos estándar. Todas las matrices BLOSUM se basan en alineamientos observados; no se extrapolan a partir de comparaciones de proteínas estrechamente relacionadas como las matrices PAM .

Antecedentes biológicos

Las instrucciones genéticas de cada célula en replicación en un organismo vivo están contenidas en su ADN. [ 2 ] A lo largo de la vida de la célula, esta información se transcribe y replica mediante mecanismos celulares para producir proteínas o proporcionar instrucciones a las células hijas durante la división celular , y existe la posibilidad de que el ADN se altere durante estos procesos. [ 2 ] [ 3 ] Esto se conoce como mutación . A nivel molecular, existen sistemas reguladores que corrigen la mayoría —pero no todos— de estos cambios en el ADN antes de su replicación. [ 3 ] [ 4 ]

La funcionalidad de una proteína depende en gran medida de su estructura. [ 5 ] Cambiar un solo aminoácido en una proteína puede reducir su capacidad para realizar esta función, o la mutación puede incluso cambiar la función que la proteína realiza. [ 3 ] Cambios como estos pueden afectar gravemente una función crucial en una célula, pudiendo causar la muerte de la célula y, en casos extremos, del organismo. [ 6 ] Por el contrario, el cambio puede permitir que la célula continúe funcionando, aunque de manera diferente, y la mutación puede transmitirse a la descendencia del organismo. Si este cambio no resulta en ninguna desventaja física significativa para la descendencia, existe la posibilidad de que esta mutación persista en la población. También existe la posibilidad de que el cambio de función se vuelva ventajoso.

Los 20 aminoácidos traducidos por el código genético varían considerablemente según las propiedades físicas y químicas de sus cadenas laterales. [ 5 ] Sin embargo, estos aminoácidos pueden clasificarse en grupos con propiedades fisicoquímicas similares. [ 5 ] Sustituir un aminoácido por otro de la misma categoría tiene menos probabilidades de afectar la estructura y función de una proteína que reemplazarlo por un aminoácido de una categoría diferente.

El alineamiento de secuencias es un método de investigación fundamental para la biología moderna. El alineamiento de secuencias más común para proteínas consiste en buscar similitudes entre diferentes secuencias para inferir su función o establecer relaciones evolutivas. Esto ayuda a los investigadores a comprender mejor el origen y la función de los genes a través de la naturaleza de la homología y la conservación . Las matrices de sustitución se utilizan en algoritmos para calcular la similitud de diferentes secuencias de proteínas; sin embargo, la utilidad de la matriz PAM de Dayhoff ha disminuido con el tiempo debido al requisito de secuencias con una similitud superior al 85 %. Para subsanar esta deficiencia, Henikoff y Henikoff introdujeron la matriz BLOSUM (BLOcks SUbstitution Matrix), que produjo mejoras notables en los alineamientos y en las búsquedas utilizando consultas de cada uno de los grupos de proteínas relacionadas. [ 1 ]

Terminología

BLOSUM
Matriz de sustitución de bloques, una matriz de sustitución utilizada para el alineamiento de secuencias de proteínas .
Métricas de puntuación (estadísticas frente a biológicas)
Al evaluar un alineamiento de secuencias, es importante conocer su relevancia. Esto requiere una matriz de puntuación, o una tabla de valores que describa la probabilidad de que un par de residuos de aminoácidos o nucleótidos biológicamente significativos aparezca en el alineamiento. Las puntuaciones para cada posición se obtienen a partir de las frecuencias de sustituciones en bloques de alineamientos locales de secuencias de proteínas. [ 7 ]
BLOSUM r
La matriz construida a partir de bloques con menos del r% de similitud.
  • Por ejemplo, BLOSUM62 es la matriz construida utilizando secuencias con menos del 62 % de similitud (las secuencias con ≥ 62 % de identidad se agruparon juntas).
  • Nota: BLOSUM 62 es la matriz predeterminada para BLAST de proteínas. La experimentación ha demostrado que la matriz BLOSUM-62 es una de las mejores para detectar la mayoría de las similitudes débiles entre proteínas. [ 1 ]

Existen varios conjuntos de matrices BLOSUM que utilizan diferentes bases de datos de alineación, identificadas con números. Las matrices BLOSUM con números altos están diseñadas para comparar secuencias estrechamente relacionadas, mientras que las de números bajos se utilizan para comparar secuencias distantemente relacionadas. Por ejemplo, BLOSUM80 se usa para alineaciones estrechamente relacionadas y BLOSUM45 para alineaciones más distantemente relacionadas. Las matrices se crearon fusionando (agrupando) todas las secuencias que presentaban una similitud superior a un porcentaje determinado en una sola secuencia, y luego comparando únicamente esas secuencias (que presentaban una divergencia superior al porcentaje especificado); reduciendo así la contribución de las secuencias estrechamente relacionadas. El porcentaje utilizado se añadió al nombre, dando como resultado, por ejemplo, BLOSUM80, donde se agruparon secuencias con una identidad superior al 80 %.

Construcción de matrices BLOSUM

Las matrices BLOSUM se obtienen utilizando bloques de secuencias de aminoácidos similares como datos, y luego aplicando métodos estadísticos a los datos para obtener las puntuaciones de similitud. Pasos de los métodos estadísticos: [ 8 ]

Eliminación de secuencias

Elimine las secuencias que sean idénticas en más del r%. Existen dos maneras de eliminar las secuencias: eliminando las secuencias del bloque o buscando secuencias similares y reemplazándolas por nuevas secuencias que representen el clúster. La eliminación se realiza para descartar las secuencias de proteínas que sean más similares que el umbral especificado.

Cálculo de frecuencia y probabilidad

Una base de datos que almacena los alineamientos de secuencias de las regiones más conservadas de familias de proteínas. Estos alineamientos se utilizan para derivar las matrices BLOSUM. Solo se utilizan las secuencias con un porcentaje de identidad inferior al umbral. Mediante el uso del bloque, se cuentan los pares de aminoácidos en cada columna del alineamiento múltiple.

razón de probabilidades logarítmicas

Indica la proporción de la frecuencia de aparición de cada combinación de aminoácidos en los datos observados con respecto al valor esperado de la frecuencia de aparición del par. Se redondea y se utiliza en la matriz de sustitución.

LogramoOddRatio=2registro2(PAG(O)PAG(mi)){\displaystyle LogOddRatio=2\log _{2}{\left({\frac {P\left(O\right)}{P\left(E\right)}}\right)}}

dóndePAG(O){\displaystyle P\left(O\right)}es la probabilidad de observar el par yPAG(mi){\displaystyle P\left(E\right)}es la probabilidad esperada de que ocurra tal par, dadas las probabilidades de fondo de cada aminoácido.

Matrices BLOSUM

Las probabilidades de parentesco se calculan a partir del logaritmo de la razón de probabilidades, que luego se redondean para obtener las matrices de sustitución BLOSUM.

Puntuación de las matrices BLOSUM

Se requiere una matriz de puntuación o una tabla de valores para evaluar la significancia de una alineación de secuencias, como por ejemplo, para describir la probabilidad de que un par de residuos de aminoácidos o nucleótidos biológicamente significativos aparezca en una alineación. Normalmente, cuando se comparan dos secuencias de nucleótidos, solo se puntúa si dos bases son iguales en una posición. A todas las coincidencias y discrepancias se les asigna la misma puntuación (normalmente +1 o +5 para las coincidencias y -1 o -4 para las discrepancias). [ 9 ] Pero es diferente para las proteínas. Las matrices de sustitución para aminoácidos son más complejas e implícitamente tienen en cuenta todo lo que podría afectar la frecuencia con la que un aminoácido se sustituye por otro. El objetivo es proporcionar una penalización relativamente alta para alinear dos residuos si tienen una baja probabilidad de ser homólogos (correctamente alineados por descendencia evolutiva). Dos fuerzas principales hacen que las tasas de sustitución de aminoácidos se alejen de la uniformidad: las sustituciones ocurren con diferentes frecuencias y son menos toleradas funcionalmente que otras. Por lo tanto, las sustituciones son seleccionadas en contra. [ 7 ]

Las matrices de sustitución más utilizadas incluyen la matriz de sustitución por bloques (BLOSUM) [ 1 ] y la matriz de mutación puntual aceptada (PAM) [ 10 ] [ 11 ] . Ambas se basan en tomar conjuntos de alineamientos de alta confianza de muchas proteínas homólogas y evaluar las frecuencias de todas las sustituciones, pero se calculan utilizando métodos diferentes. [ 7 ]

Las puntuaciones dentro de un BLOSUM son puntuaciones de log-odds que miden, en una alineación, el logaritmo de la razón de la probabilidad de que dos aminoácidos aparezcan con un sentido biológico y la probabilidad de que los mismos aminoácidos aparezcan por azar. Las matrices se basan en el porcentaje mínimo de identidad de la secuencia de proteína alineada utilizada para calcularlas. [ 12 ] A cada identidad o sustitución posible se le asigna una puntuación basada en sus frecuencias observadas en la alineación de proteínas relacionadas. [ 13 ] Se da una puntuación positiva a las sustituciones más probables, mientras que se da una puntuación negativa a las sustituciones menos probables.

Para calcular una matriz BLOSUM, se utiliza la siguiente ecuación:

Sij=1λregistropagijqiqj{\displaystyle S_{ij}={\frac {1}{\lambda }}\log {\frac {p_{ij}}{q_{i}q_{j}}}}

Aquí,pagij{\displaystyle p_{ij}}es la probabilidad de dos aminoácidosi{\displaystyle i}yj{\displaystyle j}sustituyéndose entre sí en una secuencia homóloga, yqi{\displaystyle q_{i}}yqj{\displaystyle q_{j}}son las probabilidades de fondo de encontrar los aminoácidosi{\displaystyle i}yj{\displaystyle j}en cualquier secuencia de proteínas. El factorλ{\displaystyle \lambda }es un factor de escala, establecido de tal manera que la matriz contenga valores enteros fácilmente computables.

Variantes

BLOSUM

BLOSUM80: más proteínas relacionadas

BLOSUM62: gama media

BLOSUM45: proteínas distantemente relacionadas

La matriz BLOSUM62 con los aminoácidos en la tabla agrupados según la química de la cadena lateral, como en (a). Cada valor en la matriz se calcula dividiendo la frecuencia de aparición del par de aminoácidos en la base de datos BLOCKS, agrupada al nivel del 62%, entre la probabilidad de que los mismos dos aminoácidos se alineen por casualidad. La razón luego se convierte a un logaritmo y se expresa como una puntuación de logaritmo de probabilidades, como para PAM. Las matrices BLOSUM generalmente se escalan en unidades de medio bit. [ 14 ] Una puntuación de cero indica que la frecuencia con la que se encontraron alineados dos aminoácidos dados en la base de datos fue la esperada por casualidad, mientras que una puntuación positiva indica que la alineación se encontró con más frecuencia que por casualidad, y una puntuación negativa indica que la alineación se encontró con menos frecuencia que por casualidad.

PMB

La matriz de probabilidad de bloques (PMB, por sus siglas en inglés) de 2004 utiliza la aditividad de las distancias evolutivas para mejorar el análisis de la base de datos BLOSUM. La versión actualizada de BLOSUM de 2001 se utilizó para generar un nuevo conjunto de matrices BLOSUM. Las "frecuencias de sustitución observadas" que se encuentran en estas matrices BLOSUM se utilizan para estimar las frecuencias de sustitución reales (con una mayor distancia evolutiva, es decir, un r menor , algunas sustituciones posteriores pueden enmascarar sustituciones anteriores). Por lo tanto, PMB define un modelo evolutivo verdadero como lo hacen PAM y JTT. No es una matriz simétrica . [ 15 ]

RBLOSUM

El código original escrito por Henikoff y Henikoff no se ajusta exactamente a la descripción del algoritmo que aparece en su artículo [ 1 ] . El BLOSUM62 de dicho programa se ha utilizado durante muchos años como estándar. Sorprendentemente, el BLOSUM62, aunque mal calculado, mejora el rendimiento de la búsqueda en comparación con la versión corregida de 2008 de la misma entropía relativa (RBLOSUM64). [ 16 ]

Un artículo de 2018 afirma que RBLOSUM es mejor que BLOSUM y CorBLOSUM. [ 17 ]

CorBLOSUM

Un artículo de 2016 encuentra más errores en el código original que no fueron corregidos por la corrección RBLOSUM de 2008. La versión corregida de este artículo, CorBLOSUM, logra ser más efectiva que BLOSUM en la búsqueda de similitud en aproximadamente el 75% de los casos. [ 18 ]

Algunos usos en bioinformática

Aplicaciones de investigación

Las puntuaciones BLOSUM se utilizaron para predecir y comprender las variantes del gen de superficie entre los portadores del virus de la hepatitis B [ 19 ] y los epítopos de células T. [ 20 ]

Variantes del gen de superficie entre portadores del virus de la hepatitis B

Se obtuvieron secuencias de ADN del HBsAg de 180 pacientes, de los cuales 51 eran portadores crónicos del VHB y 129 pacientes recién diagnosticados, y se compararon con secuencias consenso construidas con 168 secuencias del VHB importadas de GenBank . Se utilizó una revisión bibliográfica y puntuaciones BLOSUM para definir la antigenicidad potencialmente alterada. [ 19 ]

Predicción fiable de epítopos de células T

Se ha desarrollado una nueva representación de entrada que consiste en una combinación de codificación dispersa, codificación Blosum y entrada derivada de modelos ocultos de Markov. Este método predice epítopos de células T para el genoma del virus de la hepatitis C y analiza posibles aplicaciones del método de predicción para guiar el proceso de diseño racional de vacunas. [ 20 ]

Uso en BLAST

Las matrices BLOSUM también se utilizan como matriz de puntuación al comparar secuencias de ADN o secuencias de proteínas para evaluar la calidad del alineamiento. Este sistema de puntuación es utilizado por una amplia gama de software de alineamiento, incluido BLAST . [ 21 ]

Comparación de PAM y BLOSUM

Además de las matrices BLOSUM, se puede utilizar una matriz de puntuación desarrollada previamente. Esta se conoce como PAM . Ambas arrojan el mismo resultado de puntuación, pero utilizan metodologías diferentes. BLOSUM analiza directamente las mutaciones en motivos de secuencias relacionadas, mientras que las PAM extrapolan información evolutiva basándose en secuencias estrechamente relacionadas. [ 1 ]

Dado que tanto PAM como BLOSUM son métodos diferentes para mostrar la misma información de puntuación, ambos pueden compararse, pero debido al método muy diferente para obtener esta puntuación, un PAM100 no es igual a un BLOSUM100. [ 22 ]

La relación entre PAM y BLOSUM
Las diferencias entre PAM y BLOSUM

Disponibilidad

La versión de referencia de BLOSUM se encuentra en los kits de herramientas del NCBI . Tanto el antiguo (obsoleto) kit de herramientas C del NCBI como el actual kit de herramientas C++ del NCBI proporcionan las matrices BLOSUM45, BLOSUM50, BLOSUM62, BLOSUM80 y BLOSUM90. Ambos también ofrecen API para utilizar las matrices. [ 24 ] [ 25 ]

El código fuente original para calcular BLOSUM también se encuentra en el sitio web del NCBI, en https://ftp.ncbi.nih.gov/repository/blocks/unix/blosum/ . Este archivo "blosum.tar.Z" representa la versión original con errores de cálculo y un rendimiento de búsqueda mejorado de 1992. [ 16 ] El archivo también contiene resultados de BLOSUM precalculados en los siguientes niveles de similitud: "-2" (blosumn), 30, 40, 45, 50, 55, 60, 62, 65, 70, 75, 80, 85, 90, 95 y 100. [ 26 ]

Paquetes de software

Existen varios paquetes de software en diferentes lenguajes de programación que permiten un uso sencillo de las matrices de Blosum. Además de los mencionados kits de herramientas del NCBI, existen:

...y muchos más.

Véase también

Referencias

  1. 1 2 3 4 5 6 Henikoff, Steven; Henikoff, Jorja G. (15 de noviembre de 1992). "Matrices de sustitución de aminoácidos a partir de bloques de proteínas" . Actas de la Academia Nacional de Ciencias . 89 (22): 10915– 10919. Bibcode : 1992PNAS...8910915H . doi : 10.1073 / pnas.89.22.10915 . PMC 50453. PMID 1438297 .  
  2. 1 2 Campbell, NA; Reece, JB; Meyers, N; Urry, LA; Cain, ML; Wasserman, SA; Minorsky, PV; Jackson, RB (2009). "La base molecular de la herencia". Biología: Versión australiana (8.ª ed.). Pearson Education Australia. págs. 307–325 . ISBN   9781442502215.
  3. 1 2 3 Campbell, NA; Reece, JB; Meyers, N; Urry, LA; Cain, ML; Wasserman, SA; Minorsky, PV; Jackson, RB (2009). "Del gen a la proteína". Biología: Versión australiana (8.ª ed.). Pearson Education Australia. págs. 327–350 . ISBN   9781442502215.
  4. ^ Amigo, Jayanta K; Ghaskadbi, Saroj S (2009). "Daño, reparación y recombinación del ADN". Fundamentos de biología molecular (1ª ed.). Prensa de la Universidad de Oxford. págs. 187-203 . ISBN   9780195697810.
  5. 1 2 3 Campbell, NA; Reece, JB; Meyers, N; Urry, LA; Cain, ML; Wasserman, SA; Minorsky, PV; Jackson, RB (2009). "La estructura y función de las grandes moléculas biológicas". Biología: Versión australiana (8.ª ed.). Pearson Education Australia. págs. 68–89 . ISBN   9781442502215.
  6. Lobo, Ingrid (2008). "Proporciones mendelianas y genes letales" . Nature . Consultado el 19 de octubre de 2013 .
  7. 1 2 3 Pertsemlidis, Alexander; Fondon, John W (octubre de 2001). "Divirtiéndose a lo grande con la bioinformática (y evitando la BLASTfemia)" . Genome Biology . 2 (10): reviews2002.1–reviews2002.10. doi : 10.1186/gb-2001-2-10-reviews2002 . PMC 138974. PMID 11597340 .  
  8. «MATRICES BLOSSUM: Introducción a la BIOINFORMÁTICA» (PDF) . UNIVERSITI TEKNOLOGI MALASIA . 2009 . Consultado el 9 de septiembre de 2014 .
  9. ^ Sivaramakrishnan, Murali; Perisic, Ognjen; Ranjan, Shashi. "CS#594 - Grupo 13 (Herramientas y software)" (PDF) . Universidad de Illinois en Chicago-UIC . Consultado el 9 de septiembre de 2014 .
  10. Dayhoff, Margaret O. (1978). "22". Atlas de secuencia y estructura de proteínas . Vol. 5. Washington DC: National Biomedical Research Foundation. pp. 345–352 .  
  11. States, D; Gish, W; Altschul, S (agosto de 1991). "Mejora de la sensibilidad de las búsquedas en bases de datos de ácidos nucleicos mediante matrices de puntuación específicas de la aplicación". Methods . 3 (1): 66– 70. CiteSeerX 10.1.1.114.8183 . doi : 10.1016/s1046-2023(05)80165-3 . ISSN 1046-2023 .  
  12. Zomaya, Albert Y. (2006). Manual de computación innovadora e inspirada en la naturaleza . Nueva York, NY: Springer. ISBN 978-0-387-40532-2.página 673
  13. Sistemas de puntuación del NIH
  14. Para el uso de unidades de bits, consulte la discusión en https://ftp.ncbi.nih.gov/repository/blocks/unix/blosum/README
  15. Veerassamy, Shalini; Smith, Andrew; Tillier, Elisabeth RM (diciembre de 2003). "Un modelo de probabilidad de transición para sustituciones de aminoácidos a partir de bloques". Journal of Computational Biology . 10 (6): 997– 1010. doi : 10.1089/106652703322756195 . PMID 14980022 . 
  16. 1 2 Styczynski, Mark P; Jensen, Kyle L; Rigoutsos, Isidore; Stephanopoulos, Gregory (marzo de 2008). "Los errores de cálculo de BLOSUM62 mejoran el rendimiento de la búsqueda". Nature Biotechnology . 26 (3): 274– 275. doi : 10.1038/nbt0308-274 . PMID 18327232 . S2CID 205266180 .  
  17. Govindarajan, R; Leela, BC; Nair, AS (21 de mayo de 2018). "RBLOSUM funciona mejor que CorBLOSUM con menor error por consulta" . BMC Research Notes . 11 (1): 328. doi : 10.1186/s13104-018-3415-5 . PMC 5963171. PMID 29784028 .  
  18. Hess, M; Keul, F; Goesele, M; Hamacher, K (27 de abril de 2016). "Abordar las imprecisiones en el cálculo de BLOSUM mejora el rendimiento de la búsqueda de homología" . BMC Bioinformatics . 17 : 189. doi : 10.1186/s12859-016-1060-3 . PMC 4849092. PMID 27122148 .  
  19. 1 2 Roque-Afonso, Anne Marie; Férey, Marie-Pierre; Ly, Thoai Duong; Graube, Arielle; Costa-Faria, Luciana; Samuel, Didier; Dussaix, Elisabeth (noviembre de 2007). "Factores virales y clínicos asociados con variantes del gen de superficie entre portadores del virus de la hepatitis B" . Terapia antiviral . 12 (8): 1255– 1264. doi : 10.1177/135965350701200801 . PMID 18240865. S2CID 9822759 .  
  20. ^ Nielsen , Morten; Lundegaard, Claus; Llevando, Peder; Lauemøller, Sanne Lise; Lamberth, Kasper; Buus, Søren; Brunak, Søren; Lund, Ole (mayo de 2003). "Predicción confiable de epítopos de células T utilizando redes neuronales con representaciones de secuencias novedosas" . Ciencia de las proteínas . 12 (5): 1007– 1017. doi : 10.1110/ps.0239403 . PMC 2323871 . PMID 12717023 .  
  21. "Estadísticas de las puntuaciones de similitud de secuencias" . Centro Nacional de Información Biotecnológica . Consultado el 20 de octubre de 2013 .
  22. Saud, Omama (2009). "Matrices de sustitución PAM y BLOSUM" . Birec . Archivado del original el 9 de marzo de 2013. Recuperado el 20 de octubre de 2013 .
  23. "El arte de alinear secuencias de proteínas Parte 1 Matrices" . Dai hoc Can Tho - Universidad de Can Tho . Archivado del original el 11 de septiembre de 2014. Recuperado el 7 de septiembre de 2014 .
  24. "NCBI C Toolkit - /c/data/" . www.ncbi.nlm.nih.gov .
  25. "ncbi-cxx-toolkit-public/src/util/tables en main · ncbi/ncbi-cxx-toolkit-public" . GitHub .
  26. LÉAME de blosum.tar.Z
  • Sean R. Eddy (2004). "¿De dónde provino la matriz de puntuación de alineación BLOSUM62?". Nature Biotechnology . 22 (8): 1035– 6. doi : 10.1038/nbt0804-1035 . PMID 15286655. S2CID 205269887 .  
  • BLOQUEA el servidor WWW
  • Sistemas de puntuación para BLAST en NCBI
  • Archivos de datos de matrices, incluidas BLOSUM30 100, en el servidor FTP del NCBI .
  • Visualización interactiva de la red BLOSUM archivada el 30 de enero de 2017 en Wayback Machine.
Obtenido de " https://en.wikipedia.org/w/index.php?title=BLOSUM&oldid=1307037722 "