Articulo de referencia

Base de datos de clasificación estructural de proteínas

{{cite journal | vauthors = Andreeva A, Howorth D, Chandonia JM, Brenner SE, Hubbard TJ, Chothia C, Murzin AG | title = Data growth and its impact on the SCOP database: new deve...

La base de datos de Clasificación Estructural de Proteínas (SCOP) es una clasificación, en gran medida manual, de dominios estructurales de proteínas basada en similitudes entre sus estructuras y secuencias de aminoácidos . Una de las motivaciones de esta clasificación es determinar la relación evolutiva entre las proteínas. Las proteínas con la misma forma, pero con poca similitud de secuencia o función, se agrupan en diferentes superfamilias y se asume que tienen un ancestro común muy lejano. Las proteínas con la misma forma y cierta similitud de secuencia y/o función se agrupan en "familias" y se asume que tienen un ancestro común más cercano.

Al igual que las bases de datos CATH y Pfam , SCOP proporciona una clasificación de los dominios estructurales individuales de las proteínas, en lugar de una clasificación de las proteínas completas , que pueden incluir un número significativo de dominios diferentes.

La base de datos SCOP es de libre acceso en internet. SCOP se creó en 1994 en el Centro de Ingeniería de Proteínas y el Laboratorio de Biología Molecular . [ 3 ] Fue mantenida por Alexey G. Murzin y sus colegas en el Centro de Ingeniería de Proteínas hasta su cierre en 2010 y posteriormente en el Laboratorio de Biología Molecular en Cambridge, Inglaterra. [ 4 ] [ 5 ] [ 6 ] [ 1 ]

El trabajo en SCOP 1.75 se interrumpió en 2014. Desde entonces, el equipo de SCOP de la UC Berkeley se ha encargado de actualizar la base de datos de forma compatible, mediante una combinación de métodos automatizados y manuales. A partir de abril de 2019 , la última versión es SCOPe 2.07 (marzo de 2018). [ 2 ]

La nueva base de datos de Clasificación Estructural de Proteínas versión 2 (SCOP2) se publicó a principios de 2020. Esta actualización incluía un esquema de base de datos mejorado, una nueva API y una interfaz web modernizada. Fue la actualización más importante del grupo de Cambridge desde SCOP 1.75 y se basa en los avances del esquema del prototipo SCOP 2. [ 7 ]

Organización jerárquica

La fuente de estructuras proteicas es el Protein Data Bank . La unidad de clasificación de la estructura en SCOP es el dominio proteico . Lo que los autores de SCOP entienden por "dominio" se sugiere por su afirmación de que las proteínas pequeñas y la mayoría de las de tamaño mediano tienen solo un dominio, [ 8 ] y por la observación de que a la hemoglobina humana, [ 9 ] que tiene una estructura α2β2 , se le asignan dos dominios SCOP, uno para la subunidad α y otro para la subunidad β.

En SCOP, las formas de los dominios se denominan "pliegues". Los dominios que pertenecen al mismo pliegue tienen las mismas estructuras secundarias principales, con la misma disposición y las mismas conexiones topológicas. La versión 1.75 de SCOP incluye 1195 pliegues. Se proporcionan descripciones breves de cada pliegue. Por ejemplo, el pliegue "similar a la globina" se describe como núcleo: 6 hélices; hoja plegada, parcialmente abierta . El pliegue al que pertenece un dominio se determina mediante inspección, no mediante software.

Los niveles de SCOP versión 1.75 son los siguientes.

  1. Clase : Tipos de pliegues, por ejemplo, hojas beta.
  2. Pliegue: Las diferentes formas de los dominios dentro de una clase.
  3. Superfamilia : Los dominios de un pliegue se agrupan en superfamilias, que tienen al menos un ancestro común lejano.
  4. Familia : Los dominios de una superfamilia se agrupan en familias, que tienen un ancestro común más reciente.
  5. Dominio proteico: Los dominios de las familias se agrupan en dominios proteicos, que son esencialmente la misma proteína.
  6. Especies: Los dominios en "dominios de proteínas" se agrupan según la especie.
  7. Dominio: parte de una proteína. En el caso de proteínas simples, puede ser la proteína completa.

Clases

En la versión 1.75 de SCOP, los grupos más amplios son las clases de plegamiento de proteínas . Estas clases agrupan estructuras con una composición de estructura secundaria similar, pero con estructuras terciarias generales y orígenes evolutivos diferentes. Este es el nivel superior de la clasificación jerárquica de SCOP.

  1. Todas las proteínas alfa [46456] (284): Dominios que consisten en hélices α
  2. Todas las proteínas beta [48724] (174): Dominios que consisten en láminas β
  3. Proteínas alfa y beta (a/b) [51349] (147): Principalmente láminas beta paralelas (unidades beta-alfa-beta)
  4. Proteínas alfa y beta (a+b) [53931] (376): Principalmente láminas beta antiparalelas (regiones alfa y beta segregadas)
  5. Proteínas multidominio (alfa y beta) [56572] (66): Pliegues que constan de dos o más dominios pertenecientes a diferentes clases
  6. Proteínas y péptidos de membrana y superficie celular [56835] (58): No incluye proteínas del sistema inmunitario.
  7. Proteínas pequeñas [56992] (90): Generalmente dominadas por ligando metálico , cofactor y/o puentes disulfuro
  8. Proteínas de hélice enrollada [57942] (7): No es una clase verdadera
  9. Estructuras de proteínas de baja resolución [58117] (26): Péptidos y fragmentos. No es una clase verdadera.
  10. Péptidos [58231] (121): péptidos y fragmentos. No es una clase propiamente dicha.
  11. Proteínas diseñadas [58788] (44): Estructuras experimentales de proteínas con secuencias esencialmente no naturales. No es una clase verdadera.

El número entre corchetes, denominado "sunid", es un identificador entero único de SCOP para cada nodo en la jerarquía SCOP. El número entre paréntesis indica cuántos elementos hay en cada categoría. Por ejemplo, hay 284 pliegues en la clase "Todas las proteínas alfa". Cada miembro de la jerarquía es un enlace al siguiente nivel de la jerarquía.

Pliegues

Cada clase contiene varios pliegues distintos. Este nivel de clasificación indica una estructura terciaria similar, pero no necesariamente una relación evolutiva. Por ejemplo, la clase "Proteínas totalmente α" contiene más de 280 pliegues distintos, entre los que se incluyen: tipo globina (núcleo: 6 hélices; hoja plegada, parcialmente abierta), horquilla alfa larga (2 hélices; horquilla antiparalela, giro a la izquierda) y dominios dockerina de tipo I (repetición en tándem de dos motivos de bucle-hélice de unión al calcio, distintos del dominio EF-hand).

Superfamilias

Los dominios dentro de un pliegue se clasifican además en superfamilias . Esta es la agrupación más grande de proteínas para la cual la similitud estructural es suficiente para indicar parentesco evolutivo y, por lo tanto, comparten un ancestro común. Sin embargo, se presume que este ancestro es distante, porque los diferentes miembros de una superfamilia tienen baja identidad de secuencia . Por ejemplo, las dos superfamilias del pliegue "similar a la globina" son: la superfamilia de la globina y la superfamilia de la ferredoxina alfa-helicoidal (que contiene dos grupos Fe4-S4).

Familias

Las familias de proteínas están más estrechamente relacionadas que las superfamilias. Los dominios se colocan en la misma familia si tienen alguna de las siguientes características:

  1. >30% de identidad de secuencia
  2. cierta identidad de secuencia (por ejemplo, 15%) y realizar la misma función

La similitud en secuencia y estructura es evidencia de que estas proteínas tienen una relación evolutiva más cercana que las proteínas de la misma superfamilia. Las herramientas de secuenciación, como BLAST , se utilizan para ayudar a colocar dominios en superfamilias y familias. Por ejemplo, las cuatro familias en la superfamilia "similar a la globina" del pliegue "similar a la globina" son hemoglobina truncada (carece de la primera hélice), minihemoglobina del tejido nervioso (carece de la primera hélice pero por lo demás es más similar a las globinas convencionales que a las truncadas), globinas (proteína de unión al hemo) y proteínas ficobilisómicas similares a la ficocianina (oligómeros de dos tipos diferentes de subunidades similares a la globina que contienen dos hélices adicionales en el extremo N se unen a un cromóforo de bilina ). A cada familia en SCOP se le asigna una cadena de clasificación concisa, sccs , donde la letra identifica la clase a la que pertenece el dominio; Los siguientes números enteros identifican el pliegue, la superfamilia y la familia, respectivamente (por ejemplo, a.1.1.2 para la familia "Globin"). [ 10 ]

dominios de entrada de PDB

Un "TaxId" es el número de identificación taxonómica y enlaza con el navegador de taxonomías del NCBI , que proporciona más información sobre la especie a la que pertenece la proteína. Al hacer clic en una especie o isoforma, se muestra una lista de dominios. Por ejemplo, la proteína "Hemoglobina, cadena alfa del ser humano (Homo sapiens)" tiene más de 190 estructuras proteicas resueltas, como 2dn3 (en complejo con cmo) y 2dn1 (en complejo con hem, mbn y oxy). Se supone que al hacer clic en los números PDB se muestra la estructura de la molécula, pero los enlaces están rotos actualmente (los enlaces funcionan en versiones anteriores a SCOP).

Ejemplo

La mayoría de las páginas de SCOP incluyen un cuadro de búsqueda. Al introducir "tripsina +humana", se recuperan varias proteínas, incluida la proteína tripsinógeno humana. Al seleccionar esta entrada, se muestra una página que incluye el "linaje", que suele aparecer en la parte superior de la mayoría de las páginas de SCOP.

Linaje del tripsinogénico humano
  1. Raíz: alcance
  2. Clase: Todas las proteínas beta [48724]
  3. Plegado: Proteasas de serina similares a la tripsina [50493]
    barril, cerrado; n=6, S=8; clave griega
    duplicación: consiste en dos dominios del mismo pliegue
  4. Superfamilia: Proteasas de serina similares a la tripsina [50494]
  5. Familia: Proteasas eucariotas [50514]
  6. Proteína: tripsina (ógeno) [50515]
  7. Especie: Humano (Homo sapiens) [TaxId: 9606] [50519]

La búsqueda de "Subtilisina" devuelve la proteína "Subtilisina de Bacillus subtilis, Carlsberg", con el siguiente linaje.

Subtilisina de Bacillus subtilis, linaje Carlsberg
  1. Raíz: alcance
  2. Clase: Proteínas alfa y beta (a/b) [51349]
    Principalmente láminas beta paralelas (unidades beta-alfa-beta)
  3. Plegamiento: similar a la subtilisina [52742]
    3 capas: a/b/a, lámina beta paralela de 7 hebras, orden 2314567; conexión de cruce levógira entre las hebras 2 y 3.
  4. Superfamilia: similar a la subtilisina [52743]
  5. Familia: Subtilasas [52744]
  6. Proteína: Subtilisina [52745]
  7. Especie: Bacillus subtilis, carlsberg [TaxId: 1423] [52746]

Aunque ambas proteínas son proteasas, ni siquiera pertenecen al mismo plegamiento, lo cual es coherente con que sean un ejemplo de evolución convergente .

Comparación con otros sistemas de clasificación

La clasificación SCOP depende más de decisiones manuales que la clasificación semiautomática de CATH , su principal competidora. Se utiliza la experiencia humana para decidir si ciertas proteínas están relacionadas evolutivamente y, por lo tanto, deben asignarse a la misma superfamilia , o si su similitud es resultado de restricciones estructurales y, por lo tanto, pertenecen al mismo plegamiento . Otra base de datos, FSSP , se genera de forma totalmente automática (incluidas actualizaciones automáticas periódicas), pero no ofrece ninguna clasificación, lo que permite al usuario llegar a sus propias conclusiones sobre la importancia de las relaciones estructurales basándose en comparaciones por pares de estructuras proteicas individuales.

Sucesores de SCOP

Para 2009, la base de datos SCOP original clasificaba manualmente 38 000 entradas PDB en una estructura estrictamente jerárquica. Con el ritmo acelerado de las publicaciones sobre estructuras de proteínas, la limitada automatización de la clasificación no pudo mantenerse al día, lo que dio lugar a un conjunto de datos incompleto. La base de datos Structural Classification of Proteins extended (SCOPe) se publicó en 2012 con una automatización mucho mayor del mismo sistema jerárquico y es totalmente compatible con versiones anteriores de SCOP 1.75. En 2014, se reintrodujo la curación manual en SCOPe para mantener una asignación precisa de la estructura. En febrero de 2015, SCOPe 2.05 clasificaba 71 000 de las 110 000 entradas PDB totales. [ 11 ]

El prototipo SCOP2 fue una versión beta de la Clasificación Estructural de Proteínas y un sistema de clasificación que buscaba representar la complejidad evolutiva inherente a la evolución de la estructura proteica. [ 12 ] Por lo tanto, no se trata de una jerarquía simple, sino de una red gráfica acíclica dirigida que conecta superfamilias de proteínas que representan relaciones estructurales y evolutivas como permutaciones circulares , fusión de dominios y degradación de dominios. En consecuencia, los dominios no están separados por límites fijos estrictos, sino que se definen por sus relaciones con las estructuras más similares. El prototipo se utilizó para el desarrollo de la base de datos SCOP versión 2. [ 7 ] La versión 2 de SCOP, publicada en enero de 2020, contiene 5134 familias y 2485 superfamilias en comparación con las 3902 familias y 1962 superfamilias de SCOP 1.75. Los niveles de clasificación organizan más de 41 000 dominios no redundantes que representan más de 504 000 estructuras proteicas.

La base de datos Evolutionary Classification of Protein Domains (ECOD), publicada en 2014, es una expansión de SCOP versión 1.75 similar a SCOPe. A diferencia de SCOPe, compatible con esta última, renombra la jerarquía clase-pliegue-superfamilia-familia en una agrupación arquitectura-X-homología-topología-familia (A-XHTF), con el último nivel definido principalmente por Pfam y complementado por la agrupación HHsearch para secuencias no categorizadas. [ 13 ] ECOD tiene la mejor cobertura de PDB de los tres sucesores: cubre todas las estructuras de PDB y se actualiza quincenalmente. [ 14 ] El mapeo directo a Pfam ha demostrado ser útil para los curadores de Pfam que utilizan la categoría de nivel de homología para complementar su agrupación de "clanes". [ 15 ]

Véase también

Referencias

  1. 1 2 Andreeva A, Howorth D, Chandonia JM, Brenner SE, Hubbard TJ, Chothia C, Murzin AG (enero de 2008). "Crecimiento de datos y su impacto en la base de datos SCOP: nuevos desarrollos" . Nucleic Acids Research . 36 (número especial sobre bases de datos): D419-25. doi : 10.1093/nar/ gkm993 . PMC 2238974. PMID 18000004 .  
  2. 1 2 Chandonia JM, Fox NK, Brenner SE (enero de 2019). "SCOPe: clasificación de grandes estructuras macromoleculares en la base de datos extendida de clasificación estructural de proteínas" . Nucleic Acids Research . 47 (D1): D475– D481. doi : 10.1093 / nar/gky1134 . PMC 6323910. PMID 30500919 .  
  3. Murzin AG, Brenner SE, Hubbard T, Chothia C (abril de 1995). "SCOP: una base de datos de clasificación estructural de proteínas para la investigación de secuencias y estructuras". Journal of Molecular Biology . 247 (4): 536– 40. doi : 10.1016/S0022-2836(05)80134-2 . PMID 7723011 . 
  4. Hubbard TJ , Ailey B, Brenner SE , Murzin AG, Chothia C (enero de 1999). "SCOP: una base de datos de clasificación estructural de proteínas" . Nucleic Acids Research . 27 (1): 254–6 . doi : 10.1093/nar/27.1.254 . PMC 148149. PMID 9847194 .  
  5. ^ Lo Conte L, Ailey B, Hubbard TJ, Brenner SE, Murzin AG, Chothia C (enero de 2000). "SCOP: una base de datos de clasificación estructural de proteínas" . Investigación de ácidos nucleicos . 28 (1): 257– 9. doi : 10.1093/nar/28.1.257 . PMC 102479 . PMID 10592240 .  
  6. Andreeva A, Howorth D, Brenner SE, Hubbard TJ, Chothia C, Murzin AG (enero de 2004). "Base de datos SCOP en 2004: refinamientos integran datos de familia de estructura y secuencia" . Nucleic Acids Research . 32 (número especial de bases de datos): D226-9. doi : 10.1093/nar/ gkh039 . PMC 308773. PMID 14681400 .  
  7. 1 2 Andreeva A, Kulesha E, Gough J, Murzin AG (enero de 2020). "Base de datos SCOP en 2020: clasificación ampliada de dominios representativos de familias y superfamilias de estructuras proteicas conocidas" . Nucleic Acids Research . 48 (número especial de bases de datos): D376– D382. doi : 10.1093/nar/ gkz1064 . PMC 7139981. PMID 31724711 .  
  8. Murzin AG, Brenner SE , Hubbard T , Chothia C (abril de 1995). "SCOP: una base de datos de clasificación estructural de proteínas para la investigación de secuencias y estructuras" (PDF) . Journal of Molecular Biology . 247 (4): 536–40 . doi : 10.1016/S0022-2836(05)80134-2 . PMID 7723011. Archivado del original (PDF) el 26 de abril de 2012. 
  9. PDB : 2DN1 ​;Park SY, Yokoyama T, Shibayama N, Shiro Y, Tame JR (julio de 2006). "Estructuras cristalinas de hemoglobina humana con una resolución de 1,25 Å en las formas oxi, desoxi y carbonmonoxi". Journal of Molecular Biology . 360 (3): 690–701 . doi : 10.1016/j.jmb.2006.05.036 . PMID 16765986 . 
  10. Lo Conte L, Brenner SE, Hubbard TJ, Chothia C, Murzin AG (enero de 2002). "Base de datos SCOP en 2002: refinamientos para acomodar la genómica estructural" . Nucleic Acids Research . 30 (1): 264–7 . doi : 10.1093 / nar/30.1.264 . PMC 99154. PMID 11752311 .  
  11. "¿Cuál es la relación entre SCOP, SCOPe y SCOP2?" . scop.berkeley.edu . Consultado el 22 de agosto de 2015 .
  12. Andreeva A, Howorth D, Chothia C, Kulesha E, Murzin AG (enero de 2014). "Prototipo SCOP2: un nuevo enfoque para la minería de estructuras proteicas" . Nucleic Acids Research . 42 (número especial de bases de datos): D310-4. doi : 10.1093/nar/gkt1242 . PMC 3964979. PMID 24293656 .  
  13. Cheng H, Schaeffer RD, Liao Y, Kinch LN, Pei J, Shi S, Kim BH, Grishin NV (diciembre de 2014). "ECOD: una clasificación evolutiva de dominios proteicos" . PLOS Computational Biology . 10 (12) e1003926. Bibcode : 2014PLSCB..10E3926C . doi : 10.1371/ journal.pcbi.1003926 . PMC 4256011. PMID 25474468 .  
  14. "Clasificación evolutiva de dominios proteicos" . prodata.swmed.edu . Consultado el 18 de mayo de 2019 .
  15. El-Gebali S, Mistry J, Bateman A, Eddy SR, Luciani A, Potter SC, Qureshi M, Richardson LJ, Salazar GA, Smart A, Sonnhammer EL, Hirsh L, Paladin L, Piovesan D, Tosatto SC, Finn RD (enero de 2019). "La base de datos de familias de proteínas Pfam en 2019" . Nucleic Acids Research . 47 (D1): D427– D432. doi : 10.1093/nar/ gky995 . PMC 6324024. PMID 30357350 .  
  • Clasificación estructural de proteínas (SCOP 2): clasificación manual de dominios representativos, actualizada periódicamente por los autores de SCOP.
  • Clasificación estructural de proteínas (SCOP 1.75) - Sitio web antiguo de SCOP 1.75, ya no se actualiza.
  • Clasificación estructural de proteínas extendida (SCOPe): el sucesor más automatizado de la versión 1.75 de SCOP.
  • Clasificación evolutiva de dominios proteicos (ECOD): clasificación evolutiva basada en SCOP versión 1.75 y Pfam.
  • Clasificación estructural de proteínas 2 (prototipo SCOP2) - Sitio web antiguo del prototipo SCOP 2, ya no se actualiza.
  • SUPERFAMILIA - Biblioteca de HMM que representan superfamilias SCOP y base de datos de anotaciones (de superfamilia y familia) para todos los organismos completamente secuenciados.
  • Clasificación de la estructura de las proteínas : un capítulo de libro que analiza en detalle las diferentes clasificaciones de proteínas.