La base de datos de dominios conservados ( CDD ) es una base de datos de modelos de alineación de secuencias múltiples bien anotados y modelos de búsqueda de bases de datos derivados, para dominios antiguos y proteínas de longitud completa. [1]
Filosofía
Los dominios pueden considerarse unidades funcionales y/o estructurales diferenciadas de una proteína. De hecho, estas dos clasificaciones coinciden con bastante frecuencia, y lo que se encuentra como una unidad de plegamiento independiente de una cadena polipeptídica también conlleva una función específica. Los dominios suelen identificarse como unidades recurrentes (de secuencia o estructura), que pueden existir en diversos contextos. En la evolución molecular, dichos dominios pueden haberse utilizado como bloques de construcción y pueden haberse recombinado en diferentes disposiciones para modular la función de la proteína. La CDD define los dominios conservados como unidades recurrentes en la evolución molecular, cuya extensión puede determinarse mediante análisis de secuencia y estructura.
El objetivo del proyecto de conservación de dominios conservados del NCBI es proporcionar a los usuarios de bases de datos información sobre cómo los patrones de conservación de residuos y divergencia en una familia se relacionan con las propiedades funcionales, y proporcionar enlaces útiles a información más detallada que pueda ayudar a comprender esas relaciones entre secuencias, estructuras y funciones. Para ello, los conservadores de CDD incluyen los siguientes tipos de información para complementar y enriquecer las alineaciones de secuencias múltiples tradicionales que forman la base de los modelos de dominio: estructuras tridimensionales y motivos centrales conservados, características y sitios conservados, organización filogenética y enlaces a recursos de literatura electrónica.
Contenido
El contenido de CDD incluye modelos de dominio seleccionados manualmente por NCBI y modelos de dominio importados de varias bases de datos de fuentes externas ( Pfam , SMART, COG, PRK, TIGRFAMs ). Lo que es único acerca de los dominios seleccionados por NCBI es que utilizan información de estructura 3D para definir explícitamente los límites del dominio, alinear bloques, modificar detalles de alineación y brindar información sobre las relaciones de secuencia/estructura/función. Los modelos seleccionados manualmente se organizan jerárquicamente si describen familias de dominio que están claramente relacionadas por descendencia común. Para proporcionar una vista no redundante de los datos, CDD agrupa modelos de dominio similares de varias fuentes en superfamilias.
Buscando en la base de datos
La colección también forma parte del sistema de consulta y recuperación Entrez del NCBI , que está vinculado a numerosos otros recursos. CDD proporciona anotaciones de huellas de dominios y sitios funcionales conservados en secuencias de proteínas. Se pueden recuperar anotaciones de dominios precalculadas para secuencias de proteínas rastreadas en el sistema Entrez del NCBI, y se puede consultar la colección de modelos de CDD con secuencias de proteínas novedosas a través del "servicio CD-Search". Centro Nacional de Información Biotecnológica de los Estados Unidos., o en* "Búsqueda de CD por lotes". Centro Nacional de Información Biotecnológica de los Estados Unidos., que permite el cálculo y la descarga de anotaciones para grandes conjuntos de consultas de proteínas.
Referencias
- ^ ab Marchler-Bauer, A.; Zheng, C.; Chitsaz, F.; Derbyshire, MK; Geer, LY; Geer, RC; Gonzales, NR; Gwadz, M.; Hurwitz, DI; Lanczycki, CJ; Lu, F.; Lu, S.; Marchler, GH; Song, JS; Thanki, N.; Yamashita, RA; Zhang, D.; Bryant, SH (2012). "CDD: Dominios conservados y estructura tridimensional de proteínas". Nucleic Acids Research . 41 (número de la base de datos): D348 – D352 . doi :10.1093/nar/gks1243. PMC 3531192 . PMID 23197659.
Enlaces externos
- "Base de datos de dominios conservados (CDD) y grupo de recursos". Centro Nacional de Información Biotecnológica de los Estados Unidos.