Articulo de referencia

Proyecto CDS de consenso

El proyecto Consensus Coding Sequence (CCDS) es un esfuerzo colaborativo para mantener un conjunto de datos de regiones codificadoras de proteínas que están anotadas de manera i...

El proyecto Consensus Coding Sequence (CCDS) es un esfuerzo colaborativo para mantener un conjunto de datos de regiones codificadoras de proteínas que están anotadas de manera idéntica en los conjuntos de genomas de referencia humanos y de ratón. El proyecto CCDS rastrea anotaciones de proteínas idénticas en los genomas de referencia de ratón y humano con un identificador estable (ID CCDS) y garantiza que estén representadas de manera consistente por el Centro Nacional de Información Biotecnológica (NCBI) , Ensembl y UCSC Genome Browser . [1] La integridad del conjunto de datos CCDS se mantiene a través de estrictas pruebas de control de calidad y una curación manual continua. [2]

Motivación y antecedentes

La investigación biológica y biomédica ha llegado a depender de la anotación precisa y coherente de los genes y sus productos en los conjuntos genómicos. Las anotaciones de referencia de los genomas están disponibles en varias fuentes, cada una con sus propios objetivos y políticas independientes, lo que da lugar a cierta variación en las anotaciones.

El proyecto CCDS se creó para identificar un conjunto de referencia de anotaciones de genes codificadores de proteínas que estén anotados de forma idéntica en los conjuntos de genomas de referencia humanos y murinos por los grupos de anotación participantes. Los conjuntos de genes CCDS a los que se llegó por consenso de los diferentes socios [2] ahora constan de más de 18 000 genes humanos y más de 20 000 murinos (consulte el historial de publicaciones de CCDS). El conjunto de datos CCDS representa cada vez más eventos de empalme alternativo con cada nueva publicación. [3]

Grupos contribuyentes

Los grupos de anotación participantes incluyen: [3]

  • Centro Nacional de Información Biotecnológica (NCBI)
  • Instituto Europeo de Bioinformática (EBI)
  • Instituto Wellcome Trust Sanger (WTSI)
  • Comité de Nomenclatura Genética de HUGO (HGNC)
  • Informática del genoma del ratón (MGI)

La anotación manual la proporciona:

  • Secuencia de referencia ( RefSeq ) en NCBI
  • Análisis y anotación de seres humanos y vertebrados (HAVANA) en WTSI

Definición del conjunto de genes CCDS

"Consenso" se define como regiones codificantes de proteínas que coinciden en el codón de inicio, el codón de terminación y las uniones de empalme, y para las cuales la predicción cumple con los parámetros de garantía de calidad. [1] Se compara una combinación de anotaciones genómicas manuales y automatizadas proporcionadas por (NCBI) y Ensembl (que incorpora anotaciones manuales HAVANA) para identificar anotaciones con coordenadas genómicas coincidentes.

Pruebas de garantía de calidad

Para garantizar que los CDS sean de alta calidad, se realizan múltiples pruebas de control de calidad (QA) (Tabla 1). Todas las pruebas se realizan después del paso de comparación de anotaciones de cada compilación de CCDS y son independientes de las pruebas de QA del grupo de anotaciones individuales realizadas antes de la comparación de anotaciones. [3]

Las anotaciones que no pasan las pruebas de control de calidad se someten a una ronda de verificación manual que puede mejorar los resultados o llegar a una decisión de rechazar las coincidencias de anotaciones en función de la falla del control de calidad.

Proceso de revisión

La base de datos del CCDS es única en el sentido de que el proceso de revisión debe ser llevado a cabo por varios colaboradores y se debe llegar a un acuerdo antes de que se puedan realizar cambios. Esto es posible gracias a un sistema de coordinación de colaboradores que incluye un flujo de trabajo y foros para el análisis y el debate. La base de datos del CCDS opera un sitio web interno que cumple múltiples propósitos, entre ellos la comunicación con los curadores, la votación de los colaboradores, la elaboración de informes especiales y el seguimiento del estado de las representaciones del CCDS. Cuando un miembro del grupo colaborador del CCDS identifica un ID del CCDS que puede necesitar revisión, se emplea un proceso de votación para decidir el resultado final.

Curación manual

La curación manual coordinada se apoya en un sitio web de acceso restringido y una lista de correo electrónico de discusión. Las pautas de curación del CCDS se establecieron para abordar conflictos específicos que se observaron con mayor frecuencia. El establecimiento de pautas de curación del CCDS ha ayudado a que el proceso de curación del CCDS sea más eficiente al reducir la cantidad de votos conflictivos y el tiempo dedicado a la discusión para alcanzar un acuerdo de consenso. Puede encontrar un enlace a las pautas de curación del CCDS aquí.

Las políticas de curación establecidas para el conjunto de datos CCDS se han integrado en las pautas de anotación de RefSeq y HAVANA y, por lo tanto, es más probable que las nuevas anotaciones proporcionadas por ambos grupos sean concordantes y resulten en la adición de un ID CCDS. Estos estándares abordan áreas problemáticas específicas, no son un conjunto completo de pautas de anotación y no restringen las políticas de anotación de ningún grupo colaborador. [2] Los ejemplos incluyen pautas de curación estandarizadas para la selección del codón de iniciación y la interpretación de ORFs y transcripciones ascendentes que se prevé que sean candidatos para la desintegración mediada por sinsentidos . La curación se produce de forma continua y cualquiera de los centros colaboradores puede marcar un ID CCDS como una posible actualización o retiro.

Las opiniones contradictorias se resuelven consultando a expertos científicos u otros grupos de control de anotaciones, como el Comité de Nomenclatura Genética de HUGO (HGNC) y Mouse Genome Informatics (MGI) . Si no se puede resolver un conflicto, los colaboradores acuerdan retirar el ID del CCDS hasta que haya más información disponible.

Desafíos de curación y pautas de anotación

Decaimiento mediado por sinsentidos (NMD): el NMD es el proceso de vigilancia del ARNm más poderoso . El NMD elimina el ARNm defectuoso antes de que pueda traducirse en proteína. [4] Esto es importante porque si el ARNm defectuoso se traduce, la proteína truncada puede causar enfermedad. Se han propuesto diferentes mecanismos para explicar el NMD ; uno de ellos es el modelo del complejo de unión exónica (EJC). En este modelo, si el codón de terminación está >50 nt aguas arriba de la última unión exón-exón, se supone que el transcrito es un candidato a NMD . [2] Los colaboradores del CCDS utilizan un método conservador, basado en el modelo EJC, para examinar los transcritos de ARNm. Cualquier transcrito que se determine que es candidato a NMD se excluye del conjunto de datos del CCDS, excepto en las siguientes situaciones: [2]

  1. todas las transcripciones en un locus particular se evalúan como candidatos a NMD, sin embargo, previamente se sabe que el locus es una región codificante de proteínas;
  2. Existe evidencia experimental que sugiere que se produce una proteína funcional a partir de la transcripción candidata NMD .

Anteriormente, RefSeq y HAVANA consideraban que las transcripciones candidatas a NMD eran transcripciones codificantes de proteínas y, por lo tanto, estas transcripciones candidatas a NMD estaban representadas en el conjunto de datos CCDS. El grupo RefSeq y el proyecto HAVANA han revisado posteriormente sus políticas de anotación.

Sitios de inicio de traducción en marco múltiple: múltiples factores contribuyen a la iniciación de la traducción, como los marcos de lectura abiertos (uORFs) aguas arriba, la estructura secundaria y el contexto de secuencia alrededor del sitio de iniciación de la traducción. Un sitio de inicio común se define dentro de la secuencia de consenso de Kozak: (GCC) GCCACCAUGG en vertebrados. La secuencia entre corchetes (GCC) es el motivo con impacto biológico desconocido. [5] Hay variaciones dentro de la secuencia de consenso de Kozak, como G o A se observa tres nucleótidos aguas arriba (en la posición -3) de AUG. Las bases entre las posiciones -3 y +4 de la secuencia de Kozak tienen el impacto más significativo en la eficiencia de la traducción. Por lo tanto, una secuencia (A/G)NNAUGG se define como una señal Kozak fuerte en el proyecto CCDS.

Según el mecanismo de barrido, la subunidad ribosomal pequeña puede iniciar la traducción a partir del primer codón de inicio alcanzado. Existen excepciones al modelo de barrido:

  1. cuando el sitio de iniciación no está rodeado por una señal Kozak fuerte, lo que da como resultado un escaneo con fugas. Por lo tanto, el ribosoma omite este AUG e inicia la traducción desde un sitio de inicio aguas abajo;
  2. cuando un ORF más corto puede permitir que el ribosoma reinicie la traducción en un ORF corriente abajo . [5]

Según las pautas de anotación del CCDS, el ORF más largo debe anotarse excepto cuando exista evidencia experimental de que se utiliza un sitio de inicio interno para iniciar la traducción. Además, se pueden utilizar otros tipos de datos nuevos, como los datos de perfil de ribosomas, [6] para identificar codones de inicio. El conjunto de datos del CCDS registra un sitio de inicio de la traducción por cada ID del CCDS. Se pueden utilizar sitios de inicio alternativos para la traducción y se indicarán en una nota pública del CCDS.

Marcos de lectura abiertos ascendentes: los codones de iniciación AUG ubicados dentro de los líderes de transcripción se conocen como AUG ascendentes (uAUG). A veces, los uAUG están asociados con u ORFs . u ORFs se encuentran en aproximadamente el 50% de las transcripciones humanas y de ratón. [7] La ​​existencia de u ORFs es otro desafío para el conjunto de datos CCDS. El mecanismo de escaneo para la iniciación de la traducción sugiere que las subunidades ribosomales pequeñas (40S) se unen al extremo 5' de una transcripción de ARNm naciente y escanean en busca del primer codón de inicio AUG. [5] Es posible que un uAUG se reconozca primero, y luego se traduzca el uORF correspondiente. El u ORF traducido podría ser un candidato a NMD , aunque los estudios han demostrado que algunos u ORFs pueden evitar NMD . El límite de tamaño promedio para u ORFs que escaparán a NMD es de aproximadamente 35 aminoácidos . [2] [8] También se ha sugerido que los ORF u inhiben la traducción del gen corriente abajo al atrapar un complejo de iniciación del ribosoma y hacer que el ribosoma se disocie de la transcripción del ARNm antes de que alcance las regiones codificantes de proteínas. [4] [7] Actualmente, ningún estudio ha informado el impacto global de los ORF u en la regulación de la traducción.

Las pautas de anotación actuales del CCDS permiten la inclusión de transcripciones de ARNm que contienen ORFs u si cumplen los dos requisitos biológicos siguientes: [2]

  1. La transcripción del ARNm tiene una fuerte señal Kozak;
  2. La transcripción del ARNm tiene ≥ 35 aminoácidos o se superpone con el marco de lectura abierto primario .

Transcripciones de lectura continua: las transcripciones de lectura continua también se conocen como genes unidos o genes cotranscritos. Las transcripciones de lectura continua se definen como transcripciones que combinan al menos parte de un exón de cada uno de dos o más genes conocidos (socios) distintos que se encuentran en el mismo cromosoma en la misma orientación. [9] La función biológica de las transcripciones de lectura continua y sus moléculas proteicas correspondientes sigue siendo desconocida. Sin embargo, la definición de un gen de lectura continua en el conjunto de datos CCDS es que los genes socios individuales deben ser distintos y las transcripciones de lectura continua deben compartir ≥ 1 exón (o ≥ 2 sitios de empalme excepto en el caso de un exón terminal compartido) con cada uno de los loci más cortos distintos. [2] Las transcripciones no se consideran transcripciones de lectura continua en las siguientes circunstancias:

  1. cuando las transcripciones se producen a partir de genes superpuestos pero no comparten los mismos sitios de empalme;
  2. cuando las transcripciones se traducen a partir de genes que tienen estructuras anidadas entre sí. En este caso, los colaboradores del CCDS y el HGNC han acordado que la transcripción de lectura continua se represente como un locus separado.

Calidad de la secuencia genómica de referencia: Como el conjunto de datos del CCDS está diseñado para representar anotaciones genómicas de humanos y ratones, los problemas de calidad con las secuencias genómicas de referencia de humanos y ratones se convierten en otro desafío. Los problemas de calidad ocurren cuando el genoma de referencia está mal ensamblado. Por lo tanto, el genoma mal ensamblado puede contener codones de terminación prematuros , indeles por cambio de marco o probablemente pseudogenes polimórficos . Una vez que se identifican estos problemas de calidad, los colaboradores del CCDS informan los problemas al Consorcio de Referencia Genómica, que investiga y realiza las correcciones necesarias.

Acceso a los datos del CCDS

El proyecto CCDS está disponible en la página del conjunto de datos CCDS del NCBI (aquí), que proporciona enlaces de descarga FTP y una interfaz de consulta para adquirir información sobre las secuencias y ubicaciones del CCDS. Los informes del CCDS se pueden obtener utilizando la interfaz de consulta, que se encuentra en la parte superior de la página del conjunto de datos del CCDS. Los usuarios pueden seleccionar varios tipos de identificadores, como el ID del CCDS, el ID del gen, el símbolo del gen, el ID del nucleótido y el ID de la proteína para buscar información específica del CCDS. [1] Los informes del CCDS (Figura 1) se presentan en formato de tabla, que proporciona enlaces a recursos específicos, como un informe de historial, Entrez Gene [10] o volver a consultar el conjunto de datos del CCDS. La tabla de identificadores de secuencia presenta información de transcripción en VEGA , Ensembl y Blink. La tabla de ubicación de cromosomas incluye las coordenadas genómicas para cada exón individual de la secuencia codificante específica. Esta tabla también proporciona enlaces a varios navegadores de genoma diferentes, que le permiten visualizar la estructura de la región codificante. [1] La secuencia exacta de nucleótidos y la secuencia de proteínas de la secuencia codificante específica también se muestran en la sección de datos de secuencia del CCDS.

Figura 1. Captura de pantalla del conjunto de datos CCDS que muestra el informe de la proteína Itm2a (CCDS 30349).

Aplicaciones actuales

El conjunto de datos CCDS es una parte integral del proyecto de anotación de genes GENCODE [11] y se utiliza como estándar para la definición de exones codificantes de alta calidad en varios campos de investigación, incluidos estudios clínicos, estudios epigenómicos a gran escala , proyectos de exomas y diseño de matrices de exones. [3] Debido a la anotación de consenso de los exones CCDS por parte de los grupos de anotación independientes, los proyectos de exomas en particular han considerado a los exones codificantes CCDS como objetivos confiables para estudios posteriores (por ejemplo, para la detección de variantes de un solo nucleótido ), y estos exones se han utilizado como objetivos de la región codificante en kits de exomas disponibles comercialmente . [12]

Historial de versiones de CCDS

El tamaño del conjunto de datos del CCDS ha seguido aumentando con las actualizaciones de anotación computacional del genoma, que integran nuevos conjuntos de datos enviados a la Colaboración Internacional de Bases de Datos de Secuencias de Nucleótidos (INSDC), y con las actividades de curación en curso que complementan o mejoran esa anotación. La Tabla 2 resume las estadísticas clave para cada versión del CCDS, donde los identificadores públicos del CCDS son todos aquellos que no estaban bajo revisión o pendientes de actualización o retiro en el momento de la fecha de publicación actual.

El conjunto completo de estadísticas de lanzamiento se puede encontrar en el sitio web oficial de CCDS en su página de Lanzamientos y Estadísticas.

Perspectivas futuras

Los objetivos a largo plazo incluyen la adición de atributos que indiquen dónde la anotación de transcripción también es idéntica (incluidos los UTR ) e indicar variantes de empalme con diferentes UTR que tienen el mismo ID de CCDS. También se prevé que a medida que se disponga de datos de secuencias genómicas más completos y de alta calidad para otros organismos, las anotaciones de estos organismos puedan estar dentro del alcance de la representación en CCDS.

El conjunto de CCDS se irá completando a medida que los grupos de curación independientes se pongan de acuerdo sobre los casos en los que inicialmente difieren, a medida que se produzca una validación experimental adicional de genes con un soporte débil y a medida que los métodos de anotación automática sigan mejorando. La comunicación entre los grupos colaboradores de CCDS está en curso y resolverá las diferencias e identificará mejoras entre los ciclos de actualización de CCDS. Se espera que las actualizaciones humanas se realicen aproximadamente cada 6 meses y las versiones para ratones cada año. [3]

Véase también

Referencias

  1. ^ abcde Pruitt KD , Harrow J, Harte RA, Wallin C, Diekhans M, Maglott DR , Searle S, Farrell CM, Loveland JE, Ruef BJ, Hart E, Suner MM, Landrum MJ, Aken B, Ayling S, Baertsch R, Fernández-Banet J, Cherry JL, Curwen V, Dicuccio M, Kellis M, Lee J, Lin MF, Schuster M, Shkeda A, Amid C, Brown G, Dukhanina O, Frankish A, Hart J, Maidak BL, Mudge J, Murphy MR, Murphy T, Rajan J, Rajput B, Riddick LD, Snow C, Steward C, Webb D, Weber JA , Wilming L, Wu W, Birney E, Haussler D, Hubbard T, Ostell J, Durbin R, Lipman D (2009). "El proyecto de secuencia codificante de consenso (CCDS): identificación de un conjunto común de genes codificadores de proteínas para los genomas humano y de ratón". Genome Res . 19 (7): 1316– 23. doi :10.1101/gr.080531.108. PMC  2704439 . PMID  19498102.
  2. ^ abcdefgh Harte, RA; Farrell, CM; Loveland, JE; Suner, MM; Wilming, L; Aken, B; Barrell, D; Frankish, A; Wallin, C; Searle, S; Diekhans, M; Harrow, J; Pruitt, KD (2012). "Seguimiento y coordinación de un esfuerzo de curación internacional para el proyecto CCDS". Base de datos . 2012 : bas008. doi :10.1093/database/bas008. PMC 3308164 . PMID  22434842. 
  3. ^ abcdef Farrell, CM; O'Leary, NA; Harte, RA; Loveland, JE; Wilming, LG; Wallin, C; Diehans, M; Barril, D; Searle, SM; Aken, B; Hiatt, SM; Franco, A; Suñer, MM; Rajput, B; Mayordomo, California; Marrón, GR; Bennet, R; Murphy, M; Wu, W; Kay, diputado; Hart, J; Rajan, J; Weber, J; Nieve, C; Riddick, LD; cazar, T; Webb, D; Tomás, M; Tamez, P; Rangwala, SH; McGarvey, KM; Pujar, S; Shkeda, A; Mudge, JM; Gonzale, JM; Gilbert, JG; Trevaion, SJ; Baetsch, R; Grada, JL; Hubbard, T; Ostell, JM; Haussler, D; Pruitt, KD (2014). "Estado actual y nuevas características de la base de datos de secuencias codificantes de consenso". Nucleic Acids Res . 42 (D1): D865 – D872 . doi :10.1093/nar/gkt1059. PMC 3965069 . PMID  24217909.  
  4. ^ ab Alberts, B; Johnson, A; Lewis, J; Raff, M; Roberts, K; Walter, P (2002). Biología molecular de la célula, 5.ª ed . Nueva York: Garland Science.
  5. ^ abc Kozak, M (2002). "Ampliando los límites del mecanismo de escaneo para la iniciación de la traducción". Gene . 299 ( 1– 2): 1– 34. doi :10.1016/S0378-1119(02)01056-9. PMC 7126118 . PMID  12459250. 
  6. ^ Ingolia, NT; Brar, GA; Rouskin, S; McGeachy, AM; Weissman, JS (2014). "Anotación y cuantificación de la traducción en todo el genoma mediante el perfilado de ribosomas". Curr. Protoc. Mol. Biol . Capítulo 4: 4.18.1–4.18.19. doi :10.1002/0471142727.mb0418s103. ISBN 9780471142720. PMC  3775365 . PMID  23821443.
  7. ^ ab Calvo, SE; Pagliarni, DJ; Mootha, VK (2009). "Los marcos de lectura abiertos ascendentes causan una reducción generalizada de la expresión de proteínas y son polimórficos entre los humanos" (PDF) . Proc. Natl. Sci. USA . 106 (18): 7507– 12. Bibcode :2009PNAS..106.7507C. doi : 10.1073/pnas.0810916106 . PMC 2669787 . PMID  19372376. 
  8. ^ Silva, AL; Pereira, FJC; Morgado, A; Kong, J; Martins, R; Faustino, P; Liebhaber, SA; Romao, L (2006). "La desintegración del ARNm mediada por sinsentido dependiente de UPF1 canónica se inhibe en las transcripciones que llevan un marco de lectura abierto corto independiente del contexto de la secuencia". ARN . 12 (12): 2160– 70. doi :10.1261/rna.201406. PMC 1664719 . PMID  17077274. 
  9. ^ Prakash, Tulika; Sharma, Vineet K.; Adati, Naoki; Ozawa, Ritsuko; Kumar, Naveen; Nishida, Yuichiro; Fujikake, Takayoshi; Takeda, Tadayuki; Taylor, Todd D.; Michalak, Pawel (12 de octubre de 2010). "Expresión de genes unidos: otro mecanismo de regulación génica en eucariotas". PLOS ONE . ​​5 (10): e13284. Bibcode :2010PLoSO...513284P. doi : 10.1371/journal.pone.0013284 . PMC 2953495 . PMID  20967262. 
  10. ^ Maglott, D .; Ostell, J.; Pruitt, KD; Tatusova, T. (28 de noviembre de 2010). "Entrez Gene: información centrada en los genes en NCBI". Nucleic Acids Res . 39 (Base de datos): D52 – D57 . doi :10.1093/nar/gkq1237. PMC 3013746 . PMID  21115458.  
  11. ^ Grada, J.; Franco, A.; González, JM; Tapanari, E.; Diekhans, M.; Kokocinski, F.; Aken, BL; Barril, D.; Zadissa, A.; Searle, S.; Barnes, I.; Bignell, A.; Bóychenko, V.; cazar, T.; Kay, M.; Mukherjee, G.; Rajan, J.; Despacio-Reyes, G.; Saunders, G.; Mayordomo, C.; Harte, R.; Lin, M.; Howald, C.; Tanzer, A.; Derrien, T.; Chrast, J.; Walters, N.; Balasubramanian, S.; Pei, B.; Tress, M.; Rodríguez, JM; Ezkurdia, I.; van Baren, J.; Brent, M.; Haussler, D.; Kellis, M.; Valencia, A.; Reymond, A.; Gerstein, M.; Guigo, R.; Hubbard, TJ (5 de septiembre de 2012). "GENCODE: la anotación del genoma humano de referencia para el proyecto ENCODE". Res del genoma . 22 (9): 1760-1774 . doi :10.1101/gr.135350.111. PMC 3431492 . PMID  22955987. 
  12. ^ Parla, Jennifer S; Iossifov, Ivan; Grabill, Ian; Spector, Mona S; Kramer, Melissa; McCombie, W Richard (2011). "Un análisis comparativo de la captura del exoma". Genome Biol . 12 (9): R97. doi : 10.1186/gb-2011-12-9-r97 . PMC 3308060. PMID  21958622 . 
  • Página de inicio del CCDS
Obtenido de "https://es.wikipedia.org/w/index.php?title=Proyecto_CDS_de_consenso&oldid=1250303823"