Articulo de referencia

GENCODE

{{cite journal | vauthors = Harrow J, Frankish A, Gonzalez JM, Tapanari E, Diekhans M, Kokocinski F, Aken BL, Barrell D, Zadissa A, Searle S, Barnes I, Bignell A, Boychenko V, H...

GENCODE es un proyecto científico de investigación genómica y forma parte del proyecto de ampliación ENCODE (ENCyclopedia Of DNA Elements).

El consorcio GENCODE se formó inicialmente como parte de la fase piloto del proyecto ENCODE para identificar y mapear todos los genes codificadores de proteínas dentro de las regiones ENCODE (aproximadamente el 1 % del genoma humano). [ 2 ] Dado el éxito inicial del proyecto, GENCODE ahora tiene como objetivo construir una "Enciclopedia de genes y variantes genéticas". [ 2 ]

El resultado será un conjunto de anotaciones que incluirán todos los loci codificantes de proteínas con variantes transcritas alternativamente , [ 3 ] loci no codificantes [ 4 ] con evidencia de transcripción y pseudogenes . [ 5 ]

Progreso actual

GENCODE está progresando actualmente hacia sus objetivos en la Fase 2 del proyecto. [ 6 ]

La versión más reciente de las anotaciones del conjunto de genes humanos es Gencode 36, con fecha de congelación de diciembre de 2020. Esta versión utiliza el último ensamblaje del genoma de referencia humano GRCh38 . [ 7 ]

La última versión de las anotaciones del conjunto de genes del ratón es Gencode M25, también con fecha de congelación en diciembre de 2020. [ 7 ]

Desde septiembre de 2009, GENCODE ha sido el conjunto de genes humanos utilizado por el proyecto Ensembl y cada nueva versión de GENCODE corresponde a una versión de Ensembl. [ 8 ]

Historia

Cronograma del proyecto GENCODE

Septiembre de 2003

El proyecto se diseñó con tres fases: piloto, desarrollo tecnológico y producción. [ 9 ] La fase piloto del proyecto ENCODE tuvo como objetivo investigar en profundidad, tanto computacional como experimentalmente, 44 regiones que suman 30 Mb de secuencia, lo que representa aproximadamente el 1 % del genoma humano. Como parte de esta fase, se formó el consorcio GENCODE para identificar y mapear todos los genes codificadores de proteínas dentro de las regiones ENCODE. [ 2 ] Se preveía que los resultados de las dos primeras fases se utilizarían para determinar la mejor manera de analizar el 99 % restante del genoma humano en una fase de producción rentable e integral. [ 9 ]

Abril de 2005 La primera versión de la anotación de las 44 regiones ENCODE se congeló el 29 de abril de 2005 y se utilizó en el primer taller del Proyecto de Evaluación de Anotación del Genoma ENCODE (E-GASP). [ 2 ] La versión 1 de GENCODE contenía 416 loci conocidos, 26 loci CDS nuevos (secuencia de ADN codificante), 82 loci de transcripción nuevos, 78 loci putativos, 104 pseudogenes procesados ​​y 66 pseudogenes sin procesar.

Octubre de 2005 Una segunda versión (versión 02) se congeló el 14 de octubre de 2005, que contenía actualizaciones posteriores a descubrimientos de validaciones experimentales utilizando técnicas RACE y RT-PCR . [ 2 ] GENCODE Versión 2 contenía 411 loci conocidos, 30 nuevos loci CDS, 81 nuevos loci de transcripción, 83 loci putativos, 104 pseudogenes procesados ​​y 66 pseudogenes sin procesar.

Junio ​​de 2007 Las conclusiones del proyecto piloto se publicaron en junio de 2007. [ 10 ] Los hallazgos resaltaron el éxito del proyecto piloto para crear una plataforma viable y nuevas tecnologías para caracterizar elementos funcionales en el genoma humano, lo que allana el camino para abrir la investigación en estudios de todo el genoma.

En octubre de 2007, la nueva financiación formó parte del esfuerzo del NHGRI por ampliar el Proyecto ENCODE a una fase de producción que abarcara todo el genoma, junto con estudios piloto adicionales.

Septiembre de 2012 En septiembre de 2012, el consorcio GENCODE publicó un documento importante que analizaba los resultados de una versión importante: GENCODE Release 7, que se había congelado en diciembre de 2011. [ 11 ]

2018 En 2018, una de las últimas incorporaciones al proyecto GENCODE fue la pista CRISPR/Cas9 en ensamblajes de genomas humanos y de organismos modelo . CRISPR es una técnica de edición genómica que utiliza secuencias de ARN que se unen con éxito a la región editada con alta especificidad. La nueva pista se diseñó para facilitar la búsqueda de secuencias guía adecuadas, enumerando los posibles sitios de unión para el complejo CRISPR/Cas9 que se encuentran junto a regiones transcritas o a menos de 200 pb de una de ellas. Para cada sitio, la pista proporciona posibles secuencias guía junto con una colección de puntuaciones de eficiencia y especificidad predichas para dichas secuencias. También proporciona información sobre posibles sitios fuera de objetivo, agrupados según el número de desajustes entre el sitio fuera de objetivo y la guía. [ 11 ]

2020 Entre otros logros, se completó la primera anotación manual del genoma de referencia del ratón, se inició una cooperación con las bases de datos de anotación de referencia RefSeq y Uniprot para lograr la convergencia de la anotación, y se mejoró la anotación de los lncRNA mediante el descubrimiento de nuevos loci y nuevos transcritos en loci existentes. Además, dada la pandemia de COVID-19 durante 2020, surgió la necesidad de apoyar la investigación que respondiera a la situación, por lo que GENCODE revisó y mejoró la anotación de un conjunto de genes codificadores de proteínas asociados con la infección por SARS-CoV-2. [ 12 ]

Participantes clave

Los participantes clave del proyecto GENCODE se han mantenido relativamente constantes a lo largo de sus diversas fases, y actualmente el Wellcome Trust Sanger Institute lidera los esfuerzos generales del proyecto.

A continuación se presenta un resumen de las principales instituciones participantes en cada fase: [ 6 ] [ 13 ]

Participantes, investigadores principales y coinvestigadores principales

Fuente: [ 8 ]

  • Paul Flicek (Investigador Principal), Instituto Europeo de Bioinformática EMBL, Cambridge, Reino Unido
  • Roderic Guigo (PI), Centre de Regulació Genòmica (CRG), Barcelona, ​​Cataluña, España
  • Manolis Kellis (Investigador Principal), Instituto Tecnológico de Massachusetts (MIT), Cambridge, MA, EE. UU.
  • Mark B. Gerstein (Investigador Principal), Universidad de Yale, New Haven, CT, EE. UU.
  • Benedict Paten (Investigador Principal), Universidad de California, Santa Cruz, CA, EE. UU.
  • Michael Tress, Centro Nacional de Investigaciones Oncológicas (CNIO), Madrid, España
  • Jyoti Choudhary, Instituto de Investigación del Cáncer (ICR), Londres, Reino Unido

Estadísticas clave

Desde su creación, GENCODE ha publicado 36 versiones de las anotaciones del conjunto de genes humanos (sin incluir las actualizaciones menores).

A continuación se muestran las estadísticas descriptivas clave de la anotación más reciente del conjunto de genes humanos de GENCODE ( versión 49 ): [ 14 ]

Gracias a los avances en las tecnologías de secuenciación (como RT-PCR-seq), el aumento de la cobertura mediante anotaciones manuales (grupo HAVANA) y las mejoras en los algoritmos de anotación automática que utilizan Ensembl, la precisión y la exhaustividad de las anotaciones de GENCODE se han ido perfeccionando continuamente a través de sus sucesivas versiones.

A continuación se muestra una comparación de las estadísticas clave de tres versiones principales de GENCODE hasta 2014. [ 14 ] Es evidente que, si bien la cobertura, en términos del número total de genes descubiertos, está aumentando constantemente, el número de genes codificadores de proteínas ha disminuido. Esto se atribuye principalmente a las nuevas evidencias experimentales obtenidas mediante el análisis de la expresión génica de la caperuza (CAGE) , los sitios de poliadenilación anotados y los péptidos identificados. [ 11 ]

  • Versión 7 (congelación de diciembre de 2010, GRCh37) - Ensembl 62
  • Versión 10 (congelación de julio de 2011, GRCh37) - Ensembl 65
  • Versión 20 (congelación de abril de 2014, GRCh38) - Ensembl 76

Metodología

Diagrama de flujo de GENCODE. El esquema muestra el flujo de datos entre la anotación manual y la automatizada a través de flujos de predicción especializados para proporcionar información para la anotación inicial y el control de calidad (CC). Los modelos genéticos anotados se someten a validación experimental, y el sistema de seguimiento AnnoTrack contiene datos de todas estas fuentes y se utiliza para resaltar las diferencias, coordinar el CC y realizar el seguimiento de los resultados. Los procesos de anotación manual y automatizada generan el conjunto de datos de GENCODE y también se utilizan para el control de calidad de la anotación completada.

Los loci putativos pueden verificarse mediante experimentos de laboratorio húmedo y las predicciones computacionales se analizan manualmente. [ 15 ] Actualmente, para asegurar que un conjunto de anotaciones cubra el genoma completo en lugar de solo las regiones que se han anotado manualmente, se crea un conjunto de datos fusionado utilizando anotaciones manuales de HAVANA, junto con anotaciones automáticas del conjunto de genes anotados automáticamente de Ensembl. Este proceso también agrega predicciones únicas de CDS de longitud completa del conjunto de codificación de proteínas de Ensembl a los genes anotados manualmente, para proporcionar la anotación más completa y actualizada posible del genoma. [ 16 ]

Anotación automática (Ensembl)

Las transcripciones de Ensembl son productos del sistema automático de anotación de genes Ensembl (una colección de pipelines de anotación de genes), denominado Ensembl Gene Builder. Todas las transcripciones de Ensembl se basan en evidencia experimental, por lo que el pipeline automatizado se basa en las secuencias de ARNm y proteínas depositadas en bases de datos públicas por la comunidad científica. [ 17 ]

Anotación manual (grupo HAVANA)

En el consorcio GENCODE existen varios grupos de análisis que ejecutan pipelines que ayudan a los anotadores manuales a generar modelos en regiones no anotadas e identificar posibles anotaciones manuales omitidas o incorrectas, incluyendo loci completamente ausentes, isoformas alternativas ausentes, sitios de empalme incorrectos y biotipos incorrectos. Estos se retroalimentan a los anotadores manuales mediante el sistema de seguimiento AnnoTrack. [ 18 ] Algunos de estos pipelines utilizan datos de otros subgrupos de GENCODE, incluyendo datos de RNA-Seq, modificación de histonas y datos CAGE y Ditag. Los datos de RNA-Seq constituyen una nueva e importante fuente de evidencia, pero generar modelos genéticos completos a partir de ellos es un problema complejo. Como parte de GENCODE, se llevó a cabo una competición para evaluar la calidad de las predicciones producidas por varios pipelines de predicción de RNA-Seq (véase RGASP más adelante). Para confirmar modelos inciertos, GENCODE también dispone de un pipeline de validación experimental que utiliza secuenciación de ARN y RACE. [ 16 ]

Evaluación de la calidad

Para GENCODE 7, a los modelos de transcripción se les asigna un nivel de soporte alto o bajo en función de un nuevo método desarrollado para calificar la calidad de las transcripciones. [ 2 ]

Uso/Acceso

La versión actual del conjunto de genes humanos GENCODE (GENCODE Release 20) incluye archivos de anotación (en formatos GTF y GFF3), archivos FASTA y archivos METADATA asociados a la anotación GENCODE en todas las regiones genómicas (cromosomas de referencia, parches, andamios y haplotipos). Los datos de anotación se basan en cromosomas de referencia y se almacenan en archivos separados que incluyen: anotación genética, características de poliadenilación anotadas por HAVANA, pseudogenes (retrotranspuestos) predichos por las plataformas de Yale y UCSC, pero no por HAVANA, ARN largos no codificantes y estructuras de ARNt predichas por tRNA-Scan. A continuación se muestran algunos ejemplos de las líneas en formato GTF:

Ejemplo de archivo GTF donde se muestran columnas GTF estándar separadas por tabulaciones (1-9).

Las columnas que aparecen en los formatos de archivo GTF de GENCODE se describen a continuación.

Descripción del formato del archivo GTF de GENCODE. Columnas GTF estándar separadas por tabulaciones.

Descripción de los pares clave-valor en la novena columna del archivo GTF de GENCODE (formato: clave "valor")

Navegador del genoma de Biodalliance

Además, el sitio web GENCODE contiene un navegador genómico para humanos y ratones donde se puede acceder a cualquier región genómica indicando el número de cromosoma y la posición inicial-final (por ejemplo, 22:30.700.000..30.900.000), así como el ID de transcripción ENS (con o sin versión), el ID de gen ENS (con o sin versión) y el nombre del gen. El navegador funciona con tecnología de Biodalliance. [ 19 ]

Desafíos

Definición de "gen"

La definición de "gen" nunca ha sido un asunto trivial, con numerosas definiciones y nociones propuestas a lo largo de los años desde el descubrimiento del genoma humano. En un principio, en el siglo XX, los genes se concibieron como unidades discretas de herencia; luego, se pensó que eran el plano para la síntesis de proteínas; y, más recientemente, se definieron como el código genético que se transcribe en ARN. Si bien la definición de gen ha evolucionado enormemente durante el último siglo, sigue siendo un tema complejo y controvertido para muchos investigadores. Con la llegada del proyecto ENCODE/GENCODE, se han descubierto aspectos aún más problemáticos de la definición, como el empalme alternativo (donde una serie de exones están separados por intrones), las transcripciones intergénicas y los complejos patrones de regulación dispersa, junto con la conservación no génica y la abundancia de genes de ARN no codificante. A medida que GENCODE se esfuerza por construir una enciclopedia de genes y variantes genéticas, estos problemas presentaron un desafío creciente para que el proyecto GENCODE ideara una noción actualizada de gen. [ 20 ]

Proyecto Genoma Humano

El Proyecto Genoma Humano fue un esfuerzo de investigación internacional para determinar la secuencia del genoma humano e identificar los genes que contiene. El proyecto fue coordinado por los Institutos Nacionales de Salud y el Departamento de Energía de los Estados Unidos. Otros colaboradores incluyeron universidades de todo Estados Unidos y socios internacionales del Reino Unido, Francia, Alemania, Japón y China. El Proyecto Genoma Humano comenzó formalmente en 1990 y se completó en 2003, dos años antes de lo previsto. [ 21 ]

Subproyectos

Ensembl

Ensembl forma parte del proyecto GENCODE. [ 22 ]

Diseño de microarrays para la expresión de lncRNA

Un área clave de investigación del proyecto GENCODE fue investigar la importancia biológica de los ARN largos no codificantes (lncRNA). Para comprender mejor la expresión de lncRNA en humanos, GENCODE creó un subproyecto para desarrollar plataformas de microarrays personalizadas capaces de cuantificar los transcritos en la anotación de lncRNA de GENCODE. [ 4 ] Se han creado varios diseños utilizando el sistema eArray de Agilent Technologies , y estos diseños están disponibles en un formato personalizado estándar de Agilent. [ 4 ]

RGASP

El proyecto de evaluación de anotaciones genómicas mediante RNA-seq (RGASP) está diseñado para evaluar la eficacia de diversos métodos computacionales para el análisis de datos de secuencias de ARN de alta calidad. Los objetivos principales de RGASP son proporcionar una evaluación imparcial del software de alineación y caracterización de transcritos (descubrimiento, reconstrucción y cuantificación) de RNA-seq, y determinar la viabilidad de las anotaciones genómicas automatizadas basadas en la secuenciación del transcriptoma. [ 23 ]

RGASP se organiza en un marco de consorcio inspirado en el taller de predicción de genes EGASP (ENCODE Genome Annotation Assessment Project), y se han realizado dos rondas de talleres para abordar diferentes aspectos del análisis de RNA-seq, así como las tecnologías y formatos de secuenciación cambiantes. Uno de los principales hallazgos de las rondas 1 y 2 del proyecto fue la importancia del alineamiento de lecturas en la calidad de las predicciones de genes producidas. Por lo tanto, actualmente se está llevando a cabo una tercera ronda del taller RGASP (en 2014) para centrarse principalmente en el mapeo de lecturas al genoma. [ 23 ]

Véase también

Referencias

  1. Harrow J, Frankish A, Gonzalez JM, Tapanari E, Diekhans M, Kokocinski F, et al. (septiembre de 2012). "GENCODE: la anotación del genoma humano de referencia para el Proyecto ENCODE" ( PDF) . Genome Research . 22 (9): 1760–74 . doi : 10.1101/gr.135350.111 . PMC 3431492. PMID 22955987 .   
  2. 1 2 3 4 5 6 Harrow J, Denoeud F, Frankish A, Reymond A, Chen CK, Chrast J, et al. (2006). "GENCODE: producción de una anotación de referencia para ENCODE" . Genome Biology . 7 (Supl . 1): S4.1–9. doi : 10.1186/gb-2006-7-s1-s4 . PMC 1810553. PMID 16925838 .   
  3. Frankish A, Mudge JM, Thomas M, Harrow J (2012). "La importancia de identificar el empalme alternativo en la anotación del genoma de vertebrados" . Base de datos . 2012 bas014. doi : 10.1093/database/bas014 . PMC 3308168. PMID 22434846 .  
  4. 1 2 3 Derrien T, Johnson R, Bussotti G, Tanzer A, Djebali S, Tilgner H, et al. (septiembre de 2012). " El catálogo GENCODE v7 de ARN largos no codificantes humanos: análisis de su estructura genética, evolución y expresión" . Genome Research . 22 (9): 1775–89 . doi : 10.1101/gr.132159.111 . PMC 3431493. PMID 22955988 .   
  5. Pei B, Sisu C, Frankish A, Howald C, Habegger L, Mu XJ, et al. (septiembre de 2012). " El recurso de pseudogenes GENCODE" . Genome Biology . 13 (9): R51. doi : 10.1186/gb-2012-13-9-r51 . PMC 3491395. PMID 22951037 .   
  6. 1 2 "GENCODE - Página principal" . 20 de diciembre de 2020.
  7. 1 2 "GENCODE – Datos" . GENCODE . Wellcome Trust Sanger Institute. Septiembre de 2019. Consultado el 14 de octubre de 2019 .
  8. 1 2 "GENCODE" . Wellcome Trust Sanger Institute. p. El proyecto GENCODE: Enciclopedia de genes y variantes genéticas . Recuperado el 20 de diciembre de 2020 . 
  9. 1 2 El Consorcio del Proyecto ENCODE (octubre de 2004). "El Proyecto ENCODE (ENCyclopedia de Elementos del ADN)" . Science . 306 (5696): 636– 40. Bibcode : 2004Sci...306..636E . doi : 10.1126/science.1105136 . PMID 15499007. S2CID 22837649 .  
  10. Birney E, Stamatoyannopoulos JA, Dutta A, Guigó R, Gingeras TR, Margulies EH, et al. (junio de 2007). " Identificación y análisis de elementos funcionales en el 1% del genoma humano mediante el proyecto piloto ENCODE" . Nature . 447 (7146): 799–816 . Bibcode : 2007Natur.447..799B . doi : 10.1038/nature05874 . PMC 2212820. PMID 17571346 .   
  11. 1 2 3 Casper J, Zweig AS, Villarreal C, Tyner C, Speir ML, Rosenbloom KR, et al. (enero de 2018). "La base de datos del navegador genómico de UCSC: actualización de 2018" . Nucleic Acids Research . 46 (D1): D762– D769. doi : 10.1093 / nar/gkx1020 . PMC 5753355. PMID 29106570 .   
  12. Frankish A, Diekhans M, Jungreis I, Lagarde J, Loveland JE, Mudge JM, et al. (diciembre de 2020). " GENCODE 2021" . Nucleic Acids Research . 49 (D1): D916– D923. doi : 10.1093 / nar/gkaa1087 . PMC 7778937. PMID 33270111. S2CID 227260109 .    
  13. "Participantes del proyecto GENCODE" . Laboratorio de Investigación en Bioinformática Genómica . c. 2005. Consultado el 8 de septiembre de 2014 .
  14. 1 2 "GENCODE – Estadísticas" . GENCODE . Wellcome Trust Sanger Institute. c. 2014. Archivado del original el 19 de junio de 2018. Recuperado el 31 de enero de 2026 .
  15. "GENCODE – Objetivos" . GENCODE . Wellcome Trust Sanger Institute. c. 2013. Archivado del original el 5 de septiembre de 2014. Recuperado el 5 de septiembre de 2014 .
  16. 1 2 Searle S, Frankish A, Bignell A, Aken B, Derrien T, Diekhans M, et al. (2010). "El conjunto de genes humanos GENCODE" . Genome Biology . 11 (Supl. 1): 36. doi : 10.1186/gb-2010-11-S1-P36 . PMC 3026266 .  
  17. "Ensembl - Página principal" . Ensembl . Agosto de 2014. Consultado el 6 de septiembre de 2014 .
  18. Kokocinski F, Harrow J, Hubbard T (octubre de 2010). "AnnoTrack: un sistema de seguimiento para la anotación del genoma" . BMC Genomics . 11 : 538. doi : 10.1186/1471-2164-11-538 . PMC 3091687. PMID 20923551 .  
  19. "Biodalliance - Página principal" . 20 de diciembre de 2020.
  20. Gerstein MB, Bruce C, Rozowsky JS, Zheng D, Du J, Korbel JO, et al. (junio de 2007). "¿Qué es un gen, después de ENCODE? Historia y definición actualizada" . Genome Research . 17 (6): 669–81 . doi : 10.1101/gr.6339607 . PMID 17567988 .  
  21. "Proyecto Genoma Humano - Página principal" . 20 de diciembre de 2020.
  22. "CODIFICAR datos en Ensembl" . Ensembl . Agosto de 2014. Archivado del original el 9 de noviembre de 2017. Consultado el 7 de septiembre de 2014 .
  23. 1 2 Steijger T, Abril JF, Engström PG, Kokocinski F, Hubbard TJ, Guigó R, et al. (diciembre de 2013). " Evaluación de métodos de reconstrucción de transcripciones para RNA-seq" . Nature Methods . 10 (12): 1177– 84. doi : 10.1038/nmeth.2714 . PMC 3851240. PMID 24185837 .   
  • Páginas oficiales de GENCODE