Articulo de referencia

CODIFICAR

{{cite journal |vauthors=Hong EL, Sloan CA, Chan ET, Davidson JM, Malladi VS, Strattan JS, Hitz BC, Gabdank I, Narayanan AK, Ho M, Lee BT, Rowe LD, Dreszer TR, Roe GR, Podduturi...

La Enciclopedia de Elementos del ADN ( ENCODE ) es un proyecto de investigación público que tiene como objetivo "construir una lista completa de partes de elementos funcionales en el genoma humano ". [ 2 ]

ENCODE también apoya la investigación biomédica mediante la "generación de recursos comunitarios de datos genómicos, software, herramientas y métodos para el análisis de datos genómicos , y productos resultantes de análisis e interpretaciones de datos". [ 3 ] [ 2 ]

La fase actual de ENCODE (2016-2019) está ampliando sus recursos aumentando el número de tipos de células, tipos de datos y ensayos, e incluye ahora soporte para el análisis del genoma del ratón. [ 3 ]

Historia

ENCODE fue lanzado por el Instituto Nacional de Investigación del Genoma Humano de EE. UU. (NHGRI) en septiembre de 2003. [ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ] Concebido como una continuación del Proyecto Genoma Humano , el proyecto ENCODE tiene como objetivo identificar todos los elementos funcionales en el genoma humano . [ 9 ]

El proyecto involucra a un consorcio mundial de grupos de investigación, y los datos generados por este proyecto pueden consultarse a través de bases de datos públicas. La versión inicial de ENCODE se lanzó en 2013 y desde entonces ha ido evolucionando según las recomendaciones de los miembros del consorcio y la comunidad científica en general que utiliza el Portal para acceder a los datos de ENCODE. El objetivo de ENCODE es doble: servir como una base de datos de acceso público para "protocolos experimentales, procedimientos analíticos y los datos en sí", y que "la misma interfaz proporcione metadatos cuidadosamente seleccionados que registren la procedencia de los datos y justifiquen su interpretación en términos biológicos". [ 10 ] El proyecto inició su cuarta fase (ENCODE 4) en febrero de 2017. [ 11 ]

Motivación y significado

Se estima que los humanos poseen aproximadamente 20 000 genes codificadores de proteínas , que representan alrededor del 1,5 % del ADN del genoma humano. El objetivo principal del proyecto ENCODE es determinar la función del componente restante del genoma, gran parte del cual tradicionalmente se consideraba "basura". La actividad y la expresión de los genes codificadores de proteínas pueden ser moduladas por el reguloma , un conjunto de elementos de ADN , como promotores , secuencias reguladoras de la transcripción y regiones de estructura de la cromatina y modificación de histonas . Se cree que los cambios en la regulación de la actividad génica pueden alterar la producción de proteínas y los procesos celulares , provocando enfermedades. Determinar la ubicación de estos elementos reguladores y cómo influyen en la transcripción génica podría revelar vínculos entre las variaciones en la expresión de ciertos genes y el desarrollo de enfermedades. [ 12 ]

ENCODE también pretende ser un recurso integral que permita a la comunidad científica comprender mejor cómo el genoma puede afectar la salud humana y "estimular el desarrollo de nuevas terapias para prevenir y tratar estas enfermedades". [ 5 ]

a. Gráfico de tendencias de publicaciones de la comunidad y del consorcio ENCODE desde 2007 hasta 2019. b. Tipos de publicaciones que utilizan datos de ENCODE según el campo de investigación. [ 13 ]

El consorcio ENCODE

El Consorcio ENCODE está compuesto principalmente por científicos financiados por el Instituto Nacional de Investigación del Genoma Humano de Estados Unidos (NHGRI). Otros participantes que contribuyen al proyecto se incorporan al Consorcio o al Grupo de Trabajo de Análisis.

La fase piloto contó con ocho grupos de investigación y doce grupos que participaron en la fase de desarrollo tecnológico de ENCODE. Tras la finalización oficial de la fase piloto en 2007, el número de participantes se amplió a 440 científicos distribuidos en 32 laboratorios de todo el mundo. Actualmente, el consorcio está formado por distintos centros que realizan diversas tareas.

ENCODE es miembro del Consorcio Internacional del Epigenoma Humano (IHEC). [ 14 ]

El principal requisito del NHGRI para los productos de la investigación financiada por ENCODE es que se compartan de forma gratuita y altamente accesible a todos los investigadores para promover la investigación genómica. La investigación de ENCODE permite la reproducibilidad y, por lo tanto, la transparencia del software, los métodos, los datos y otras herramientas relacionadas con el análisis genómico. [ 3 ]

El proyecto ENCODE

ENCODE se implementa actualmente en cuatro fases: la fase piloto y la fase de desarrollo tecnológico, que se iniciaron simultáneamente; [ 15 ] y la fase de producción. La cuarta fase es una continuación de la tercera e incluye la caracterización funcional y un análisis integrador adicional para la enciclopedia.

El objetivo de la fase piloto era identificar un conjunto de procedimientos que, en combinación, pudieran aplicarse de forma rentable y a gran escala para caracterizar con precisión y exhaustividad grandes regiones del genoma humano . La fase piloto debía revelar las deficiencias del conjunto actual de herramientas para la detección de secuencias funcionales, y también se esperaba que revelara si algunos métodos utilizados hasta entonces eran ineficientes o inadecuados para su utilización a gran escala. Algunos de estos problemas debían abordarse en la fase de desarrollo tecnológico de ENCODE, cuyo objetivo era diseñar nuevos métodos de laboratorio y computacionales que mejoraran nuestra capacidad para identificar secuencias funcionales conocidas o descubrir nuevos elementos genómicos funcionales. Los resultados de las dos primeras fases determinaron el mejor camino a seguir para analizar el 99 % restante del genoma humano en una fase de producción rentable y exhaustiva. [ 5 ]

El proyecto ENCODE Fase I: El proyecto piloto

La fase piloto puso a prueba y comparó métodos existentes para analizar rigurosamente una porción definida de la secuencia del genoma humano. Se organizó como un consorcio abierto y reunió a investigadores con diversos antecedentes y experiencia para evaluar las ventajas relativas de un conjunto diverso de técnicas, tecnologías y estrategias. La fase de desarrollo tecnológico concurrente del proyecto tuvo como objetivo desarrollar nuevos métodos de alto rendimiento para identificar elementos funcionales. El objetivo de estos esfuerzos fue identificar un conjunto de enfoques que permitieran la identificación exhaustiva de todos los elementos funcionales del genoma humano. A través del proyecto piloto ENCODE, el Instituto Nacional de Investigación del Genoma Humano (NHGRI) evaluó la capacidad de diferentes enfoques para ser ampliados a un esfuerzo por analizar todo el genoma humano y detectar deficiencias en la capacidad de identificar elementos funcionales en la secuencia genómica.

El proceso del proyecto piloto ENCODE implicó una estrecha interacción entre científicos computacionales y experimentales para evaluar diversos métodos de anotación del genoma humano. Se seleccionó un conjunto de regiones que representan aproximadamente el 1 % (30 Mb) del genoma humano como objetivo del proyecto piloto, y fue analizado por todos los investigadores del proyecto piloto ENCODE. Todos los datos generados por los participantes de ENCODE sobre estas regiones se publicaron rápidamente en bases de datos públicas. [ 7 ] [ 16 ]

Selección de objetivos

Para el proyecto piloto ENCODE, se seleccionaron regiones definidas del genoma humano, correspondientes a 30 Mb, aproximadamente el 1 % del genoma humano total. Estas regiones sirvieron de base para probar y evaluar la eficacia y eficiencia de diversos métodos y tecnologías para la detección de diferentes elementos funcionales en el ADN humano.

Antes de iniciar la selección de regiones objetivo, se decidió que el 50 % de los 30 Mb de secuencia se seleccionarían manualmente, mientras que el resto se seleccionaría aleatoriamente. Los dos criterios principales para la selección manual de regiones fueron: 1) la presencia de genes bien estudiados u otros elementos de secuencia conocidos, y 2) la existencia de una cantidad sustancial de datos de secuencia comparativos. Mediante este método, se seleccionaron manualmente un total de 14,82 Mb de secuencia, que comprenden 14 regiones objetivo con tamaños que oscilan entre 500 kb y 2 Mb.

El 50% restante de los 30 Mb de secuencia se compuso de treinta regiones de 500 kb seleccionadas según una estrategia de muestreo aleatorio estratificado basada en la densidad génica y el nivel de conservación no exónica. La decisión de utilizar estos criterios específicos se tomó para asegurar un buen muestreo de regiones genómicas con un contenido de genes y otros elementos funcionales muy variable. El genoma humano se dividió en tres partes —el 20% superior, el 30% medio y el 50% inferior— a lo largo de dos ejes: 1) densidad génica y 2) nivel de conservación no exónica con respecto a la secuencia genómica ortóloga del ratón (véase más adelante), para un total de nueve estratos. De cada estrato, se eligieron tres regiones aleatorias para el proyecto piloto. Para aquellos estratos subrepresentados por las selecciones manuales, se eligió una cuarta región, lo que resultó en un total de 30 regiones. Para todos los estratos, se designó una región de reserva para su uso en caso de problemas técnicos imprevistos.

En mayor detalle, los criterios de estratificación fueron los siguientes:

  • Densidad genética : La puntuación de densidad genética de una región fue el porcentaje de bases cubiertas ya sea por genes en la base de datos Ensembl , o por las mejores alineaciones BLAT ( herramienta de alineación tipo BLAST ) de ARNm humano en la base de datos del navegador genómico UCSC .
  • Conservación no exónica : La región se dividió en subventanas no superpuestas de 125 bases. Se descartaron las subventanas que mostraron menos del 75 % de alineación de bases con la secuencia de ratón. Para las subventanas restantes, se utilizó como puntuación de conservación no exónica el porcentaje con al menos un 80 % de identidad de bases con el ratón, y que no correspondía a genes de Ensembl , alineaciones BLASTZ de ARNm de GenBank , predicciones de genes de Fgenesh++, predicciones de genes de TwinScan, alineaciones de EST empalmados o secuencias repetidas ( ADN ).

Las puntuaciones anteriores se calcularon dentro de ventanas no superpuestas de 500 kb de secuencia terminada a lo largo del genoma, y ​​se utilizaron para asignar cada ventana a un estrato. [ 17 ]

Resultados de la fase piloto

La fase piloto se completó con éxito y los resultados se publicaron en junio de 2007 en Nature [ 7 ] y en un número especial de Genome Research ; [ 18 ] los resultados publicados en el primer artículo mencionado avanzaron el conocimiento colectivo sobre la función del genoma humano en varias áreas importantes, incluidas en los siguientes aspectos destacados: [ 7 ]

  • El genoma humano se transcribe de forma generalizada, de manera que la mayoría de sus bases están asociadas con al menos un transcrito primario y muchos transcritos vinculan regiones distales con loci codificadores de proteínas ya establecidos .
  • Se han identificado numerosos transcritos novedosos que no codifican proteínas, muchos de los cuales se superponen con loci codificadores de proteínas , y otros se localizan en regiones del genoma que anteriormente se consideraban transcripcionalmente silenciosas.
  • Se han identificado numerosos sitios de inicio de transcripción previamente desconocidos , muchos de los cuales muestran una estructura de cromatina y propiedades de unión a proteínas específicas de la secuencia similares a las de los promotores bien conocidos .
  • Las secuencias reguladoras que rodean los sitios de inicio de la transcripción se distribuyen simétricamente, sin sesgo hacia las regiones río arriba.
  • La accesibilidad de la cromatina y los patrones de modificación de las histonas son altamente predictivos tanto de la presencia como de la actividad de los sitios de inicio de la transcripción.
  • Los sitios distales hipersensibles a la DNasa I presentan patrones característicos de modificación de histonas que los distinguen de forma fiable de los promotores ; algunos de estos sitios distales muestran marcas compatibles con la función de aislante.
  • El momento de la replicación del ADN está correlacionado con la estructura de la cromatina.
  • En los mamíferos, se puede identificar con certeza que un total del 5% de las bases del genoma están sujetas a restricciones evolutivas ; para aproximadamente el 60% de estas bases restringidas, existe evidencia de función según los resultados de los ensayos experimentales realizados hasta la fecha.
  • Aunque existe una superposición general entre las regiones genómicas identificadas como funcionales mediante ensayos experimentales y aquellas sometidas a restricciones evolutivas, no todas las bases dentro de estas regiones definidas experimentalmente muestran evidencia de dichas restricciones.
  • Los distintos elementos funcionales varían enormemente en su variabilidad de secuencia en toda la población humana y en su probabilidad de residir dentro de una región estructuralmente variable del genoma .
  • Sorprendentemente, muchos elementos funcionales parecen no estar restringidos a lo largo de la evolución de los mamíferos. Esto sugiere la posibilidad de una gran reserva de elementos neutros que son bioquímicamente activos pero que no aportan ningún beneficio específico al organismo. Esta reserva podría funcionar como un «almacén» para la selección natural, actuando potencialmente como fuente de elementos específicos de linaje y elementos funcionalmente conservados pero no ortólogos entre especies.

Proyecto ENCODE Fase II: Proyecto de la Fase de Producción

Imagen de datos de ENCODE en el Navegador Genómico de UCSC . Muestra varias pistas con información sobre la regulación génica . El gen de la izquierda ( ATP2B4 ) se transcribe en una amplia variedad de células (véase también la información sobre H3K4me1 ). El gen de la derecha se transcribe únicamente en algunos tipos de células, incluidas las células madre embrionarias.

En septiembre de 2007, el Instituto Nacional de Investigación del Genoma Humano (NHGRI) comenzó a financiar la fase de producción del proyecto ENCODE. En esta fase, el objetivo era analizar el genoma completo y realizar "estudios piloto adicionales". [ 19 ]

Al igual que en el proyecto piloto, el esfuerzo de producción se organiza como un consorcio abierto. En octubre de 2007, el NHGRI otorgó subvenciones por un total de más de 80 millones de dólares durante cuatro años. [ 20 ] La fase de producción también incluye un Centro de Coordinación de Datos, un Centro de Análisis de Datos y un Esfuerzo de Desarrollo Tecnológico. [ 21 ] En ese momento, el proyecto evolucionó hasta convertirse en una empresa verdaderamente global, que involucraba a 440 científicos de 32 laboratorios de todo el mundo. Una vez completada la fase piloto, el proyecto se "escaló" en 2007, beneficiándose enormemente de las máquinas de secuenciación de nueva generación. Y los datos eran, en efecto, enormes; los investigadores generaron alrededor de 15 terabytes de datos brutos.

Para 2010, el proyecto ENCODE había generado más de 1000 conjuntos de datos genómicos. En conjunto, estos conjuntos de datos muestran qué regiones se transcriben en ARN, qué regiones probablemente controlan los genes utilizados en un tipo particular de célula y qué regiones están asociadas con una amplia variedad de proteínas. Los ensayos principales utilizados en ENCODE son ChIP-seq , hipersensibilidad a la DNasa I , RNA-seq y ensayos de metilación del ADN .

Resultados de la fase de producción

En septiembre de 2012, el proyecto publicó un conjunto de resultados mucho más extenso, en 30 artículos publicados simultáneamente en varias revistas, incluyendo seis en Nature , seis en Genome Biology y un número especial con 18 publicaciones de Genome Research . [ 22 ]

Los autores describieron la producción y el análisis inicial de 1640 conjuntos de datos diseñados para anotar elementos funcionales en todo el genoma humano, integrando resultados de diversos experimentos dentro de tipos celulares, experimentos relacionados que involucran 147 tipos celulares diferentes y todos los datos de ENCODE con otros recursos, como regiones candidatas de estudios de asociación de genoma completo ( GWAS ) y regiones restringidas evolutivamente . En conjunto, estos esfuerzos revelaron características importantes sobre la organización y función del genoma humano, que se resumieron en un artículo de revisión como sigue: [ 23 ]

  1. La gran mayoría (80,4%) del genoma humano participa en al menos un evento bioquímico asociado al ARN y/o la cromatina en al menos un tipo de célula . Gran parte del genoma se encuentra cerca de un evento regulador: el 95% del genoma se encuentra a menos de 8 kb de una interacción ADN - proteína (según lo analizado mediante motivos ChIP-seq unidos o huellas de DNasa I ), y el 99% se encuentra a menos de 1,7 kb de al menos uno de los eventos bioquímicos medidos por ENCODE.
  2. Los elementos específicos de los primates, así como los elementos sin restricciones detectables en los mamíferos, muestran, en conjunto, evidencia de selección negativa; por lo tanto, se espera que algunos de ellos sean funcionales.
  3. La clasificación del genoma en siete estados de cromatina sugiere un conjunto inicial de 399.124 regiones con características de potenciadores y 70.292 regiones con características de promotores , además de cientos de miles de regiones quiescentes. Los análisis de alta resolución subdividen aún más el genoma en miles de estados específicos con propiedades funcionales distintas.
  4. Es posible correlacionar cuantitativamente la producción y el procesamiento de secuencias de ARN con las marcas de cromatina y la unión de factores de transcripción (FT) a los promotores , lo que indica que la funcionalidad del promotor puede explicar la mayor parte de la variación en la expresión del ARN.
  5. Muchas variantes no codificantes en secuencias genómicas individuales se encuentran en regiones funcionales anotadas por ENCODE; este número es al menos tan grande como el de las que se encuentran en genes codificadores de proteínas.
  6. Los SNP asociados con enfermedades según los estudios de asociación de genoma completo (GWAS) se encuentran enriquecidos dentro de elementos funcionales no codificantes, y la mayoría reside en regiones definidas por ENCODE o cerca de ellas, fuera de los genes codificadores de proteínas . En muchos casos, los fenotipos de la enfermedad pueden asociarse con un tipo celular o factor de transcripción específico .

El hallazgo más sorprendente fue que la fracción de ADN humano biológicamente activo es considerablemente mayor que incluso las estimaciones previas más optimistas. En un documento de revisión, el Consorcio ENCODE informó que sus miembros pudieron asignar funciones bioquímicas a más del 80 % del genoma. [ 23 ] Se descubrió que gran parte de esto estaba involucrado en el control de los niveles de expresión del ADN codificante , que constituye menos del 1 % del genoma.

Los elementos nuevos más importantes de la "enciclopedia" incluyen:

  • Un mapa exhaustivo de sitios hipersensibles a la DNasa 1, que son marcadores de ADN regulador ubicado típicamente junto a los genes y que permite que factores químicos influyan en su expresión. El mapa identificó casi 3 millones de sitios de este tipo, incluyendo casi todos los que se conocían previamente y muchos que son nuevos. [ 24 ]
  • Un léxico de secuencias cortas de ADN que forman motivos de reconocimiento para proteínas de unión al ADN. Se encontraron aproximadamente 8,4 millones de dichas secuencias, que comprenden una fracción del ADN total aproximadamente el doble del tamaño del exoma . Se descubrió que miles de promotores de transcripción utilizan una única huella estereotipada de 50 pares de bases. [ 25 ]
  • Un esbozo preliminar de la arquitectura de la red de factores de transcripción humanos, es decir, factores que se unen al ADN para promover o inhibir la expresión de genes. Se encontró que la red era bastante compleja, con factores que operan en diferentes niveles, así como numerosos bucles de retroalimentación de diversos tipos. [ 26 ]
  • Una medición de la fracción del genoma humano que es capaz de transcribirse en ARN. Se estimó que esta fracción sumaba más del 75 % del ADN total, un valor mucho mayor que las estimaciones previas. El proyecto también comenzó a caracterizar los tipos de transcritos de ARN que se generan en diversas ubicaciones. [ 27 ]

Gestión y análisis de datos

Capturar, almacenar, integrar y mostrar los diversos datos generados es un desafío. El Centro de Coordinación de Datos (DCC) de ENCODE organiza y muestra los datos generados por los laboratorios del consorcio y garantiza que cumplan con estándares de calidad específicos al ser publicados. Antes de que un laboratorio envíe datos, el DCC y el laboratorio elaboran un acuerdo de datos que define los parámetros experimentales y los metadatos asociados. El DCC valida los datos recibidos para garantizar la coherencia con el acuerdo. También se asegura de que todos los datos estén anotados utilizando ontologías apropiadas . [ 28 ] Luego, carga los datos en un servidor de prueba para una inspección preliminar y coordina con los laboratorios para organizarlos en un conjunto coherente de pistas. Cuando las pistas están listas, el equipo de Garantía de Calidad del DCC realiza una serie de comprobaciones de integridad, verifica que los datos se presenten de manera coherente con otros datos del navegador y, quizás lo más importante, verifica que los metadatos y el texto descriptivo que los acompaña se presenten de manera útil para nuestros usuarios. Los datos se publican en el sitio web público del Navegador Genómico de la UCSC solo después de que se hayan cumplido todas estas verificaciones. Paralelamente, los datos son analizados por el Centro de Análisis de Datos ENCODE, un consorcio de equipos de análisis de los diversos laboratorios de producción, además de otros investigadores. Estos equipos desarrollan protocolos estandarizados para analizar datos de ensayos novedosos, determinar las mejores prácticas y producir un conjunto coherente de métodos analíticos, como la detección estandarizada de picos y la generación de señales a partir de alineamientos múltiples . [ 29 ]

El Instituto Nacional de Investigación del Genoma Humano (NHGRI) ha identificado a ENCODE como un "proyecto de recursos comunitarios". Este importante concepto se definió en una reunión internacional celebrada en Fort Lauderdale en enero de 2003 como un proyecto de investigación específicamente diseñado e implementado para crear un conjunto de datos, reactivos u otro material cuya utilidad principal será servir como recurso para la amplia comunidad científica. En consecuencia, la política de publicación de datos de ENCODE estipula que los datos, una vez verificados, se depositarán en bases de datos públicas y estarán disponibles para que todos los utilicen sin restricciones. [ 29 ]

Otros proyectos

Con la continuación de la tercera fase, el Consorcio ENCODE se ha involucrado en proyectos adicionales cuyos objetivos son paralelos a los del proyecto ENCODE. Algunos de estos proyectos formaron parte de la segunda fase de ENCODE.

Proyecto modENCODE

El proyecto MODel organism ENCyclopedia Of DNA Elements (modENCODE) es una continuación del proyecto ENCODE original que apunta a la identificación de elementos funcionales en genomas de organismos modelo seleccionados, específicamente Drosophila melanogaster y Caenorhabditis elegans . [ 30 ] La extensión a organismos modelo permite la validación biológica de los hallazgos computacionales y experimentales del proyecto ENCODE, algo que es difícil o imposible de hacer en humanos. [ 30 ] La financiación para el proyecto modENCODE fue anunciada por los Institutos Nacionales de Salud (NIH) en 2007 e incluyó a varias instituciones de investigación diferentes en los EE. UU. [ 31 ] [ 32 ] El proyecto completó su trabajo en 2012.

A finales de 2010, el consorcio modENCODE presentó su primer conjunto de resultados con publicaciones sobre anotación y análisis integrador de los genomas del gusano y la mosca en Science . [ 33 ] [ 34 ] Los datos de estas publicaciones están disponibles en el sitio web de modENCODE. [ 35 ]

modENCODE se gestionó como una red de investigación y el consorcio se formó a partir de 11 proyectos principales, divididos entre gusanos y moscas. Los proyectos abarcaron lo siguiente:

moderno

modERN, acrónimo de enciclopedia de redes reguladoras de organismos modelo, se derivó del proyecto modENCODE. El proyecto fusionó los grupos de C. elegans y Drosophila y se centra en la identificación de sitios de unión de factores de transcripción adicionales en los respectivos organismos. El proyecto comenzó al mismo tiempo que la Fase III de ENCODE y se prevé que finalice en 2017. [ 37 ] Hasta la fecha, el proyecto ha publicado 198 experimentos, [ 38 ] y alrededor de 500 experimentos más han sido enviados y están siendo procesados ​​por el DCC.

Genómica de la regulación génica

A principios de 2015, los NIH lanzaron el programa de Genómica de la Regulación Génica (GGR). [ 39 ] El objetivo del programa, que durará tres años, es estudiar las redes y vías genéticas en diferentes sistemas del cuerpo, con la esperanza de comprender mejor los mecanismos que controlan la expresión génica. Aunque el proyecto ENCODE es independiente de GGR, el Centro de Datos y Computación de ENCODE (ENCODE DCC) ha estado alojando datos de GGR en el portal de ENCODE. [ 40 ]

Hoja de ruta

En 2008, los NIH iniciaron el Consorcio de Mapeo Epigenómico Roadmap , cuyo objetivo era producir "un recurso público de datos epigenómicos humanos para catalizar la biología básica y la investigación orientada a enfermedades". [ 41 ] En febrero de 2015, el consorcio publicó un artículo titulado "Análisis integrador de 111 epigenomas humanos de referencia" que cumplió con el objetivo del consorcio. El consorcio integró información y anotó elementos reguladores en 127 epigenomas de referencia, 16 de los cuales formaban parte del proyecto ENCODE. [ 42 ] Los datos del proyecto Roadmap se pueden encontrar en el portal Roadmap o en el portal ENCODE.

Cronología que destaca el inicio de Roadmap Epigenome y el Consorcio Internacional de Codificación Humana (IHEC). [ 43 ]

Proyecto fruitENCODE

fruitENCODE : una enciclopedia de elementos de ADN para la maduración de la fruta es un proyecto de ENCODE para plantas que busca generar conjuntos de datos sobre metilación del ADN, modificaciones de histonas, DHS, expresión génica y unión de factores de transcripción para todas las especies de frutas carnosas en diferentes etapas de desarrollo. Los datos preliminares se pueden encontrar en el portal de fruitENCODE .

Críticas al proyecto

Aunque el consorcio afirma que aún no ha terminado con el proyecto ENCODE, muchas reacciones a los artículos publicados y a la cobertura mediática que acompañó su lanzamiento fueron favorables. Los editores de Nature y los autores de ENCODE «... colaboraron durante muchos meses para lograr el mayor impacto posible y captar la atención no solo de la comunidad científica, sino también del público en general». [ 44 ] La afirmación del proyecto ENCODE de que el 80 % del genoma humano tiene función bioquímica [ 23 ] fue rápidamente recogida por la prensa popular, que describió los resultados del proyecto como un avance hacia la eliminación del ADN basura . [ 45 ] [ 46 ]

Sin embargo, la conclusión de que la mayor parte del genoma es "funcional" ha sido criticada debido a que el proyecto ENCODE utilizó una definición liberal de "funcional", es decir, todo lo que se transcribe debe ser funcional. Esta conclusión se alcanzó a pesar de la opinión ampliamente aceptada, basada en estimaciones de conservación genómica de la genómica comparativa , de que muchos elementos de ADN, como los pseudogenes que se transcriben, no son funcionales. Además, el proyecto ENCODE ha priorizado la sensibilidad sobre la especificidad, lo que posiblemente condujo a la detección de muchos falsos positivos . [ 47 ] [ 48 ] [ 49 ] La elección algo arbitraria de líneas celulares y factores de transcripción, así como la falta de experimentos de control adecuados, fueron otras críticas importantes a ENCODE, ya que el ADN aleatorio imita el comportamiento "funcional" de ENCODE. [ 50 ]

En respuesta a algunas de las críticas, otros científicos argumentaron que la transcripción y el empalme generalizados que se observan en el genoma humano directamente mediante pruebas bioquímicas son un indicador más preciso de la función genética que las estimaciones de conservación genómica porque las estimaciones de conservación son todas relativas y difíciles de alinear debido a las increíbles variaciones en los tamaños del genoma incluso de especies estrechamente relacionadas, es parcialmente tautológico, y estas estimaciones no se basan en pruebas directas de funcionalidad en el genoma. [ 51 ] [ 52 ] Las estimaciones de conservación pueden usarse para proporcionar pistas para identificar posibles elementos funcionales en el genoma, pero no limitan ni tocan la cantidad total de elementos funcionales que posiblemente podrían existir en el genoma. [ 52 ] Además, gran parte del genoma que está siendo disputado por los críticos parece estar involucrado en la regulación epigenética como la expresión génica y parece ser necesario para el desarrollo de organismos complejos. [ 51 ] [ 53 ] Los resultados de ENCODE no fueron necesariamente inesperados ya que los aumentos en las atribuciones de funcionalidad fueron anticipados por décadas anteriores de investigación. [ 51 ] [ 53 ] Además, otros han señalado que el proyecto ENCODE, desde sus inicios, tuvo un alcance basado en la búsqueda de elementos funcionales biomédicamente relevantes en el genoma, no en elementos funcionales evolutivos, que no son necesariamente lo mismo, ya que la selección evolutiva no es ni suficiente ni necesaria para establecer una función. Es un indicador muy útil de funciones relevantes, pero imperfecto y no el único. [ 54 ]

Recientemente, los investigadores de ENCODE reiteraron que su objetivo principal es identificar elementos funcionales en el genoma humano. [ 55 ] En un artículo posterior de 2020, ENCODE afirmó que la anotación funcional de los elementos identificados "aún está en sus inicios". [ 56 ]

En respuesta a las quejas sobre la definición de la palabra "función", algunos han señalado que ENCODE sí definió su significado y, dado que el objetivo de ENCODE era buscar elementos funcionales biomédicamente relevantes en el genoma, la conclusión del proyecto debería interpretarse como que "el 80  % del genoma participa en actividades bioquímicas relevantes que muy probablemente tengan funciones causales en fenómenos considerados relevantes para la investigación biomédica". [ 54 ] Ewan Birney , uno de los investigadores de ENCODE, comentó que "función" se usó pragmáticamente para referirse a "actividad bioquímica específica", que incluía diferentes clases de ensayos: ARN, modificaciones de histonas "amplias", modificaciones de histonas "estrechas", sitios hipersensibles a la DNasa I, picos de ChIP-seq de factores de transcripción, huellas de DNasa I, motivos unidos a factores de transcripción y exones. [ 57 ]

En 2014, los investigadores de ENCODE observaron que, en la literatura científica, las partes funcionales del genoma se habían identificado de forma diferente en estudios previos, dependiendo de los enfoques utilizados. Se han empleado tres enfoques generales para identificar las partes funcionales del genoma humano: enfoques genéticos (basados ​​en cambios fenotípicos), enfoques evolutivos (basados ​​en la conservación) y enfoques bioquímicos (basados ​​en pruebas bioquímicas, el método utilizado por ENCODE). Los tres presentan limitaciones: los enfoques genéticos pueden pasar por alto elementos funcionales que no se manifiestan físicamente en el organismo; los enfoques evolutivos tienen dificultades para utilizar alineaciones de secuencias multiespecie precisas, dado que los genomas incluso de especies estrechamente relacionadas varían considerablemente; y, si bien los enfoques bioquímicos presentan una alta reproducibilidad, las firmas bioquímicas no siempre indican automáticamente una función. Concluyeron que, a diferencia de la evidencia evolutiva y genética, los datos bioquímicos ofrecen pistas tanto sobre la función molecular que desempeñan los elementos de ADN subyacentes como sobre los tipos de células en las que actúan. En definitiva, los tres enfoques pueden utilizarse de forma complementaria para identificar regiones que podrían ser funcionales en la biología humana y en las enfermedades. Además, señalaron que los mapas bioquímicos proporcionados por ENCODE fueron los elementos más valiosos del proyecto, ya que ofrecen un punto de partida para probar cómo estas firmas se relacionan con la función molecular, celular y orgánica. [ 52 ]

El proyecto también ha sido criticado por su alto costo (aproximadamente 400 millones de dólares en total) y por favorecer a la ciencia a gran escala, lo que desvía fondos de la investigación altamente productiva iniciada por investigadores. [ 58 ] El proyecto piloto ENCODE tuvo un costo estimado de 55 millones de dólares; la ampliación costó alrededor de 130 millones de dólares y el Instituto Nacional de Investigación del Genoma Humano de EE. UU . (NHGRI) podría otorgar hasta 123 millones de dólares para la siguiente fase. Algunos investigadores argumentan que aún no se ha visto un retorno sólido de esa inversión. Se han realizado intentos de rastrear la literatura en busca de artículos en los que ENCODE juegue un papel significativo y, desde 2012, se han encontrado 300 artículos, 110 de los cuales provienen de laboratorios sin financiación de ENCODE. Un problema adicional es que ENCODE no es un nombre único dedicado exclusivamente al proyecto ENCODE, por lo que la palabra "encode" aparece en mucha literatura de genética y genómica. [ 59 ]

Otra crítica importante es que los resultados no justifican el tiempo invertido en el proyecto y que este, en esencia, es imposible de completar. Si bien a menudo se le compara con el Proyecto Genoma Humano (PGH) e incluso se le denomina su sucesor, el PGH tenía un objetivo final claro, algo de lo que actualmente carece ENCODE.

Los autores parecen simpatizar con las preocupaciones científicas y, al mismo tiempo, intentan justificar sus esfuerzos concediendo entrevistas y explicando los detalles de ENCODE no solo al público científico, sino también a los medios de comunicación. Afirman además que transcurrió más de medio siglo desde que se comprendió que el ADN es el material hereditario de la vida hasta la secuenciación del genoma humano, por lo que su plan para el próximo siglo sería comprender realmente la secuencia en sí misma. [ 59 ]

Libro de factores

El análisis de los datos de unión de factores de transcripción generados por el proyecto ENCODE está disponible actualmente en el repositorio web FactorBook. [ 60 ] En esencia, Factorbook.org es una base de datos basada en Wiki para datos de unión de factores de transcripción generados por el consorcio ENCODE. En su primera versión, FactorBook contiene:

  • 457 conjuntos de datos ChIP-seq sobre 119 factores de transcripción en varias líneas celulares humanas
  • Los perfiles promedio de modificaciones de histonas y posicionamiento de nucleosomas alrededor de las regiones de unión de TF.
  • Motivos de secuencia enriquecidos en las regiones y las preferencias de distancia y orientación entre los sitios de los motivos. [ 61 ]

Véase también

Referencias

  1. Hong EL, Sloan CA, Chan ET, Davidson JM, Malladi VS, Strattan JS, Hitz BC, Gabdank I, Narayanan AK, Ho M, Lee BT, Rowe LD, Dreszer TR, Roe GR, Podduturi NR, Tanaka F, Hilton JA, Cherry JM (enero de 2016). " Principios de organización de metadatos en el centro de coordinación de datos ENCODE. (Actualización de 2016)" . Base de datos . 2016 baw001. doi : 10.1093/database/baw001 . PMC 4792520. PMID 26980513 .  
  2. 1 2 "El proyecto ENCODE: Descripción general del proyecto" . www.endodeproject.org . Consultado el 23 de febrero de 2023 .
  3. 1 2 3 "Políticas de uso de datos, software y publicación de análisis – ENCODE" . www.encodeproject.org . Consultado el 18 de diciembre de 2021 .
  4. Raney BJ, Cline MS, Rosenbloom KR, Dreszer TR, Learned K, Barber GP, Meyer LR, Sloan CA, Malladi VS, Roskin KM, Suh BB, Hinrichs AS, Clawson H, Zweig AS, Kirkup V, Fujita PA, Rhead B, Smith KE, Pohl A, Kuhn RM, Karolchik D, Haussler D, Kent WJ (enero de 2011). "Datos del genoma completo de ENCODE en el navegador del genoma de UCSC (actualización de 2011)" . Nucleic Acids Res. 39 (número especial de bases de datos): D871–5. doi : 10.1093 / nar/gkq1017 . PMC 3013645. PMID 21037257 .  
  5. 1 2 3 El Consorcio del Proyecto ENCODE (2004). " El Proyecto ENCODE (ENCyclopedia de Elementos del ADN)" . Science . 306 (5696): 636– 640. Bibcode : 2004Sci...306..636E . doi : 10.1126/science.1105136 . PMID 15499007. S2CID 22837649 .  
  6. Consorcio del Proyecto ENCODE (2011). Becker PB (ed.). "Guía del usuario de la Enciclopedia de Elementos del ADN (ENCODE)" . PLOS Biology . 9 (4) e1001046. doi : 10.1371/journal.pbio.1001046 . PMC 3079585. PMID 21526222 .  Icono de acceso abierto
  7. 1 2 3 4 ENCODE Project Consortium, Birney E , Stamatoyannopoulos JA , Dutta A , Guigó R, Gingeras TR, Margulies EH, Weng Z, Snyder M, Dermitzakis ET, et al. (2007). "Identificación y análisis de elementos funcionales en el 1% del genoma humano por el proyecto piloto ENCODE" . Nature . 447 (7146): 799– 816. Bibcode : 2007Natur.447..799B . doi : 10.1038/nature05874 . PMC 2212820 . PMID 17571346 .   
  8. ^ Guigó R, Flicek P, Abril JF, Reymond A, Lagarde J, Denoeud F, Antonarakis S, Ashburner M, Bajic VB, Birney E, Castelo R, Eyras E, Ucla C, Gingeras TR, Harrow J, Hubbard T, Lewis SE, Reese MG (2006). "EGASP: Proyecto de evaluación de anotación del genoma humano ENCODE" . Biología del genoma . 7 (Suplemento 1): S2.1–31. doi : 10.1186/gb-2006-7-s1-s2 . PMC 1810551 . PMID 16925836 .  
  9. "El proyecto ENCODE: Descripción general del proyecto" . www.endodeproject.org . Consultado el 23 de febrero de 2023 .
  10. ^ Davis, Carrie A.; Hitz, Benjamín C.; Sloan, Cricket A.; Chan, Esther T.; Davidson, Jean M.; Gabdank, Idan; Hilton, Jason A.; Jainista, Kriti; Baymuradov, Ulugbek K.; Narayanan, Aditi K.; Oñate, Kathrina C. (4 de enero de 2018). «La Enciclopedia de elementos del ADN (ENCODE): actualización del portal de datos» . Investigación de ácidos nucleicos . 46 (D1): D794– D801. doi : 10.1093/nar/gkx1081 . ISSN 1362-4962 . PMC 5753278 . PMID 29126249 .   
  11. "El proyecto ENCODE: enciclopedia de elementos del ADN" . www.genome.gov . Consultado el 13 de mayo de 2016 .
  12. Saey, Tina Hesman (6 de octubre de 2012). "El equipo publica la secuela del genoma humano" . Society for Science & the Public. Archivado del original el 23 de octubre de 2012. Recuperado el 18 de octubre de 2012 .
  13. "Fig. 3: Publicaciones que utilizan datos de ENCODE. | Nature" . Directorio de eventos de Nature . ISSN 1476-4687 . 
  14. GmbH, Eurice. "Estados Unidos de América · IHEC" . ihec-epigenomes.org . Consultado el 18 de julio de 2017 .
  15. "Proyecto ENCODE" . www.genome.gov . Archivado del original el 17 de mayo de 2016. Consultado el 16 de mayo de 2016 .
  16. Personal del programa ENCODE (18 de octubre de 2012). "ENCODE: Proyecto piloto: descripción general" . Instituto Nacional de Investigación del Genoma Humano.
  17. Personal del programa ENCODE (19 de febrero de 2012). "ENCODE: Proyecto piloto: Selección de objetivos" . Instituto Nacional de Investigación del Genoma Humano.
  18. Weinstock GM (2007). "ENCODE: Más empoderamiento genómico" . Genome Research . 17 (6): 667– 668. doi : 10.1101/gr.6534207 . PMID 17567987 . 
  19. "Genome.gov | Proyectos ENCODE y modENCODE" . El Proyecto ENCODE: ENCyclopedia de Elementos del ADN . Instituto Nacional de Investigación del Genoma Humano de los Estados Unidos. 1 de agosto de 2011. Consultado el 5 de agosto de 2011 .
  20. "Instituto Nacional de Investigación del Genoma Humano - Organización" . El Anuario de los NIH . Institutos Nacionales de Salud de los Estados Unidos . Consultado el 5 de agosto de 2011 .
  21. "Genome.gov | Participantes y proyectos de ENCODE" . El proyecto ENCODE: ENCyclopedia de elementos del ADN . Instituto Nacional de Investigación del Genoma Humano de los Estados Unidos. 1 de agosto de 2011. Consultado el 5 de agosto de 2011 .
  22. Ecker JR, Bickmore WA, Barroso I, Pritchard JK, Gilad Y, Segal E (septiembre de 2012). "Genómica: explicación de ENCODE" . Nature . 489 ( 7414): 52–5 . Bibcode : 2012Natur.489...52E . doi : 10.1038/489052a . PMID 22955614. S2CID 5366257 .  
  23. 1 2 3 Bernstein BE, Birney E, Dunham I, Green ED, Gunter C, Snyder M (septiembre de 2012). " Una enciclopedia integrada de elementos de ADN en el genoma humano" . Nature . 489 (7414): 57– 74. Bibcode : 2012Natur.489...57T . doi : 10.1038/nature11247 . PMC 3439153. PMID 22955616 .  
  24. Thurman RE, Rynes E, Humbert R, Vierstra J, Maurano MT, Haugen E, Sheffield NC, Stergachis AB, Wang H, et al. (septiembre de 2012). "El paisaje de cromatina accesible del genoma humano" . Nature . 489 (7414): 75–82 . Bibcode : 2012Natur.489...75T . doi : 10.1038/nature11232 . PMC 3721348. PMID 22955617 .   
  25. Neph S, Vierstra J, Stergachis AB, Reynolds AP, Haugen E, Vernot B, Thurman RE, John S, Sandstrom R, et al. (septiembre de 2012). "Un extenso léxico regulador humano codificado en huellas de factores de transcripción" . Nature . 489 (7414): 83–90 . Bibcode : 2012Natur.489...83N . doi : 10.1038 / nature11212 . PMC 3736582. PMID 22955618 .   
  26. Gerstein MB, Kundaje A, Hariharan M, Landt SG, Yan KK, Cheng C, Mu XJ, Khurana E, Rozowsky J, et al. (septiembre de 2012). "Arquitectura de la red reguladora humana derivada de datos ENCODE" . Nature . 489 (7414): 91–100 . Bibcode : 2012Natur.489...91G . doi : 10.1038 / nature11245 . PMC 4154057. PMID 22955619 .   
  27. Djebali S, Davis CA, Merkel A, Dobin A, Lassmann T, Mortazavi A, Tanzer A, Lagarde J, Lin W, et al. (septiembre de 2012). "Panorama de la transcripción en células humanas" . Nature . 489 (7414): 101–8 . Bibcode : 2012Natur.489..101D . doi : 10.1038 / nature11233 . PMC 3684276. PMID 22955620 .   
  28. Malladi VS, Erickson DT, Podduturi NR, Rowe LD, Chan ET, Davidson JM, Hitz BC, Ho M, Lee BT, Miyasato S, Roe GR, Simison M, Sloan CA, Strattan JS, Tanaka F, Kent WJ, Cherry JM, Hong EL (2015). "Aplicación y uso de ontologías en el ENCODE DCC" . Database (Oxford) . 2015. doi : 10.1093/database/bav010 . PMC 4360730. PMID 25776021 .  
  29. 1 2 Brian J. Raney; et al. (30-10-2010). "Datos del genoma completo de ENCODE en el navegador del genoma de UCSC (actualización de 2011)" . Nucleic Acids Res . 39 (número especial de bases de datos). Nucleic Acids Research: D871–5. doi : 10.1093 / nar/gkq1017 . PMC 3013645. PMID 21037257 .   
  30. 1 2 "El proyecto modENCODE: Enciclopedia de elementos de ADN de organismos modelo (modENCODE)" . Sitio web del NHGRI . Consultado el 13 de noviembre de 2008 .
  31. "Participantes y proyectos de modENCODE" . Sitio web del NHGRI . Consultado el 13 de noviembre de 2008 .
  32. "El Laboratorio de Ciencias Biológicas de Berkeley recibe subvenciones de los NIH para estudios sobre moscas de la fruta y nematodos" . Sitio web del Laboratorio Nacional Lawrence Berkeley . 14 de mayo de 2007. Archivado del original el 21 de septiembre de 2008. Consultado el 13 de noviembre de 2008 .
  33. ^ Gerstein MB, Lu ZJ, Van Nostrand EL, Cheng C, Arshinoff BI, Liu T, Yip KY, Robilotto R, Rechtsteiner A, et al. (2010). "Análisis integrativo del genoma de Caenorhabditis elegans mediante el proyecto modENCODE" . Ciencia . 330 (6012): 1775– 1787. Bibcode : 2010Sci...330.1775G . doi : 10.1126/ciencia.1196914 . PMC 3142569 . PMID 21177976 .   
  34. Consorcio modENCODE, Roy S, Ernst J, Kharchenko PV, Kheradpour P, Negre N, Eaton ML, Landolin JM, Bristow CA, Ma L, et al. (2010). "Identificación de elementos funcionales y circuitos reguladores mediante modENCODE de Drosophila" . Science . 330 (6012): 1787– 1797. Bibcode : 2010Sci...330.1787R . doi : 10.1126 /science.1198374 . PMC 3192495. PMID 21177974 .   
  35. "modENCODE" . El Instituto Nacional de Investigación del Genoma Humano.
  36. Celniker S (11 de junio de 2009). "Descifrando los secretos del genoma" . Nature . 459 (7249): 927– 930. Bibcode : 2009Natur.459..927C . doi : 10.1038/459927a . PMC 2843545. PMID 19536255 .  
  37. "RePORT ⟩ REPORTERO" .
  38. "Buscar – CODIFICAR" .
  39. "Comunicado de 2015: Las subvenciones de los NIH buscan descifrar el lenguaje de la regulación genética" . www.genome.gov . Archivado del original el 6 de abril de 2016.
  40. "Buscar – CODIFICAR" .
  41. "Proyecto de Epigenómica de la Hoja de Ruta - Inicio" . Archivado del original el 8 de abril de 2021. Consultado el 10 de enero de 2014 .
  42. Kundaje, Anshul; Meuleman, Wouter; Ernst, Jason; Bilenky, Misha; Yen, Angela; Heravi-Moussavi, Alireza; Kheradpour, Pouya; Zhang, Zhizhuo; Wang, Jianrong; Ziller, Michael J.; Amin, Viren; Whitaker, John W.; Schultz, Matthew D.; Ward, Lucas D.; Sarkar, Abhishek; Quon, Gerald; Sandstrom, Richard S.; Eaton, Matthew L.; Wu, Yi-Chieh; Pfenning, Andreas R.; Wang, Xinchen; Claussnitzer, Melina; Liu, Yaping; Coarfa, Cristian; Harris, R. Alan; Shoresh, Noam; Epstein, Charles B.; Gjoneska, Elizabeta; Leung, Danny; et al. (2015). "Análisis integrador de 111 epigenomas humanos de referencia" . Nature . 518 (7539): 317– 330. Bibcode : 2015Natur.518..317. . doi : 10.1038/nature14248 . PMC 4530010 . PMID 25693563 .   
  43. Cho, Young-Dan; Kim, Woo-Jin; Ryoo, Hyun-Mo; Kim, Hong-Gee; Kim, Kyoung-Hwa; Ku, Young; Seol, Yang-Jo (2021-04-26). "Avances actuales de la epigenética en periodoncia del proyecto ENCODE: una revisión y perspectivas futuras" . Epigenética clínica . 13 (1): 92. doi : 10.1186 / s13148-021-01074-w . ISSN 1868-7083 . PMC 8077755. PMID 33902683. S2CID 233402899 .    
  44. Maher B (6 de septiembre de 2012). "Disputas sobre ENCODE y basura" . Blog de noticias . Nature Publishing Group. Archivado del original el 6 de agosto de 2013. Recuperado el 17 de agosto de 2013 .
  45. Kolata G (5 de septiembre de 2012). "Lejos de ser 'basura', la materia oscura del ADN demuestra ser crucial para la salud" . The New York Times .
  46. Gregory TR (6 de septiembre de 2012). "La maquinaria publicitaria de ENCODE" . Genomicron. Archivado del original el 6 de abril de 2015. Consultado el 17 de agosto de 2013 .
  47. Graur D ; Zheng Y; Price N; Azevedo RB; Zufall RA; Elhaik E (2013). "Sobre la inmortalidad de los televisores: "función" en el genoma humano según el evangelio libre de evolución de ENCODE" . Genome Biol Evol . 5 (3): 578–90 . doi : 10.1093/gbe/ evt028 . PMC 3622293. PMID 23431001 .  
  48. Moran LA (15 de marzo de 2013). "Sandwalk: Sobre el significado de la palabra "función""" . Sandwalk.
  49. Gregory TR (11 de abril de 2013). «Críticas a ENCODE en revistas revisadas por pares». « Genomicron» . Genomicron. Archivado del original el 21 de abril de 2013. 
  50. White MA, Myers CA, Corbo JC, Cohen BA (julio de 2013). "Ensayo de potenciador in vivo masivamente paralelo revela que las características altamente locales determinan la función cis-reguladora de los picos de ChIP-seq" . Proc. Natl. Acad. Sci. USA . 110 (29): 11952–7 . Bibcode : 2013PNAS..11011952W . doi : 10.1073 / pnas.1307449110 . PMC 3718143. PMID 23818646 .  
    • Mike White (17 de julio de 2013). "Encontrar la función en el genoma con una hipótesis nula" . The Finch & Pea .
  51. 1 2 3 Mattick JS, Dinger ME (2013). "El alcance de la funcionalidad en el genoma humano" . The HUGO Journal . 7 (1) 2. doi : 10.1186/1877-6566-7-2 . PMC 4685169 . 
  52. 1 2 3 Kellis M, et al. (2014). "Definición de elementos de ADN funcionales en el genoma humano" . Proc. Natl. Acad. Sci. USA . 111 (17): 6131– 8. Bibcode : 2014PNAS..111.6131K . doi : 10.1073 / pnas.1318948111 . PMC 4035993. PMID 24753594 .   
  53. 1 2 Carey, Nessa (2015). ADN basura: Un viaje a través de la materia oscura del genoma . Columbia University Press. ISBN 978-0-231-17084-0.
  54. 1 2 Germain, Pierre-Luc; Ratti, Emanuele; Boem, Federico (noviembre de 2014). "¿ADN basura o funcional? ENCODE y la controversia de la función". Biology & Philosophy . 29 (6): 807– 831. doi : 10.1007/s10539-014-9441-3 . S2CID 84480632 . 
  55. Abascal F, Acosta R, Addleman NJ, Adrian J, et al. (30 de julio de 2020). "Enciclopedias ampliadas de elementos de ADN en los genomas humano y de ratón" . Nature . 583 ( 7818): 699–710 . Bibcode : 2020Natur.583..699E . doi : 10.1038/s41586-020-2493-4 . PMC 7410828. PMID 32728249. El proyecto ENCODE tiene como objetivo delimitar de forma precisa y exhaustiva los segmentos de los genomas humano y de ratón que codifican elementos funcionales .   
  56. Snyder MP, Gingeras MB, Ren B, Hardison RC, et al. (2020). "Perspectivas sobre ENCODE". Nature . 583 : 583–698 . Es importante destacar que, si bien se han definido muchos elementos no codificantes, la anotación funcional de los elementos identificados por ENCODE aún está en sus inicios. 
  57. Birney, Ewan (5 de septiembre de 2012). "ENCODE: Mis propias reflexiones" . Blog de Ewan: Bioinformático independiente .
  58. Timpson T (5 de marzo de 2013). "Debatiendo ENCODE: Dan Graur, Michael Eisen" . Mendelspod. Archivado del original el 11 de abril de 2015. Recuperado el 15 de agosto de 2013 .
  59. 1 2 Maher B (septiembre de 2012). "ENCODE: La enciclopedia humana" . Nature . 489 (7414): 46–8 . doi : 10.1038/489046a . PMID 22962707 . 
  60. FactorBook
  61. Wang J (2012-11-29). "Factorbook.org: una base de datos basada en Wiki para datos de unión de factores de transcripción generados por el consorcio ENCODE" . Nucleic Acids Research . 41 (Número especial de bases de datos): D171-6. doi : 10.1093/nar/gks1221 . PMC 3531197. PMID 23203885 .