In genetics, an expressed sequence tag (EST) is a short sub-sequence of a cDNA sequence.[1] ESTs may be used to identify gene transcripts, and were instrumental in gene discovery and in gene-sequence determination.[2] The identification of ESTs has proceeded rapidly, with approximately 74.2 million ESTs now available in public databases (e.g. GenBank 1 January 2013, all species). EST approaches have largely been superseded by whole genome and transcriptome sequencing and metagenome sequencing.
An EST results from one-shot sequencing of a cloned cDNA. The cDNAs used for EST generation are typically individual clones from a cDNA library. The resulting sequence is a relatively low-quality fragment whose length is limited by current technology to approximately 500 to 800 nucleotides. Because these clones consist of DNA that is complementary to mRNA, the ESTs represent portions of expressed genes. They may be represented in databases as either cDNA/mRNA sequence or as the reverse complement of the mRNA, the template strand.
One can map ESTs to specific chromosome locations using physical mapping techniques, such as radiation hybrid mapping, HAPPY mapping, or FISH. Alternatively, if the genome of the organism that originated the EST has been sequenced, one can align the EST sequence to that genome using a computer.
The current understanding of the human set of genes (as of 2006) includes the existence of thousands of genes based solely on EST evidence. In this respect, ESTs have become a tool to refine the predicted transcripts for those genes, which leads to the prediction of their protein products and ultimately of their function. Moreover, the situation in which those ESTs are obtained (tissue, organ, disease state - e.g. cancer) gives information on the conditions in which the corresponding gene is acting. ESTs contain enough information to permit the design of precise probes for DNA microarrays that then can be used to determine gene expression profiles.
Some authors use the term "EST" to describe genes for which little or no further information exists besides the tag.[3]
History
In 1979, teams at Harvard and Caltech extended the basic idea of making DNA copies of mRNAs in vitro to amplifying a library of such in bacterial plasmids.[4]
En 1982, Greg Sutcliffe y sus colaboradores exploraron la idea de seleccionar clones aleatorios o semi-aleatorios de una biblioteca de ADNc de este tipo para su secuenciación. [ 5 ]
En 1983, Putney et al. secuenciaron 178 clones de una biblioteca de ADNc de músculo de conejo. [ 6 ]
En 1991, Adams y sus colaboradores acuñaron el término EST e iniciaron una secuenciación más sistemática como proyecto (comenzando con 600 cDNA cerebrales). [ 2 ]
Fuentes de datos y anotaciones
dbEST
dbEST es una división de GenBank establecida en 1992. Al igual que en GenBank , los datos en dbEST son enviados directamente por laboratorios de todo el mundo y no están sujetos a ningún tipo de curación .
contigs EST
Debido a la forma en que se secuencian las EST, muchas etiquetas de secuencia expresada distintas suelen ser secuencias parciales que corresponden al mismo ARNm de un organismo. En un esfuerzo por reducir el número de etiquetas de secuencia expresada para análisis posteriores de descubrimiento de genes, varios grupos ensamblaron etiquetas de secuencia expresada en contigs de EST . Ejemplos de recursos que proporcionan contigs de EST incluyen: índices de genes TIGR, [ 7 ] Unigene, [ 8 ] y STACK [ 9 ].
La construcción de contigs EST no es trivial y puede generar artefactos (contigs que contienen dos productos génicos distintos). Cuando se dispone de la secuencia genómica completa de un organismo y se han anotado los transcritos, es posible omitir el ensamblaje de contigs y relacionar directamente los transcritos con los EST. Este enfoque se utiliza en el sistema TissueInfo (véase más abajo) y facilita la vinculación de las anotaciones de la base de datos genómica con la información tisular proporcionada por los datos EST.
Información sobre tejidos
Los análisis de alto rendimiento de EST a menudo presentan desafíos similares en la gestión de datos. Un primer desafío es que la procedencia tisular de las bibliotecas de EST se describe en lenguaje natural en dbEST . [ 10 ] Esto dificulta la creación de programas que puedan determinar inequívocamente que dos bibliotecas de EST se secuenciaron a partir del mismo tejido. De manera similar, las afecciones de la enfermedad del tejido no se anotan de forma computacionalmente eficiente. Por ejemplo, el origen canceroso de una biblioteca a menudo se mezcla con el nombre del tejido (p. ej., el nombre del tejido " glioblastoma " indica que la biblioteca de EST se secuenció a partir de tejido cerebral y la afección de la enfermedad es cáncer). [ 11 ] Con la notable excepción del cáncer, la afección de la enfermedad a menudo no se registra en las entradas de dbEST . El proyecto TissueInfo se inició en 2000 para ayudar a superar estos desafíos. El proyecto proporciona datos seleccionados (actualizados diariamente) para desambiguar el origen del tejido y el estado de la enfermedad (cáncer/no cáncer), ofrece una ontología de tejidos que vincula tejidos y órganos mediante relaciones de "es parte de" (es decir, formaliza el conocimiento de que el hipotálamo es parte del cerebro y que el cerebro es parte del sistema nervioso central) y distribuye software de código abierto para vincular las anotaciones de transcripción de genomas secuenciados con los perfiles de expresión tisular calculados con datos en dbEST . [ 12 ]
Véase también
Referencias
- ↑ Hoja informativa sobre EST . Centro Nacional de Información Biotecnológica .
- 1 2 Adams MD, Kelley JM, Gocayne JD, et al. (junio de 1991). "Secuenciación de ADN complementario: etiquetas de secuencia expresada y proyecto del genoma humano". Science . 252 ( 5013): 1651– 6. Bibcode : 1991Sci...252.1651A . doi : 10.1126/science.2047873 . PMID 2047873. S2CID 13436211 .
- ↑ dbEST
- ↑ Sim GK, Kafatos FC, Jones CW, Koehler MD, Efstratiadis A, Maniatis T (diciembre de 1979). "Uso de una biblioteca de ADNc para estudios sobre la evolución y la expresión del desarrollo de las familias multigénicas del corion" . Cell . 18 (4): 1303–16 . doi : 10.1016/0092-8674(79)90241-1 . PMID 519770 .
- ↑ Sutcliffe JG, Milner RJ, Bloom FE, Lerner RA (agosto de 1982). "Secuencia común de 82 nucleótidos única del ARN cerebral" . Proc Natl Acad Sci USA . 79 (16): 4942–6 . Bibcode : 1982PNAS...79.4942S . doi : 10.1073/pnas.79.16.4942 . PMC 346801. PMID 6956902 .
- ↑ Putney SD, Herlihy WC, Schimmel P (1983). "Una nueva troponina T y clones de ADNc para 13 proteínas musculares diferentes, encontrados mediante secuenciación de escopeta". Nature . 302 (5910): 718– 21. Bibcode : 1983Natur.302..718P . doi : 10.1038/302718a0 . PMID 6687628 . S2CID 4364361 .
- ↑ Lee Y, Tsai J, Sunkara S, et al. (enero de 2005). "Los índices genéticos TIGR: agrupamiento y ensamblaje de EST y genes conocidos e integración con genomas eucariotas" . Nucleic Acids Res . 33 (número especial de bases de datos): D71–4. doi : 10.1093/nar/gki064 . PMC 540018. PMID 15608288 .
- ↑ Stanton JA, Macgregor AB, Green DP (2003). "Identificación de la expresión génica enriquecida en tejidos de ratón utilizando la base de datos UniGene del NIH". Appl Bioinform . 2 (3 Suppl): S65–73. PMID 15130819 .
- ↑ Christoffels A, van Gelder A, Greyling G, Miller R, Hide T, Hide W (enero de 2001). "STACK: Alineación de etiquetas de secuencia y base de conocimiento de consenso" . Nucleic Acids Res . 29 (1): 234–8 . doi : 10.1093/nar/29.1.234 . PMC 29830. PMID 11125101 .
- ↑ Skrabanek L, Campagne F (noviembre de 2001). "TissueInfo: identificación de alto rendimiento de perfiles de expresión tisular y especificidad" . Nucleic Acids Res . 29 (21): E102–2. doi : 10.1093/nar/29.21.e102 . PMC 60201. PMID 11691939 .
- ↑ Campagne F, Skrabanek L (2006). "La minería de etiquetas de secuencias expresadas identifica marcadores de cáncer de interés clínico" . BMC Bioinformatics . 7 481. doi : 10.1186/1471-2105-7-481 . PMC 1635568. PMID 17078886 .
- ↑ :instituto de biomedicina computacional::TissueInfo Archivado el 4 de junio de 2008 en Wayback Machine
Enlaces externos
- "ESTs: Descubrimiento de genes simplificado" . Science Primer . NCBI. 29 de marzo de 2004. Archivado del original el 28 de febrero de 2007.
- Pontius, Joan U.; Wagner, Lukas; Schuler, Gregory D. (2003) [2002]. "21 UniGene: Una visión unificada del transcriptoma § Etiquetas de secuencia expresada (EST)" . En McEntyre, J; Ostell, J (eds.). Manual del NCBI . Centro Nacional de Información Biotecnológica. NBK21101.
Esta publicación se proporciona únicamente como referencia histórica y la información puede estar desactualizada.
- Friedel, CC1; Jahn, KH; Sommer, S; Rudd, S; Mewes, HW; Tetko, IV (15 de abril de 2005). "Máquinas de vectores de soporte para la separación de colecciones mixtas de EST de plantas y patógenos basadas en el uso de codones (ECLAT)" . Bioinformatics . 21 (8): 1383–8 . doi : 10.1093/bioinformatics/bti200 . PMID 15585526 .
{{cite journal}}: CS1 maint: nombres numéricos: lista de autores ( enlace )- "ECLAT" . MIPS . Archivado del original el 27 de septiembre de 2008.
Servidor para la clasificación de EST a partir de conjuntos mixtos de EST (de plantas infectadas por hongos) utilizando el uso de codones.
- "ECLAT" . MIPS . Archivado del original el 27 de septiembre de 2008.
- "dbEST" . GenBank .
- Resumen de dbEST . GenBank . 1 de enero de 2013. Archivado del original el 7 de junio de 2019.
- Ranganathan, Shoba. "Bioinformática" .
- "Recursos web para datos y análisis de EST" . Archivado del original el 29 de agosto de 2007.
Información sobre tejidos
- "Información sobre tejidos" . Wiki .
- "TissueInfo" . Archivado del original el 4 de junio de 2008.
Procedencia de tejidos EST curada, ontología de tejidos, software de código abierto.
- Skrabanek L, Campagne F (1 de noviembre de 2001). "TissueInfo: identificación de alto rendimiento de perfiles de expresión tisular y especificidad" . Nucleic Acids Res . 29 (21): E102–2. doi : 10.1093/nar/29.21.e102 . PMC 60201. PMID 11691939 .
- expresión génica
- Genómica
- ADN