
En biología computacional , la predicción o identificación de genes se refiere al proceso de identificar las regiones del ADN genómico que codifican genes . Esto incluye genes que codifican proteínas y genes de ARN , pero también puede incluir la predicción de otros elementos funcionales, como regiones reguladoras . La identificación de genes es uno de los primeros y más importantes pasos para comprender el genoma de una especie una vez que ha sido secuenciado .
En sus inicios, la búsqueda de genes se basaba en una experimentación minuciosa con células y organismos vivos. El análisis estadístico de las tasas de recombinación homóloga de varios genes diferentes permitía determinar su orden en un cromosoma determinado , y la información de muchos de estos experimentos podía combinarse para crear un mapa genético que especificara la ubicación aproximada de los genes conocidos entre sí. Hoy en día, gracias a la secuenciación completa del genoma y a los potentes recursos computacionales a disposición de la comunidad científica, la búsqueda de genes se ha redefinido como un problema fundamentalmente computacional.
Es importante distinguir entre determinar si una secuencia es funcional y determinar la función del gen o su producto. Predecir la función de un gen y confirmar la precisión de dicha predicción aún requiere experimentación in vivo [ 1 ] mediante la eliminación de genes y otros ensayos, si bien los avances en bioinformática [ 2 ] permiten predecir cada vez más la función de un gen basándose únicamente en su secuencia.
La predicción de genes es uno de los pasos clave en la anotación del genoma , después del ensamblaje de secuencias , el filtrado de regiones no codificantes y el enmascaramiento de repeticiones. [ 3 ]
La predicción de genes está estrechamente relacionada con el llamado "problema de búsqueda de objetivos", que investiga cómo las proteínas de unión al ADN ( factores de transcripción ) localizan sitios de unión específicos dentro del genoma . [ 4 ] [ 5 ] Muchos aspectos de la predicción estructural de genes se basan en la comprensión actual de los procesos bioquímicos subyacentes en la célula , como la transcripción genética , la traducción , las interacciones proteína-proteína y los procesos de regulación , que son objeto de investigación activa en los diversos campos ómicos, como la transcriptómica , la proteómica , la metabolómica y, más generalmente, la genómica estructural y funcional .
Métodos empíricos
En los sistemas empíricos (basados en similitud, homología o evidencia) de búsqueda de genes, se buscan en el genoma objetivo secuencias similares a evidencia extrínseca en forma de etiquetas de secuencia expresada conocidas , ARN mensajero (ARNm), productos proteicos y secuencias homólogas u ortólogas. Dada una secuencia de ARNm, es trivial derivar una secuencia de ADN genómico única a partir de la cual debió transcribirse . Dada una secuencia de proteína, se puede derivar una familia de posibles secuencias de ADN codificante mediante la traducción inversa del código genético . Una vez determinadas las secuencias de ADN candidatas, es un problema algorítmico relativamente sencillo buscar coincidencias en un genoma objetivo, completas o parciales, exactas o inexactas. Dada una secuencia, los algoritmos de alineación local como BLAST , FASTA y Smith-Waterman buscan regiones de similitud entre la secuencia objetivo y posibles coincidencias candidatas. Las coincidencias pueden ser completas o parciales, exactas o inexactas. El éxito de este enfoque está limitado por el contenido y la precisión de la base de datos de secuencias.
Un alto grado de similitud con un ARN mensajero o producto proteico conocido constituye una fuerte evidencia de que una región del genoma objetivo es un gen codificador de proteínas. Sin embargo, para aplicar este enfoque de forma sistemática se requiere una secuenciación exhaustiva de los productos de ARNm y proteínas. Esto no solo es costoso, sino que, en organismos complejos, solo se expresa un subconjunto de todos los genes del genoma en un momento dado, lo que significa que la evidencia extrínseca de muchos genes no es fácilmente accesible en un solo cultivo celular. Por lo tanto, para obtener evidencia extrínseca de la mayoría o de todos los genes en un organismo complejo se requiere el estudio de cientos o miles de tipos celulares , lo que presenta dificultades adicionales. Por ejemplo, algunos genes humanos pueden expresarse solo durante el desarrollo embrionario o fetal, lo que podría ser difícil de estudiar por razones éticas.
A pesar de estas dificultades, se han generado extensas bases de datos de secuencias de transcritos y proteínas tanto para humanos como para otros organismos modelo importantes en biología, como ratones y levaduras. Por ejemplo, la base de datos RefSeq contiene secuencias de transcritos y proteínas de muchas especies diferentes, y el sistema Ensembl mapea exhaustivamente esta información al genoma humano y a otros genomas. Sin embargo, es probable que estas bases de datos sean incompletas y contengan cantidades pequeñas pero significativas de datos erróneos.
Las nuevas tecnologías de secuenciación de transcriptoma de alto rendimiento, como RNA-Seq y ChIP-sequencing, abren oportunidades para incorporar evidencia extrínseca adicional en la predicción y validación de genes, y permiten una alternativa estructuralmente rica y más precisa a los métodos anteriores de medición de la expresión génica, como las etiquetas de secuencia expresada o los microarrays de ADN .
Los principales desafíos que implica la predicción de genes incluyen lidiar con errores de secuenciación en datos brutos de ADN, la dependencia de la calidad del ensamblaje de la secuencia , el manejo de lecturas cortas, mutaciones de cambio de marco de lectura , genes superpuestos y genes incompletos.
En procariotas, es fundamental considerar la transferencia horizontal de genes al buscar homología de secuencias genéticas . Otro factor importante, poco utilizado en las herramientas actuales de detección de genes, es la existencia de agrupaciones de genes —operones (unidades funcionales de ADN que contienen un conjunto de genes bajo el control de un único promotor )— tanto en procariotas como en eucariotas. La mayoría de los detectores de genes más populares tratan cada gen de forma aislada, independientemente de los demás, lo cual no es biológicamente preciso.
métodos ab initio
La predicción de genes ab initio es un método intrínseco basado en el contenido genético y la detección de señales. Debido al elevado coste y la dificultad inherentes a la obtención de evidencia extrínseca para muchos genes, también es necesario recurrir a la búsqueda de genes ab initio , en la que se examina sistemáticamente la secuencia de ADN genómico en busca de ciertos indicios característicos de genes codificadores de proteínas. Estos indicios pueden clasificarse, a grandes rasgos, como señales (secuencias específicas que indican la presencia de un gen cercano) o contenido (propiedades estadísticas de la propia secuencia codificadora de proteínas). La búsqueda de genes ab initio podría describirse con mayor precisión como predicción de genes , ya que generalmente se requiere evidencia extrínseca para establecer de forma concluyente que un gen putativo es funcional.

En los genomas de los procariotas , los genes poseen secuencias promotoras (señales) específicas y relativamente bien conocidas , como la caja de Pribnow y los sitios de unión de factores de transcripción , que son fáciles de identificar sistemáticamente. Además, la secuencia que codifica una proteína se presenta como un marco de lectura abierto (ORF) contiguo, que suele tener cientos o miles de pares de bases de longitud. La estadística de los codones de parada es tal que incluso encontrar un marco de lectura abierto de esta longitud constituye un indicador bastante informativo. (Dado que 3 de los 64 codones posibles en el código genético son codones de parada, se esperaría encontrar uno aproximadamente cada 20-25 codones, o 60-75 pares de bases, en una secuencia aleatoria ). Asimismo, el ADN codificante de proteínas presenta ciertas periodicidades y otras propiedades estadísticas que son fáciles de detectar en una secuencia de esta longitud. Estas características hacen que la identificación de genes procariotas sea relativamente sencilla, y los sistemas bien diseñados pueden alcanzar altos niveles de precisión.
La búsqueda de genes de novo en eucariotas , especialmente en organismos complejos como los humanos, es considerablemente más difícil por varias razones. Primero, el promotor y otras señales reguladoras en estos genomas son más complejos y menos comprendidos que en los procariotas, lo que hace que sean más difíciles de reconocer de manera confiable. Dos ejemplos clásicos de señales identificadas por buscadores de genes eucariotas son las islas CpG y los sitios de unión para una cola de poli(A) .
En segundo lugar, los mecanismos de empalme empleados por las células eucariotas implican que una secuencia codificante de proteínas en el genoma se divide en varias partes ( exones ), separadas por secuencias no codificantes ( intrones ). (Los sitios de empalme son, a su vez, otra señal que los buscadores de genes eucariotas suelen estar diseñados para identificar). Un gen codificante de proteínas típico en humanos puede dividirse en una docena de exones, cada uno de menos de doscientos pares de bases de longitud, y algunos tan cortos como veinte o treinta. Por lo tanto, es mucho más difícil detectar periodicidades y otras propiedades conocidas del contenido del ADN codificante de proteínas en eucariotas.
Los buscadores de genes avanzados para genomas procariotas y eucariotas suelen utilizar modelos probabilísticos complejos , como los modelos ocultos de Markov (HMM), para combinar información de diversas mediciones de señal y contenido. El sistema GLIMMER es un buscador de genes ampliamente utilizado y de alta precisión para procariotas. GeneMark es otro enfoque popular. Los buscadores de genes ab initio eucariotas , en comparación, han logrado un éxito limitado; ejemplos notables son los programas GENSCAN y geneid . Los buscadores de genes GeneMark-ES y SNAP se basan en GHMM, al igual que GENSCAN. Intentan abordar los problemas relacionados con el uso de un buscador de genes en una secuencia genómica con la que no fue entrenado. [ 7 ] [ 8 ] Algunos enfoques recientes, como mSplicer, [ 9 ] CONTRAST, [ 10 ] o mGene [ 11 ], también utilizan técnicas de aprendizaje automático, como máquinas de vectores de soporte, para una predicción de genes exitosa. Construyen un modelo discriminativo utilizando máquinas de vectores de soporte de Markov ocultas o campos aleatorios condicionales para aprender una función de puntuación de predicción de genes precisa.
Los métodos Ab Initio se han comparado, y algunos se acercan al 100% de sensibilidad, [ 3 ] sin embargo, a medida que aumenta la sensibilidad, la precisión se ve afectada como resultado de un aumento de los falsos positivos .
Otras señales
Entre las señales derivadas utilizadas para la predicción se encuentran las estadísticas resultantes de las estadísticas de subsecuencias, como las estadísticas de k-meros , la composición/uniformidad/entropía de GC del dominio de isocora (genética) o composicional , la longitud de la secuencia y del marco, el vocabulario de sitios de unión de intrones/exones/donantes/aceptores/promotores y ribosomales , la dimensión fractal , la transformada de Fourier de un ADN codificado con pseudonúmeros, los parámetros de la curva Z y ciertas características de ejecución. [ 12 ]
Se ha sugerido que otras señales, además de las directamente detectables en las secuencias, pueden mejorar la predicción de genes. Por ejemplo, se ha informado sobre el papel de la estructura secundaria en la identificación de motivos reguladores. [ 13 ] Además, se ha sugerido que la predicción de la estructura secundaria del ARN ayuda a la predicción de sitios de empalme. [ 14 ] [ 15 ] [ 16 ] [ 17 ]
Redes neuronales
Las redes neuronales artificiales son modelos computacionales que destacan en el aprendizaje automático y el reconocimiento de patrones . Deben entrenarse con datos de ejemplo antes de poder generalizar a datos experimentales y probarse con datos de referencia. Las redes neuronales pueden ofrecer soluciones aproximadas a problemas difíciles de resolver algorítmicamente, siempre que haya suficientes datos de entrenamiento. Cuando se aplican a la predicción de genes, las redes neuronales pueden utilizarse junto con otros métodos ab initio para predecir o identificar características biológicas como los sitios de empalme. [ 18 ] Un enfoque [ 19 ] implica el uso de una ventana deslizante, que recorre los datos de secuencia de forma superpuesta. La salida en cada posición es una puntuación basada en si la red cree que la ventana contiene un sitio de empalme donador o un sitio de empalme aceptor. Las ventanas más grandes ofrecen mayor precisión, pero también requieren mayor potencia computacional. Una red neuronal es un ejemplo de sensor de señal, ya que su objetivo es identificar un sitio funcional en el genoma.
Enfoques combinados
Programas como Maker combinan enfoques extrínsecos y ab initio, mapeando datos de proteínas y EST al genoma para validar predicciones ab initio . Augustus, que puede utilizarse como parte del flujo de trabajo de Maker, también puede incorporar información adicional, como alineaciones de EST o perfiles de proteínas, para aumentar la precisión de la predicción genética.
Enfoques de genómica comparativa
A medida que se secuencian los genomas completos de muchas especies diferentes, un enfoque de genómica comparativa se perfila como una dirección prometedora en la investigación actual sobre la identificación de genes .
Esto se basa en el principio de que las fuerzas de la selección natural provocan que los genes y otros elementos funcionales muten a un ritmo más lento que el resto del genoma, ya que las mutaciones en elementos funcionales tienen más probabilidades de afectar negativamente al organismo que las mutaciones en otras partes. Por lo tanto, los genes pueden detectarse comparando los genomas de especies emparentadas para detectar esta presión evolutiva para la conservación. Este enfoque se aplicó por primera vez a los genomas del ratón y del ser humano, utilizando programas como SLAM, SGP, TWINSCAN/N-SCAN y CONTRAST. [ 20 ]
Múltiples informantes
TWINSCAN examinó únicamente la sintenia humano-ratón para buscar genes ortólogos. Programas como N-SCAN y CONTRAST permitieron la incorporación de alineaciones de múltiples organismos o, en el caso de N-SCAN, de un único organismo alternativo al objetivo. El uso de múltiples informantes puede conducir a mejoras significativas en la precisión. [ 20 ]
CONTRAST se compone de dos elementos. El primero es un clasificador más pequeño que identifica los sitios de empalme donadores y aceptores, así como los codones de inicio y de parada. El segundo elemento consiste en la construcción de un modelo completo mediante aprendizaje automático. Dividir el problema en dos implica que se pueden utilizar conjuntos de datos específicos más pequeños para entrenar los clasificadores, y que cada clasificador puede operar de forma independiente y entrenarse con ventanas más pequeñas. El modelo completo puede utilizar el clasificador independiente, evitando así el desperdicio de tiempo computacional o la complejidad del modelo al reclasificar los límites intrón-exón. El artículo en el que se presenta CONTRAST propone que su método (y los de TWINSCAN, etc.) se clasifiquen como ensamblaje de genes de novo , utilizando genomas alternativos, y lo identifica como distinto del método ab initio , que utiliza genomas "informantes" objetivo. [ 20 ]
La identificación comparativa de genes también puede utilizarse para proyectar anotaciones de alta calidad de un genoma a otro. Algunos ejemplos destacados son Projector, GeneWise, GeneMapper y GeMoMa. Estas técnicas desempeñan actualmente un papel fundamental en la anotación de todos los genomas.
Predicción de pseudogenes
Los pseudogenes son parientes cercanos de los genes, comparten una homología de secuencia muy alta, pero no pueden codificar la misma proteína . Si bien antes se consideraban subproductos de la secuenciación genética , cada vez más, a medida que se descubren sus funciones reguladoras, se están convirtiendo en objetivos predictivos por derecho propio. [ 21 ] La predicción de pseudogenes utiliza métodos de similitud de secuencia y métodos ab initio existentes, a la vez que añade filtrado adicional y métodos para identificar las características de los pseudogenes.
Los métodos de similitud de secuencias pueden personalizarse para la predicción de pseudogenes mediante filtrado adicional para encontrar pseudogenes candidatos. Esto podría incluir la detección de inhabilitación, que busca mutaciones sin sentido o de cambio de marco que truncarían o colapsarían una secuencia codificante que de otro modo sería funcional. [ 22 ] Además, la traducción de ADN a secuencias de proteínas puede ser más eficaz que la simple homología de ADN. [ 21 ]
Los sensores de contenido se pueden filtrar según las diferencias en las propiedades estadísticas entre pseudogenes y genes, como un menor número de islas CpG en los pseudogenes o las diferencias en el contenido de GC entre los pseudogenes y sus vecinos. Los sensores de señal también se pueden ajustar a los pseudogenes, buscando la ausencia de intrones o colas de poliadenina. [ 23 ]
predicción de genes metagenómicos
La metagenómica es el estudio del material genético recuperado del medio ambiente, lo que da como resultado información de secuencias de un conjunto de organismos. La predicción de genes es útil para la metagenómica comparativa .
Las herramientas de metagenómica también se dividen en las categorías básicas de uso de enfoques de similitud de secuencias (MEGAN4) y técnicas ab initio (GLIMMER-MG).
Glimmer-MG [ 24 ] es una extensión de GLIMMER que se basa principalmente en un enfoque ab initio para la identificación de genes y en el uso de conjuntos de entrenamiento de organismos relacionados. La estrategia de predicción se complementa con la clasificación y agrupación de conjuntos de datos genéticos antes de aplicar los métodos de predicción genética ab initio. Los datos se agrupan por especies. Este método de clasificación aprovecha técnicas de clasificación filogenética metagenómica. Un ejemplo de software para este propósito es Phymm, que utiliza modelos de Markov interpolados, y PhymmBL, que integra BLAST en las rutinas de clasificación.
MEGAN4 [ 25 ] utiliza un enfoque de similitud de secuencias, empleando alineación local contra bases de datos de secuencias conocidas, pero también intenta clasificar utilizando información adicional sobre funciones, vías biológicas y enzimas. Al igual que en la predicción de genes de organismos individuales, los enfoques de similitud de secuencias están limitados por el tamaño de la base de datos.
FragGeneScan y MetaGeneAnnotator son programas populares de predicción de genes basados en el modelo oculto de Markov . Estos predictores tienen en cuenta los errores de secuenciación, los genes incompletos y funcionan con lecturas cortas.
Otra herramienta rápida y precisa para la predicción de genes en metagenomas es MetaGeneMark. [ 26 ] Esta herramienta es utilizada por el Instituto Conjunto del Genoma del DOE para anotar IMG/M, la colección de metagenomas más grande hasta la fecha.
Véase también
Referencias
- ↑ Sleator RD (agosto de 2010). "Una visión general del estado actual de las estrategias de predicción de genes eucariotas". Gene . 461 ( 1–2 ): 1–4 . doi : 10.1016/j.gene.2010.04.008 . PMID 20430068 .
- ↑ Ejigu, Girum Fitihamlak; Jung, Jaehee (2020-09-18). "Revisión sobre la anotación genómica computacional de secuencias obtenidas mediante secuenciación de próxima generación" . Biology . 9 (9): 295. doi : 10.3390/biology9090295 . ISSN 2079-7737 . PMC 7565776. PMID 32962098 .
- 1 2 Yandell M, Ence D (abril de 2012). "Una guía para principiantes sobre la anotación del genoma eucariota". Nature Reviews. Genetics . 13 (5): 329– 42. doi : 10.1038/nrg3174 . PMID 22510764 . S2CID 3352427 .
- ↑ Redding S, Greene EC (mayo de 2013). "¿Cómo localizan las proteínas objetivos específicos en el ADN?" . Chemical Physics Letters . 570 : 1– 11. Bibcode : 2013CPL...570....1R . doi : 10.1016/j.cplett.2013.03.035 . PMC 3810971 . PMID 24187380 .
- ↑ Sokolov IM, Metzler R, Pant K, Williams MC (agosto de 2005). "Búsqueda de objetivos de N proteínas deslizantes en un ADN" . Biophysical Journal . 89 (2): 895– 902. Bibcode : 2005BpJ....89..895S . doi : 10.1529/biophysj.104.057612 . PMC 1366639. PMID 15908574 .
- ↑ Madigan MT, Martinko JM, Bender KS, Buckley DH, Stahl D (2015). Brock Biology of Microorganisms (14.ª ed.). Boston: Pearson. ISBN 9780321897398.
- ↑ Lomsadze, Alexandre; Ter-Hovhannisyan, Vardges; Chernoff, Yury O.; Borodovsky, Mark (noviembre de 2005). "GeneMark-ES" . Nucleic Acids Research . 33 (20): 6494– 6506. doi : 10.1093/nar/ gki937 . PMC 1298918. PMID 16314312 .
- ↑ Korf I (mayo de 2004). " Búsqueda de genes en genomas novedosos" . BMC Bioinformatics . 5 : 59. doi : 10.1186/1471-2105-5-59 . PMC 421630. PMID 15144565 .
- ↑ Rätsch G, Sonnenburg S, Srinivasan J, Witte H, Müller KR , Sommer RJ, Schölkopf B (febrero de 2007). "Mejora de la anotación del genoma de Caenorhabditis elegans mediante aprendizaje automático" . PLOS Computational Biology . 3 (2): e20. Bibcode : 2007PLSCB...3...20R . doi : 10.1371/journal.pcbi.0030020 . PMC 1808025 . PMID 17319737 .
- ↑ Gross SS, Do CB, Sirota M, Batzoglou S (2007-12-20). "CONTRAST: un enfoque discriminativo y libre de filogenia para la predicción de genes de novo con múltiples informantes" . Genome Biology . 8 (12): R269. doi : 10.1186/gb-2007-8-12-r269 . PMC 2246271. PMID 18096039 .
- ↑ Schweikert G, Behr J, Zien A, Zeller G, Ong CS, Sonnenburg S, Rätsch G (julio de 2009). "mGene.web: un servicio web para la búsqueda computacional precisa de genes" . Nucleic Acids Research . 37 (número especial de servidores web): W312–6. doi : 10.1093/nar/gkp479 . PMC 2703990. PMID 19494180 .
- ↑ Saeys Y, Rouzé P, Van de Peer Y (febrero de 2007). "En busca de los pequeños: predicción mejorada de exones cortos en vertebrados, plantas, hongos y protistas" . Bioinformatics . 23 (4): 414–20 . doi : 10.1093/bioinformatics/btl639 . PMID 17204465 .
- ↑ Hiller M, Pudimat R, Busch A, Backofen R (2006). "Uso de estructuras secundarias de ARN para guiar la búsqueda de motivos de secuencia hacia regiones monocatenarias" . Nucleic Acids Research . 34 (17): e117. doi : 10.1093/nar/gkl544 . PMC 1903381. PMID 16987907 .
- ↑ Patterson DJ, Yasuhara K, Ruzzo WL (2002). "La predicción de la estructura secundaria del pre-ARNm ayuda a la predicción del sitio de empalme". Simposio del Pacífico sobre Biocomputación. Simposio del Pacífico sobre Biocomputación : 223–34 . PMID 11928478 .
- ↑ Marashi SA, Goodarzi H, Sadeghi M, Eslahchi C, Pezeshk H (febrero de 2006). "Importancia de la información sobre la estructura secundaria del ARN para las predicciones de sitios de empalme donadores y aceptores de levadura mediante redes neuronales". Computational Biology and Chemistry . 30 (1): 50– 7. doi : 10.1016/j.compbiolchem.2005.10.009 . PMID 16386465 .
- ↑ Marashi SA, Eslahchi C, Pezeshk H, Sadeghi M (junio de 2006). "Impacto de la estructura del ARN en la predicción de sitios de empalme donadores y aceptores" . BMC Bioinformatics . 7 : 297. doi : 10.1186/1471-2105-7-297 . PMC 1526458. PMID 16772025 .
- ↑ Rogic, S (2006). El papel de la estructura secundaria del pre-ARNm en el empalme de genes en Saccharomyces cerevisiae(PDF) (Tesis doctoral). Universidad de Columbia Británica. Archivado del original (PDF) el 30 de mayo de 2009. Consultado el 1 de abril de 2007 .
- ↑ Goel N, Singh S, Aseri TC (julio de 2013). "Análisis comparativo de técnicas de computación blanda para la predicción de genes". Analytical Biochemistry . 438 (1): 14– 21. doi : 10.1016/j.ab.2013.03.015 . PMID 23529114 .
- ↑ Johansen, ∅Ystein; Ryen, Tom; Eftes∅l, Trygve; Kjosmoen, Thomas; Ruoff, Peter (2009). "Predicción de sitios de empalme mediante redes neuronales artificiales". Métodos de inteligencia computacional para bioinformática y bioestadística . Lec Not Comp Sci. Vol. 5488. pp. 102–113 . doi : 10.1007/978-3-642-02504-4_9 . ISBN 978-3-642-02503-7.
- 1 2 3 Gross SS, Do CB, Sirota M, Batzoglou S (2007). "CONTRAST: un enfoque discriminativo y libre de filogenia para la predicción de genes de novo con múltiples informantes" . Genome Biology . 8 (12): R269. doi : 10.1186/gb-2007-8-12-r269 . PMC 2246271. PMID 18096039 .
- 1 2 Alexander RP, Fang G, Rozowsky J, Snyder M, Gerstein MB (agosto de 2010). "Anotación de regiones no codificantes del genoma". Nature Reviews. Genetics . 11 (8): 559– 71. doi : 10.1038/nrg2814 . PMID 20628352 . S2CID 6617359 .
- ↑ Svensson O, Arvestad L, Lagergren J (mayo de 2006). "Estudio a nivel genómico de pseudogenes biológicamente funcionales" . PLOS Computational Biology . 2 (5): e46. Bibcode : 2006PLSCB...2...46S . doi : 10.1371 /journal.pcbi.0020046 . PMC 1456316. PMID 16680195 .
- ↑ Zhang Z, Gerstein M (agosto de 2004). "Análisis a gran escala de pseudogenes en el genoma humano". Current Opinion in Genetics & Development . 14 (4): 328– 35. doi : 10.1016/j.gde.2004.06.003 . PMID 15261647 .
- ↑ Kelley DR, Liu B, Delcher AL, Pop M, Salzberg SL (enero de 2012). "Predicción de genes con Glimmer para secuencias metagenómicas aumentada por clasificación y agrupamiento" . Nucleic Acids Research . 40 (1): e9. doi : 10.1093 / nar/gkr1067 . PMC 3245904. PMID 22102569 .
- ↑ Huson DH, Mitra S, Ruscheweyh HJ, Weber N, Schuster SC (septiembre de 2011). "Análisis integrador de secuencias ambientales usando MEGAN4" . Genome Research . 21 (9): 1552–60 . doi : 10.1101/gr.120618.111 . PMC 3166839. PMID 21690186 .
- ↑ Zhu W, Lomsadze A, Borodovsky M (julio de 2010). "Identificación de genes ab initio en secuencias metagenómicas" . Nucleic Acids Research . 38 (12): e132. doi : 10.1093/nar/gkq275 . PMC 2896542. PMID 20403810 .
Enlaces externos
- Augusto
- FGENESH Enlace obsoleto archivado el 4 de enero de 2013 en archive.today
- GeMoMa : predicción de genes basada en homología a partir de la conservación de la posición de aminoácidos e intrones, así como de datos de RNA-Seq.
- genido , SGP2
- Glimmer archivado el 26/08/2011 en Wayback Machine , GlimmerHMM archivado el 18/08/2011 en Wayback Machine
- Enhebrador de genoma
- ChemGenome
- Marca genética
- Gismo
- mGene
- StarORF : una herramienta web y multiplataforma para predecir ORF y obtener la secuencia complementaria inversa.
- Creador Archivado el 3 de abril de 2016 en Wayback Machine : una herramienta portátil y fácilmente configurable para la anotación de genomas.
- Bioinformática
- Biología matemática y teórica
- modelos de Markov