Articulo de referencia

Marca genética

GeneMark es un nombre genérico para una familia de algoritmos de predicción de genes ab initio y programas de software desarrollados en el Instituto de Tecnología de Georgia en ...

GeneMark es un nombre genérico para una familia de algoritmos de predicción de genes ab initio y programas de software desarrollados en el Instituto de Tecnología de Georgia en Atlanta . Desarrollado en 1993, el GeneMark original se utilizó en 1995 como una herramienta primaria de predicción de genes para la anotación del primer genoma bacteriano completamente secuenciado de Haemophilus influenzae , y en 1996 para el primer genoma arqueológico de Methanococcus jannaschii . El algoritmo introdujo modelos de cadena de Markov triperiódicos no homogéneos de secuencia de ADN codificante de proteínas que se convirtieron en estándar en la predicción de genes, así como el enfoque bayesiano para la predicción de genes en dos cadenas de ADN simultáneamente. Los parámetros específicos de especie de los modelos se estimaron a partir de conjuntos de entrenamiento de secuencias de tipo conocido (codificante de proteínas y no codificante). El paso principal del algoritmo calcula para un fragmento de ADN dado las probabilidades posteriores de ser "codificante de proteínas" (portador de código genético ) en cada uno de los seis marcos de lectura posibles (incluidos tres marcos en la cadena de ADN complementaria ) o ser "no codificante". El GeneMark original (desarrollado antes del advenimiento de las aplicaciones HMM en bioinformática) era un algoritmo similar a HMM; podría verse como una aproximación al algoritmo de decodificación posterior conocido en la teoría HMM para un modelo HMM adecuadamente definido de secuencia de ADN.

Nuevas mejoras en los algoritmos de predicción de genes en genomas procariotas

El algoritmo GeneMark.hmm (1998) fue diseñado para mejorar la precisión de la predicción de genes cortos y comienzos de genes. La idea era utilizar los modelos de cadena de Markov no homogéneos introducidos en GeneMark para calcular las probabilidades de las secuencias emitidas por los estados de un modelo de Markov oculto , o más bien HMM semi-Markov, o HMM generalizado que describe la secuencia genómica. Los límites entre las regiones codificantes y no codificantes se interpretaron formalmente como transiciones entre estados ocultos. Además, el modelo del sitio de unión del ribosoma se agregó al modelo GHMM para mejorar la precisión de la predicción del comienzo de genes. El siguiente paso importante en el desarrollo del algoritmo fue la introducción del autoentrenamiento o el entrenamiento no supervisado de los parámetros del modelo en la nueva herramienta de predicción de genes GeneMarkS (2001). La rápida acumulación de genomas procariotas en los años siguientes ha demostrado que la estructura de los patrones de secuencia relacionados con las señales de regulación de la expresión génica cerca de los comienzos de genes puede variar. Además, se observó que el genoma procariota puede exhibir variabilidad del contenido de GC debido a la transferencia lateral de genes. El nuevo algoritmo, GeneMarkS-2, fue diseñado para realizar ajustes automáticos a los tipos de patrones de expresión génica y a los cambios en el contenido de GC a lo largo de la secuencia genómica. GeneMarkS y, posteriormente, GeneMarkS-2 se han utilizado en el proceso de anotación de genomas procariotas (PGAP) del NCBI ( www.ncbi.nlm.nih.gov/genome/annotation_prok/process ).

Modelos heurísticos y predicción genética en metagenomas y metatransciptomas

La identificación precisa de los parámetros específicos de la especie de un algoritmo de búsqueda de genes es una condición necesaria para realizar predicciones genéticas precisas. Sin embargo, en los estudios de genomas virales es necesario estimar los parámetros a partir de una secuencia bastante corta que no tiene un contexto genómico amplio. Es importante destacar que, a partir de 2004, se tuvo que abordar la misma cuestión para la predicción de genes en secuencias metagenómicas cortas. Se encontró una respuesta sorprendentemente precisa mediante la introducción de funciones generadoras de parámetros que dependen de una sola variable, el contenido de G+C de la secuencia ("método heurístico" 1999). Posteriormente, el análisis de varios cientos de genomas procariotas condujo al desarrollo de un método heurístico más avanzado en 2010 (implementado en MetaGeneMark). Más adelante, la necesidad de predecir genes en transcripciones de ARN condujo al desarrollo de GeneMarkS-T (2015), una herramienta que identifica genes sin intrones en secuencias de transcripciones largas ensambladas a partir de lecturas de ARN-Seq.

Predicción de genes eucariotas

En los genomas eucariotas, el modelado de los límites de los exones con intrones y regiones intergénicas presenta un gran desafío. La arquitectura GHMM de GeneMark.hmm eucariota incluye estados ocultos para exones iniciales, internos y terminales, intrones , regiones intergénicas y genes de un solo exón ubicados en ambas cadenas de ADN. La versión inicial de GeneMark.hmm eucariota necesitaba la compilación manual de conjuntos de entrenamiento de secuencias codificantes de proteínas para la estimación de los parámetros del algoritmo. Sin embargo, en 2005, se desarrolló el primer buscador de genes eucariotas de autoentrenamiento, GeneMark-ES. Una versión fúngica de GeneMark-ES desarrollada en 2008 presenta un modelo de intrones más complejo y una estrategia jerárquica de autoentrenamiento. En 2014, en GeneMark-ET, el autoentrenamiento de los parámetros fue ayudado por pistas extrínsecas generadas al mapear las lecturas cortas de RNA-Seq del genoma. La evidencia extrínseca no se limita a las secuencias de ARN "nativas". Las proteínas de especies cruzadas recopiladas en las vastas bases de datos de proteínas podrían ser una fuente de pistas externas, si se establecen las relaciones homólogas entre las proteínas ya conocidas y las proteínas codificadas por genes aún desconocidos en el nuevo genoma. Esta tarea se resolvió al desarrollar el nuevo algoritmo, GeneMark-EP+ (2020). La integración de las fuentes de ARN y proteínas de las pistas intrínsecas se realizó en GeneMark-ETP (2023). La versatilidad y precisión de los buscadores de genes eucariotas de la familia GeneMark han llevado a su incorporación en varios procesos de anotación del genoma. Además, desde 2016, se desarrollaron los procesos BRAKER1, BRAKER2, BRAKER3 para combinar las características más sólidas de GeneMark y AUGUSTUS.

Cabe destacar que la predicción de genes en transcripciones eucariotas se puede realizar mediante el nuevo algoritmo GeneMarkS-T (2015).

Familia de programas de predicción genética GeneMark

Bacterias, arqueas

  • Marca genética
  • Marcadores genéticos
  • GeneMark S-2

Metagenomas y metatranscriptomas

  • Marca MetaGene
  • GeneMark S-T

Eucariotas

  • Marca genética
  • GeneMark.hmm [1]
  • GeneMark-ES: algoritmo de búsqueda de genes ab initio para genomas eucariotas con entrenamiento automático (no supervisado). [2]
  • GeneMark-ET: amplía GeneMark-ES al integrar alineaciones de lectura de RNA-Seq en el procedimiento de autoentrenamiento. [3]
  • GeneMark-EP+: amplía GeneMark-ES mediante la búsqueda iterativa de genes en un genoma nuevo, la detección de similitudes de los genes predichos con proteínas conocidas, la alineación de empalmes de las proteínas conocidas con el genoma y la generación de pistas para la siguiente ronda de predicción y corrección basada en la evidencia externa.
  • GeneMark-ETP: integra evidencia genómica, de transcripción y de proteínas en la predicción genética

Virus, fagos y plásmidos

  • Modelos heurísticos

Transcripciones ensambladas a partir de la lectura de RNA-Seq

  • GeneMark S-T

Véase también

Referencias

  1. ^ "GeneMark.HMM eucariota".
  2. ^ "GeneMark-ES".
  3. ^ "GeneMark-ET – algoritmo de búsqueda de genes para genomas eucariotas | Blog de RNA-Seq". 9 de julio de 2014.
  • Borodovsky M. y McIninch J. "GeneMark: reconocimiento de genes paralelos para ambas cadenas de ADN". Computers & Chemistry (1993) 17 (2): 123–133. DOI
  • Lukashin A. y Borodovsky M. "GeneMark.hmm: nuevas soluciones para la búsqueda de genes". Nucleic Acids Research (1998) 26 (4): 1107–1115. DOI PMID
  • Besemer J. y Borodovsky M. "Enfoque heurístico para derivar modelos para la búsqueda de genes". Nucleic Acids Research (1999) 27 (19): 3911–3920. DOI PMID
  • Besemer J., Lomsadze A. y Borodovsky M. "GeneMarkS: un método de autoentrenamiento para la predicción de inicios de genes en genomas microbianos. Implicaciones para encontrar motivos de secuencia en regiones reguladoras". Nucleic Acids Research (2001) 29 (12): 2607–2618. DOI PMID
  • Mills R., Rozanov M., Lomsadze A., Tatusova T. y Borodovsky M. "Mejora de la anotación de genes en genomas virales completos". Nucleic Acids Research (2003) 31 (23): 7041–7055. DOI PMID
  • Besemer J. y Borodovsky M. "GeneMark: software web para la búsqueda de genes en procariotas, eucariotas y virus". Nucleic Acids Research (2005) 33 (Web Server Issue): W451-454. DOI PMID
  • Lomsadze A., Ter-Hovhannisyan V., Chernoff Y. y Borodovsky M. "Identificación de genes en nuevos genomas eucariotas mediante un algoritmo de autoentrenamiento". Nucleic Acids Research (2005) 33 (20): 6494–6506. DOI PMID
  • Ter-Hovhannisyan V., Lomsadze A., Chernoff Y. y Borodovsky M. "Predicción de genes en genomas fúngicos nuevos utilizando un algoritmo ab initio con entrenamiento no supervisado". Genome Research (2008) 18 (12): 1979-1990. DOI PMID
  • Zhu W., Lomsadze A. y Borodovsky M. "Identificación de genes ab initio en secuencias metagenómicas". Nucleic Acids Research (2010) 38 (12): e132. DOI PMID
  • Lomsadze A., Burns PD y Borodovsky M. "Integración de lecturas de ARN-Seq mapeadas en el entrenamiento automático del algoritmo de búsqueda de genes eucariotas". Nucleic Acids Research (2014) 42 (15): e119. DOI PMID
  • Tang S., Lomsadze A. y Borodovsky M. "Identificación de regiones codificantes de proteínas en transcripciones de ARN". Nucleic Acids Research (2015) 43 (12): e78. DOI PMID
  • Tatusova T., DiCuccio M., Badretdin A., Chetvernin V., Nawrocki E., Zaslavsky L., Lomsadze A., Pruitt K., Borodovsky M. y Ostell J. "Proceso de anotación del genoma procariota del NCBI". Nucleic Acids Research (2016) 44 (14): 6614-6624. DOI PMID
  • Hoff K., Lange S., Lomsadze A., Borodovsky M. y Stanke M. "BRAKER1: Anotación genómica no supervisada basada en secuenciación de ARN con GeneMark-ET y AUGUSTUS". Bioinformática (2016) 32 (5): 767-769. DOI PMID
  • Lomsadze A., Gemayel K., Tang S. y Borodovsky M. "El modelado de la transcripción sin líder y de los genes atípicos da como resultado una predicción genética más precisa en procariotas". Genome Research (2018) 28 (7): 1079-1089. DOI PMID
  • Bruna T., Hoff K., Lomsadze A., Stanke M. y Borodovsky M. "BRAKER2: anotación automática del genoma eucariota con GeneMark-EP+ y AUGUSTUS con el apoyo de una base de datos de proteínas". NAR Genomics and Bioinformatics (2021) 3 (1): lqaa108 DOI PMID
  • Bruna T., Lomsadze A. y Borodovsky M. "GeneMark-EP+: predicción de genes eucariotas con autoentrenamiento en el espacio de genes y proteínas". NAR Genomics and Bioinformatics (2022) 2 (2): lqaa026 DOI PMID
  • Bruna T., Lomsadze A. y Borodovsky M. "GeneMark-ETP: búsqueda automática de genes en genomas eucariotas en coherencia con datos extrínsecos". bioRxiv (5 de enero de 2023) DOI PMID
  • Gabriel L., Brůna T., Hoff K., Ebel M., Lomsadze A., Borodovsky M. y Stanke M. "BRAKER3: Anotación genómica totalmente automatizada utilizando ARN-Seq y evidencia proteica con GeneMark-ETP, AUGUSTUS y TSEBRA". bioRxiv (27 de noviembre de 2023) DOI PMID
  • Sitio web oficial
Obtenido de "https://es.wikipedia.org/w/index.php?title=GeneMark&oldid=1202393351"