En bioinformática , GLIMMER ( Gene Locator and Interpolated Markov ModelER ) se utiliza para encontrar genes en el ADN procariota . [ 1 ] "Es eficaz para encontrar genes en bacterias , arqueas y virus , encontrando típicamente el 98-99% de todos los genes codificadores de proteínas relativamente largos ". [ 1 ] GLIMMER fue el primer sistema que utilizó el modelo de Markov interpolado [ 2 ] para identificar regiones codificantes. El software GLIMMER es de código abierto y es mantenido por Steven Salzberg , Art Delcher y sus colegas en el Centro de Biología Computacional [ 3 ] en la Universidad Johns Hopkins . Los algoritmos y el software originales de GLIMMER fueron diseñados por Art Delcher, Simon Kasif y Steven Salzberg y aplicados a la anotación del genoma bacteriano en colaboración con Owen White .
Versiones
DESLUMBRAMIENTO 1.0
La primera versión de GLIMMER, denominada GLIMMER 1.0, se publicó en 1998 en el artículo « Identificación de genes microbianos mediante un modelo de Markov interpolado» [ 1 ] . En GLIMMER 1.0 se utilizaron modelos de Markov para identificar genes microbianos. GLIMMER considera las dependencias de secuencia de composición local, lo que lo hace más flexible y potente en comparación con un modelo de Markov de orden fijo .
En el artículo «Identificación de genes microbianos mediante modelos de Markov interpolados » [ 1 ] se realizó una comparación entre el modelo de Markov interpolado utilizado por GLIMMER y el modelo de Markov de quinto orden . «El algoritmo GLIMMER encontró 1680 genes de los 1717 genes anotados en Haemophilus influenzae, mientras que el modelo de Markov de quinto orden encontró 1574 genes. GLIMMER encontró 209 genes adicionales que no estaban incluidos en los 1717 genes anotados, mientras que el modelo de Markov de quinto orden encontró 104 genes.» [ 1 ]
DESLUMBRAMIENTO 2.0
La segunda versión de GLIMMER, es decir, GLIMMER 2.0, se lanzó en 1999 y se publicó en el artículo " Improved microbial identification with GLIMMER" [ 4 ] . Este artículo [ 4 ] proporciona mejoras técnicas significativas, como el uso de un modelo de contexto interpolado en lugar de un modelo de Markov interpolado y la resolución de genes superpuestos, lo que mejora la precisión de GLIMMER.
En lugar del modelo de Markov interpolado , se utilizan modelos de contexto interpolados , lo que permite seleccionar cualquier base. En el modelo de Markov interpolado, la distribución de probabilidad de una base se determina a partir de las bases inmediatamente anteriores. Si la base inmediatamente anterior no corresponde a la traducción de un aminoácido , el modelo de Markov interpolado la sigue considerando para determinar la probabilidad de la base dada, mientras que el modelo de contexto interpolado utilizado en GLIMMER 2.0 puede ignorar las bases irrelevantes. En GLIMMER 2.0 se incrementaron las predicciones de falsos positivos para reducir el número de predicciones de falsos negativos. También se resuelven los genes superpuestos.
En el artículo «Identificación microbiana mejorada con GLIMMER» [ 4 ] se realizaron varias comparaciones entre GLIMMER 1.0 y GLIMMER 2.0, que muestran una mejora en la versión posterior. «La sensibilidad de GLIMMER 1.0 oscila entre el 98,4 % y el 99,7 %, con un promedio del 99,1 %, mientras que GLIMMER 2.0 tiene un rango de sensibilidad del 98,6 % al 99,8 %, con un promedio del 99,3 %. GLIMMER 2.0 es muy eficaz para encontrar genes de alta densidad. El parásito Trypanosoma brucei , responsable de la tripanosomiasis africana, está siendo identificado por GLIMMER 2.0» [ 4 ].
DESLUMBRAMIENTO 3.0
La tercera versión de GLIMMER, "GLIMMER 3.0", se lanzó en 2007 y se publicó en el artículo " Identifying bacterial genes and endosimbiont DNA with Glimmer" [ 5 ] . Este artículo describe varios cambios importantes realizados en el sistema GLIMMER, incluyendo métodos mejorados para identificar regiones codificantes y codones de inicio . La puntuación de ORF en GLIMMER 3.0 se realiza en orden inverso, es decir, comenzando desde el codón de parada y retrocediendo hacia el codón de inicio . El escaneo inverso ayuda a identificar con mayor precisión la porción codificante del gen, que se encuentra dentro de la ventana de contexto de IMM. GLIMMER 3.0 también mejora los datos del conjunto de entrenamiento generados al comparar el ORF largo con la distribución universal de aminoácidos de genomas bacterianos muy dispares. "GLIMMER 3.0 tiene una salida promedio de ORF largo del 57% para varios organismos, mientras que GLIMMER 2.0 tiene una salida promedio de ORF largo del 39%" [ 5 ] .
GLIMMER 3.0 reduce la tasa de predicciones falsas positivas, que se incrementó en GLIMMER 2.0 para disminuir el número de predicciones falsas negativas. "GLIMMER 3.0 tiene una precisión de predicción del sitio de inicio del 99,5 % para coincidencias 3'5', mientras que GLIMMER 2.0 tiene un 99,1 % para coincidencias 3'5'. GLIMMER 3.0 utiliza un nuevo algoritmo para escanear regiones codificantes, un nuevo módulo de detección del sitio de inicio y una arquitectura que integra todas las predicciones genéticas en todo el genoma." [ 5 ]
Fundamentos teóricos y biológicos
El proyecto GLIMMER contribuyó a introducir y popularizar el uso de modelos de longitud variable en biología computacional y bioinformática, que posteriormente se han aplicado a numerosos problemas, como la clasificación de proteínas, entre otros. El modelado de longitud variable fue desarrollado inicialmente por teóricos de la información y, posteriormente, se aplicó y popularizó ingeniosamente en la compresión de datos (por ejemplo, la compresión Ziv-Lempel). La predicción y la compresión están íntimamente ligadas mediante los Principios de Longitud Mínima de Descripción . La idea básica consiste en crear un diccionario de palabras frecuentes (motivos en secuencias biológicas). La intuición es que los motivos que aparecen con frecuencia son probablemente los más predictivos e informativos. En GLIMMER, el modelo interpolado es un modelo de mezcla de las probabilidades de estos motivos relativamente comunes. De forma similar al desarrollo de los HMM en biología computacional, los autores de GLIMMER se vieron influenciados conceptualmente por la aplicación previa de otra variante de modelos de Markov interpolados al reconocimiento de voz por investigadores como Fred Jelinek (IBM) y Eric Ristad (Princeton). El algoritmo de aprendizaje en GLIMMER es diferente de estos enfoques anteriores.
Acceso
GLIMMER se puede descargar desde la página principal de Glimmer (requiere un compilador de C++ ). Alternativamente, NCBI ofrece una versión en línea..
Cómo funciona
- GLIMMER busca principalmente marcos de lectura abiertos largos ( ORF largos ). Un marco de lectura abierto puede superponerse con cualquier otro, lo cual se resolverá mediante la técnica descrita en la subsección. Utilizando estos ORF largos y siguiendo una distribución específica de aminoácidos, GLIMMER genera datos para el conjunto de entrenamiento .
- Utilizando estos datos de entrenamiento, GLIMMER entrena los seis modelos de Markov de ADN codificante desde orden cero hasta orden ocho y también entrena el modelo para ADN no codificante.
- GLIMMER intenta calcular las probabilidades a partir de los datos. En función del número de observaciones, GLIMMER determina si debe utilizar un modelo de Markov de orden fijo o un modelo de Markov interpolado .
- Si el número de observaciones es mayor que 400, GLIMMER utiliza un modelo de Markov de orden fijo para obtener sus probabilidades.
- Si el número de observaciones es inferior a 400, GLIMMER utiliza un modelo de Markov interpolado , que se explica brevemente en la siguiente subsección.
- GLIMMER obtiene una puntuación para cada ORF largo generado utilizando los seis modelos de ADN codificante y también utilizando un modelo de ADN no codificante.
- Si la puntuación obtenida en el paso anterior es superior a un determinado umbral, GLIMMER predice que se trata de un gen.
Los pasos explicados anteriormente describen la funcionalidad básica de GLIMMER. GLIMMER incorpora diversas mejoras, algunas de las cuales se describen en las siguientes subsecciones.
El sistema GLIMMER
El sistema GLIMMER consta de dos programas. El primer programa se llama build-imm, que toma un conjunto de secuencias de entrada y genera el modelo de Markov interpolado de la siguiente manera.
Se calcula la probabilidad para cada base, es decir, A, C, G, T, para todos los k-meros para 0 ≤ k ≤ 8. Luego, para cada k-mero , GLIMMER calcula el peso. La probabilidad de la nueva secuencia se calcula de la siguiente manera.
donde n es la longitud de la secuenciaes el oligómero en la posición x., elLa puntuación del modelo de Markov interpolado de orden - se calcula como
"dóndees el peso del k-mero en la posición x-1 en la secuencia S yes la estimación obtenida a partir de los datos de entrenamiento de la probabilidad de la base ubicada en la posición x en el-modelo de orden." [ 1 ]
La probabilidad de basedadas las i bases anteriores se calcula de la siguiente manera.
"El valor deasociado conpuede considerarse una medida de confianza en la precisión de este valor como una estimación de la probabilidad verdadera. GLIMMER utiliza dos criterios para determinar. La primera de ellas es la ocurrencia de frecuencia simple en la que el número de ocurrencias de la cadena de contexto en los datos de entrenamiento supera un valor umbral específico, entoncesestá configurado en 1.0. El valor predeterminado actual para el umbral es 400, lo que da una confianza del 95%. Cuando no hay suficientes ocurrencias de muestra de una cadena de contexto, build-imm emplea criterios adicionales para determinarvalor. Para una cadena de contexto dadade longitud i, build-imm compara las frecuencias observadas de la siguiente base,,,con las probabilidades del modelo de Markov interpoladas calculadas previamente utilizando el siguiente contexto más corto,,,,. Usando unprueba, construir-imm determinar qué tan probable es que las cuatro frecuencias observadas sean consistentes con los valores IMM del siguiente contexto más corto." [ 1 ]
El segundo programa, llamado Glimmer, utiliza este IMM para identificar genes putativos en todo el genoma. Glimmer identifica todos los marcos de lectura abiertos con una puntuación superior al umbral y comprueba si hay genes superpuestos. La resolución de genes superpuestos se explica en la siguiente subsección.
Las ecuaciones y la explicación de los términos utilizados anteriormente se toman del artículo 'Identificación de genes microbianos mediante modelos de Markov interpolados [ 1 ]
Resolución de genes superpuestos
En GLIMMER 1.0, cuando dos genes A y B se superponen, se evalúa la región de superposición. Si A es más largo que B, si A obtiene una puntuación mayor en la región de superposición y si modificar el sitio de inicio de B no resuelve la superposición, entonces B se descarta.
GLIMMER 2.0 proporcionó una mejor solución para resolver la superposición. En GLIMMER 2.0, cuando dos genes potenciales A y B se superponen, se evalúa la región de superposición. Si el gen A obtiene una puntuación más alta, se consideran cuatro orientaciones diferentes.

En el caso anterior, el cambio de posición de los sitios de inicio no elimina la superposición. Si A es significativamente más largo que B, entonces B se rechaza; de lo contrario, tanto A como B se consideran genes, con una superposición dudosa.

En el caso anterior, mover B puede resolver la superposición, A y B pueden considerarse genes no superpuestos, pero si B es significativamente más corto que A, entonces B es rechazado.

En el caso anterior, mover A puede resolver la superposición. A solo se mueve si la superposición es una pequeña fracción de A; de lo contrario, B se rechaza.

En el caso anterior, tanto A como B pueden moverse. Primero movemos el inicio de B hasta que la región de superposición tenga una puntuación más alta para B. Luego movemos el inicio de A hasta que tenga una puntuación más alta. Después B de nuevo, y así sucesivamente, hasta que se elimine la superposición o no se puedan realizar más movimientos.
El ejemplo anterior se ha tomado del artículo 'Identificación de genes bacterianos y ADN de endosimbiontes con Glimmer'. [ 5 ]
sitios de unión del ribosoma
La señal del sitio de unión del ribosoma (RBS) se puede utilizar para determinar la posición real del sitio de inicio. Los resultados de GLIMMER se pasan como entrada al programa RBSfinder para predecir los sitios de unión del ribosoma. GLIMMER 3.0 integra el programa RBSfinder en la propia función de predicción de genes.
El software ELPH (que se determinó como altamente efectivo para identificar RBS en el artículo [ 5 ] ) se utiliza para identificar RBS y está disponible en este sitio web. Archivado el 27/11/2013 en Wayback Machine . El algoritmo de muestreo de Gibbs se utiliza para identificar motivos compartidos en cualquier conjunto de secuencias. Estas secuencias de motivos compartidos y su longitud se proporcionan como entrada a ELPH. ELPH luego calcula la matriz de peso de posición (PWM) que GLIMMER 3 utilizará para puntuar cualquier RBS potencial encontrado por RBSfinder. El proceso anterior se realiza cuando tenemos una cantidad sustancial de genes de entrenamiento. Si hay un número insuficiente de genes de entrenamiento, GLIMMER 3 puede autoarrancarse para generar un conjunto de predicciones de genes que pueden usarse como entrada para ELPH. ELPH ahora calcula la PWM y esta PWM puede usarse nuevamente en el mismo conjunto de genes para obtener resultados más precisos para los sitios de inicio. Este proceso puede repetirse durante muchas iteraciones para obtener PWM y resultados de predicción de genes más consistentes.
Actuación
Glimmer apoya los esfuerzos de anotación genómica en una amplia gama de especies bacterianas, arqueales y virales. En un esfuerzo de reanotación a gran escala en el Banco de Datos de ADN de Japón (DDBJ, que replica Genbank ), Kosuge et al. (2006) [ 6 ] examinaron los métodos de búsqueda de genes utilizados para 183 genomas. Informaron que, de estos proyectos, Glimmer fue el buscador de genes para el 49%, seguido de GeneMark con el 12%, y otros algoritmos se utilizaron en el 3% o menos de los proyectos. (También informaron que el 33% de los genomas utilizaron "otros" programas, lo que en muchos casos significaba que no podían identificar el método. Excluyendo esos casos, Glimmer se utilizó para el 73% de los genomas para los que los métodos pudieron identificarse inequívocamente). Glimmer fue utilizado por el DDBJ para reanotar todos los genomas bacterianos en las Bases de Datos Internacionales de Secuencias de Nucleótidos. [ 7 ] También está siendo utilizado por este grupo para anotar virus. [ 8 ] Glimmer forma parte del sistema de anotación bacteriana del Centro Nacional de Información Biotecnológica (NCBI), [ 9 ] que también mantiene un servidor web para Glimmer, [ 10 ] al igual que los sitios en Alemania, [ 11 ] Canadá. [ 12 ]
Según Google Scholar, a principios de 2011 el artículo original de Glimmer (Salzberg et al., 1998) [ 1 ] había sido citado 581 veces, y el artículo de Glimmer 2.0 (Delcher et al., 1999) [ 4 ] había sido citado 950 veces.
Referencias
- 1 2 3 4 5 6 7 8 9 Salzberg, SL; Delcher, AL; Kasif, S.; White, O. (1998). "Identificación de genes microbianos mediante modelos de Markov interpolados" . Nucleic Acids Research . 26 (2): 544– 548. doi : 10.1093/nar/26.2.544 . PMC 147303. PMID 9421513 .
- ↑ Salzberg, SL; Pertea, M.; Delcher, AL; Gardner, MJ; Tettelin, H. (1999). "Modelos de Markov interpolados para la localización de genes eucariotas". Genomics . 59 (1): 24– 31. CiteSeerX 10.1.1.126.431 . doi : 10.1006/geno.1999.5854 . PMID 10395796 .
- ↑ "Centro de Biología Computacional" . Universidad Johns Hopkins . Consultado el 23 de marzo de 2013 .
- 1 2 3 4 5 Delcher, A.; Harmon, D.; Kasif, S.; White, O.; Salzberg, S. (1999). "Identificación mejorada de genes microbianos con GLIMMER" . Nucleic Acids Research . 27 (23): 4636– 4641. doi : 10.1093/nar/27.23.4636 . PMC 148753. PMID 10556321 .
- 1 2 3 4 5 Delcher, AL; Bratke, KA; Powers, EC; Salzberg, SL (2007). "Identificación de genes bacterianos y ADN de endosimbiontes con Glimmer" . Bioinformática . 23 (6): 673– 679. doi : 10.1093/bioinformatics/btm009 . PMC 2387122. PMID 17237039 .
- ↑ Kosuge, T.; Abe, T.; Okido, T.; Tanaka, N.; Hirahata, M.; Maruyama, Y.; Mashima, J.; Tomiki, A.; Kurokawa, M.; Himeno, R.; Fukuchi, S.; Miyazaki, S.; Gojobori, T.; Tateno, Y.; Sugawara, H. (2006). "Exploración y clasificación de posibles genes de 183 cepas bacterianas mediante un protocolo común para la identificación de nuevos genes: Gene Trek in Prokaryote Space (GTPS)" . DNA Research . 13 (6): 245– 254. doi : 10.1093/dnares/dsl014 . PMID 17166861 .
- ↑ Sugawara, H.; Abe, T.; Gojobori, T.; Tateno, Y. (2007). "DDBJ trabaja en la evaluación y clasificación de genes bacterianos en INSDC" . Nucleic Acids Research . 35 (número especial de bases de datos): D13– D15. doi : 10.1093/nar/gkl908 . PMC 1669713. PMID 17108353 .
- ↑ Hirahata, M.; Abe, T.; Tanaka, N.; Kuwana, Y.; Shigemoto, Y.; Miyazaki, S.; Suzuki, Y.; Sugawara, H. (2007). "Genome Information Broker for Viruses (GIB-V): Database for comparative analysis of virus genomes" . Nucleic Acids Research . 35 (número especial de bases de datos): D339– D342. doi : 10.1093/nar/gkl1004 . PMC 1781101 . PMID 17158166 .
- ↑ "NCBI Prokaryotic Genomes Automatic Annotation Pipeline (PGAAP)" . Centro de Bioinformática y Biología Computacional . Consultado el 23 de marzo de 2012 .
- ↑ "Herramientas de anotación del genoma microbiano" . Centro de Bioinformática y Biología Computacional . Consultado el 23 de marzo de 2012 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ «TiCo» . Institut für Mikrobiologie und Genetik, Universität Göttingen. 2005-02-11. Archivado desde el original el 31 de marzo de 2022 . Consultado el 23 de marzo de 2012 .
- ↑ "Sistema de anotación bacteriana BASys" . Archivado del original el 24 de julio de 2012. Consultado el 23 de marzo de 2012 .
Enlaces externos
- La página principal de Glimmer en CCB, Universidad Johns Hopkins , desde donde se puede descargar el software.
- Software de bioinformática
- modelos de Markov