
En biología molecular y genética , la anotación del ADN o anotación del genoma es el proceso de describir la estructura y función de los componentes de un genoma , [ 2 ] analizándolos e interpretándolos para extraer su significado biológico y comprender los procesos biológicos en los que participan. [ 3 ] Entre otras cosas, identifica la ubicación de los genes y todas las regiones codificantes en un genoma y determina la función de esos genes. [ 4 ]
La anotación se realiza después de secuenciar y ensamblar un genoma , y es un paso necesario en el análisis genómico antes de que la secuencia se deposite en una base de datos y se describa en un artículo publicado. Si bien la descripción de genes individuales y sus productos o funciones es suficiente para considerar esta descripción como una anotación, la profundidad del análisis reportada en la literatura para diferentes genomas varía ampliamente, e incluso algunos informes incluyen información adicional que va más allá de una simple anotación. [ 5 ] Además, debido al tamaño y la complejidad de los genomas secuenciados, la anotación de ADN no se realiza manualmente, sino que se automatiza mediante métodos computacionales. Sin embargo, las conclusiones extraídas de los resultados obtenidos requieren el análisis manual de expertos. [ 6 ]
La anotación del ADN se clasifica en dos categorías: anotación estructural , que identifica y delimita elementos en un genoma, y anotación funcional , que asigna funciones a estos elementos. [ 7 ] Esta no es la única forma en que se ha categorizado, ya que también se han propuesto varias alternativas, como clasificaciones basadas en dimensiones [ 8 ] y en niveles . [ 3 ]
Historia
La primera generación de anotadores de genomas utilizó métodos locales ab initio , que se basan únicamente en la información que se puede extraer de la secuencia de ADN a escala local, es decir, un marco de lectura abierto (ORF) a la vez. [ 9 ] [ 10 ] Surgieron como una necesidad para manejar la enorme cantidad de datos producidos por las técnicas de secuenciación de ADN de Maxam-Gilbert y Sanger desarrolladas a finales de la década de 1970. El primer software utilizado para analizar lecturas de secuenciación es el paquete Staden , creado por Rodger Staden en 1977. [ 11 ] Realizaba varias tareas relacionadas con la anotación, como recuentos de bases y codones . De hecho, el uso de codones fue la estrategia principal empleada por varios métodos iniciales de predicción de secuencias codificantes de proteínas (CDS), [ 12 ] [ 13 ] [ 14 ] basados en la suposición de que las regiones más traducidas de un genoma contienen codones con los ARNt correspondientes más abundantes (las moléculas responsables de transportar aminoácidos al ribosoma durante la síntesis de proteínas), lo que permite una traducción más eficiente. [ 15 ] También se sabía que esto ocurría con los codones sinónimos , que suelen estar presentes en proteínas expresadas a un nivel inferior. [ 13 ] [ 16 ]
La llegada de genomas completos en la década de 1990 (el primero fue el genoma de Haemophilus influenzae secuenciado en 1995) introdujo una segunda generación de anotadores. Al igual que en la generación anterior, realizaron la anotación mediante métodos ab initio , pero ahora aplicados a escala genómica. [ 9 ] [ 10 ] Los modelos de Markov son la fuerza motriz detrás de muchos algoritmos utilizados por los anotadores de esta generación; [ 17 ] [ 18 ] estos modelos pueden pensarse como grafos dirigidos donde los nodos representan diferentes señales genómicas (como sitios de inicio de transcripción y traducción ) conectados por flechas que representan el escaneo de la secuencia. Para asegurar que un modelo de Markov detecte una señal genómica, primero debe ser entrenado con una serie de señales genómicas conocidas. [ 19 ] La salida de los modelos de Markov en el contexto de la anotación incluye las probabilidades de cada tipo de elemento genómico en cada parte del genoma, y un modelo de Markov preciso asignará altas probabilidades a las anotaciones correctas y bajas probabilidades a las incorrectas. [ 20 ]

A medida que se disponía de más genomas secuenciados a principios y mediados de la década de 2000, junto con las numerosas secuencias de proteínas obtenidas experimentalmente, los anotadores de genomas comenzaron a emplear métodos basados en homología, dando inicio a la tercera generación de anotación genómica. Estos nuevos métodos permitieron a los anotadores no solo inferir elementos genómicos mediante métodos estadísticos (como en generaciones anteriores), sino también realizar su tarea comparando la secuencia que se estaba anotando con otras secuencias ya existentes y validadas. Estos denominados anotadores combinadores, que realizan tanto anotación ab initio como basada en homología, requieren algoritmos de alineación rápidos para identificar regiones de homología . [ 2 ] [ 9 ] [ 10 ]
A finales de la década de 2000, la anotación del genoma centró su atención en la identificación de regiones no codificantes del ADN, gracias a la aparición de métodos para analizar sitios de unión de factores de transcripción , sitios de metilación del ADN , estructura de la cromatina y otras técnicas de análisis de ARN y regiones reguladoras . Otros anotadores del genoma también comenzaron a centrarse en estudios a nivel poblacional representados por el pangenoma ; de este modo, por ejemplo, las plataformas de anotación garantizan que los genes centrales de un clado también se encuentren en nuevos genomas del mismo clado. Ambas estrategias de anotación constituyen la cuarta generación de anotadores del genoma. [ 9 ] [ 10 ]
Para la década de 2010, las secuencias genómicas de más de mil individuos humanos (a través del Proyecto 1000 Genomas ) y de varios organismos modelo estaban disponibles. Por lo tanto, la anotación del genoma sigue siendo un desafío importante para los científicos que investigan el genoma humano y otros genomas. [ 21 ] [ 22 ]
Anotación estructural

La anotación estructural describe la ubicación precisa de los diferentes elementos en un genoma, como marcos de lectura abiertos (ORF), secuencias codificantes (CDS), exones , intrones , repeticiones , sitios de empalme , motivos reguladores , codones de inicio y parada , y promotores . [ 6 ] [ 23 ] Los pasos principales de la anotación estructural son:
- Repetir la identificación y el enmascaramiento.
- Alineación de la evidencia (opcional).
- Identificación de empalmes (solo en eucariotas).
- Predicción de características (secuencias codificantes y no codificantes).
Identificación y enmascaramiento repetidos
El primer paso de la anotación estructural consiste en la identificación y el enmascaramiento de repeticiones , que incluyen secuencias de baja complejidad (como AGAGAGAG o segmentos monopoliméricos como TTTTTTTTT) y transposones (que son elementos más grandes con varias copias en todo el genoma). [ 2 ] [ 24 ] Las repeticiones son un componente principal tanto de los genomas procariotas como eucariotas; por ejemplo, entre el 0 % y más del 42 % de los genomas procariotas consisten en repeticiones [ 25 ] y tres cuartas partes del genoma humano están compuestas por elementos repetitivos. [ 26 ]
La identificación de repeticiones es difícil por dos razones principales: están poco conservadas y sus límites no están claramente definidos. Debido a esto, se deben construir bibliotecas de repeticiones para el genoma de interés, lo que se puede lograr con uno de los siguientes métodos: [ 24 ] [ 27 ]
- Métodos de novo . Las repeticiones se identifican detectando y agrupando pares de secuencias en diferentes ubicaciones cuya similitud supera un umbral mínimo de conservación de secuencia en una comparación del propio genoma, por lo que no se requiere información previa sobre la estructura o las secuencias repetidas. La desventaja de estos métodos es que pueden identificar cualquier secuencia repetida, no solo transposones, y pueden incluir secuencias codificantes conservadas (CDS), lo que hace que un procesamiento posterior cuidadoso sea un paso indispensable para eliminar estas secuencias. También pueden omitir regiones relacionadas que se han degradado con el tiempo y pueden agrupar elementos que no tienen conexión en su historia evolutiva. [ 28 ]
- Métodos basados en homología . Las repeticiones se identifican por similitud ( homología ) con repeticiones conocidas almacenadas en una base de datos curada. Estos métodos tienen mayor probabilidad de encontrar transposones reales, incluso en cantidades menores, en comparación con los métodos de novo , pero están sesgados hacia familias previamente identificadas.
- Métodos basados en la estructura . Las repeticiones se identifican a partir de modelos de su estructura, en lugar de por repetición o similitud. Son capaces de identificar transposones reales (al igual que los métodos basados en homología), pero no están sesgados por elementos conocidos. Sin embargo, son muy específicos para cada clase de repetición y, por lo tanto, su aplicabilidad es menos universal.
- Métodos genómicos comparativos . Las repeticiones se identifican como interrupciones de una o más secuencias en un alineamiento múltiple de secuencias producido por grandes regiones de inserción . Si bien esta estrategia evita el problema de los límites mal definidos que existe en otros métodos, depende en gran medida de la calidad del ensamblaje y del nivel de actividad de los transposones en los genomas en cuestión.
Una vez identificadas las regiones repetitivas de un genoma, se enmascaran. El enmascaramiento consiste en sustituir las letras de los nucleótidos (A, C, G o T) por otras letras. De este modo, estas regiones se marcan como repetitivas y los análisis posteriores las tratan como tales. Las regiones repetitivas pueden generar problemas de rendimiento si no se enmascaran, e incluso pueden producir evidencia falsa para la anotación de genes (por ejemplo, tratar un marco de lectura abierto (ORF) en un transposón como un exón ) [ 24 ]. Dependiendo de las letras utilizadas para la sustitución, el enmascaramiento puede clasificarse como suave o duro: en el enmascaramiento suave , las regiones repetitivas se indican con letras minúsculas (a, c, g o t), mientras que en el enmascaramiento duro , las letras de estas regiones se sustituyen por N. De este modo, por ejemplo, el enmascaramiento suave puede utilizarse para excluir coincidencias de palabras y evitar iniciar una alineación en esas regiones, y el enmascaramiento duro, además de todo esto, también puede excluir las regiones enmascaradas de las puntuaciones de alineación. [ 29 ] [ 30 ]
Alineación de la evidencia
El siguiente paso tras el enmascaramiento del genoma suele consistir en alinear todas las evidencias de transcripción y proteínas disponibles con el genoma analizado, es decir, alinear todas las etiquetas de secuencia expresada (EST), ARN y proteínas conocidas del organismo que se está anotando con el genoma. [ 31 ] Aunque es opcional, puede mejorar la elucidación de la secuencia genética porque los ARN y las proteínas son productos directos de las secuencias codificantes. [ 19 ]
Si se dispone de datos de RNA-Seq , estos pueden utilizarse para anotar y cuantificar todos los genes y sus isoformas ubicados en el genoma correspondiente, proporcionando no solo sus ubicaciones, sino también sus tasas de expresión. [ 32 ] Sin embargo, los transcritos proporcionan información insuficiente para la predicción de genes porque pueden ser inaccesibles para algunos genes, pueden codificar operones de más de un gen y sus codones de inicio y parada no pueden determinarse debido a cambios de marco de lectura y factores de iniciación de la traducción . [ 19 ] Para resolver este problema, se emplean enfoques basados en proteogenómica , que utilizan información de proteínas expresadas, a menudo derivada de espectrometría de masas . [ 33 ]
Identificación de empalmes
La anotación de genomas eucariotas presenta una dificultad adicional debido al empalme de ARN , un proceso postranscripcional en el que se eliminan los intrones (regiones no codificantes) y se unen los exones (regiones codificantes). [ 23 ] Por lo tanto, las secuencias codificantes eucariotas (CDS) son discontinuas y, para asegurar su correcta identificación, es necesario filtrar las regiones intrónicas. Para ello, los pipelines de anotación deben encontrar los límites exón-intrón, y se han desarrollado múltiples metodologías para este propósito. Una solución consiste en utilizar límites de exones conocidos para la alineación; por ejemplo, muchos intrones comienzan con GT y terminan con AG. [ 31 ] Sin embargo, este enfoque no puede detectar límites nuevos, por lo que existen alternativas como los algoritmos de aprendizaje automático que se entrenan con límites de exones conocidos e información de calidad para predecir nuevos. [ 34 ] Los predictores de nuevos límites de exones generalmente requieren algoritmos eficientes de compresión y alineación de datos, pero son propensos a fallar en límites ubicados en regiones con baja cobertura de secuencia o altas tasas de error producidas durante la secuenciación. [ 35 ] [ 36 ]
Predicción de características
Un genoma se divide en regiones codificantes y no codificantes , y el último paso de la anotación estructural consiste en identificar estas características dentro del genoma. De hecho, la tarea principal en la anotación del genoma es la predicción de genes , razón por la cual se han desarrollado numerosos métodos para este propósito. [ 19 ] La predicción de genes es un término engañoso, ya que la mayoría de los predictores de genes solo identifican secuencias codificantes (CDS) y no informan regiones no traducidas (UTR); por esta razón, se ha propuesto la predicción de CDS como un término más preciso. [ 24 ] Los predictores de CDS detectan características del genoma a través de métodos llamados sensores , que incluyen sensores de señal que identifican señales de sitios funcionales como promotores y sitios de poliA , y sensores de contenido que clasifican secuencias de ADN en contenido codificante y no codificante. [ 37 ] Mientras que los predictores de CDS procariotas se ocupan principalmente de marcos de lectura abiertos (ORF), que son segmentos de ADN entre los codones de inicio y parada , los predictores de CDS eucariotas se enfrentan a un problema más difícil debido a la compleja organización de los genes eucariotas. [ 3 ] Los métodos de predicción de CDS se pueden clasificar en tres categorías amplias: [ 2 ] [ 31 ]
- Métodos ab initio (también llamados estadísticos, intrínsecos o de novo). La predicción de CDS se basa únicamente en la información que se puede extraer de la secuencia de ADN. Se basan en métodos estadísticos como el modelo oculto de Markov (HMM). Algunos métodos emplean dos o más genomas para inferir tasas y patrones de mutación locales a lo largo del genoma. [ 38 ]
- Métodos basados en homología (también llamados empíricos, basados en evidencia o extrínsecos). La predicción de CDS se basa en la similitud con secuencias conocidas. Específicamente, realiza alineaciones de la secuencia analizada con etiquetas de secuencia expresada (EST), ADN complementario (ADNc) o secuencias de proteínas .
- Combinadores . La predicción de CDS se realiza mediante una combinación de los dos métodos mencionados anteriormente.
Anotación funcional
La anotación funcional asigna funciones a los elementos genómicos encontrados mediante la anotación estructural, [ 7 ] relacionándolos con procesos biológicos como el ciclo celular , la muerte celular , el desarrollo , el metabolismo , etc. [ 3 ] También puede utilizarse como una verificación de calidad adicional al identificar elementos que podrían haber sido anotados erróneamente. [ 2 ]
Predicción de la función de secuencia codificante

La anotación funcional de genes requiere un vocabulario controlado (u ontología) para nombrar las características funcionales predichas. Sin embargo, debido a que existen numerosas formas de definir las funciones genéticas, el proceso de anotación puede verse obstaculizado cuando lo realizan diferentes grupos de investigación. Por lo tanto, se debe emplear un vocabulario controlado estandarizado, siendo la Ontología Génica (GO) el más completo. Esta clasifica las propiedades funcionales en una de tres categorías (función molecular, proceso biológico y componente celular) y las organiza en un grafo dirigido acíclico , en el que cada nodo es una función particular y cada arista (o flecha) entre dos nodos indica una relación padre-hijo o subcategoría-categoría. [ 40 ] [ 41 ] A partir de 2020, GO es el vocabulario controlado más utilizado para la anotación funcional de genes, seguido por el Catálogo Funcional MIPS (FunCat). [ 42 ]
Algunos métodos convencionales para la anotación funcional se basan en la homología , que se apoya en herramientas de búsqueda de alineación local. [ 40 ] Su premisa es que una alta conservación de secuencia entre dos elementos genómicos implica que su función también se conserva. Los pares de secuencias homólogas que aparecieron a través de paralogía , ortología o xenología suelen realizar una función similar. Sin embargo, las secuencias ortólogas deben tratarse con precaución por dos razones: (1) pueden tener nombres diferentes dependiendo de cuándo se anotaron originalmente, y (2) pueden no desempeñar el mismo rol funcional en dos organismos diferentes. Los anotadores a menudo se refieren a una secuencia análoga cuando no se encontró paralogía, ortología o xenología. [ 19 ] Los métodos basados en la homología tienen varios inconvenientes, como errores en la base de datos, baja sensibilidad/especificidad, incapacidad para distinguir entre paralogía y homología, [ 43 ] puntuaciones artificialmente altas debido a la presencia de regiones de baja complejidad y variación significativa dentro de una familia de proteínas. [ 44 ]
La anotación funcional puede realizarse mediante métodos probabilísticos. La distribución de aminoácidos hidrofílicos e hidrofóbicos indica si una proteína se encuentra en solución o en membrana. Los motivos de secuencia específicos proporcionan información sobre las modificaciones postraduccionales y la ubicación final de cualquier proteína. [ 19 ] Los métodos probabilísticos pueden combinarse con un vocabulario controlado, como GO; por ejemplo, las redes de interacción proteína-proteína (PPI) suelen ubicar cerca unas de otras proteínas con funciones similares. [ 45 ]
Los métodos de aprendizaje automático también se utilizan para generar anotaciones funcionales para proteínas novedosas basadas en términos GO. Generalmente, consisten en construir un clasificador binario para cada término GO, que luego se combinan para realizar predicciones sobre términos GO individuales (formando un clasificador multiclase ) para los cuales posteriormente se obtienen puntuaciones de confianza. La máquina de vectores de soporte (SVM) es el clasificador binario más utilizado en la anotación funcional; sin embargo, también se han empleado otros algoritmos, como el de k-vecinos más cercanos (kNN) y la red neuronal convolucional (CNN). [ 40 ]
Los métodos de clasificación binaria o multiclase para la anotación funcional generalmente producen resultados menos precisos porque no consideran las interrelaciones entre los términos GO. Los métodos más avanzados que sí consideran estas interrelaciones lo hacen mediante un enfoque plano o jerárquico, que se distinguen por el hecho de que el primero no considera la estructura de la ontología, mientras que el segundo sí. Algunos de estos métodos comprimen los términos GO mediante factorización matricial o hash , lo que mejora su rendimiento. [ 42 ]
predicción de la función de secuencias no codificantes
Las secuencias no codificantes (ADNnc) son aquellas que no codifican proteínas. Incluyen elementos como pseudogenes, duplicaciones segmentarias, sitios de unión y genes de ARN. [ 28 ]
Los pseudogenes son copias mutadas de genes codificadores de proteínas que perdieron su función codificante debido a una interrupción en su marco de lectura abierto (ORF), lo que los hace no traducibles . [ 28 ] Se pueden identificar utilizando uno de los dos métodos siguientes: [ 46 ]
- Método basado en homología . Los pseudogenes se identifican mediante la búsqueda de secuencias similares a genes funcionales, pero que contienen mutaciones que alteran su marco de lectura abierto (ORF). Este método no permite determinar la relación evolutiva entre un pseudogén y su gen parental, ni el tiempo transcurrido desde que ocurrió el evento.
- Método basado en filogenia . Los pseudogenes se identifican mediante un análisis filogenético. Primero, se construye un árbol filogenético de la especie de interés y un árbol filogenético del gen (o familia de genes) de interés. Luego, se comparan ambos para identificar una especie que haya perdido el gen. A continuación, dentro del genoma de la especie donde no se encontró el gen, se busca una secuencia ortóloga al gen identificado en la especie más cercana. Finalmente, si esta secuencia ortóloga presenta una interrupción en su ORF (y cumple con otros criterios, como el análisis de datos de RNA-Seq , la relación dN/dS , etc.), significa que la secuencia es efectivamente un pseudogén.
Las duplicaciones segmentarias son segmentos de ADN de más de 1000 pares de bases que se repiten en el genoma con más del 90 % de identidad de secuencia. Dos estrategias utilizadas para su identificación son WGAC y WSSD: [ 47 ]
- Comparación del ensamblaje del genoma completo (WGAC). Alinea todo el genoma consigo mismo para identificar secuencias repetidas tras filtrar las repeticiones comunes; no requiere que se utilicen las lecturas originales para el ensamblaje.
- Detección de secuencias de escopeta de genoma completo (WSSD). Alinea las lecturas originales con el genoma ensamblado y busca regiones con una profundidad de lectura superior a la media, que suelen ser señales de duplicación. Las duplicaciones segmentarias identificadas por este método, pero no por WGAC, probablemente sean duplicaciones colapsadas, lo que significa que se alinearon erróneamente con la misma región. [ 48 ]
Los sitios de unión al ADN son regiones en la secuencia del genoma que se unen e interactúan con proteínas específicas. Desempeñan un papel importante en la replicación y reparación del ADN , la regulación transcripcional y la infección viral . La predicción de sitios de unión implica el uso de uno de los dos métodos siguientes: [ 49 ]
- Métodos basados en la similitud de secuencias . Consisten en la identificación de secuencias homólogas con sitios de unión al ADN conocidos, o en su alineación con proteínas de consulta. Su rendimiento suele ser bajo debido a que las secuencias de unión al ADN están menos conservadas .
- Métodos basados en la estructura . Estos métodos emplean la información estructural tridimensional de las proteínas para predecir la ubicación de los sitios de unión al ADN.
El ARN no codificante (ARNnc), producido por genes de ARN, es un tipo de ARN que no se traduce en una proteína. Incluye moléculas como el ARNt , el ARNr , el ARNsno y el microARN , así como transcritos similares al ARNm no codificante. La predicción ab initio de genes de ARN en un solo genoma suele arrojar resultados inexactos (con la excepción del microARN), por lo que se utilizan métodos comparativos multigénicos. Estos métodos se centran específicamente en las estructuras secundarias del ARNnc, ya que se conservan en especies relacionadas incluso cuando su secuencia no lo está. Por lo tanto, mediante un alineamiento múltiple de secuencias, se puede obtener información más útil para su predicción. También se puede emplear la búsqueda de homología para identificar genes de ARN, pero este procedimiento es complejo, especialmente en eucariotas, debido a la presencia de un gran número de repeticiones y pseudogenes. [ 50 ]
Visualización

Formatos de archivo
La visualización de anotaciones en un navegador genómico requiere un archivo de salida descriptivo, que debe describir las estructuras intrón - exón de cada anotación, sus codones de inicio y parada , UTR y transcripciones alternativas, e idealmente debería incluir información sobre los alineamientos de secuencias y las predicciones genéticas que respaldan cada modelo genético. Algunos formatos comúnmente utilizados para describir anotaciones son GenBank, GFF3 , GTF, BED y EMBL. [ 24 ] Algunos de estos formatos utilizan vocabularios controlados y ontologías para definir sus terminologías descriptivas y garantizar la interoperabilidad entre las herramientas de análisis y visualización. [ 2 ]
Navegadores de genoma
Los navegadores genómicos son productos de software que simplifican el análisis y la visualización de grandes conjuntos de datos de secuencias y anotaciones genómicas para obtener información biológica, a través de una interfaz gráfica. [ 52 ] [ 31 ] [ 53 ]
Los navegadores genómicos se pueden dividir en navegadores genómicos basados en la web y navegadores genómicos independientes . Los primeros utilizan información de bases de datos y se pueden clasificar en multiespecie (integran secuencias y anotaciones de múltiples organismos y promueven el análisis comparativo entre especies) y específicos de especie (se centran en un organismo y las anotaciones para una especie en particular). Los segundos no están necesariamente vinculados a una base de datos genómica específica, sino que son navegadores de propósito general que se pueden descargar e instalar como una aplicación en una computadora local. [ 54 ] [ 19 ]
Visualización comparativa de genomas

La genómica comparativa tiene como objetivo identificar similitudes y diferencias en las características genómicas, así como examinar las relaciones evolutivas entre organismos. [ 55 ] Las herramientas de visualización capaces de ilustrar el comportamiento comparativo entre dos o más genomas son esenciales para este enfoque y pueden clasificarse en tres categorías según la representación de las relaciones entre los genomas comparados: [ 19 ]
- Gráficos de puntos: Este esquema solo permite mostrar la alineación de dos genomas; un genoma se representa en el eje horizontal y el otro en el eje vertical, y los puntos en el gráfico representan los elementos genómicos que son similares entre estas dos anotaciones.
- Representación lineal: Esta representación utiliza múltiples pistas lineales para representar múltiples genomas y sus características, donde "pista" es un concepto que se refiere a un tipo específico de característica genómica en una ubicación genómica.
- Representación circular: Esta representación facilita la comparación de genomas microbianos o virales completos. En este modo de visualización, se utilizan círculos y arcos concéntricos para representar secciones genómicas.
Control de calidad
La calidad del ensamblaje de la secuencia influye en la calidad de la anotación, por lo que es importante evaluar la calidad del ensamblaje antes de realizar los pasos de anotación subsiguientes. [ 31 ] Para cuantificar la calidad de una anotación genómica, se han utilizado tres métricas: exhaustividad , precisión y exactitud ; aunque estas medidas no se utilizan explícitamente en proyectos de anotación, sino más bien en discusiones sobre la exactitud de la predicción. [ 56 ]
Los enfoques de anotación comunitaria son excelentes técnicas para el control de calidad y la estandarización en la anotación genómica. Un encuentro de anotación que tuvo lugar en 2002 condujo a la creación de los estándares de anotación utilizados por el Proyecto de Análisis Humano y Vertebrado (HAVANA) del Instituto Sanger. [ 57 ] [ 20 ]
Reanotación
Los proyectos de anotación suelen basarse en anotaciones previas del genoma de un organismo; sin embargo, estas anotaciones antiguas pueden contener errores que se propagan a las nuevas. A medida que se desarrollan nuevas tecnologías de análisis genómico y se dispone de bases de datos más completas, la anotación de algunos genomas antiguos puede actualizarse. Este proceso, conocido como reanotación, proporciona a los usuarios información nueva sobre el genoma, incluyendo detalles sobre genes y funciones proteicas. Por lo tanto, la reanotación es un método útil para el control de calidad. [ 56 ] [ 58 ]
Anotación de la comunidad
La anotación comunitaria consiste en la participación de una comunidad (tanto científica como no científica) en proyectos de anotación de genomas. Se puede clasificar en las siguientes seis categorías: [ 59 ] [ 3 ]
- Modelo de fábrica: La anotación se realiza mediante un proceso completamente automatizado.
- Modelo de museo: Se requiere la curación manual por parte de expertos para interpretar los resultados de un proyecto de anotación.
- Modelo de industria artesanal: La anotación está descentralizada y es el resultado del esfuerzo de diferentes curadores a tiempo parcial.
- Modelo de fiesta o encuentro: Consiste en un taller intensivo breve con curadores destacados de la comunidad. Se utilizó por primera vez en el proyecto de anotación del genoma de Drosophila melanogaster . [ 60 ]
- Anotador privilegiado: Una variante del modelo de museo, aplicada en el Proyecto Ratón Noqueado (KOMP) , en la que los conservadores pasan por un período de formación previo a la anotación y, posteriormente, se les da acceso a herramientas de anotación para continuar su trabajo.
- Enfoque de guardián: Combina los modelos de jamboree y de industria artesanal. Comienza con un taller de anotación, seguido de una colaboración descentralizada para ampliar y refinar la anotación inicial. Se ha utilizado con datos de múltiples especies.
Se dice que una anotación comunitaria es supervisada cuando existe un coordinador que gestiona el proyecto solicitando la anotación de elementos específicos a un grupo selecto de expertos. Por otro lado, cuando cualquier persona puede participar en un proyecto y la coordinación se realiza de forma descentralizada, se denomina anotación comunitaria no supervisada . La anotación comunitaria supervisada es efímera y se limita a la duración del evento, mientras que la no supervisada no presenta esta limitación. Sin embargo, esta última ha tenido menos éxito que la primera, presumiblemente debido a la falta de tiempo, motivación, incentivos o comunicación. [ 61 ]
Wikipedia cuenta con varios WikiProyectos destinados a mejorar la anotación. El WikiProyecto de Genes , por ejemplo, utiliza un bot que recopila datos genéticos de bases de datos de investigación y crea fragmentos genéticos a partir de ellos. [ 62 ] El WikiProyecto de ARN busca escribir artículos que describan ARN individuales y familias de ARN de forma accesible. [ 63 ]
Aplicaciones
diagnóstico de la enfermedad
La Ontología Génica (GO) está siendo utilizada por investigadores para establecer una relación entre enfermedades y genes, ya que GO ayuda en la identificación de genes nuevos, las alteraciones en su expresión, distribución y función bajo diferentes condiciones, como la enfermedad frente a la salud. [ 41 ] Se han creado bases de datos de estas relaciones entre enfermedades y genes de diferentes organismos, como la Ontología de Patógenos Vegetales, [ 64 ] la Ontología Génica de Microbios Asociados a Plantas [ 65 ] o DisGeNET. [ 66 ] Y algunas otras se han implementado en bases de datos preexistentes, como la Ontología de Enfermedades de Ratas en la base de datos del Genoma de Ratas. [ 67 ]
Biorremediación
Una gran diversidad de enzimas catabólicas involucradas en la degradación de hidrocarburos por algunas cepas bacterianas están codificadas por genes ubicados en sus elementos genéticos móviles (EGM). El estudio de estos elementos es de gran importancia en el campo de la biorremediación , ya que recientemente se ha buscado la inoculación de cepas silvestres o genéticamente modificadas con estos EGM para adquirir estas capacidades de degradación de hidrocarburos. [ 68 ] En 2013, Phale et al. [ 69 ] publicaron la anotación del genoma de una cepa de Pseudomonas putida (CSV86), una bacteria conocida por su preferencia por el naftaleno y otros compuestos aromáticos sobre la glucosa como fuente de carbono y energía. Para encontrar los EGM de esta bacteria, su genoma fue anotado usando RAST y el NCBI Prokaryotic Genome Annotation Pipeline (PGAP), y la identificación de nueve elementos móviles fue posible con la base de datos Insertion Sequence (IS) Finder . Este análisis concluyó con la localización de los genes de la vía superior de degradación del naftaleno, [ 70 ] justo al lado de los genes que codifican el ARNt-Gly y la integrasa , así como la identificación de los genes que codifican las enzimas involucradas en la degradación del salicilato , benzoato , 4-hidroxibenzoato , ácido fenilacético , ácido hidroxifenilacético y el reconocimiento de un operón involucrado en el transporte de glucosa en la cepa.
El análisis de ontología genética es de gran importancia en la anotación funcional, y específicamente en biorremediación se puede aplicar para conocer las relaciones entre los genes de algunos microorganismos con sus funciones y su papel en la remediación de ciertos contaminantes. Este fue el enfoque de la investigación e identificación de la cepa Halomonas zincidurans B6(T), una bacteria con treinta y un genes que codifican resistencia a metales pesados , especialmente zinc [ 71 ] y Stenotrophomonas sp. DDT-1, una cepa capaz de usar DDT como su única fuente de carbono y energía, [ 72 ] por mencionar algunos ejemplos.
Software
Los genes en un genoma eucariota pueden anotarse utilizando diversas herramientas de anotación [ 73 ] como FINDER. [ 74 ] Un flujo de trabajo de anotación moderno puede admitir una interfaz web fácil de usar y la contenerización de software como MOSGA. [ 75 ] [ 76 ] Los flujos de trabajo de anotación modernos para genomas procariotas son Bakta, [ 77 ] Prokka [ 51 ] y PGAP. [ 78 ]
El Centro Nacional de Ontología Biomédica desarrolla herramientas para la anotación automatizada [ 79 ] de registros de bases de datos basándose en las descripciones textuales de esos registros.
Como método general, dcGO [ 80 ] tiene un procedimiento automatizado para inferir estadísticamente asociaciones entre términos de ontología y dominios de proteínas o combinaciones de dominios a partir de las anotaciones existentes a nivel de gen/proteína.
Se han desarrollado diversas herramientas de software que permiten a los científicos visualizar y compartir anotaciones genómicas, como por ejemplo MAKER .
La anotación genómica es un área de investigación activa en la que participan diversas organizaciones de la comunidad de ciencias biológicas, las cuales publican los resultados de sus trabajos en bases de datos biológicas públicas accesibles a través de la web y otros medios electrónicos. A continuación, se presenta una lista alfabética de proyectos en curso relacionados con la anotación genómica:
Referencias
- ↑ Zheng S, Poczai P, Hyvönen J, Tang J, Amiryousefi A (2020). "Chloroplot: Un programa en línea para la representación gráfica versátil de genomas de orgánulos" . Frontiers in Genetics . 11 576124. doi : 10.3389/fgene.2020.576124 . PMC 7545089. PMID 33101394 .
- 1 2 3 4 5 6 Domínguez Del Angel V, Hjerde E, Sterck L, Capella-Gutiérrez S, Notredame C, Vinnere Pettersson O, et al. (5 de febrero de 2018). "Diez pasos para iniciarse en el ensamblaje y la anotación del genoma" . F1000Investigación . 7 (148): 148. doi : 10.12688/f1000research.13598.1 . PMC 5850084 . PMID 29568489 .
- 1 2 3 4 5 Stein L (julio de 2001). "Anotación del genoma: de la secuencia a la biología". Nature Reviews. Genetics . 2 (7): 493– 503. doi : 10.1038/35080529 . PMID 11433356 . S2CID 12044602 .
- ↑ Davis CP (29 de marzo de 2021). "Definición médica de anotación del genoma" . MedicineNet . Archivado del original el 9 de febrero de 2023. Recuperado el 17 de abril de 2023 .
- ↑ Koonin E, Galperin MY (2003). "Anotación y análisis del genoma". Secuencia — Evolución — Función (1.ª ed.). Springer US. pp. 193–226 . doi : 10.1007/978-1-4757-3783-7_6 . ISBN 978-1-4757-3783-7.
- 1 2 Mishra P, Maurya R, Avashthi H, Mittal S, Chandra M, Ramteke PW (2021). "Ensamblaje y anotación del genoma". En Singh DB, Pathak RK (eds.). Bioinformática: Métodos y aplicaciones (1.ª ed.). Elsevier Science. pp. 49–66 . doi : 10.1016/B978-0-323-89775-4.00013-4 . ISBN 978-0-323-89775-4.
- 1 2 Bright LA, Burgess SC, Chowdhary B, Swiderski CE, McCarthy FM (octubre de 2009). "Anotación estructural y funcional de un oligoarreglo de genoma completo equino" . BMC Bioinformatics . 10 (Supl. 11): S8. doi : 10.1186/1471-2105-10-S11-S8 . PMC 3226197. PMID 19811692 .
- ↑ Reed JL, Famili I, Thiele I, Palsson BO (febrero de 2006). "Hacia la anotación genómica multidimensional". Nature Reviews. Genetics . 7 (2): 130– 141. doi : 10.1038/nrg1769 . PMID 16418748 . S2CID 13107786 .
- 1 2 3 4 Abril JF, Castellano S (2019). "Anotación del genoma". En Ranganathan S, Nakai K, Schonbach C, Gribskov M (eds.). Enciclopedia de bioinformática y biología computacional (1.ª ed.). Elsevier Science. pp. 195–209 . doi : 10.1016/B978-0-12-809633-8.20226-4 . ISBN 978-0-12-811432-2. S2CID 226248103 .
- 1 2 3 4 Tatusova T, DiCuccio M, Badretdin A, Chetvernin V, Nawrocki EP, Zaslavsky L, et al. (agosto de 2016). "NCBI prokaryotic genome annotation pipeline" . Nucleic Acids Research . 44 (14): 6614– 6624. doi : 10.1093 / nar/gkw569 . PMC 5001611. PMID 27342282 .
- ↑ Staden R (noviembre de 1977). " Manejo de datos de secuencias por computadora" . Nucleic Acids Research . 4 (11): 4037– 4051. doi : 10.1093/nar/4.11.4037 . PMC 343220. PMID 593900 .
- ↑ Staden R, McLachlan AD (enero de 1982). "Preferencia de codones y su uso en la identificación de regiones codificantes de proteínas en secuencias largas de ADN" . Nucleic Acids Research . 10 (1): 141– 156. doi : 10.1093/nar/10.1.141 . PMC 326122. PMID 7063399 .
- 1 2 Gribskov M, Devereux J, Burgess RR (enero de 1984). "El gráfico de preferencia de codones: análisis gráfico de secuencias codificantes de proteínas y predicción de la expresión génica" . Nucleic Acids Research . 12 (1 Pt 2): 539– 549. doi : 10.1093 / nar/12.1part2.539 . PMC 321069. PMID 6694906 .
- ↑ Fickett JW (agosto de 1996). "Detección de genes mediante ordenador: estado del arte". Trends in Genetics . 12 (8): 316– 320. doi : 10.1016/0168-9525(96)10038-X . PMID 8783942 .
- ↑ Grosjean H, Fiers W (junio de 1982). "Uso preferencial de codones en genes procariotas: la energía óptima de interacción codón-anticodón y el uso selectivo de codones en genes expresados eficientemente". Gene . 18 (3): 199–209 . doi : 10.1016/0378-1119(82)90157-3 . PMID 6751939 .
- ↑ Grantham R, Gautier C, Gouy M, Mercier R, Pavé A (enero de 1980). "Uso del catálogo de codones y la hipótesis del genoma" . Nucleic Acids Research . 8 (1): r49– r62. doi : 10.1093/nar/8.1.197-c . PMC 327256. PMID 6986610 .
- ↑ Lukashin AV, Borodovsky M (febrero de 1998). "GeneMark.hmm: nuevas soluciones para la búsqueda de genes" . Nucleic Acids Research . 26 (4): 1107– 1115. doi : 10.1093/nar/26.4.1107 . PMC 147337. PMID 9461475 .
- ↑ Salzberg SL, Delcher AL, Kasif S, White O (enero de 1998). "Identificación de genes microbianos mediante modelos de Markov interpolados" . Nucleic Acids Research . 26 (2): 544– 548. doi : 10.1093/nar/26.2.544 . PMC 147303. PMID 9421513 .
- 1 2 3 4 5 6 7 8 Soh J, Gordon PM, Sensen CW (4 de septiembre de 2012). Anotación del genoma . Nueva York: Chapman and Hall/CRC. doi : 10.1201/b12682 . ISBN 978-0-429-06401-2Archivado del original el 18 de abril de 2023. Consultado el 18 de abril de 2023 .
- 1 2 Brent MR (diciembre de 2005). "Anotación del genoma: pasado, presente y futuro: cómo definir un ORF en cada locus" . Genome Research . 15 (12): 1777– 1786. doi : 10.1101/gr.3866105 . PMID 16339376 .
- ↑ Consorcio del Proyecto ENCODE (abril de 2011). Becker PB (ed.). "Guía del usuario de la enciclopedia de elementos del ADN (ENCODE)" . PLOS Biology . 9 (4) e1001046. doi : 10.1371/journal.pbio.1001046 . PMC 3079585. PMID 21526222 .

- ↑ Abecasis GR, Auton A, Brooks LD, DePristo MA, Durbin RM, Handsaker RE, et al. (noviembre de 2012). " Un mapa integrado de variación genética de 1092 genomas humanos" . Nature . 491 (7422): 56– 65. Bibcode : 2012Natur.491...56T . doi : 10.1038/nature11632 . PMC 3498066. PMID 23128226 .
- 1 2 Kahl G (2015). Diccionario de genómica, transcriptómica y proteómica (Quinta ed.). Weinheim: Wiley. doi : 10.1002/9783527678679 . ISBN 978-3-527-67867-9Archivado del original el 4 de agosto de 2022. Consultado el 24 de abril de 2023 .
- 1 2 3 4 5 Yandell M, Ence D (abril de 2012). "Una guía para principiantes sobre la anotación del genoma eucariota". Nature Reviews. Genetics . 13 (5): 329– 342. doi : 10.1038/nrg3174 . PMID 22510764 . S2CID 3352427 .
- ↑ Treangen TJ, Abraham AL, Touchon M, Rocha EP (mayo de 2009). "Génesis, efectos y destinos de las repeticiones en genomas procariotas" . FEMS Microbiology Reviews . 33 (3): 539– 571. doi : 10.1111/j.1574-6976.2009.00169.x . PMID 19396957 .
- ↑ Liehr T (febrero de 2021). " Elementos repetitivos en humanos" . Revista Internacional de Ciencias Moleculares . 22 (4): 2072. doi : 10.3390/ijms22042072 . PMC 7922087. PMID 33669810 .
- ↑ Bergman CM, Quesneville H (noviembre de 2007). "Descubrimiento y detección de elementos transponibles en secuencias genómicas" . Briefings in Bioinformatics . 8 (6): 382– 392. doi : 10.1093/bib/bbm048 . PMID 17932080 .
- 1 2 3 Alexander RP, Fang G, Rozowsky J, Snyder M, Gerstein MB (agosto de 2010). "Anotación de regiones no codificantes del genoma". Nature Reviews. Genetics . 11 (8): 559– 571. doi : 10.1038/nrg2814 . PMID 20628352. S2CID 6617359 .
- ↑ Edgar RC (octubre de 2010). "Búsqueda y agrupamiento órdenes de magnitud más rápidos que BLAST" . Bioinformatics . 26 (19): 2460– 2461. doi : 10.1093/bioinformatics/btq461 . PMID 20709691 .
- ↑ Edgar R. "Enmascaramiento de secuencias" . drive5.com . Archivado del original el 3 de febrero de 2020. Consultado el 25 de abril de 2023 .
- 1 2 3 4 5 Ejigu GF, Jung J (septiembre de 2020). "Revisión sobre la anotación genómica computacional de secuencias obtenidas mediante secuenciación de próxima generación" . Biology . 9 ( 9): 295. doi : 10.3390/biology9090295 . PMC 7565776. PMID 32962098 .
- ↑ Garber M, Grabherr MG, Guttman M, Trapnell C (junio de 2011). "Métodos computacionales para la anotación y cuantificación del transcriptoma mediante RNA-seq". Nature Methods . 8 (6): 469– 477. doi : 10.1038/nmeth.1613 . PMID 21623353. S2CID 205419756 .
- ↑ Gupta N, Tanner S, Jaitly N, Adkins JN, Lipton M, Edwards R, et al. (septiembre de 2007). " Análisis del proteoma completo de las modificaciones postraduccionales: aplicaciones de la espectrometría de masas para la anotación proteogenómica" . Genome Research . 17 (9): 1362– 1377. doi : 10.1101/gr.6427907 . PMC 1950905. PMID 17690205 .
- ↑ De Bona F, Ossowski S, Schneeberger K, Rätsch G (agosto de 2008). "Alineaciones óptimas de secuencias cortas empalmadas" . Bioinformatics . 24 (16): i174– i180. doi : 10.1093/bioinformatics/btn300 . PMID 18689821 .
- ↑ Trapnell C, Pachter L, Salzberg SL (mayo de 2009). "TopHat: descubrimiento de uniones de empalme con RNA-Seq" . Bioinformatics . 25 ( 9): 1105–1111 . doi : 10.1093/bioinformatics/btp120 . PMC 2672628. PMID 19289445 .
- ↑ Križanovic K, Echchiki A, Roux J, Šikic M (marzo de 2018). "Evaluación de herramientas para alineación de ARN-seq de lectura larga con detección de empalmes" . Bioinformatics . 34 ( 5): 748– 754. doi : 10.1093/bioinformatics/btx668 . PMC 6192213. PMID 29069314 .
- ↑ McHardy AC, Kloetgen A (2017). "Finding Genes in Genome Sequence". En Keith JM (ed.). Bioinformática . Métodos en biología molecular. Vol. 1525 (Segunda ed.). Nueva York: Springer. pp. 271–291 . doi : 10.1007/978-1-4939-6622-6_11 . ISBN 978-1-4939-6622-6. PMID 27896725 .
- ↑ Brent MR, Guigó R (junio de 2004). "Avances recientes en la predicción de la estructura genética". Current Opinion in Structural Biology . 14 (3): 264– 272. doi : 10.1016/j.sbi.2004.05.007 . PMID 15193305 .
- ↑ Binns D, Dimmer E, Huntley R, Barrell D, O'Donovan C, Apweiler R (noviembre de 2009). "QuickGO: una herramienta web para la búsqueda en Gene Ontology" . Bioinformatics . 25 ( 22): 3045–3046 . doi : 10.1093/bioinformatics/btp536 . PMC 2773257. PMID 19744993 .
- 1 2 3 Vu TT, Jung J (2021). "Predicción de la función de las proteínas con ontología genética: de los modelos tradicionales a los de aprendizaje profundo" . PeerJ . 9 e12019 . doi : 10.7717/peerj.12019 . PMC 8395570. PMID 34513334 .
- 1 2 Saxena R, Bishnoi R, Singla D (2021). "Ontología genética: aplicación e importancia en la anotación funcional de los datos genómicos". En Singh B, Pathak RK (eds.). Bioinformática: métodos y aplicaciones . Londres: Academic Press. pp. 145–157 . doi : 10.1016/B978-0-323-89775-4.00015-8 . ISBN 978-0-323-89775-4.
- 1 2 Zhao Y, Wang J, Chen J, Zhang X, Guo M, Yu G (2020). "Una revisión de la literatura sobre la predicción de la función genética mediante el modelado de la ontología genética" . Frontiers in Genetics . 11 : 400. doi : 10.3389/fgene.2020.00400 . PMC 7193026. PMID 32391061 .
- ↑ Sasson O, Kaplan N, Linial M (junio de 2006). " Predicción de anotaciones funcionales: todos para uno y uno para todos" . Protein Science . 15 (6): 1557–1562 . doi : 10.1110/ps.062185706 . PMC 2242553. PMID 16672244 .
- ↑ Sinha S, Lynn AM, Desai DK (octubre de 2020). "Implementación de métodos computacionales basados en homología y no basados en homología para la identificación y anotación de enzimas huérfanas: uso de Mycobacterium tuberculosis H37Rv como estudio de caso" . BMC Bioinformatics . 21 (1): 466. doi : 10.1186/s12859-020-03794-x . PMC 574302. PMID 33076816 .
- ↑ Letovsky S, Kasif S (2003). "Predicción de la función de las proteínas a partir de datos de interacción proteína/proteína: un enfoque probabilístico" . Bioinformatics . 19 (Supl. 1): i197– i204. doi : 10.1093/bioinformatics/btg1026 . PMID 12855458 .
- ↑ Dainat J, Pontarotti P (2021). "Métodos para identificar y estudiar la evolución de los pseudogenes mediante un enfoque filogenético" (PDF) . En Poliseno L (ed.). Pseudogenes . Métodos en biología molecular. Vol. 2324 (Segunda ed.). Nueva York: Springer. pp. 21–34 . doi : 10.1007/978-1-0716-1503-4_2 . ISBN 978-1-0716-1503-4. PMID 34165706 . S2CID 235625288 .
- ↑ Numanagic I, Gökkaya AS, Zhang L, Berger B, Alkan C, Hach F (septiembre de 2018). "Caracterización rápida de duplicaciones segmentales en ensamblajes de genomas" . Bioinformatics . 34 ( 17): i706– i714. doi : 10.1093/bioinformatics/bty586 . PMC 6129265. PMID 30423092 .
- ↑ Hartasánchez DA, Brasó-Vives M, Heredia-Genestar JM, Pybus M, Navarro A (noviembre de 2018). "Efecto de las duplicaciones colapsadas en las estimaciones de diversidad: qué esperar" . Genome Biology and Evolution . 10 (11): 2899– 2905. doi : 10.1093/gbe/ evy223 . PMC 6239678. PMID 30364947 .
- ↑ Si J, Zhao R, Wu R (marzo de 2015). "Una visión general de la predicción de sitios de unión de proteínas al ADN" . International Journal of Molecular Sciences . 16 (3): 5194– 5215. doi : 10.3390/ijms16035194 . PMC 4394471. PMID 25756377 .
- ↑ Griffiths-Jones S (2007). "Anotación de genes de ARN no codificante". Annual Review of Genomics and Human Genetics . 8 : 279–298 . doi : 10.1146/annurev.genom.8.080706.092419 . PMID 17506659 .
- 1 2 Seemann T (julio de 2014). "Prokka: anotación rápida del genoma procariota" . Bioinformatics . 30 (14): 2068–2069 . doi : 10.1093/bioinformatics/btu153 . PMID 24642063 .
- ↑ Valeev T, Yevshin I, Kolpakov F (2013). "BioUML Genome Browser" . Virtual Biology . 1 (1): 15. doi : 10.12704/vb/e8 .
- ↑ Szot PS, Yang A, Wang X, Parsania C, Röhm U, Wong KH, Ho JW (mayo de 2017). "PBrowse: una plataforma web para la exploración colaborativa en tiempo real de datos genómicos" . Nucleic Acids Research . 45 (9): e67. doi : 10.1093 / nar/gkw1358 . PMC 5605237. PMID 28100700 .
- ↑ Wang J, Kong L, Gao G, Luo J (marzo de 2013). "Una breve introducción a los navegadores de genomas basados en la web" . Briefings in Bioinformatics . 14 (2): 131– 143. doi : 10.1093/bib/bbs029 . PMID 22764121 .
- ↑ Jung J, Kim JI, Yi G (diciembre de 2019). "geneCo: un método genómico comparativo visualizado para analizar múltiples estructuras genómicas" . Bioinformatics . 35 ( 24): 5303– 5305. doi : 10.1093/bioinformatics/btz596 . PMC 6954651. PMID 31350879 .
- 1 2 Ouzounis CA, Karp PD (2002). "El pasado, presente y futuro de la reanotación del genoma" . Genome Biology . 3 (2) COMENTARIO2001. doi : 10.1186/gb-2002-3-2-comment2001 . PMC 139008. PMID 11864365 .
- ↑ "Anotación manual - Instituto Wellcome Sanger" . www.sanger.ac.uk . Archivado del original el 2 de febrero de 2023. Consultado el 28 de marzo de 2023 .
- ↑ Siezen RJ, van Hijum SA (julio de 2010). "Genome (re-)annotation and open-source annotation pipelines" . Microbial Biotechnology . 3 (4): 362– 369. doi : 10.1111/j.1751-7915.2010.00191.x . PMC 3815804. PMID 21255336 .
- ↑ Loveland JE, Gilbert JG, Griffiths E, Harrow JL (2012). "Anotación de genes comunitarios en la práctica" . Base de datos . 2012 (2012) bas009. doi : 10.1093/database/bas009 . PMC 3308165. PMID 22434843 .
- ↑ Hartl DL (abril de 2000). "La mosca se encuentra con la escopeta: la escopeta gana". Nature Genetics . 24 (4): 327– 328. doi : 10.1038/74125 . PMID 10742085. S2CID 5354139 .
- ↑ Mazumder R, Natale DA , Julio JA, Yeh LS, Wu CH (febrero de 2010). "Anotación de comunidades en biología" . Biology Direct . 5 (1): 12. doi : 10.1186/1745-6150-5-12 . PMC 2834641. PMID 20167071 .
- ↑ Huss JW, Orozco C, Goodale J, Wu C, Batalov S, Vickers TJ, et al. (julio de 2008). " Una wiki de genes para la anotación comunitaria de la función genética" . PLOS Biology . 6 (7) e175. doi : 10.1371/journal.pbio.0060175 . PMC 2443188. PMID 18613750 .
- ^ Daub J, Gardner PP, Tate J, Ramsköld D, Manske M, Scott WG y col. (Diciembre de 2008). "El RNA WikiProject: anotación comunitaria de familias de RNA" . ARN . 14 (12): 2462–2464 . doi : 10.1261/rna.1200508 . PMC 2590952 . PMID 18945806 .
- ↑ Cooper L, Jaiswal P (2016). "La ontología vegetal: una herramienta para la genómica vegetal". En Edwards D (ed.). Bioinformática vegetal . Métodos en biología molecular. Vol. 1374 (2.ª ed.). Totowa, NJ: Humana Press. pp. 89–114 . doi : 10.1007/978-1-4939-3167-5_5 . ISBN 978-1-4939-3167-5. PMID 26519402 .
- ↑ Torto-Alalibo T, Collmer CW, Gwinn-Giglio M (febrero de 2009). "El consorcio de ontología genética de microbios asociados a plantas (PAMGO): desarrollo comunitario de nuevos términos de ontología genética que describen procesos biológicos involucrados en las interacciones microbio-huésped" . BMC Microbiology . 9 (Supl. 1): S1. doi : 10.1186/1471-2180-9-S1-S1 . PMC 2654661. PMID 19278549 .
- ↑ Piñero J, Ramírez-Anguita JM, Saüch-Pitarch J, Ronzano F, Centeno E, Sanz F, Furlong LI (enero 2020). "La plataforma de conocimiento DisGeNET para la genómica de enfermedades: actualización de 2019" . Investigación de ácidos nucleicos . 48 (D1): D845– D855. doi : 10.1093/nar/gkz1021 . PMC 7145631 . PMID 31680165 .
- ↑ Hayman GT, Laulederkind SJ, Smith JR, Wang SJ, Petri V, Nigam R, et al. (2016). " The Disease Portals, disease-gene annotation and the RGD disease ontology at the Rat Genome Database" . Database . 2016 baw034. doi : 10.1093/database/baw034 . PMC 4805243. PMID 27009807 .
- ↑ Top EM, Springael D, Boon N (noviembre de 2002). "Elementos genéticos móviles catabólicos y su uso potencial en la bioaumentación de suelos y aguas contaminados" . FEMS Microbiology Ecology . 42 (2): 199– 208. doi : 10.1111/j.1574-6941.2002.tb01009.x . hdl : 1854/LU-348539 . PMID 19709279. S2CID 15173391 .
- ↑ Phale PS, Paliwal V, Raju SC, Modak A, Purohit HJ (enero de 2013). "Secuencia del genoma de la bacteria del suelo degradadora de naftaleno Pseudomonas putida CSV86" . Anuncios del genoma . 1 (1): 234– 235. doi : 10.1128/genomeA.00234-12 . PMC 3587945. PMID 23469351 .
- ↑ Trivedi VD, Jangir PK, Sharma R, Phale PS (diciembre de 2016). "Perspectivas sobre el análisis funcional y evolutivo de la vía metabólica del carbaryl de la cepa C5pp de Pseudomonas sp." Scientific Reports . 6 ( 1) 38430. Bibcode : 2016NatSR...638430T . doi : 10.1038/srep38430 . PMC 5141477. PMID 27924916 .
- ↑ Huo YY, Li ZY, Cheng H, Wang CS, Xu XW (2014). "Secuencia genómica preliminar de alta calidad de la bacteria resistente a metales pesados Halomonas zincidurans cepa tipo B6(T)" . Standards in Genomic Sciences . 9 (30): 30. doi : 10.1186/1944-3277-9-30 . PMC 4286145. PMID 25945155 .
- ↑ Pan X, Lin D, Zheng Y, Zhang Q, Yin Y, Cai L, et al. (febrero de 2016). " Biodegradación de DDT por Stenotrophomonas sp. DDT-1: Caracterización y análisis funcional del genoma" . Scientific Reports . 6 (1) 21332. Bibcode : 2016NatSR...621332P . doi : 10.1038/srep21332 . PMC 4758049. PMID 26888254 .
- ↑ GAAS , NBIS -- Infraestructura Nacional de Bioinformática de Suecia, 13 de abril de 2022 , consultado el 25 de abril de 2022
- ↑ Banerjee S, Bhandary P, Woodhouse M, Sen TZ, Wise RP, Andorf CM (abril de 2021). "FINDER: un paquete de software automatizado para anotar genes eucariotas a partir de datos de RNA-Seq y secuencias de proteínas asociadas" . BMC Bioinformatics . 22 (1): 205. doi : 10.1186/s12859-021-04120-9 . PMC 8056616. PMID 33879057 .
- ^ Martin R, Hackl T, Hattab G, Fischer MG, Heider D (abril de 2021). Birol I (ed.). "MOSGA: Anotador del genoma modular de código abierto". Bioinformática . 36 ( 22– 23): 5514– 5515. arXiv : 2009.03758 . doi : 10.1093/bioinformática/btaa1003 . hdl : 21.11116/0000-0006-FED4-D . PMID 33258916 .
- ↑ Martin R. "MOSGA" . mosga.mathematik.uni-marburg.de . Consultado el 25 de abril de 2022 .
- ↑ Schwengers O, Jelonek L, Dieckmann MA, Beyvers S, Blom J, Goesmann A (noviembre de 2021). "Bakta: anotación rápida y estandarizada de genomas bacterianos mediante identificación de secuencias sin alineación" . Microbial Genomics . 7 (11). doi : 10.1099/mgen.0.000685 . PMC 8743544. PMID 34739369 .
- ↑ Li W, O'Neill KR, Haft DH, DiCuccio M, Chetvernin V, Badretdin A, et al. (enero de 2021). "RefSeq: ampliando el alcance del Pipeline de Anotación del Genoma Procariota con la curación de modelos de familias de proteínas" . Nucleic Acids Research . 49 (D1): D1020– D1028. doi : 10.1093/nar/gkaa1105 . PMC 7779008. PMID 33270901 .
- ↑ "Anotador NCBO" . ncbo.bioontology.org . Consultado el 8 de febrero de 2023 .
- ↑ Fang H, Gough J (enero de 2013). "DcGO: base de datos de ontologías centradas en dominios sobre funciones, fenotipos, enfermedades y más" . Nucleic Acids Research . 41 (número especial sobre bases de datos): D536– D544. doi : 10.1093 / nar/gks1080 . PMC 3531119. PMID 23161684 .
- ADN