WormBase es una base de datos biológica en línea sobre la biología y el genoma del nematodo modelo Caenorhabditis elegans y contiene información sobre otros nematodos relacionados. [ 1 ] [ 2 ] La comunidad de investigación de C. elegans utiliza WormBase como recurso de información y como plataforma para publicar y distribuir sus resultados. La base de datos se actualiza periódicamente, con nuevas versiones que se publican cada dos meses. WormBase es una de las organizaciones que participan en el proyecto Base de Datos Genérica de Organismos Modelo (GMOD). También forma parte de la Alianza de Recursos Genómicos. [ 3 ]
Contenido
WormBase comprende los siguientes conjuntos de datos principales:
- Los genomas anotados de Caenorhabditis elegans , Caenorhabditis briggsae , Caenorhabditis remanei , Caenorhabditis brenneri , Caenorhabditis angaria , Pristionchus pacificus , Haemonchus contortus , Meloidogyne hapla , Meloidogyne incognita , Brugia malayi y Onchocerca. vólvulo ;
- Anotaciones seleccionadas manualmente que describen la función de aproximadamente 20.500 genes codificadores de proteínas de C. elegans y aproximadamente 16.000 genes no codificantes de C. elegans ;
- Familias de genes;
- Ortologías;
- Sitios de unión de factores de transcripción genómicos
- Información exhaustiva sobre los alelos mutantes y sus fenotipos;
- Análisis de ARN de interferencia ( ARNi ) de genoma completo ;
- Mapas genéticos, marcadores y polimorfismos;
- Mapa físico de C. elegans ;
- Perfiles de expresión génica (etapa, tejido y célula) a partir de microarrays, análisis SAGE y fusiones del promotor GFP;
- El linaje celular completo del gusano;
- Diagrama de cableado del sistema nervioso del gusano;
- Interacción proteína-proteína . Datos del interactoma ;
- Relaciones de regulación genética;
- Detalles de las homologías de secuencias intra e interespecíficas (con enlaces a otras bases de datos de organismos modelo ).
Además, WormBase contiene una bibliografía actualizada y consultable sobre la investigación de C. elegans y está vinculada al proyecto WormBook .
Herramientas
WormBase ofrece muchas maneras de buscar y recuperar datos de la base de datos:
- WormMart , Wiki - era [ 4 ] una herramienta para recuperar información variada sobre muchos genes (o las secuencias de esos genes). Esta era la implementación de BioMart en WormBase . [ 5 ]
- WormMine , Wiki - a partir de 2016, [ 4 ] la principal herramienta de minería de datos. Esta es la implementación de WormBase de InterMine . [ 6 ]
- Navegador del genoma : explore los genes de C. elegans (y otras especies) en su contexto genómico.
- Textpresso es una herramienta de búsqueda que consulta la literatura publicada sobre C. elegans (incluidos los resúmenes de congresos) y un subconjunto de la literatura sobre nematodos.
Curación de secuencias
La curación de secuencias en WormBase se refiere al mantenimiento y la anotación de la secuencia genómica primaria y un conjunto de genes consensuados.
Secuencia del genoma
Aunque la secuencia del genoma de C. elegans es la secuencia genómica eucariota más precisa y completa, ha requerido refinamiento continuo a medida que se ha generado nueva evidencia. Muchos de estos cambios fueron inserciones o deleciones de un solo nucleótido; sin embargo, se han descubierto varios errores de ensamblaje importantes. Por ejemplo, en 2005 fue necesario invertir un cósmido de 39 kb. Otras mejoras provienen de la comparación de secuencias de ADN genómico con secuencias de ADNc y del análisis de datos de alto rendimiento de RNA-Seq. Cuando se identifican diferencias entre la secuencia genómica y los transcritos, el reanálisis de los datos genómicos originales suele conducir a modificaciones de la secuencia genómica. Los cambios en la secuencia genómica plantean dificultades al comparar las coordenadas cromosómicas de los datos derivados de diferentes versiones de WormBase. Existe un programa de remapeo de coordenadas y datos de mapeo disponibles para facilitar estas comparaciones. [ 7 ]
Modelos de estructura genética
Todos los conjuntos de genes de las especies de WormBase se generaron inicialmente mediante programas de predicción genética. Estos programas proporcionan un conjunto razonable de estructuras genéticas, pero los mejores solo predicen correctamente alrededor del 80 % de las estructuras genéticas completas. Tienen dificultades para predecir genes con estructuras inusuales, así como aquellos con una señal de inicio de traducción débil, sitios de empalme débiles o genes de un solo exón. Pueden predecir incorrectamente un modelo de gen codificante cuando el gen es un pseudogén y predicen las isoformas de un gen de forma deficiente, o incluso no las predicen en absoluto.
Los modelos genéticos de los genes de C. elegans , C. briggsae , C. remanei y C. brenneri se curan manualmente. La mayoría de los cambios en la estructura genética se han basado en datos de transcripción de proyectos a gran escala como las bibliotecas EST de Yuji Kohara, el proyecto Orfeome de Mark Vidal (worfdb.dfci.Harvard.edu/), los datos Illumina de Waterston y Hillier y los datos 454 de Makedonka Mitreva. Sin embargo, otros tipos de datos (por ejemplo, alineamientos de proteínas, programas de predicción ab initio , sitios líderes de trans-splice, señales de poli-A y sitios de adición, etiquetas de transcripción SAGE y TEC-RED , péptidos espectroscópicos de masas y dominios proteicos conservados) son útiles para refinar las estructuras, especialmente cuando la expresión es baja y, por lo tanto, no hay suficientes transcripciones disponibles. Cuando los genes se conservan entre las especies de nematodos disponibles, el análisis comparativo también puede ser muy informativo.
WormBase anima a los investigadores a que les informen a través del servicio de asistencia si tienen evidencia de una estructura genética incorrecta. Cualquier evidencia de secuencia de ADNc o ARNm que confirme el cambio debe enviarse a EMBL/GenBank/DDBJ; esto ayuda a confirmar y validar el modelo genético, ya que WormBase recupera rutinariamente datos de secuencias de estas bases de datos públicas. Además, esto hace públicos los datos, permitiendo la referencia y el reconocimiento adecuados a los investigadores.
Cuando se realiza algún cambio en un CDS (o pseudogén), el modelo genético anterior se conserva como un objeto de historial. Este tendrá un sufijo como: "AC3.5:wp119", donde "AC3.5" es el nombre del CDS y "119" se refiere a la versión de la base de datos en la que se realizó el cambio. El motivo del cambio y la evidencia que lo justifica se añaden a la anotación del CDS; estos datos se pueden consultar en la sección "Visible/Remark" de la sección "Tree Display" del CDS en el sitio web de WormBase.
nomenclatura genética
Genes
En WormBase, un gen es una región que se expresa o que se ha expresado y ahora es un pseudogén. Los genes tienen identificadores únicos como 'WBGene00006415'. Todos los genes de C. elegans en WormBase también tienen un nombre de secuencia, que se deriva del cósmido, fosmido o clon YAC en el que residen; por ejemplo, F38H4.7 , que indica que está en el cósmido 'F38H4', y que hay al menos otros 6 genes en ese cósmido. Si un gen produce una proteína que puede clasificarse como miembro de una familia, también se le puede asignar un nombre CGC como tag-30, que indica que es el miembro número 30 de la familia de genes tag . La asignación de nombres de familias de genes está controlada por WormBase. [ 8 ] Antes de la publicación, se deben solicitar nombres en WormBase. [ 9 ]
Hay algunas excepciones a este formato, como los genes cln-3.1 , cln-3.2 y cln-3.3 , que son todos igualmente similares al gen humano CLN3 . Los nombres GCG de genes para especies que no son elegans en WormBase tienen el código de especie de 3 letras antepuesto, como Cre-acl-5 , Cbr-acl-5 , Cbn-acl-5 .
Un gen puede ser un pseudogén o puede expresar uno o más genes de ARN no codificante (ARNnc) o secuencias codificantes de proteínas (CDS).
Pseudogenes
Los pseudogenes son genes que no producen una transcripción funcional y coherente. Pueden ser pseudogenes de genes codificantes o de ARN no codificante, estar compuestos por fragmentos o la totalidad de un gen y expresar o no una transcripción. El límite entre lo que se considera una transcripción codificante coherente es a veces subjetivo, ya que, en ausencia de otras pruebas, el uso de sitios de empalme débiles o exones cortos suele generar un modelo putativo, aunque insatisfactorio, de una región codificante. Los pseudogenes y los genes con una estructura problemática se revisan constantemente en WormBase y se utilizan nuevas pruebas para intentar determinar su estatus.
Sistemas de apoyo a la decisión clínica (CDS)
Las secuencias codificantes (CDS) son la única parte de la estructura de un gen que se revisa manualmente en WormBase. La estructura del gen y sus transcripciones se derivan de la estructura de sus CDS.
Las secuencias codificantes (CDS) tienen un nombre de secuencia derivado del mismo nombre de secuencia que su objeto genético principal; por lo tanto, el gen 'F38H4.7' tiene una CDS llamada 'F38H4.7'. La CDS especifica los exones codificantes del gen desde el codón de inicio (metionina) hasta el codón de parada (inclusive).
Cualquier gen puede codificar múltiples proteínas como resultado del empalme alternativo. Estas isoformas tienen un nombre que se forma a partir del nombre de la secuencia del gen con una letra única añadida. En el caso del gen bli-4, existen 6 isoformas CDS conocidas, denominadas K04F10.4a, K04F10.4b, K04F10.4c, K04F10.4d, K04F10.4e y K04F10.4f.
Es común referirse a las isoformas en la literatura científica utilizando el nombre de la familia de genes CGC con una letra añadida, por ejemplo, pha-4a ; sin embargo, esto no tiene significado en la base de datos WormBase y las búsquedas de pha-4a en WormBase no arrojarán ningún resultado. El nombre correcto de esta isoforma es el nombre del CDS/transcrito: F38A6.1a , o mejor aún, el nombre de la proteína: WP:CE15998 .
transcripciones genéticas
En WormBase, las transcripciones de un gen se generan automáticamente mediante el mapeo de cualquier alineación de ADNc o ARNm disponible sobre el modelo CDS. Por lo tanto, estas transcripciones genéticas suelen incluir los exones UTR que rodean el CDS. Si no hay transcripciones de ADNc o ARNm disponibles, las transcripciones genéticas tendrán exactamente la misma estructura que el CDS en el que se basan.
Las transcripciones genéticas reciben su nombre del nombre de la secuencia del CDS utilizado para crearlas, por ejemplo, F38H4.7 o K04F10.4a .
Sin embargo, si hay empalme alternativo en las UTR, que no cambiaría la secuencia de proteínas, los transcritos empalmados alternativamente se nombran con un dígito añadido, por ejemplo: K04F10.4a.1 y K04F10.4a.2 . Si no hay isoformas del gen codificante, por ejemplo AC3.5 , pero hay empalme alternativo en las UTR, habrá múltiples transcritos llamados AC3.5.1 y AC3.5.2 , etc. Si no hay transcritos UTR alternativos, el único transcrito codificante se nombra igual que el CDS y no tiene el .1 añadido, como en el caso de K04F10.4f.
operones
Los grupos de genes que se transcriben conjuntamente como operones se catalogan como objetos de operón. Estos tienen nombres como CEOP5460 y se catalogan manualmente utilizando la información de los sitios de secuencia líder trans-spliced SL2.
Genes de ARN no codificante
En WormBase existen varias clases de genes de ARN no codificante:
- Los genes de ARNt se predicen mediante el programa 'tRNAscan-SE'.
- Los genes de ARNr se predicen por homología con otras especies.
- Los genes de snRNA se importan principalmente de Rfam .
- Los genes piRNA se obtuvieron mediante un análisis del motivo característico presente en estos genes.
- Los genes de miRNA se han importado principalmente de miRBase . Tienen el transcrito primario y el transcrito maduro marcados. El transcrito primario tendrá un nombre de secuencia como W09G3.10 y el transcrito maduro tendrá una letra añadida a este nombre, como W09G3.10a (y si hay transcripciones maduras alternativas, W09G3.10b , etc.).
- Los genes snoRNA se importan principalmente de Rfam o de artículos científicos.
- Se seleccionan genes de ARN no codificante que no tienen otra función aparente, pero que claramente no codifican proteínas ni son pseudogenes. Muchos de ellos presentan homología conservada con genes de otras especies. Algunos se expresan en sentido inverso al de los genes codificadores de proteínas.
También existe un gen de ARNc.
transposones
Los transposones no se clasifican como genes y, por lo tanto, no tienen un objeto de gen padre. Su estructura se conserva como un objeto Transposon_CDS con un nombre como C29E6.6 .
Otras especies
Las especies no pertenecientes al género Elegans en WormBase poseen genomas ensamblados mediante tecnologías de secuenciación que no utilizan cósmidos ni YAC. Por lo tanto, estas especies no tienen nombres de secuencia para las regiones codificantes (CDS) ni para los transcritos genéticos basados en nombres de cósmidos. En su lugar, cuentan con identificadores alfanuméricos únicos, similares a los nombres que se muestran en la tabla a continuación.
Proteínas
Las proteínas codificadas por genes se generan mediante la traducción de las secuencias CDS. Cada secuencia proteica única recibe un nombre de identificación único, como WP:CE40440 . En la tabla que aparece a continuación, se muestran ejemplos de los nombres de identificación de proteínas para cada especie en WormBase.
Es posible que dos secuencias CDS de genes distintos, dentro de una misma especie, sean idénticas, por lo que es posible que existan proteínas idénticas codificadas por genes diferentes. Cuando esto ocurre, se utiliza un único nombre identificativo para la proteína, aunque esta sea producida por dos genes.
Parásito
WormBase ParaSite [ 10 ] es un subportal para aproximadamente 100 genomas preliminares de helmintos parásitos ( nematodos y platelmintos ) desarrollados en el Instituto Europeo de Bioinformática y el Instituto Wellcome Trust Sanger . Todos los genomas están ensamblados y anotados. También se encuentra disponible información adicional, como dominios proteicos y términos de Gene Ontology . Los árboles genéticos permiten la alineación de ortólogos entre gusanos parásitos, otros nematodos y especies de comparación no helmínticas. Se ofrece una herramienta de minería de datos BioMart para permitir el acceso a gran escala a los datos.
Gestión de WormBase
WormBase es una colaboración entre el Instituto Europeo de Bioinformática , el Instituto Wellcome Trust Sanger , el Instituto de Investigación del Cáncer de Ontario , la Universidad de Washington en St. Louis y el Instituto Tecnológico de California . Cuenta con el apoyo de la subvención P41-HG002223 de los Institutos Nacionales de Salud y la subvención G0701197 del Consejo Británico de Investigación Médica . [ 11 ] Caltech lleva a cabo la curación biológica y desarrolla las ontologías subyacentes, el EBI realiza la curación de secuencias y el cálculo, así como la construcción de bases de datos, el Sanger participa principalmente en la curación y visualización de genomas y genes de nematodos parásitos, y el OICR desarrolla el sitio web y las principales herramientas de minería de datos.
Véase también
Notas y referencias
- ↑ Harris, TW; et al. (12 de noviembre de 2009). "WormBase: un recurso integral para la investigación de nematodos" . Nucleic Acids Res . 38 (número especial de bases de datos): D463–7. doi : 10.1093/nar/gkp952 . PMC 2808986. PMID 19910365 .
- ↑ Williams, GW; Davis, PA; Rogers, AS; Bieri, T.; Ozersky, P.; Spieth, J. (2011). "Métodos y estrategias para la curación de la estructura genética en WormBase" . Base de datos . 2011 baq039. doi : 10.1093/database/baq039 . PMC 3092607. PMID 21543339 .
- ↑ "Alianza de Recursos Genómicos" . www.alliancegenome.org . Consultado el 21 de mayo de 2025 .
- 1 2 "Período de cierre de WormMart: se retirará el 1 de enero de 2016" . Blog . WormBase. 13 de noviembre de 2015.
- ↑ "WormMart" . Minería de datos . WormBase.
- ↑ "WormMine" . Minería de datos . WormBase.
- ↑ "Conversión de coordenadas entre versiones" . Consultado el 21 de septiembre de 2023 .
- ↑ "Nomenclatura de genes de WormBase" . Wormbase .
- ↑ "Formulario de envío de propuestas de nombres de genes/clases de genes" . Consultado el 21 de septiembre de 2023 .
- ↑ "WormBase ParaSite" . Consultado el 21 de septiembre de 2023 .
- ↑ "WormBaseWiki:Derechos de autor - WormBaseWiki" . www.wormbase.org . Archivado del original el 27 de septiembre de 2006.
Enlaces externos
- Base de gusanos
- WormBase Parasite
- El sitio web WormBook , el libro de texto en línea que complementa a WormBase.
- Textpresso , motor de búsqueda de literatura biológica sobre C. elegans y otros organismos.
- Wiki de WormBase
- Notas de la versión , detalles de la última versión de WormBase
- WormBase: mejor software, contenido más completo. Artículo de Nucleic Acids Research que describe WormBase (2006).
- WormBase en X
- Caenorhabditis elegans
- bases de datos genéticas
- Genética en el Reino Unido
- Organizaciones de genómica
- bases de datos de organismos modelo
- Distrito de South Cambridgeshire
- Wellcome Trust