Articulo de referencia

Banco de datos de la Red de Objetos Biomoleculares

NCB (Biomolecular Object Network Databank) es un banco de datos bioinformático que contiene información sobre estructuras e interacciones de moléculas pequeñas . Este banco de d...

NCB (Biomolecular Object Network Databank) es un banco de datos bioinformático que contiene información sobre estructuras e interacciones de moléculas pequeñas . Este banco de datos integra varias bases de datos existentes para ofrecer una visión general completa de la información disponible para una molécula determinada.

Fondo

La Iniciativa Blueprint comenzó como un programa de investigación en el laboratorio del Dr. Christopher Hogue en el Instituto de Investigación Samuel Lunenfeld del Hospital Mount Sinai en Toronto . El 14 de diciembre de 2005, Unleashed Informatics Limited adquirió los derechos comerciales de la propiedad intelectual de la Iniciativa Blueprint . Esto incluía los derechos de la base de datos de interacción de proteínas BIND, la base de datos de interacción de moléculas pequeñas SMID, así como el almacén de datos SeqHound. Unleashed Informatics es un proveedor de servicios de gestión de datos y supervisa la gestión y curación de la Iniciativa Blueprint bajo la dirección del Dr. Hogue. [ 1 ]

Construcción

BOND integra las bases de datos originales de Blueprint Initiative, así como otras bases de datos, como GenBank , junto con numerosas herramientas necesarias para analizar estos datos. También están disponibles enlaces de anotación para secuencias, incluyendo identificadores de taxones, secuencias redundantes, descripciones de Gene Ontology , identificadores de Online Mendelian Inheritance in Man , dominios conservados , referencias cruzadas entre bases de datos, identificadores de LocusLink y genomas completos. BOND facilita las consultas entre bases de datos y es un recurso de acceso abierto que integra datos de interacción y secuencia. [ 2 ]

Base de datos de interacciones de moléculas pequeñas (SMID)

La base de datos de interacciones de moléculas pequeñas ( SMID) contiene interacciones entre dominios proteicos y moléculas pequeñas. Utiliza un enfoque basado en dominios para identificar familias de dominios, presentes en la base de datos de dominios conservados (CDD), que interactúan con una molécula pequeña de consulta. La CDD del NCBI integra datos de diversas fuentes: Protein FAMilies (PFAM), Simple Modular Architecture Research Tool (SMART), Cluster of Orthologous Genes (COGs) y las secuencias curadas del propio NCBI. Los datos de SMID provienen del Protein Data Bank (PDB), una base de datos de estructuras cristalinas de proteínas conocidas. SMID permite realizar consultas introduciendo un identificador de interacción proteica (GI), un identificador de dominio, un ID de PDB o un ID de SMID. Los resultados de la búsqueda proporcionan información sobre la molécula pequeña, la proteína y el dominio para cada interacción identificada en la base de datos. Las interacciones con contactos no biológicos se filtran automáticamente.

SMID-BLAST es una herramienta desarrollada para anotar sitios de unión conocidos de moléculas pequeñas, así como para predecir sitios de unión en proteínas cuyas estructuras cristalinas aún no se han determinado. La predicción se basa en la extrapolación de interacciones conocidas, encontradas en la base de datos PDB, a interacciones entre una proteína no cristalizada y una molécula pequeña de interés. SMID-BLAST se validó con un conjunto de prueba de interacciones conocidas de moléculas pequeñas de la base de datos PDB. Se demostró que es un predictor preciso de interacciones proteína-molécula pequeña; el 60 % de las interacciones predichas coincidieron idénticamente con el sitio de unión anotado en la base de datos PDB, y de estas, el 73 % tenía más del 80 % de los residuos de unión de la proteína correctamente identificados. Hogue, C et al. estimaron que el 45 % de las predicciones que no se observaron en los datos de la base de datos PDB representan verdaderos positivos. [ 3 ]

Base de datos de la red de interacción biomolecular (BIND)

Introducción

La idea de una base de datos para documentar todas las interacciones moleculares conocidas fue propuesta originalmente por Tony Pawson en la década de 1990 y posteriormente desarrollada por científicos de la Universidad de Toronto en colaboración con el equipo de Francis Ouellette en la Universidad de Columbia Británica . El desarrollo de la Base de Datos de la Red de Interacciones Biomoleculares (BIND) ha sido financiado por subvenciones de los Institutos Canadienses de Investigación en Salud ( CIHR ), Genome Canada, [ 4 ] la Fundación Canadiense para la Innovación y el Fondo de Investigación y Desarrollo de Ontario. BIND fue diseñada originalmente para ser un repositorio en constante crecimiento de información sobre interacciones biomoleculares, complejos moleculares y vías metabólicas. Dado que la proteómica es un campo que avanza rápidamente, es necesario que los investigadores tengan acceso inmediato a la información de las revistas científicas. BIND facilita la comprensión de las interacciones moleculares y las vías metabólicas involucradas en los procesos celulares y, con el tiempo, permitirá a los científicos comprender mejor los procesos de desarrollo y la patogénesis de las enfermedades.

Los principales objetivos del proyecto BIND son: crear un recurso público de proteómica accesible para todos; crear una plataforma que permita la minería de datos de otras fuentes (PreBIND); y crear una plataforma capaz de presentar visualizaciones de interacciones moleculares complejas. Desde sus inicios, BIND ha sido de acceso abierto y su software puede distribuirse y modificarse libremente. Actualmente, BIND incluye una especificación de datos, una base de datos y herramientas asociadas de minería y visualización de datos. Se espera que, en el futuro, BIND se convierta en una recopilación de todas las interacciones que ocurren en cada uno de los principales organismos modelo.

Estructura de la base de datos

BIND contiene información sobre tres tipos de datos: interacciones, complejos moleculares y vías metabólicas.

  1. Las interacciones son el componente básico de BIND y describen cómo dos o más objetos (A y B) interactúan entre sí. Los objetos pueden ser una variedad de cosas: ADN , ARN , genes , proteínas , ligandos o fotones . La entrada de interacción contiene la mayor parte de la información sobre una molécula; proporciona información sobre su nombre y sinónimos, dónde se encuentra (por ejemplo, en qué parte de la célula, qué especie, cuándo está activa, etc.) y su secuencia o dónde se puede encontrar su secuencia. La entrada de interacción también describe las condiciones experimentales necesarias para observar la unión in vitro, la dinámica química (incluyendo la termodinámica y la cinética ).
  2. El segundo tipo de entradas BIND son los complejos moleculares. Un complejo molecular se define como un agregado de moléculas estables que cumplen una función al unirse entre sí. El registro también puede contener información sobre la función del complejo en diversas interacciones, y la entrada del complejo molecular vincula datos de dos o más registros de interacción.
  3. El tercer componente de BIND es la sección de registro de vías metabólicas. Una vía metabólica consiste en una red de interacciones que participan en la regulación de los procesos celulares. Esta sección también puede contener información sobre fenotipos y enfermedades relacionadas con dicha vía.

La cantidad mínima de información necesaria para crear una entrada en BIND es una referencia de publicación en PubMed y una entrada en otra base de datos (por ejemplo, GenBank ). Cada entrada dentro de la base de datos proporciona referencias/autores para los datos. Dado que BIND es una base de datos en constante crecimiento, todos sus componentes registran las actualizaciones y los cambios. [ 5 ]

BIND se basa en una especificación de datos escrita en el lenguaje de Notación de Sintaxis Abstracta 1 ( ASN.1 ). ASN.1 también es utilizado por NCBI para almacenar datos en su sistema Entrez , por lo que BIND utiliza los mismos estándares que NCBI para la representación de datos. Se prefiere el lenguaje ASN.1 porque se puede traducir fácilmente a otros lenguajes de especificación de datos (por ejemplo, XML ), puede manejar fácilmente datos complejos y se puede aplicar a todas las interacciones biológicas, no solo a las proteínas. [ 5 ] Bader y Hogue (2000) prepararon un manuscrito detallado sobre la especificación de datos ASN.1 utilizada por BIND. [ 6 ]

Envío y curación de datos

Se anima a los usuarios a enviar información a la base de datos. Para contribuir, es necesario enviar: información de contacto, identificador de PubMed y las dos moléculas que interactúan. La persona que envía un registro es su propietaria. Todos los registros se validan antes de hacerse públicos y BIND se somete a un proceso de curación para garantizar su calidad. La curación de BIND tiene dos modalidades: alto rendimiento (HTP) y bajo rendimiento (LTP). Los registros HTP provienen de artículos que han reportado más de 40 resultados de interacción con una misma metodología experimental. Los curadores HTP suelen tener formación en bioinformática . Son responsables de la recopilación y el almacenamiento de datos experimentales, y también crean scripts para actualizar BIND en función de las nuevas publicaciones. Los registros LTP son curados por personas con maestría o doctorado y experiencia de laboratorio en investigación de interacciones. Los curadores LTP reciben formación adicional a través de los Talleres Canadienses de Bioinformática . La información sobre química de moléculas pequeñas es curada por separado por químicos para garantizar que el curador tenga conocimientos sobre el tema. La prioridad para la curación de BIND es centrarse en LTP para recopilar información a medida que se publica. Aunque los estudios HTP proporcionan más información de una sola vez, se están publicando más estudios LTP y ambos tipos de estudios informan de un número similar de interacciones. En 2004, BIND recopiló datos de 110 revistas. [ 7 ]

Crecimiento de la base de datos

BIND ha crecido significativamente desde su creación; de hecho, la base de datos experimentó un aumento de diez veces en el número de entradas entre 2003 y 2004. En septiembre de 2004, ya contaba con más de 100 000 registros de interacciones (incluidas 58 266 interacciones proteína-proteína, 4 225 genéticas, 874 proteína-molécula pequeña, 25 857 proteína-ADN y 19 348 biopolímeros). La base de datos también contiene información de secuencias para 31 972 proteínas, 4560 muestras de ADN y 759 muestras de ARN. Estas entradas se han recopilado a partir de 11 649 publicaciones; por lo tanto, la base de datos representa una importante recopilación de datos. Los organismos con entradas en la base de datos incluyen: Saccharomyces cerevisiae , Drosophila melanogaster , Homo sapiens , Mus musculus , Caenorhabditis elegans , Helicobacter pylori , Bos taurus , VIH-1 , Gallus gallus , Arabidopsis thaliana , entre otros. En total, se incluyeron 901 taxones en septiembre de 2004 y BIND se ha dividido en BIND-Metazoa, BIND-Fungi y BIND-Taxroot. [ 7 ]

No solo se actualiza continuamente la información contenida en la base de datos, sino que el software en sí ha pasado por varias revisiones. La versión 1.0 de BIND se lanzó en 1999 y, basándose en los comentarios de los usuarios, se modificó para incluir detalles adicionales sobre las condiciones experimentales necesarias para la unión y una descripción jerárquica de la ubicación celular de la interacción. La versión 2.0 se lanzó en 2001 e incluyó la capacidad de vincularse con información disponible en otras bases de datos. [ 5 ] La versión 3.0 (2002) amplió la base de datos de interacciones físicas/bioquímicas para incluir también interacciones genéticas. [ 8 ] La versión 3.5 (2004) incluyó una interfaz de usuario refinada que tenía como objetivo simplificar la recuperación de información. [ 7 ] En 2006, BIND se incorporó a la Base de Datos de la Red de Objetos Biomoleculares (BOND), donde continúa actualizándose y mejorándose.

Características especiales

BIND fue la primera base de datos de su tipo en contener información sobre interacciones, reacciones y vías biomoleculares en un solo esquema. También es la primera en basar su ontología en la química, lo que permite la representación tridimensional de las interacciones moleculares. La química subyacente permite describir las interacciones moleculares hasta el nivel de resolución atómica. [ 7 ]

PreBIND es un sistema asociado para la minería de datos que permite localizar información sobre interacciones biomoleculares en la literatura científica. Se puede introducir el nombre o el número de acceso de una proteína y PreBIND buscará en la literatura y devolverá una lista de proteínas que potencialmente interactúan. También está disponible BIND BLAST para encontrar interacciones con proteínas similares a la especificada en la consulta. [ 7 ]

BIND ofrece varias características que muchas otras bases de datos de proteómica no incluyen. Los autores de este programa han creado una extensión de la nomenclatura tradicional de la IUPAC para ayudar a describir las modificaciones postraduccionales que ocurren en los aminoácidos. Estas modificaciones incluyen: acetilación , formilación , metilación , palmitoilación , etc. La extensión de los códigos tradicionales de la IUPAC permite que estos aminoácidos también se representen en forma de secuencia. BIND también utiliza una herramienta de visualización única conocida como OntoGlyphs . Los OntoGlyphs se desarrollaron a partir de la Ontología Génica (GO) y proporcionan un enlace a la información GO original. Varios términos GO se han agrupado en categorías, cada una de las cuales representa una función específica, especificidad de unión o localización en la célula. Hay 83 caracteres OntoGlyph en total. Hay 34 OntoGlyphs funcionales que contienen información sobre el papel de la molécula (por ejemplo, fisiología celular, transporte de iones, señalización). Hay 25 OntoGlyphs de unión que describen a qué se une la molécula (p. ej., ligandos, ADN, iones). Los otros 24 OntoGlyphs proporcionan información sobre la ubicación de la molécula dentro de una célula (p. ej., núcleo, citoesqueleto). Los OntoGlyphs se pueden seleccionar y manipular para incluir o excluir ciertas características de los resultados de búsqueda. La naturaleza visual de los OntoGlyphs también facilita el reconocimiento de patrones al observar los resultados de búsqueda. [ 7 ] Los ProteoGlyphs son representaciones gráficas de las propiedades estructurales y de unión de las proteínas a nivel de dominios conservados. La proteína se diagrama como una línea horizontal recta y se insertan glifos para representar dominios conservados. Cada glifo se muestra para representar la posición relativa y la longitud de su alineación en la secuencia de la proteína.

Acceso a la base de datos

Figura 1: Captura de pantalla de los resultados de la secuencia obtenidos con BOND

La interfaz de usuario de la base de datos es web y permite realizar consultas mediante texto o números/identificadores de acceso. Desde su integración con los demás componentes de BOND, se han añadido secuencias a las interacciones, complejos moleculares y vías metabólicas en los resultados. Los registros incluyen información sobre: ​​ID de BIND, descripción de la interacción/complejo/vía metabólica, publicaciones, registros de actualización, organismo, OntoGlyphs, ProteoGlyphs y enlaces a otras bases de datos donde se puede encontrar información adicional. Los registros de BIND incluyen diversos formatos de visualización (p. ej. , HTML , ASN.1 , XML , FASTA ), diversos formatos para exportar resultados (p. ej., ASN.1, XML , lista GI , PDF ) y visualizaciones (p. ej., Cytoscape ). Las opciones exactas de visualización y exportación varían según el tipo de datos recuperados.

Estadísticas de usuario

El número de usuarios registrados en Unleashed se ha multiplicado por diez desde la integración de BIND. En diciembre de 2006, el registro rondaba los 10 000. Los suscriptores a las versiones comerciales de BOND se dividen en seis categorías generales: agricultura y alimentación , biotecnología , productos farmacéuticos , informática , materiales y otros. El sector de la biotecnología es el más numeroso, con un 28 % de las suscripciones. Le siguen los sectores farmacéutico e informático, con un 22 % y un 18 %, respectivamente. Estados Unidos concentra la mayor parte de estas suscripciones, un 69 %. Otros países con acceso a las versiones comerciales de BOND son Canadá , Reino Unido , Japón , China , Corea , Alemania , Francia , India y Australia . Todos estos países representan menos del 6 % de la cuota de usuarios. [ 2 ]

Referencias

  1. Blueprint.org
  2. 1 2 BOND en Unleashed Informatics Archivado el 14 de marzo de 2007 en Wayback Machine
  3. Snyder, K, et al. . Anotación de sitios de unión de moléculas pequeñas basada en dominios. BMC Bioinformatics 7: 152 (2006)
  4. BIND en genomecanada.ca
  5. 1 2 3 Bader, GD, et al. BIND: Base de datos de la red de interacción biomolecular. Nucleic Acids Research 29: 242-245 (2001).
  6. Bader, GD, Hogue, CWV. BIND: una especificación de datos para almacenar y describir interacciones biomoleculares, complejos moleculares y vías metabólicas. Bioinformatics 16(5): 465-477 (2000).
  7. 1 2 3 4 5 6 Alfarano, C, et al. La base de datos de la red de interacción biomolecular y herramientas relacionadas: actualización de 2005. Nucleic Acids Research 33: D418-D424 (2005).
  8. Bader, GD, et al. . BIND: la base de datos de la red de interacción biomolecular. Nucleic Acids Research 31: 248-250 (2003).
Obtenido de " https://en.wikipedia.org/w/index.php?title=Biomolecular_Object_Network_Databank&oldid=1324420539#Biomolecular_Interaction_Network_Database_(BIND) "