Articulo de referencia

Herramienta de perfilado de secuencias

En bioinformática, una herramienta de perfilado de secuencias es un tipo de software que presenta información relacionada con una secuencia genética , un nombre de gen o una pal...

En bioinformática, una herramienta de perfilado de secuencias es un tipo de software que presenta información relacionada con una secuencia genética , un nombre de gen o una palabra clave. Estas herramientas generalmente toman una consulta, como una secuencia de ADN , ARN o proteína , o una palabra clave, y buscan información relacionada con dicha secuencia en una o más bases de datos . Se proporcionan resúmenes y resultados agregados en un formato estandarizado que describe la información que, de otro modo, habría requerido visitar numerosos sitios web o realizar búsquedas bibliográficas directas para recopilarla. Muchas herramientas de perfilado de secuencias son portales o plataformas de software que simplifican el proceso de búsqueda de información sobre una consulta en el gran y creciente número de bases de datos bioinformáticas. El acceso a este tipo de herramientas se realiza a través de la web o mediante ejecutables descargables localmente.

Introducción y uso

La era "postgenómica " ha dado lugar a una variedad de herramientas y programas informáticos basados ​​en la web para recopilar, organizar y distribuir grandes cantidades de información de secuencias primarias , así como estructuras de proteínas , anotaciones genéticas, alineaciones de secuencias y otras tareas bioinformáticas comunes.

En general, existen tres tipos de bases de datos y proveedores de servicios. El primero incluye las bases de datos populares de dominio público o de acceso abierto, financiadas mediante subvenciones como NCBI , ExPASy , Ensembl y PDB . El segundo incluye bases de datos más pequeñas o específicas, organizadas y compiladas por grupos de investigación individuales. Algunos ejemplos son la Base de Datos del Genoma de la Levadura y la Base de Datos de ARN (archivada el 15 de septiembre de 2002 en los Archivos Web de la Biblioteca del Congreso ). El tercer y último tipo incluye bases de datos privadas, corporativas o institucionales, cuyo acceso requiere pago o afiliación institucional. Estos ejemplos son poco frecuentes dada la globalización de las bases de datos públicas, a menos que el servicio en cuestión esté en desarrollo o que el análisis final tenga valor comercial.

Los escenarios típicos de un enfoque de perfilado cobran relevancia, sobre todo, en los casos de los dos primeros grupos, donde los investigadores suelen querer combinar información procedente de diversas fuentes sobre una única secuencia de consulta o secuencia objetivo. Por ejemplo, los usuarios podrían utilizar la herramienta de alineación y búsqueda de secuencias BLAST para identificar homólogos de su gen de interés en otras especies y, a continuación, utilizar estos resultados para localizar la estructura proteica resuelta de uno de los homólogos. Del mismo modo, también podrían querer conocer la probable estructura secundaria del ARNm que codifica el gen de interés, o si una empresa comercializa un constructo de ADN que contenga dicho gen. Las herramientas de perfilado de secuencias automatizan e integran el proceso de búsqueda de esta información tan diversa, haciendo que la búsqueda en varias bases de datos externas sea transparente para el usuario.

Muchas bases de datos públicas ya están ampliamente interconectadas, lo que facilita el acceso a información complementaria de otras bases de datos; por ejemplo, GenBank y la PDB están estrechamente vinculadas. Sin embargo, las herramientas especializadas organizadas y alojadas por grupos de investigación específicos pueden ser difíciles de integrar en esta interconexión, ya que tienen un enfoque limitado, se modifican con frecuencia o utilizan versiones personalizadas de formatos de archivo comunes. Las ventajas de las herramientas de perfilado de secuencias incluyen la posibilidad de usar varias de estas herramientas especializadas en una sola consulta y presentar los resultados con una interfaz común, la capacidad de dirigir los resultados de un conjunto de herramientas o búsquedas en bases de datos hacia la entrada de otro, y la capacidad de distribuir las obligaciones de alojamiento y compilación a una red de grupos de investigación e instituciones en lugar de a un único repositorio centralizado.

Perfiladores basados ​​en palabras clave

La mayoría de las herramientas de perfilado disponibles en la web hoy en día pertenecen a esta categoría. Al visitar el sitio o la herramienta, el usuario introduce información relevante, como palabras clave (por ejemplo, distrofia, diabetes, etc.) o números de acceso de GenBank (ID de PDB). Todos los resultados relevantes de la búsqueda se presentan en un formato único, adaptado al enfoque principal de cada herramienta. Las herramientas de perfilado basadas en búsquedas por palabras clave son, en esencia, motores de búsqueda altamente especializados en bioinformática, lo que elimina la gran cantidad de resultados irrelevantes o no académicos que podrían aparecer con un motor de búsqueda tradicional como Google . La mayoría de estas herramientas permiten introducir palabras clave de forma flexible, números de acceso de bases de datos indexadas y descriptores de palabras clave tradicionales.

Cada herramienta de perfilado tiene su propio enfoque y área de interés. Por ejemplo, el motor de búsqueda Entrez del NCBI clasifica sus resultados por categoría, de modo que los usuarios que buscan información sobre la estructura de proteínas pueden descartar secuencias sin una estructura correspondiente, mientras que los usuarios interesados ​​en consultar la bibliografía sobre un tema pueden ver resúmenes de artículos publicados en revistas académicas sin distraerse con los resultados de genes o secuencias. La base de datos de literatura de biociencias PubMed es una herramienta popular para búsquedas bibliográficas, aunque este servicio es casi igualado por el más general Google Scholar .

Los servicios de agregación de datos basados ​​en palabras clave, como Bioinformatic Harvester , proporcionan informes de diversos servidores de terceros en un formato tal cual , de modo que los usuarios no necesitan visitar el sitio web ni instalar el software para cada componente individual. Esto resulta especialmente valioso dada la rápida aparición de diversos sitios que ofrecen diferentes herramientas de análisis y manipulación de secuencias. Otro portal web de agregación, la Base de Datos de Referencia de Proteínas Humanas ( Hprd ), contiene entradas anotadas y curadas manualmente para proteínas humanas. La información proporcionada es, por lo tanto, selectiva y completa, y el formato de consulta es flexible e intuitivo. Las ventajas de desarrollar bases de datos curadas manualmente incluyen la presentación de material revisado y el concepto de "autoridades moleculares" que asumen la responsabilidad de proteínas específicas. Sin embargo, las desventajas son que suelen ser más lentas en actualizarse y pueden no contener datos muy recientes o controvertidos.

Perfiladores basados ​​en datos de secuencia

Una herramienta típica de perfilado de secuencias va más allá, ya que utiliza una secuencia real de ADN, ARN o proteína como entrada y permite al usuario acceder a diferentes herramientas de análisis web para obtener la información deseada. Estas herramientas suelen venir incluidas con equipos de laboratorio comerciales, como secuenciadores de genes, o se venden como aplicaciones de software para biología molecular. En otro ejemplo de base de datos pública, el informe de búsqueda de secuencias BLAST del NCBI proporciona un enlace desde su informe de alineación a otra información relevante en sus propias bases de datos, si dicha información específica existe.

Por ejemplo, un registro recuperado que contiene una secuencia humana tendrá un enlace independiente que la conecta con su ubicación en un mapa del genoma humano; un registro que contiene una secuencia para la cual se ha resuelto una estructura 3D tendrá un enlace que la conecta con su base de datos de estructuras. Sequerome , una herramienta de servicio público, vincula el informe BLAST completo con numerosos servidores/sitios de terceros que proporcionan servicios altamente específicos en manipulación de secuencias, como mapas de enzimas de restricción , análisis de marcos de lectura abiertos para secuencias de nucleótidos y predicción de estructura secundaria . La herramienta ofrece la ventaja adicional de mantener un registro de investigación de las operaciones realizadas por el usuario, que luego se puede archivar fácilmente mediante las funciones de "correo electrónico", "imprimir" o "guardar". De esta manera, toda una operación de investigación de una secuencia utilizando diferentes herramientas de investigación y, por lo tanto, llevar un proyecto a su finalización, se puede completar dentro de una única interfaz de navegador. En consecuencia, la futura generación de herramientas de perfilado de secuencias incluiría la capacidad de colaborar en línea con investigadores para compartir registros de proyectos y herramientas de investigación, anotar resultados de análisis de secuencias o trabajo de laboratorio, personalizar y automatizar el procesamiento de conjuntos de datos de secuencias, etc. InstaSeq es una herramienta de búsqueda impulsada por Google que permite al usuario ingresar directamente una secuencia y buscar en toda la World Wide Web. Este motor de búsqueda único, que es el único de su tipo, contrasta con la búsqueda en bases de datos específicas como GenBank .

Como resultado, el usuario puede terminar con un documento alojado de forma privada o una página de una base de datos menos conocida, prácticamente desde cualquier lugar del mundo. Si bien la presencia de analizadores de secuencias es escasa en la actualidad, su papel fundamental se hará evidente cuando sea necesario procesar grandes cantidades de datos de secuencias en distintos portales y dominios.

Crecimiento futuro y direcciones

La proliferación de herramientas bioinformáticas para el análisis genético facilita a los investigadores la identificación y categorización de genes y conjuntos de genes de interés en su trabajo; sin embargo, la gran variedad de herramientas que realizan funciones agregativas y analíticas sustancialmente similares también puede confundir y frustrar a los nuevos usuarios. La descentralización que fomentan las herramientas agregativas permite a los grupos de investigación individuales mantener servidores especializados dedicados a tipos específicos de análisis de datos, con la expectativa de que sus resultados se recopilen en un informe más amplio sobre un gen o proteína de interés para otros investigadores.

Los datos generados por experimentos de microarrays, cribado de doble híbrido y otros experimentos biológicos de alto rendimiento son voluminosos y difíciles de analizar manualmente. Los esfuerzos de las colaboraciones en genómica estructural, cuyo objetivo es resolver rápidamente un gran número de estructuras proteicas muy diversas, también incrementan la necesidad de integrar bases de datos y portales de secuencias y estructuras. Este impulso hacia el desarrollo de métodos de perfilado de secuencias más completos y fáciles de usar convierte a este campo en un área de investigación activa entre los investigadores genómicos actuales.

Véase también

Referencias

  • Peri S, Navarro JD, Kristiansen TZ, et al. (enero de 2004). "Base de datos de referencia de proteínas humanas como recurso de descubrimiento para la proteómica" . Nucleic Acids Res . 32 (número especial sobre bases de datos): D497–501. doi : 10.1093/nar/gkh070 . PMC  308804. PMID  14681466 .
  • Liebel U; Kindler B; Pepperkok R (agosto de 2004). "'Harvester': un motor de metabúsqueda rápido de recursos de proteínas humanas" . Bioinformática . 20 (12): 1962–3 . doi : 10.1093/bioinformatics/bth146 . PMID  14988114 .
  • Ganesan N; Bennett NF; Velauthapillai M; Pattabiraman N; Squier R; Kalyanasundaram B (agosto de 2005). "Interfaz web que facilita el análisis de secuencia a estructura de informes de alineación BLAST" . BioTechniques . 39 (2): 186, 188. doi : 10.2144/05392BM05 . PMID  16116790 .
  • Beaton J; Smith C (noviembre de 2005). "Google versus PubMed" . Ann R Coll Surg Engl . 87 (6): 491–2 . doi : 10.1308/003588405X71207 . PMC  1964102. PMID  16263030 .
  • Hunter L; Cohen KB (marzo de 2006). "Procesamiento del lenguaje biomédico: ¿qué hay más allá de PubMed?" . Mol. Cell . 21 (5): 589– 94. doi : 10.1016/j.molcel.2006.02.012 . PMC  1702322 . PMID  16507357 .
  • Ganesan N; Kalyanasundaram B; Velauthapillai M (marzo de 2007). "Herramientas de perfilado de datos bioinformáticos: un preludio al perfilado metabólico". Pac. Symp. Biocomput. : 127– 32. PMID  17990486 .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Sequence_profiling_tool&oldid=1334507440 "