COMBREX es un proyecto multifacético que incluye una base de datos de anotaciones genéticas, predicciones funcionales y recomendaciones basadas en principios de aprendizaje activo asociados con millones de genes en genomas procariotas . [1]
Acerca de
COMBREX es un proyecto multifacético que tiene como objetivo reunir a las comunidades computacionales y experimentales de biólogos con el objetivo de mejorar nuestra comprensión de la función de los genes microbianos y acelerar la anotación de la función de los genes microbianos. El proyecto COMBREX fue cofundado por Simon Kasif, Richard Roberts y Martin Steffen como un consorcio internacional con sede en la Universidad de Boston y más de 100 colaboradores experimentales y computacionales. El proyecto se inspiró en un llamado a la acción comunitaria publicado en PLoS Biology por Richard J. Roberts.
Contenido
Una base de datos de genes y funciones
Esta base de datos en evolución consta de funciones determinadas experimentalmente y predichas computacionalmente para más de tres millones de genes microbianos. La búsqueda de un gen o genes de interés puede ser un fin en sí mismo, o puede ser un primer paso para contribuir con información a COMBREX o buscar una subvención de éste. La base de datos actualmente consta de genes de más de 1000 genomas bacterianos y arqueológicos completamente secuenciados, complementados con una serie de genes individuales cuya función bioquímica ha sido determinada experimentalmente. Los genes están organizados en grupos similares en cuanto a secuencia y probablemente isofuncionales, determinados por el NCBI, denominados grupos de proteínas.
Se utiliza un sistema de codificación por colores para identificar qué genes tienen funciones determinadas experimentalmente, cuáles tienen funciones predichas computacionalmente y cuáles no tienen una función conocida o predicha (información). Por necesidad, las "funciones predichas" pueden abarcar una amplia gama de especificidad, y uno de nuestros objetivos a más largo plazo es cuantificar esta especificidad. (Por ejemplo, la función predicha "valina descarboxilasa" es significativamente más específica y más fácilmente verificable que "liasa", o incluso "carboxiliasa").
La identificación de genes cuyos productos han sido verificados experimentalmente tampoco es una tarea trivial, por lo que nos hemos embarcado en un proyecto para crear un conjunto completo y seleccionado manualmente de todos esos genes, al que llamamos la Base de Datos de Genes Estándar de Oro. Este conjunto seleccionado es actualmente exclusivo de la base de datos COMBREX, y los genes que pertenecen a él están codificados por colores con un símbolo dorado.
Predicciones de la función genética
La base de datos COMBREX sirve como un lugar para que los biólogos computacionales publiquen sus predicciones más informativas sobre la función de los genes. Un esfuerzo importante dentro del campo de la bioinformática ha sido la predicción computacional de la función de los genes. Ha habido avances significativos en este campo durante la última década, pero muchos de estos esfuerzos no han alcanzado su potencial total para hacer avanzar el conocimiento biológico debido al hecho de que las predicciones rara vez se prueban experimentalmente y las funciones predichas para genes individuales realizadas mediante métodos competitivos rara vez se comparan directamente.
La base de datos COMBREX, además de extraer información de fuentes conocidas como NCBI y UniProtKB, también muestra predicciones de funciones genéticas presentadas por laboratorios individuales. Dichas predicciones pueden generarse a gran escala utilizando algoritmos computacionales, o pueden ser realizadas para genes individuales por biólogos experimentales o computacionales que estén familiarizados con una familia de proteínas o una vía bioquímica en particular. De este modo, las predicciones realizadas con diferentes métodos pueden ser fácilmente comparadas, contrastadas y examinadas por biólogos experimentales. Esta presentación en paralelo de predicciones de funciones de muchas fuentes es el núcleo de la interacción entre las comunidades computacionales y experimentales que COMBREX espera fomentar.
Recomendación y priorización de experimentos basados en principios de Aprendizaje Activo.
COMBREX utiliza principios simples, así como metodologías de aprendizaje activo más sofisticadas , para recomendar los experimentos más informativos. Se trata de experimentos que tienen más probabilidades de generar las predicciones más informativas (en el sentido matemático de maximizar la ganancia de información) para la mayor cantidad de proteínas en la base de datos. Las recomendaciones más básicas proporcionan una clasificación de todas las proteínas en un grupo de genes en términos de su distancia a otras proteínas. En el caso más simple, las proteínas cercanas al centro de un grupo se consideran las más informativas porque su distancia a las otras proteínas en el grupo es relativamente pequeña. Como resultado, es probable que la anotación funcional de un "centro" de un grupo resulte en las predicciones más precisas para las otras proteínas en el grupo. En términos evolutivos, estos "centros de grupo" son los más cercanos al ancestro evolutivo de todas las proteínas en el grupo. El aprendizaje activo generaliza este principio de intuición para producir recomendaciones para experimentos adicionales que probablemente produzcan predicciones precisas o identifiquen proteínas que no están anotadas correctamente.
Además del análisis evolutivo y el aprendizaje activo, COMBREX también señala otros criterios que podrían tenerse en cuenta al considerar los experimentos. Dichos criterios incluyen si existe una estructura disponible, la conservación del gen bacteriano en el genoma humano (por ejemplo, el dominio compartido), la disponibilidad de evidencia computacional o experimental de la función del gen, consideraciones fenotípicas (como la presencia en un patógeno o la relación con la resistencia a los antibióticos, la patogenicidad o la virulencia) y otros.
Subvenciones para la caracterización bioquímica de genes
Una de las misiones de COMBREX es la de otorgar pequeñas subvenciones monetarias para la validación experimental de predicciones genéticas específicas. La determinación experimental de la función bioquímica de productos genéticos específicos sirve para validar (o invalidar) las predicciones computacionales realizadas a priori. Por lo tanto, este esfuerzo experimental persigue tres objetivos: (1) reunir directamente a los científicos que realizan predicciones de la función genética y a quienes las ponen a prueba, (2) evaluar los métodos computacionales en función de la precisión de sus predicciones para poder mejorarlas, y (3) ampliar el panorama de genes validados experimentalmente, mejorando nuestra comprensión general de la biología y de las relaciones secuencia-estructura-función.
La investigación experimental de la función bioquímica de un solo gen o de un pequeño número de genes suele quedar fuera del ámbito de competencia de las grandes agencias de financiación. COMBREX está creada para conceder pequeñas subvenciones precisamente para este tipo de trabajo, y dichas subvenciones son especialmente adecuadas para laboratorios que ya están familiarizados con los tipos de ensayos necesarios para los experimentos previstos.
Objetivos
Anotación genética mejorada
Uno de los problemas actuales con la anotación de genes y genomas es la falta de transparencia con respecto a la fuente. A menudo es difícil determinar qué funciones se han determinado experimentalmente y cuáles se predicen computacionalmente. Además, en el caso de las funciones predichas computacionalmente, rara vez se indica el método utilizado para realizar la predicción y la solidez de la evidencia. COMBREX ha dado los primeros pasos hacia un sistema de anotación más transparente mediante (1) la codificación por colores de los genes para distinguir las funciones observadas de las predichas y (2) para muchas funciones predichas por similitud de secuencias, la identificación del "gen fuente" validado experimentalmente en el que se basó la predicción.
COMBREX está trabajando para lograr un sistema de anotación más completamente rastreable, en el que cada anotación funcional indicada se determina experimentalmente o es una predicción vinculada explícitamente a través de una cadena de evidencia a una fuente última de información. Estas fuentes serán en muchos casos genes validados experimentalmente, pero en algunos casos serán anotaciones de bases de datos existentes cuyas fuentes no son inmediatamente evidentes.
COMBREX es la primera base de datos que intenta identificar "computacionalmente" el vínculo con la fuente experimental de una anotación utilizando homología. Otras bases de datos proporcionan dos tipos de evidencia, por ejemplo, inferida directamente a partir de experimentos o inferida computacionalmente. Sin embargo, la inferencia no puede rastrearse típicamente hasta la fuente experimental de la anotación. COMBREX no puede garantizar que los "rastros" que proporciona sean precisos en este punto, pero permite a los biólogos hacer esta determinación directamente examinando el vínculo.
Este sistema de identificación de genes y funciones de origen, y de vínculos evidenciales, permitirá un sistema dinámico de anotación que se actualiza automáticamente a medida que se determinan las evidencias experimentales de nuevos genes y se desarrollan nuevos métodos predictivos. Este sistema dinámico de anotación funcional de genes puede ayudar a superar la frecuencia relativamente alta de genes no anotados o mal anotados que resulta del sistema estático utilizado en muchas bases de datos públicas. Además, iluminará aquellos genes cuyas funciones bioquímicas son verdaderamente desconocidas, a diferencia de aquellos que simplemente están insuficientemente anotados.
Precisión predictiva mejorada
Es importante que las predicciones funcionales de los genes sean transparentes, pero es igualmente importante que sean lo más precisas posible. Las predicciones deben ser proporcionales a la solidez de las pruebas que las respaldan, de modo que sean tan específicas como lo permitan las pruebas. Las que no son lo suficientemente específicas no se prestan a pruebas experimentales, y las que son demasiado específicas para las pruebas subyacentes corren un alto riesgo de ser inexactas. COMBREX está trabajando activamente en el desarrollo de algoritmos para la predicción funcional que puedan identificar genes con funciones novedosas o interesantes, y cuyos resultados puedan compararse con las predicciones de alta calidad recibidas de los grupos computacionales colaboradores. La propagación relativamente conservadora de la función genética basada en BLAST de COMBREX representa un primer paso simple hacia este objetivo.
Validación experimental dirigida
Mediante sus decisiones de financiación, COMBREX puede ayudar a ampliar y profundizar nuestra comprensión de la función bioquímica de los genes al fomentar la investigación experimental de genes específicos. La elección de qué genes validar es importante: se obtiene poco conocimiento nuevo general al validar parientes muy similares de genes isofuncionales, y es poco probable que los experimentos de validación para genes sin funciones específicas previstas tengan éxito. Además, el panorama de lo que ya se sabe es desigual, con muchos ejemplos validados de algunas funciones y pocos o ningún ejemplo de otras.
COMBREX desea desarrollar un nuevo modelo integrador de investigación en el que se prioricen los experimentos para cerrar las brechas más grandes en nuestra comprensión predictiva general de la función genética. Este modelo favorece la validación de genes que proporcionan aumentos relativamente grandes en el conocimiento, por ejemplo, porque su función validada da como resultado una gran cantidad de nuevas predicciones para otros genes. En una etapa temprana, COMBREX introducirá listas de genes de "alta prioridad", que pueden identificarse como de valor predictivo o biomédico significativo, y para los cuales los miembros de COMBREX pueden nominar candidatos. Como objetivo a más largo plazo, COMBREX está trabajando en el uso de técnicas de aprendizaje automático, como el aprendizaje activo, para optimizar la selección de dichos genes.
Nuevas tecnologías
COMBREX fomenta el desarrollo de nuevas tecnologías y ensayos rentables para la determinación de la función de los genes. El esfuerzo de validación experimental descrito anteriormente equivale a una aplicación masiva y paralela de experimentos de bajo rendimiento a través de muchas subvenciones a pequeña escala. Los ensayos de alto rendimiento que pueden analizar muchos productos genéticos en paralelo pueden dar como resultado la determinación de la función de muchos genes simultáneamente y pueden ayudar a hacer grandes avances en nuestra comprensión general de la función de los genes. [2]
Referencias
- ^ Roberts, Richard J; Chang Yi-Chien; Hu Zhenjun; Rachlin John N; Anton Brian P; Pokrzywa Revonda M; Choi Han-Pil; Faller Lina L; Guleria Jyotsna; Housman Genevieve; Klitgord Niels; Mazumdar Varun; McGettrick Mark G; Osmani Lais; Swaminathan Rajeswari; Tao Kevin R; Letovsky Stan; Vitkup Dennis; Segrè Daniel; Salzberg Steven L; Delisi Charles; Steffen Martin; Kasif Simon (enero de 2011). "COMBREX: un proyecto para acelerar la anotación funcional de genomas procariotas". Nucleic Acids Res . 39 (número de base de datos). Inglaterra: D11–4. doi :10.1093/nar/gkq1168. PMC 3013729 . PMID 21097892.
- ^ Anton, B.; et al. (2013). "El proyecto COMBREX: diseño, metodología y resultados iniciales". PLOS Biol . 11 (8): e1001638. doi : 10.1371/journal.pbio.1001638 . PMC 3754883. PMID 24013487 .
[1]
Enlaces externos
- http://combrex.bu.edu