Articulo de referencia

Lista de bases de datos biológicas

Las bases de datos biológicas son depósitos de información biológica. [ 1 ] La revista Nucleic Acids Research publica regularmente números especiales sobre bases de datos biológ...

Las bases de datos biológicas son depósitos de información biológica. [ 1 ] La revista Nucleic Acids Research publica regularmente números especiales sobre bases de datos biológicas y cuenta con una lista de dichas bases de datos. El número de 2018 incluye una lista de aproximadamente 180 bases de datos y actualizaciones de las bases de datos descritas previamente. [ 2 ] El Omics Discovery Index permite explorar y buscar en diversas bases de datos biológicas. Además, el portal Data Ecosystem Discovery Portal, desarrollado por el Instituto Nacional de Alergias y Enfermedades Infecciosas (NIAID), permite realizar búsquedas en diferentes bases de datos.

Metabases de datos

Las metabases de datos son bases de datos de bases de datos que recopilan información sobre datos para generar nueva información. Son capaces de fusionar información de diferentes fuentes y presentarla de forma novedosa y más práctica, o bien, con especial énfasis en una enfermedad u organismo en particular. Originalmente, el término metadatos se refería simplemente a información sobre datos, como etiquetas, palabras clave y encabezados de marcado.

bases de datos de organismos modelo

Las bases de datos de organismos modelo proporcionan datos biológicos exhaustivos sobre organismos que han sido objeto de intensos estudios.

Bases de datos de ácidos nucleicos

Las bases de datos primarias conforman la Base de Datos Internacional de Secuencias de Nucleótidos (INSD). Estas incluyen:

DDBJ (Japón), GenBank (EE. UU.) y el Archivo Europeo de Nucleótidos (Europa) son repositorios de datos de secuencias de nucleótidos de todos los organismos . Los tres aceptan el envío de secuencias de nucleótidos e intercambian datos nuevos y actualizados diariamente para lograr una sincronización óptima entre ellos. Estas tres bases de datos son primarias, ya que albergan los datos de secuencias originales. Colaboran con Sequence Read Archive (SRA), que archiva las lecturas sin procesar de los instrumentos de secuenciación de alto rendimiento.

Las bases de datos secundarias son:

  • Mapa HapMap
  • OMIM (Herencia Mendeliana en el Hombre en Línea): enfermedades hereditarias
  • RefSeq
  • Proyecto 1000 Genomas : lanzado en enero de 2008. Se analizaron los genomas de más de mil participantes anónimos de diversos grupos étnicos y se pusieron a disposición del público.
  • Base de datos EggNOG: un recurso ortológico jerárquico, funcional y filogenéticamente anotado, basado en 5090 organismos y 2502 virus. Proporciona alineamientos de secuencias múltiples y árboles de máxima verosimilitud, así como una amplia anotación funcional. [ 6 ] [ 7 ]

Otras bases de datos

bases de datos de expresión genética

Bases de datos genéricas de expresión génica

bases de datos de expresión génica de microarrays

bases de datos del genoma

Estas bases de datos recopilan secuencias genómicas , las anotan y analizan, y ofrecen acceso público. Algunas incorporan la curación de literatura experimental para mejorar las anotaciones computarizadas. Estas bases de datos pueden contener genomas de muchas especies o el genoma de un único organismo modelo .

bases de datos de fenotipos

bases de datos de ARN

Bases de datos de aminoácidos y proteínas

(Véase también: Lista de proteínas en el cuerpo humano )

Se han desarrollado varios repositorios y recursos de datos de acceso público para respaldar y gestionar información relacionada con proteínas , el descubrimiento de conocimiento biológico y la generación de hipótesis basada en datos. [ 16 ] Las bases de datos de la tabla siguiente se seleccionaron de las bases de datos enumeradas en los números y la colección de bases de datos de Nucleic Acids Research (NAR) y de las bases de datos referenciadas en UniProt KB. La mayoría de estas bases de datos están referenciadas con UniProt / UniProt KB para que los identificadores puedan asignarse entre sí. [ 16 ]

Proteínas en humanos:

Hay alrededor de ~20 000 genes codificadores de proteínas en el genoma humano estándar. (Aproximadamente ~1200 ya tienen artículos en Wikipedia - la Wiki de genes - sobre ellos) si incluimos las variantes de empalme, podría haber hasta 500 000 proteínas humanas únicas [ 17 ].

Diferentes tipos de bases de datos de proteínas

bases de datos de vías de transducción de señales

Bases de datos de vías metabólicas y función de proteínas

bases de datos taxonómicas

Numerosas bases de datos recopilan información sobre especies y otras categorías taxonómicas . El Catálogo de la Vida es un caso especial, ya que se trata de una metabase de datos que reúne aproximadamente 150 "bases de datos globales de especies" (GSD, por sus siglas en inglés) especializadas, las cuales han recopilado los nombres y otra información sobre (casi) todas las especies descritas y, por lo tanto, "conocidas".

  • BacDive : metadatos bacterianos que proporciona información vinculada a cepas sobre la biodiversidad bacteriana y arqueal, incluyendo información taxonómica.
  • Catálogo de la Vida : una metabase de datos de todas las especies de la Tierra.
  • EzTaxon-e : base de datos para la identificación de procariotas basada en secuencias del gen del ARN ribosomal 16S.
  • Taxonomía del NCBI: una base de datos taxonómica gestionada por el NCBI que se centra en todos los taxones para los que se dispone de secuencias de ADN (dichas secuencias se almacenan en GenBank , otra base de datos gestionada por el NCBI).

bases de datos de imágenes

Las imágenes desempeñan un papel fundamental en la biomedicina, desde imágenes de especímenes antropológicos hasta zoología . Sin embargo, existen relativamente pocas bases de datos dedicadas a la recopilación de imágenes, aunque algunos proyectos como iNaturalist recopilan fotografías como parte principal de sus datos. Un caso especial de "imágenes" son las imágenes tridimensionales, como las estructuras de proteínas o las reconstrucciones 3D de estructuras anatómicas. Las bases de datos de imágenes incluyen, entre otras: [ 23 ]

Bases de datos radiológicas

Bases de datos adicionales

Bases de datos de exosomas

  • ExoCarta
  • Atlas de ARN extracelular: un repositorio de perfiles de ARN pequeño derivados de secuenciación de ARN y qPCR de fluidos biológicos humanos y de ratón.

Bases de datos de modelos matemáticos

Bases de datos sobre tasas de resistencia antimicrobiana y consumo de antibióticos.

Bases de datos sobre mecanismos de resistencia antimicrobiana

Bases de datos estilo wiki

Bases de datos especializadas

Referencias

  1. Wren JD, Bateman A (octubre de 2008). "Bases de datos, tumbas de datos y polvo en el viento" . Bioinformática . 24 (19): 2127–8 . doi : 10.1093/bioinformatics/btn464 . PMID 18819940 . 
  2. "Volumen 46 Número D1 | Investigación sobre ácidos nucleicos | Oxford Academic" . academic.oup.com . Consultado el 4 de septiembre de 2018 .
  3. Carme, Pascal; Rutherford, Kim M.; Bähler, Jürg; Mata, Juan; Wood, Valerie (2026). " PomBase en 2026: Ampliando el conocimiento, modelando conexiones" . Genetics . doi : 10.1093/genetics/iyag001 . PMC 13050190. PMID 41518600 .  
  4. Zhu B, Stülke J (enero de 2018). "SubtiWiki en 2018: de genes y proteínas a la anotación de redes funcionales del organismo modelo Bacillus subtilis" . Nucleic Acids Research . 46 (D1): D743– D748. doi : 10.1093/nar/gkx908 . PMC 5753275. PMID 29788229 .  
  5. Margarita García-Hernández; Tanya Berardini; Guanghong Chen; Debbie Crist; Aisling Doyle; Eva Hualá; Emma rodilla; Marcos Lambrecht; Neil Molinero; Lucas A. Müller; Suparna Mundodi; Leonore Reiser; Seung Y. Rhee; Randy Scholl; Julie Tacklind; Dan C. Weems; Yihe Wu; Iris Xu; Daniel Yoo; Jungwon Yoon; Peifen Zhang (noviembre de 2002). "TAIR: un recurso para datos integrados de Arabidopsis". Genómica funcional e integradora . 2 (6): 239– 253. doi : 10.1007/s10142-002-0077-z . PMID 12444417 . S2CID 7827488 .  
  6. Powell S, Forslund K, Szklarczyk D, Trachana K, Roth A, Huerta-Cepas J, et al. (enero de 2014). "eggNOG v4.0: inferencia de ortología anidada en 3686 organismos" . Nucleic Acids Research . 42 (número especial de bases de datos): D231-9. doi : 10.1093 / nar/gkt1253 . PMC 3964997. PMID 24297252 .   
  7. Huerta-Cepas J, Szklarczyk D, Heller D, Hernández-Plaza A, Forslund SK, Cook H, et al. (enero de 2019). "eggNOG 5.0: un recurso de ortología jerárquico, funcional y filogenéticamente anotado basado en 5090 organismos y 2502 virus" . Nucleic Acids Research . 47 (D1): D309– D314. doi : 10.1093/nar/gky1085 . PMC 6324079. PMID 30418610 .   
  8. ArrayExpress
  9. GEO
  10. "El Atlas de Proteínas Humanas" . www.proteinatlas.org . Consultado el 27 de mayo de 2019 .
  11. Dash S, Campbell JD, Cannon EK, Cleary AM, Huang W, Kalberer SR, et al. (enero de 2016). "Sistema de información sobre leguminosas (LegumeInfo.org): un componente clave de un conjunto de recursos de datos federados para la familia de las leguminosas" . Nucleic Acids Research . 44 (D1): D1181-8. doi : 10.1093/nar/gkv1159 . PMC 4702835. PMID 26546515 .   
  12. Goodstein DM, Shu S, Howson R, Neupane R, Hayes RD, Fazo J, Mitros T, Dirks W, Hellsten U, Putnam N, Rokhsar DS (enero de 2012). "Phytozome: una plataforma comparativa para la genómica de plantas verdes" . Nucleic Acids Research . 40 (D1): D1178– D1186. doi : 10.1093/nar/gkr944 . PMC 3245001. PMID 22110026 .  
  13. "Base de datos del genoma de Saccharomyces | SGD" . www.yeastgenome.org . Consultado el 4 de septiembre de 2018 .
  14. Grant D, Nelson RT, Cannon SB, Shoemaker RC (enero de 2010). "SoyBase, la base de datos de genética y genómica de la soja del USDA-ARS" . Nucleic Acids Research . 38 (número especial sobre bases de datos): D843-6. doi : 10.1093/nar/gkp798 . PMC 2808871. PMID 20008513 .  
  15. "IRESbase" .
  16. 1 2 Chen C, Huang H, Wu CH (2017). "Bases de datos y recursos de bioinformática de proteínas". En Wu CH, Arighi CN, Ross KE (eds.). Bioinformática de proteínas . Métodos en biología molecular. Vol. 1558. Nueva York, NY: Springer New York. pp. 3–39 . doi : 10.1007/978-1-4939-6783-4_1 . ISBN   978-1-4939-6781-0. PMC 5506686 . PMID 28150231 .  
  17. Karnkowska, Anna; Treitli, Sebastián C.; Brzoň, Ondřej; Novák, Lukáš; Vacek, Vojtěch; Soukal, Petr; Barlow, Lael D.; Herman, Emily K.; Pipaliya, Shweta V.; Panek, Tomaš; Žihala, David; Petrželková, Romana; Butenko, Anzhelika; Eme, Laura; Escaleras, Courtney W.; Roger, Andrés J.; Eliaš, Marek; Dacks, Joel B.; Hampl, Vladimir (2019). "El genoma de Oxymonad muestra complejidad eucariótica canónica en ausencia de una mitocondria" . Biología Molecular y Evolución . 36 (10): 2292– 2312. doi : 10.1093/molbev/msz147 . PMC 6759080 . PMID 31387118 .  
  18. ^ Keshava Prasad, TS; Goel, R.; Kandasamy, K.; Keerthikumar, S.; Kumar, S.; Mathivanan, S.; Telikicherla, D.; Raju, R.; Shafreen, B.; Venugopal, A.; Balakrishnan, L.; Marimuthu, A.; Banerjee, S.; Somanathan, DS; Sebastián, A.; Rani, S.; Rayo, S.; Harrys Kishore, CJ; Kanth, S.; Ahmed, M.; Kashyap, MK; Mohmood, R.; Ramachandra, YL; Krishna, V.; Rahiman, Licenciatura en Letras; Mohán, S.; Ranganathan, P.; Ramabadrán, S.; Chaerkadi, R.; Pandey, A. (2008). "Base de datos de referencia de proteínas humanas: actualización de 2009" . Investigación de ácidos nucleicos . 37 (Número de base de datos): D767– D772. doi : 10.1093/nar/gkn892 . PMC 2686490 . PMID 18988627 .  
  19. Mir S, Alhroub Y, Anyango S, Armstrong DR, Berrisford JM, Clark AR, et al. (enero de 2018). "PDBe: hacia una infraestructura de entrega de datos reutilizable en el banco de datos de proteínas en Europa" . Nucleic Acids Research . 46 (D1): D486– D492. doi : 10.1093 / nar/gkx1070 . PMC 5753225. PMID 29126160 .   
  20. Kinjo AR, Bekker GJ, Suzuki H, Tsuchiya Y, Kawabata T, Ikegawa Y, Nakamura H (enero de 2017). "Protein Data Bank Japan (PDBj): interfaces de usuario actualizadas, marco de descripción de recursos, herramientas de análisis para estructuras grandes" . Nucleic Acids Research . 45 (D1): D282– D288. doi : 10.1093/nar/gkw962 . PMC 5210648. PMID 27789697 .  
  21. Rose PW, Prlić A, Altunkaya A, Bi C, Bradley AR, Christie CH, et al. (enero de 2017). " El banco de datos de proteínas RCSB: visión integradora de la información estructural de proteínas, genes y 3D" . Nucleic Acids Research . 45 (D1): D271– D281. doi : 10.1093/nar/gkw1000 . PMC 5210513. PMID 27794042 .   
  22. ^ Hermjakob H, Montecchi-Palazzi L, Lewington C, Mudali S, Kerrien S, Orchard S, et al. (Enero de 2004). "IntAct: una base de datos de interacción molecular de código abierto" . Investigación de ácidos nucleicos . 32 (Problema de base de datos): D452-5. doi : 10.1093/nar/gkh052 . PMC 308786 . PMID 14681455 .   
  23. 1 2 Ellenberg J, Swedlow JR, Barlow M, Cook CE, Sarkans U, Patwardhan A, et al. (noviembre de 2018). "Un llamado a los archivos públicos de datos de imágenes biológicas" . Nature Methods . 15 (11): 849– 854. doi : 10.1038/s41592-018-0195-8 . PMC 6884425. PMID 30377375 .   
  24. Tendler BC, Hanayik T, Ansorge O, Bangerter-Christensen S, Berns GS, Bertelsen MF, et al. (marzo de 2022). "El Banco Digital de Cerebros, una plataforma de acceso abierto para conjuntos de datos de imágenes post mortem" . eLife . 11 e73153. doi : 10.7554/eLife.73153 . PMC 9042233. PMID 35297760 .   
  25. Iudin A, Korir PK, Salavert-Torres J, Kleywegt GJ, Patwardhan A (mayo de 2016). "EMPIAR: un archivo público para datos brutos de imágenes de microscopía electrónica". Nature Methods . 13 (5): 387– 388. doi : 10.1038/nmeth.3806 . PMID 27067018. S2CID 38996040 .  
  26. Starruß J, de Back W, Brusch L, Deutsch A (enero de 2014). "Morpheus: un entorno de modelado fácil de usar para la biología de sistemas multicelulares y multiescala" . Bioinformatics . 30 ( 9): 1331– 1332. doi : 10.1093/bioinformatics/btt772 . PMC 3998129. PMID 24443380 .  
  27. Crickmore, N.; Berry, C.; Panneerselvam, S.; Mishra, R.; Connor, TR; Bonning, BC (noviembre de 2021). "Una nomenclatura basada en la estructura para Bacillus thuringiensis y otras proteínas pesticidas derivadas de bacterias" . Journal of Invertebrate Pathology . 186 (D1) 107438. Bibcode : 2021JInvP.18607438C . doi : 10.1016/j.jip.2020.107438 . PMID 32652083 . 
  28. Panneerselvam S; Mishra R; Berry C; Crickmore N; Bonning BC (2022). "Base de datos BPPRC: una herramienta web para acceder y analizar proteínas pesticidas bacterianas" . Database (Oxford) . 186 (D1): 107438. doi : 10.1093/database/baac022 . PMC 9216523. PMID 35396594 .  
  29. Hounkpe BW, Chenou F, de Lima F, De Paula EV (enero de 2021). "Base de datos HRT Atlas v1.0: redefiniendo genes de mantenimiento celular humanos y de ratón y transcripciones de referencia candidatas mediante la minería de conjuntos de datos masivos de RNA-seq" . Nucleic Acids Research . 49 (D1): D947– D955. doi : 10.1093/nar/gkaa609 . PMC 7778946. PMID 32663312 .  
  30. Portal de datos (IHEC)
  31. CEAHRC
  32. Plano
  33. EGA
  34. PROFUNDO
  35. CREST
  36. "Compartiendo epigenomas globalmente" . Nature Methods . 15 (3): 151. 2018. doi : 10.1038/nmeth.4630 . ISSN 1548-7105 . 
  37. Valverde H, Cantón FR, Aledo JC (noviembre de 2019). "MetOSite: un recurso integrado para el estudio de la sulfoxidación de residuos de metionina" . Bioinformatics . 35 ( 22): 4849– 4850. doi : 10.1093/bioinformatics/btz462 . PMC 6853639. PMID 31197322 .  
  • Colección de bases de datos de biología molecular para la investigación de ácidos nucleicos : más de 1600 bases de datos.
  1. Recursos de la base de datos del Centro Nacional de Información Biotecnológica en la plataforma de investigación académica de Oxford University Press (OUP).