Articulo de referencia

Base de datos química

Una base de datos química es una base de datos diseñada específicamente para almacenar información química . Esta información abarca estructuras químicas y cristalinas , espectr...

Una base de datos química es una base de datos diseñada específicamente para almacenar información química . Esta información abarca estructuras químicas y cristalinas , espectros, reacciones y síntesis, y datos termofísicos .

Tipos de bases de datos químicas

base de datos de bioactividad

Las bases de datos de bioactividad correlacionan estructuras u otra información química con los resultados de bioactividad obtenidos de bioensayos en la literatura, patentes y programas de cribado.

Estructuras químicas

Las estructuras químicas se representan tradicionalmente mediante líneas que indican los enlaces químicos entre átomos y se dibujan en papel ( fórmulas estructurales 2D ). Si bien estas son representaciones visuales ideales para el químico , no son adecuadas para el uso computacional, especialmente para la búsqueda y el almacenamiento . Las moléculas pequeñas (también llamadas ligandos en aplicaciones de diseño de fármacos) se representan generalmente mediante listas de átomos y sus conexiones. Sin embargo, las moléculas grandes, como las proteínas, se representan de forma más compacta mediante las secuencias de sus aminoácidos. También se representan los isótopos radiactivos, lo cual es un atributo importante para algunas aplicaciones. Se espera que las grandes bases de datos químicas de estructuras gestionen el almacenamiento y la búsqueda de información sobre millones de moléculas, ocupando terabytes de memoria física. [ 6 ] [ 7 ]

Base de datos de literatura

Las bases de datos de literatura química correlacionan estructuras u otra información química con referencias relevantes, como artículos académicos o patentes. Este tipo de bases de datos incluye STN , Scifinder y Reaxys . Muchas bases de datos centradas en la caracterización química también incluyen enlaces a literatura.

Base de datos cristalográfica

Las bases de datos cristalográficas almacenan datos de estructuras cristalinas obtenidas mediante rayos X. Algunos ejemplos comunes son el Protein Data Bank y la Cambridge Structural Database .

base de datos de espectros de RMN

Las bases de datos de espectros de RMN correlacionan la estructura química con los datos de RMN. Estas bases de datos suelen incluir otros datos de caracterización, como espectroscopia FTIR y espectrometría de masas .

Base de datos de reacciones

La mayoría de las bases de datos químicas almacenan información sobre moléculas estables , pero en las bases de datos de reacciones también se almacenan intermedios y moléculas inestables creadas temporalmente. Las bases de datos de reacciones contienen información sobre productos, reactivos y mecanismos de reacción .

Un ejemplo popular que enumera datos de reacciones químicas , entre otros, sería la base de datos Beilstein , Reaxys.

Base de datos termofísica

Los datos termofísicos son información sobre

Representación de la estructura química

Existen dos técnicas principales para representar estructuras químicas en bases de datos digitales.

Estos métodos se han perfeccionado para permitir la representación de diferencias estereoquímicas y cargas, así como de tipos especiales de enlaces, como los que se observan en los compuestos organometálicos . La principal ventaja de una representación computacional es la posibilidad de aumentar la capacidad de almacenamiento y realizar búsquedas rápidas y flexibles.

Infraestructura

El fármaco lenalidomida contiene subestructuras de isoindolina (rojo) y glutarimida (azul).

Los químicos pueden buscar en bases de datos utilizando partes de estructuras, partes de sus nombres IUPAC , así como basándose en restricciones de propiedades. Las bases de datos químicas se diferencian de otras bases de datos de propósito general por su compatibilidad con la búsqueda de subestructuras, un método para recuperar compuestos químicos que coinciden con un patrón de átomos y enlaces especificado por el usuario. Este tipo de búsqueda se logra mediante la búsqueda de isomorfismo de subgrafos (a veces también llamado monomorfismo ) y es una aplicación ampliamente estudiada de la teoría de grafos . [ 8 ] [ 9 ] [ 10 ]

Las estructuras de consulta pueden contener patrones de enlace como "simple/aromático" o "cualquiera" para brindar flexibilidad. De manera similar, los vértices que en un compuesto real serían un átomo específico pueden reemplazarse con una lista de átomos en la consulta. La isomería cis - trans en los enlaces dobles se contempla ofreciendo la opción de recuperar solo la forma E , la forma Z o ambas. [ 8 ] [ 11 ]

Conformación

La búsqueda mediante la coincidencia de la conformación 3D de las moléculas o mediante la especificación de restricciones espaciales es otra característica particularmente útil en el diseño de fármacos . Las búsquedas de este tipo pueden ser computacionalmente muy costosas. Se han propuesto muchos métodos aproximados, por ejemplo BCUTS , [ 12 ] [ 13 ] [ 14 ] representaciones de funciones especiales, momentos de inercia , histogramas de trazado de rayos , histogramas de distancia máxima, multipolos de forma , por nombrar algunos. [ 15 ] [ 16 ] [ 17 ] [ 18 ] [ 19 ]

Ejemplos

Grandes bases de datos, como PubChem [ 11 ] [ 20 ] y ChemSpider [ 21 ], cuentan con interfaces gráficas para la búsqueda. El Chemical Abstracts Service proporciona herramientas para buscar en la literatura química, y Reaxys, de Elsevier, abarca información sobre productos químicos y reacciones, incluyendo la que originalmente se encontraba en la base de datos Beilstein [ 22 ] . PATENTSCOPE permite acceder a las patentes químicas por subestructura [ 23 ] , y los artículos de Wikipedia que describen productos químicos individuales también pueden buscarse de esta manera [ 24 ] .

Los proveedores de productos químicos, ya sea como intermedios de síntesis o para cribado de alto rendimiento, suelen ofrecer interfaces de búsqueda. Actualmente, la base de datos más grande a la que el público puede acceder libremente es la base de datos ZINC , que afirma contener más de 37 mil millones de moléculas disponibles comercialmente. [ 25 ] [ 26 ]

Descriptores

Todas las propiedades de las moléculas, más allá de su estructura, pueden dividirse en atributos fisicoquímicos o farmacológicos, también llamados descriptores. Además, existen diversos sistemas de nomenclatura artificiales y más o menos estandarizados para las moléculas, que proporcionan nombres y sinónimos más o menos ambiguos .

  • El nombre IUPAC suele ser una buena opción para representar la estructura de una molécula en una cadena única y legible para humanos , aunque resulta engorroso para moléculas grandes. Sin embargo, no es una clave de base de datos ideal debido a la falta de estandarización : algunas estructuras pueden describirse con varios nombres IUPAC igualmente válidos, y puede ser difícil determinar si dos nombres son equivalentes.
  • Por otro lado, los nombres triviales abundan en homónimos y sinónimos y, por lo tanto, son una mala elección como clave definitoria de la base de datos .
  • Los sistemas que codifican directamente la estructura, como InChI y SMILES, no son ambiguos y son canónicamente canónicos, pero no son necesariamente lo suficientemente flexibles como para describir mezclas y conformaciones relativas.
  • Los números de secuencia asignados manualmente tras confirmar su unicidad son buenas claves primarias de la base de datos, pero no son descriptivos.

Si bien los descriptores fisicoquímicos como el peso molecular , la carga ( parcial ), la solubilidad , etc., se pueden calcular directamente a partir de la estructura de la molécula, los descriptores farmacológicos solo se pueden obtener indirectamente mediante estadísticas multivariantes complejas o resultados experimentales ( cribado , bioensayo ). Por razones de esfuerzo computacional, todos estos descriptores se pueden almacenar junto con la representación de la molécula, y generalmente se almacenan.

Semejanza

No existe una única definición de similitud molecular; sin embargo, el concepto puede definirse según la aplicación y a menudo se describe como el inverso de una medida de distancia en el espacio de descriptores. Dos moléculas podrían considerarse más similares, por ejemplo, si su diferencia de peso molecular es menor que la de otras moléculas. Se pueden combinar diversas medidas para obtener una medida de distancia multivariada. Las medidas de distancia suelen clasificarse en medidas euclidianas y no euclidianas, dependiendo de si se cumple la desigualdad triangular . La búsqueda de subestructuras basada en el Subgrafo Común Máximo ( MCS ) [ 27 ] (medida de similitud o distancia) también es muy común. El MCS también se utiliza para la detección de compuestos con potencial farmacológico mediante la identificación de moléculas que comparten un subgrafo común (subestructura). [ 28 ]

Las sustancias químicas en las bases de datos pueden agruparse en conjuntos de moléculas "similares" según sus similitudes. Se pueden aplicar enfoques de agrupamiento tanto jerárquicos como no jerárquicos a entidades químicas con múltiples atributos. Estos atributos o propiedades moleculares pueden determinarse empíricamente o derivarse computacionalmente . Uno de los enfoques de agrupamiento más populares es el algoritmo de Jarvis-Patrick . [ 29 ]

En los repositorios químicos con orientación farmacológica , la similitud se define generalmente en términos de los efectos biológicos de los compuestos ( ADME /tox), que a su vez pueden inferirse semiautomáticamente a partir de combinaciones similares de descriptores fisicoquímicos utilizando métodos QSAR .

Sistemas de registro

Los sistemas de bases de datos para mantener registros únicos de compuestos químicos se denominan sistemas de registro. Estos se utilizan con frecuencia para la indexación química, sistemas de patentes y bases de datos industriales.

Los sistemas de registro suelen garantizar la unicidad de la sustancia química representada en la base de datos mediante el uso de representaciones únicas. Al aplicar reglas de precedencia para la generación de notaciones en cadena, se pueden obtener representaciones de cadena únicas o canónicas , como las SMILES canónicas . Algunos sistemas de registro, como el sistema CAS, utilizan algoritmos para generar códigos hash únicos con el mismo objetivo.

Una diferencia clave entre un sistema de registro y una base de datos química simple radica en la capacidad de representar con precisión lo conocido, lo desconocido y lo parcialmente conocido. Por ejemplo, una base de datos química podría almacenar una molécula con estereoquímica no especificada, mientras que un sistema de registro químico requiere que el registrador especifique si la configuración estereoquímica es desconocida, una mezcla específica (conocida) o racémica . Cada una de estas configuraciones se consideraría un registro diferente en un sistema de registro químico.

Los sistemas de registro también preprocesan las moléculas para evitar tener en cuenta diferencias triviales, como las diferencias en los iones halógenos de los productos químicos.

Un ejemplo es el sistema de registro del Chemical Abstracts Service (CAS). Véase también el número de registro CAS .

Lista de cartuchos químicos

Lista de sistemas de registro de productos químicos

Basado en la web

Herramientas

Las representaciones computacionales suelen hacerse transparentes para los químicos mediante la visualización gráfica de los datos. La introducción de datos también se simplifica con el uso de editores de estructuras químicas. Estos editores convierten internamente los datos gráficos en representaciones computacionales.

También existen numerosos algoritmos para la interconversión de diversos formatos de representación. Una utilidad de código abierto para la conversión es OpenBabel . Estos algoritmos de búsqueda y conversión se implementan dentro del propio sistema de base de datos o, como es la tendencia actual, se implementan como componentes externos que se integran en sistemas de bases de datos relacionales estándar. Tanto los sistemas basados ​​en Oracle como en PostgreSQL utilizan tecnología de cartuchos que permite tipos de datos definidos por el usuario. Estos permiten al usuario realizar consultas SQL con condiciones de búsqueda química (por ejemplo, una consulta para buscar registros que tengan un anillo fenilo en su estructura representados como una cadena SMILES en una columna SMILESCOL podría ser

SELECCIONAR * DE CHEMTABLE DONDE SMILESCOL . CONTIENE ( 'c1ccccc1' )

Los algoritmos para la conversión de nombres IUPAC a representaciones estructurales y viceversa también se utilizan para extraer información estructural del texto . Sin embargo, existen dificultades debido a la existencia de múltiples dialectos de IUPAC. Se está trabajando para establecer un estándar IUPAC único (véase InChI ).

Véase también

Referencias

  1. "Página principal - ScrubChem" . scrubchem.org . Archivado del original el 26 de mayo de 2017.
  2. Harris, JB (2019). "Postprocesamiento de grandes conjuntos de datos de bioactividad". Bioinformática y descubrimiento de fármacos . Methods Mol Biol. Vol. 1939. pp. 37–47 . doi : 10.1007/978-1-4939-9089-4_3 . ISBN   978-1-4939-9088-7. PMID 30848455 . S2CID 73493315 .  
  3. "Base de datos ChEMBL" .
  4. «PubChem» . pubchem.ncbi.nlm.nih.gov .
  5. Wang, Y; Bryant, SH; Cheng, T; Wang, J; Gindulyte, A; Shoemaker, BA; Thiessen, PA; He, S; Zhang, J (2017). "PubChem BioAssay: actualización de 2017" . Nucleic Acids Res . 45 (D1): D955– D963. doi : 10.1093/nar/ gkw1118 . PMC 5210581. PMID 27899599 .  
  6. Hoffmann, Torsten; Gastreich, Marcus (2019). "El siguiente nivel en la navegación del espacio químico: yendo mucho más allá de las bibliotecas de compuestos enumerables" . Drug Discovery Today . 24 (5): 1148– 1156. doi : 10.1016/j.drudis.2019.02.013 . PMID 30851414 . 
  7. Sadybekov, Anastasiia V.; Katritch, Vsevolod (2023). "Enfoques computacionales que agilizan el descubrimiento de fármacos" . Nature . 616 (7958): 673– 685. Bibcode : 2023Natur.616..673S . doi : 10.1038/s41586-023-05905-z . PMID 37100941 . 
  8. 1 2 Currano, Judith N. (2014). «Capítulo 5. Búsqueda por estructura y subestructura». Información química para químicos . págs. 109–145 . doi : 10.1039/9781782620655-00109 . ISBN  978-1-84973-551-3.
  9. Ullmann, JR (1976). "Un algoritmo para el isomorfismo de subgrafos" . Journal of the ACM . 23 : 31–42 . doi : 10.1145/321921.321925 .
  10. Warr, Wendy A. (2011). "Representación de estructuras químicas". WIREs Computational Molecular Science . 1 (4): 557– 579. doi : 10.1002/wcms.36 .
  11. 1 2 "Búsqueda de estructura en PubChem" . pubchem.ncbi.nlm.nih.gov . Consultado el 1 de agosto de 2024 .
  12. Pearlman, RS; Smith, KM (1999). "Validación métrica y el concepto de subespacio relevante para el receptor". J. Chem. Inf. Comput. Sci . 39 : 28–35 . doi : 10.1021/ci980137x .
  13. "BCUTDescriptor (cdk 2.5 API)" . CDK - Chemistry Development Kit . 2021-05-05 . Consultado el 2024-06-04 .
  14. Burden, Frank R. (1 de agosto de 1989). "Número de identificación molecular para búsquedas de subestructuras". Journal of Chemical Information and Computer Sciences . 29 (3): 225– 227. doi : 10.1021/ci00063a011 .
  15. Pearlman, RS; Smith, KM (1999). "Validación métrica y el concepto de subespacio relevante para el receptor". J. Chem. Inf. Comput. Sci . 39 : 28–35 . doi : 10.1021/ci980137x .
  16. Lin, Jr., Hung; Clark, Timothy (2005). "Una descripción analítica, de resolución variable y completa de moléculas estáticas y sus propiedades de unión intermolecular". Journal of Chemical Information and Modeling . 45 (4): 1010– 1016. doi : 10.1021/ci050059v . PMID 16045295 . 
  17. Meek, PJ; Liu, Z.; Tian, ​​L.; Wang, C. J; Welsh, W. J; Zauhar, R. J (2006). "Shape Signatures: speeding up computer aided drug discovery". DDT 2006 . 19– 20 ( 19– 20): 895– 904. doi : 10.1016/j.drudis.2006.08.014 . PMID 16997139 . 
  18. Grant, J. A; Gallardo, MA; Pickup, BT (1996). "Un método rápido de comparación de formas moleculares: una aplicación simple de una descripción gaussiana de la forma molecular". Journal of Computational Chemistry . 17 (14): 1653– 1666. doi : 10.1002/(sici)1096-987x(19961115)17:14 < 1653::aid-jcc7 > 3.0.co ; 2-k . S2CID 96794688 . 
  19. Ballester, PJ; Richards, WG (2007). "Reconocimiento ultrarrápido de formas para la búsqueda de similitud en bases de datos moleculares". Proceedings of the Royal Society A . 463 (2081): 1307– 1321. Bibcode : 2007RSPSA.463.1307B . doi : 10.1098/rspa.2007.1823 . S2CID 12540483 . 
  20. Kim, Sunghwan (2021). "Explorando información química en PubChem" . Current Protocols . 1 (8) e217. doi : 10.1002/cpz1.217 . PMC 8363119. PMID 34370395 .  
  21. Williams, Antony J. (2010). «ChemSpider: Integración de recursos basados ​​en la estructura distribuidos a través de Internet». Mejora del aprendizaje con recursos en línea, redes sociales y bibliotecas digitales . Serie de simposios de la ACS. Vol. 1060. págs. 23–39 . doi : 10.1021/bk-2010-1060.ch002 . ISBN   978-0-8412-2600-5.
  22. Jarabak, Charlotte; Mutton, Troy; Ridley, Damon D. (2020). "Información sobre propiedades en registros de sustancias en las principales herramientas web de recuperación de datos e información química: comprensión del contenido, oportunidades de búsqueda y aplicación a la enseñanza". Journal of Chemical Education . 97 (5): 1345– 1359. Bibcode : 2020JChEd..97.1345J . doi : 10.1021/acs.jchemed.9b00966 .
  23. "Búsqueda de subestructuras ahora disponible en PATENTSCOPE" . www.wipo.int . 11 de febrero de 2019. Consultado el 4 de agosto de 2024 .
  24. Ertl, Peter; Patiny, Luc; Sander, Thomas; et al. (2015). "Wikipedia Chemical Structure Explorer: Búsqueda de subestructuras y similitudes de moléculas de Wikipedia" . Journal of Cheminformatics . 7 10. doi : 10.1186/s13321-015-0061-y . PMC 4374119. PMID 25815062 .   
  25. Tingle, Benjamin I.; Tang, Khanh G.; Castanon, Mar; Gutierrez, John J.; Khurelbaatar, Munkhzul; Dandarchuluun, Chinzorig; Moroz, Yurii S.; Irwin, John J. (2023). "ZINC-22: una base de datos gratuita a escala multimillonaria de compuestos tangibles para el descubrimiento de ligandos" . Journal of Chemical Information and Modeling . 63 (4): 1166– 1176. doi : 10.1021/acs.jcim.2c01253 . PMC 9976280. PMID 36790087 .  
  26. Warr, Wendy A.; Nicklaus, Marc C.; Nicolaou, Christos A.; Rarey, Matthias (2022). "Exploración de colecciones de compuestos ultragrandes para el descubrimiento de fármacos". Journal of Chemical Information and Modeling . 62 (9): 2021– 2034. doi : 10.1021/acs.jcim.2c00224 . PMID 35421301 . 
  27. Rahman, SA; Bashton, M.; Holliday, GL; Schrader, R.; Thornton, JM (2000). "Kit de herramientas del detector de subgrafos de moléculas pequeñas (SMSD)" . Journal of Cheminformatics . 1 (1): 12. doi : 10.1186/1758-2946-1-12 . PMC 2820491. PMID 20298518 .  
  28. Rahman, S. Asad; Bashton, M.; Holliday, GL; Schrader, R.; Thornton, JM (2009). " Small Molecule Subgraph Detector (SMSD) Toolkit" . Journal of Cheminformatics . 1 (1): 12. doi : 10.1186/1758-2946-1-12 . PMC 2820491. PMID 20298518 .  
  29. Butina, Darko (1999). "Agrupamiento de bases de datos no supervisado basado en la huella digital de Daylight y la similitud de Tanimoto: una forma rápida y automatizada de agrupar conjuntos de datos pequeños y grandes". Chem. Inf. Comput. Sci . 39 (4): 747– 750. doi : 10.1021/ci9803381 .
  30. «BIOVIA Direct - BIOVIA - Dassault Systèmes®» . 8 de septiembre de 2023.
  31. "JChem Engines | ChemAxon" .
  32. "Química – Cartucho Oracle | Inside Informatics" .
  33. Pavlov, D.; Rybalkin, M.; Karulin, B. (2010). "Bingo de SciTouch LLC: cartucho de química para base de datos Oracle" . Journal of Cheminformatics . 2 (Supl. 1): F1. doi : 10.1186/1758-2946-2-S1-F1 . PMC 2867114 . 
  34. "Software para el descubrimiento de fármacos de moléculas pequeñas" . Software para el descubrimiento de fármacos de moléculas pequeñas .
  35. «Registro Químico BIOVIA - BIOVIA - Dassault Systèmes®» . www.3ds.com . 7 de septiembre de 2023.
  36. "Registrarse" . Archivado del original el 10/12/2021 . Consultado el 13/03/2021 .
  37. "Scilligence RegMol | Scilligence" . 6 de junio de 2016. Archivado del original el 29 de septiembre de 2018.
  38. "Registro de compuestos" . chemaxon.com .
  39. "Cuaderno de señales - PerkinElmer Informatics" . perkinelmerinformatics.com .
  40. "Actualización de CDD Vault: CDD Vault ahora es un ELN" . 16 de febrero de 2018.
  41. "Cuaderno de laboratorio electrónico (ELN) de CDD" . 14 de agosto de 2019.
  42. "Cuadernos de laboratorio electrónicos: qué son (y por qué necesitas uno)" . 4 de agosto de 2019.
  43. "Reseña de SDF Pro de Adroit DI. Junio ​​de 2023 – Macs in Chemistry" . 5 de noviembre de 2023. Consultado el 11 de marzo de 2024 .
  44. "Página principal de Adroit DI" . adroitdi.com . Consultado el 10 de marzo de 2024 .
  45. "SDF Pro de Adroit DI: La solución rápida y asequible para almacenar, clasificar y manipular 10 millones de moléculas en segundos" . www.businesswire.com . 16 de mayo de 2023. Consultado el 10 de marzo de 2024 .
  46. "Lo mejor de lo mejor en registro de entidades" . 20Visioneers15 . Consultado el 10 de marzo de 2024 .

47. https://www.elsevier.com/en-in/products/reaxys

  • Explorador de Estructuras Químicas de Wikipedia para buscar artículos de química de Wikipedia por subestructura.