Un formato de archivo químico es un tipo de archivo de datos que se utiliza específicamente para representar datos moleculares. Uno de los más utilizados es el formato de archivo de tabla química , similar a los archivos SDF ( Formato de Datos Estructurales ) . Son archivos de texto que representan múltiples registros de estructuras químicas y campos de datos asociados. El formato de archivo XYZ es un formato sencillo que generalmente muestra el número de átomos en la primera línea, un comentario en la segunda, seguido de varias líneas con símbolos atómicos (o números atómicos) y coordenadas cartesianas. El formato Protein Data Bank se utiliza comúnmente para proteínas, pero también para otros tipos de moléculas. Existen muchos otros formatos que se detallan a continuación. Hay varios sistemas de software disponibles para convertir de un formato a otro.
Formatos distintivos
La información química se suele proporcionar en forma de archivos o flujos de datos , y se han creado muchos formatos con distintos grados de documentación. El formato se indica de tres maneras:
- extensión de archivo (generalmente 3 letras). Esto es ampliamente utilizado, pero frágil ya que muchos sistemas, incluidos los no químicos, utilizan sufijos comunes como
.moly ..dat - Archivos autodescriptivos donde la información de formato está incluida en el archivo. Ejemplos de ello son CIF y CML.
- Tipo MIME químico añadido por un servidor con capacidad química. (véase § El proyecto Chemical MIME )
Lenguaje de marcado químico
El Lenguaje de Marcado Químico (CML) es un estándar abierto para representar datos moleculares y otros datos químicos. El proyecto de código abierto incluye XML Schema, código fuente para analizar y trabajar con datos CML, y una comunidad activa. Los artículos «Herramientas para trabajar con el Lenguaje de Marcado Químico» y «XML para Química y Biociencias» abordan CML con mayor detalle. Numerosas herramientas, como JChemPaint , Jmol , XDrawChem y MarvinView, aceptan archivos de datos CML.
Formatos que solo permiten conectividad
Los formatos químicos más sencillos se centran en describir la conectividad de los átomos (y a veces su estereoquímica). Incluyen:
InChI
InChI es un formato estándar de la IUPAC para describir moléculas. Varias cadenas InChI se pueden combinar para formar un "RInChI" que describe una reacción química, o un "MInChI" que describe una mezcla.
SONRISAS
El sistema simplificado de entrada lineal molecular , o SMILES, [ 1 ] es una notación lineal para moléculas. Las cadenas SMILES incluyen conectividad, pero no incluyen coordenadas 2D o 3D.
Los átomos de hidrógeno no están representados. Los demás átomos están representados por sus símbolos de elementos B, C, N, O, F, P, S, Cl, Br, y I. El símbolo =representa enlaces dobles y #representa enlaces triples. La ramificación se indica con ( ). Los anillos se indican con pares de dígitos.
Algunos ejemplos son
Se pueden combinar varias cadenas SMILES para formar una "SMILES de reacción", que describe una reacción química.
Notación de líneas SYBYL
La notación de líneas SYBYL (SLN) es una notación química lineal. Basada en SMILES, incorpora una sintaxis completa para especificar la estereoquímica relativa. SLN cuenta con una sintaxis de consulta avanzada que permite especificar consultas de estructuras de Markush . La sintaxis también admite la especificación de bibliotecas combinatorias de ChemDraw.
Formatos de coordenadas
Algunos formatos químicos describen las coordenadas de los átomos. Esto es importante para
- conocer la estructura 3D de las moléculas y simular su comportamiento.
- mantener el diseño de los dibujos de moléculas en 2D
Formatos de tablas químicas
Uno de los estándares industriales más utilizados son los formatos de archivo de tablas químicas . Se trata de archivos de texto que siguen un formato estricto para representar múltiples registros de estructuras químicas y campos de datos asociados. El formato fue desarrollado y publicado originalmente por Molecular Design Limited (MDL). Esta familia incluye el archivo MOLfile, el archivo SDfile (Formato de Datos Estructurales, archivo MOLfile con metadatos), el archivo RXNfile (varios archivos MOLfile combinados para describir una reacción química) y el archivo RDfile (archivo RXNfile con metadatos). [ 2 ]
Formato del banco de datos de proteínas
El formato Protein Data Bank es un formato obsoleto para estructuras de proteínas desarrollado en 1972. [ 3 ] Es un formato de ancho fijo y, por lo tanto, limitado a un número máximo de átomos, residuos y cadenas; esto resultó en la división de estructuras muy grandes como los ribosomas en múltiples archivos. Por ejemplo, el 70S de E. coli estaba representado como 4 archivos PDB en 2009: 3I1M Archivado el 5 de octubre de 2016 en Wayback Machine , 3I1N Archivado el 16 de octubre de 2016 en Wayback Machine , 3I1O y 3I1P. En 2014, se consolidaron en un solo archivo, 4V6C .
Algunos archivos PDB contenían una sección opcional que describía la conectividad de los átomos, así como su posición. Debido a que estos archivos a veces se usaban para describir ensamblajes macromoleculares o moléculas representadas en disolvente explícito , podían llegar a ser muy grandes y a menudo se comprimían. Algunas herramientas, como Jmol y KiNG, [ 4 ] podían leer archivos PDB en formato gzip. El wwPDB mantenía las especificaciones del formato de archivo PDB y su alternativa XML, PDBML. Hubo un cambio bastante importante en la especificación del formato PDB (a la versión 3.0) en agosto de 2007, y una corrección de muchos problemas de archivos en la base de datos existente. [ 5 ] La extensión de archivo típica para un archivo PDB era .pdb, aunque algunos archivos más antiguos usaban .ento .brk. Algunas herramientas de modelado molecular escribían archivos de estilo PDB no estándar que adaptaban el formato básico a sus propias necesidades.
Formato GROMACS
La familia de formatos de archivo GROMACS se creó para su uso con el paquete de software de simulación molecular GROMACS . Se asemeja mucho al formato PDB, pero fue diseñado para almacenar la salida de simulaciones de dinámica molecular , por lo que permite una mayor precisión numérica y, opcionalmente, conserva información sobre la velocidad de las partículas , así como su posición en un punto dado de la trayectoria de la simulación. No permite almacenar información de conectividad, que en GROMACS se obtiene de archivos separados de topología de moléculas y sistemas. La extensión de archivo típica para un archivo GROMACS es .gro.
Formato CHARMM
El paquete de dinámica molecular CHARMM [ 6 ] puede leer y escribir varios formatos de archivo químicos y bioquímicos estándar; sin embargo, los formatos CARD (coordenadas) y PSF ( archivo de estructura de proteína ) son en gran medida exclusivos de CHARMM. El formato CARD tiene un ancho de columna fijo, se asemeja al formato PDB y se utiliza exclusivamente para almacenar coordenadas atómicas. El archivo PSF contiene información de conectividad atómica (que describe los enlaces atómicos) y es necesario antes de comenzar una simulación. Las extensiones de archivo típicas utilizadas son .crdy .psfrespectivamente.
formato mmCIF
En 2014, el formato PDB fue reemplazado oficialmente por mmCIF . mmCIF es un nuevo formato de texto para representar coordenadas atómicas y "ensamblajes biológicos", es decir, ensamblajes de moléculas. Puede expresar información que el formato PDB no puede, por lo que algunas estructuras PDB más recientes podrían no tener archivos PDB disponibles (pero se puede descargar un archivo que contiene archivos PDB extraídos del archivo mmCIF principal).
También existe una variante XML más detallada.
formato GSD
El formato de archivo de datos de simulación general (GSD) se creó para la lectura y escritura eficiente de simulaciones de partículas genéricas, principalmente (aunque no exclusivamente) las de HOOMD-blue . El paquete también incluye un módulo de Python que lee y escribe archivos gsd con esquema HOOMD mediante una sintaxis fácil de usar.
formato de archivo Ghemical
El software Ghemical puede usar OpenBabel para importar y exportar varios formatos de archivo. Sin embargo, por defecto, usa el formato GPR. Este archivo se compone de varias partes, separadas por una etiqueta ( !Header, !Info, !Atoms, !Bonds, !Coord, !PartialChargesy !End).
XYZ
El formato de archivo XYZ es un formato sencillo que normalmente indica el número de átomos en la primera línea, un comentario en la segunda, seguido de varias líneas con símbolos atómicos (o números atómicos) y coordenadas cartesianas.
Otros formatos comunes
PubChem ofrece la opción de exportar datos en formatos SDF, JSON, XML y ASNT/B.
Referencias de bases de datos
Estos "formatos" son referencias a entradas en bases de datos específicas. Algunos ejemplos son:
- ElEl número MDL contiene un número de identificación único para cada reacción y variación. El formato es RXXXnnnnnnnn. R indica una reacción, XXX indica la base de datos que contiene el registro de la reacción. La parte numérica, nnnnnnnn, es un número de 8 dígitos.
- ElInChIKey se deriva de hashes criptográficos de partes de un InChI. El mismo InChI siempre produce la misma clave.
- PubChem, ChEBI, KEGG, etc., tienen cada uno números de entrada numéricos.
Formatos de contenedor
Estos formatos encapsulan otros formatos.
Mixfile
El formato Mixfile es un formato basado en JSON para describir mezclas. [ 7 ]
El proyecto Chemical MIME
Al igual que las extensiones de archivo se utilizan para distinguir los tipos de archivo en las carpetas, los tipos MIME se utilizan para distinguir los tipos de flujo de datos en Internet. "Chemical MIME" es un proyecto que propone tipos MIME para flujos químicos.
Este proyecto comenzó en enero de 1994 y se anunció por primera vez durante el taller de Química de la Primera Conferencia Internacional WWW, celebrada en el CERN en mayo de 1994. ... La primera versión de un borrador de Internet se publicó entre mayo y octubre de 1994, y la segunda versión revisada entre abril y septiembre de 1995. Un documento presentado al CPEP (Comité de Publicaciones Impresas y Electrónicas) en la reunión de la IUPAC en agosto de 1996 está disponible para su discusión. [ 8 ]
En 1998, el trabajo fue publicado formalmente en el JCIM . [ 9 ]
Apoyo
Para Linux/Unix, los archivos de configuración están disponibles como un paquete " chemical-mime-data " en formatos .deb , RPM y tar.gz para registrar tipos MIME químicos en un servidor web. [ 10 ] [ 11 ] Los programas pueden registrarse como visor, editor o procesador para estos formatos, de modo que esté disponible la compatibilidad total con los tipos MIME químicos.
Conversión entre formatos
OpenBabel y JOELib son herramientas de código abierto disponibles gratuitamente, diseñadas específicamente para la conversión entre formatos de archivo. Sus sistemas expertos en química admiten extensas tablas de conversión de tipos de átomos.
obabel -i input_formatinput_file -o output_formatoutput_file
Por ejemplo, para convertir el archivo epinephrine.sdf en SDF a CML, utilice el comando
obabel -i sdf epinephrine.sdf -o cml epinephrine.cml
El archivo resultante es epinephrine.cml.
IOData es una biblioteca de Python gratuita y de código abierto para analizar, almacenar y convertir diversos formatos de archivo comúnmente utilizados por programas de química cuántica, dinámica molecular y teoría funcional de la densidad de ondas planas. También ofrece un marco flexible para generar archivos de entrada para diversos paquetes de software. Para obtener una lista completa de los formatos compatibles, visite https://iodata.readthedocs.io/en/latest/formats.html .
Varias herramientas destinadas a la visualización y edición de estructuras moleculares pueden leer archivos en diversos formatos y escribirlos en otros. Las herramientas JChemPaint (basada en Chemistry Development Kit ), XDrawChem (basada en OpenBabel ), Chime , Jmol , Mol2mol [ 12 ] y Discovery Studio entran en esta categoría.
Fuentes de datos químicos
Aquí encontrará una breve lista de fuentes de datos moleculares de acceso libre. Existen muchos más recursos en internet de los que se mencionan aquí. Los enlaces a estas fuentes se incluyen en las referencias a continuación.
Moléculas pequeñas:
- La base de datos PubChem del Instituto Nacional de Salud de EE. UU. es una enorme fuente de datos químicos. Todas las entradas contienen datos bidimensionales, y algunas disponen de datos de conformaciones tridimensionales. Los datos incluyen los formatos SDF, SMILES, InChI, PubChem XML y PubChem ASN1.
- eMolecules es una base de datos comercial de datos moleculares. Los datos incluyen un diagrama de estructura bidimensional y una cadena SMILE para cada compuesto. eMolecules permite realizar búsquedas rápidas de subestructuras basadas en partes de la estructura molecular.
- ChemExper es una base de datos comercial de información molecular. Los resultados de la búsqueda incluyen un diagrama de estructura bidimensional y un archivo molar para muchos compuestos.
- Biblioteca de Estructuras Moleculares Tridimensionales de la Universidad de Nueva York .
- La Red de Bases de Datos de Toxicidad Distribuida con Búsqueda de Estructura (DSSTox, por sus siglas en inglés) de la Agencia de Protección Ambiental de los Estados Unidos ( EPA, por sus siglas en inglés) es un proyecto del Programa de Toxicología Computacional de la EPA. Esta base de datos proporciona archivos moleculares SDF centrados en sustancias cancerígenas y otras sustancias tóxicas.
Macromoléculas:
- El Banco Mundial de Datos de Proteínas ( wwPDB ) [ 13 ] es una excelente fuente de datos de coordenadas moleculares de proteínas y ácidos nucleicos. Los datos son tridimensionales y se proporcionan en formato PDB (Protein Data Bank).
- Las bases de datos para la predicción de estructuras de proteínas y ácidos nucleicos, como AlphaFold Protein Structure Database y Swiss-Model, también ofrecen la descarga en formato PDB.
Véase también
- Formato de archivo
- OpenBabel , JOELib , OELib
- Kit de desarrollo químico
- Lenguaje de marcado químico
- Software para modelado molecular
- Solucionador de identificadores químicos NCI/CADD
Referencias
- ↑ Weininger, David (1988). "SMILES, un sistema de información y lenguaje químico: 1: Introducción a la metodología y las reglas de codificación". Journal of Chemical Information and Modeling . 28 (1): 31– 36. doi : 10.1021/ci00057a005 . S2CID 5445756 .
- ↑ Sistemas de Información MDL 2005
- ↑ wwPDB.org. "wwPDB: Formato de archivo" . www.wwpdb.org . Consultado el 13 de junio de 2024 .
- ↑ Chen, VB; et al. (2009). "KING (Kinemage, Next Generation): Un programa versátil e interactivo de visualización molecular y científica" . Protein Science . 18 (11): 2403– 2409. doi : 10.1002/pro.250 . PMC 2788294. PMID 19768809 .
- ↑ Henrick, K.; et al. (2008). "Remediación del archivo del banco de datos de proteínas" . Nucleic Acids Research . 36 (número especial sobre bases de datos): D426– D433. doi : 10.1093/nar/gkm937 . PMC 2238854. PMID 18073189 .
- ↑ Brooks, BM; et al. (1983). "CHARMM: Un programa para cálculos de energía, minimización y dinámica macromolecular". J. Comput. Chem . 4 (2): 187– 217. doi : 10.1002/jcc.540040211 . S2CID 91559650 .
- ↑ Clark, Alex M.; McEwen, Leah R.; Gedeck, Peter; Bunin, Barry A. (diciembre de 2019). "Captura de la composición de mezclas: un formato abierto legible por máquina para representar sustancias mixtas" . Journal of Cheminformatics . 11 (1). doi : 10.1186/s13321-019-0357-4 . PMC 6533230 .
- ↑ Página principal de Chemical MIME (consultada el 24 de enero de 2013)
- ↑ Rzepa, HS; Murray-Rust, P.; Whitaker, BJ (1998). "La aplicación de los estándares de Internet Chemical Multipurpose Internet Mail Extensions (Chemical MIME) al correo electrónico y al intercambio de información en la World Wide Web". Journal of Chemical Information and Modeling . 38 (6): 976. doi : 10.1021/ci9803233 .
- ↑ "Resultados de la búsqueda de paquetes para "chemical-mime" | Debian" .
- ↑ "¿Por qué usar SourceForge? Características y beneficios" .
- ↑ Página principal de Mol2mol
- ↑ Berman, HM; et al. (2003). "Anuncio del banco mundial de datos de proteínas" . Nature Structural Biology . 10 (12): 980. doi : 10.1038/nsb1203-980 . PMID 14634627 .
Enlaces externos
- MDL Information Systems (junio de 2005), Formatos de archivos CTFile (PDF) , San Leandro, California, Estados Unidos: MDL Information Systems , archivado del original (PDF) el 30 de junio de 2007.
- "Resolver un identificador de estructura como SDF, CML, MRV, PDB" . NCI . NIH : CADD Group Chemoinformatics Tools and User Services (CACTUS). Julio de 2009.
- formatos de archivos químicos