La base de datos de polimorfismos de un solo nucleótido [1] ( dbSNP ) es un archivo público gratuito para la variación genética dentro y entre diferentes especies desarrollado y alojado por el Centro Nacional de Información Biotecnológica (NCBI) en colaboración con el Instituto Nacional de Investigación del Genoma Humano (NHGRI). Aunque el nombre de la base de datos implica una colección de una sola clase de polimorfismos (es decir, polimorfismos de un solo nucleótido (SNP)), de hecho contiene una gama de variación molecular: (1) SNP , (2) polimorfismos de inserción y deleción cortos ( indels /DIP), (3) marcadores microsatélites o repeticiones cortas en tándem (STR), (4) polimorfismos multinucleótidos (MNP), (5) secuencias heterocigotas y (6) variantes con nombre. [2] La dbSNP acepta polimorfismos aparentemente neutrales, polimorfismos correspondientes a fenotipos conocidos y regiones sin variación. Se creó en septiembre de 1998 para complementar GenBank , la colección de secuencias de proteínas y ácidos nucleicos disponibles públicamente del NCBI. [2]
En 2017, NCBI dejó de brindar soporte para todos los organismos no humanos en dbSNP. [3] A partir de la versión 153 (publicada en agosto de 2019), dbSNP había acumulado casi 2 mil millones de presentaciones que representan más de 675 millones de variantes distintas para Homo sapiens .

Objetivo
dbSNP es un recurso en línea implementado para ayudar a los investigadores de biología . Su objetivo es actuar como una base de datos única que contenga toda la variación genética identificada, que se puede utilizar para investigar una amplia variedad de fenómenos naturales de base genética. Específicamente, el acceso a la variación molecular catalogada dentro de dbSNP ayuda a la investigación básica como el mapeo físico, la genética de poblaciones , las investigaciones sobre relaciones evolutivas, así como a la capacidad de cuantificar rápida y fácilmente la cantidad de variación en un sitio de interés determinado. Además, dbSNP guía la investigación aplicada en farmacogenómica y la asociación de la variación genética con los rasgos fenotípicos. [4] Según el sitio web del NCBI, "La inversión a largo plazo en una investigación tan novedosa y emocionante [dbSNP] promete no solo hacer avanzar la biología humana, sino revolucionar la práctica de la medicina moderna".
Envío
1. Fuente
Originalmente, dbSNP aceptaba presentaciones de cualquier organismo de una amplia variedad de fuentes, incluidos laboratorios de investigación individuales, esfuerzos colaborativos de descubrimiento de polimorfismos, centros de secuenciación genómica a gran escala, otras bases de datos de SNP (por ejemplo, el consorcio SNP, HapMap , etc.) y empresas privadas. [5] El 1 de septiembre de 2017, dbSNP dejó de aceptar presentaciones de datos de variantes no humanas y dos meses después, sus sitios web interactivos y los servicios relacionados del NCBI dejaron de presentar datos de variantes no humanas. Ahora dbSNP solo acepta y presenta datos de variantes humanas.
2. Tipos de registros
Cada variación enviada recibe un número de identificación de SNP enviado (“ss#”). [5] Este número de acceso es un identificador estable y único para esa presentación. Los registros de SNP únicos enviados también reciben un número de identificación de SNP de referencia (“rs#”; “grupo de SNP de referencia”). Sin embargo, es probable que se envíe más de un registro de una variación a dbSNP, especialmente en el caso de variaciones clínicamente relevantes. Para dar cabida a esto, dbSNP reúne rutinariamente registros de SNP enviados idénticos en un único registro de SNP de referencia, que también es un identificador único y estable (véase a continuación). [4]
3. Cómo enviar
Para enviar variaciones a dbSNP, primero se debe obtener un identificador de remitente, que identifica al laboratorio responsable del envío. [4] A continuación, se requiere que el autor complete un archivo de envío que contenga la información y los datos relevantes. Los registros enviados deben contener los diez datos esenciales que se enumeran en la siguiente tabla. [4] Otra información requerida para los envíos incluye información de contacto, información de publicación (título, revista, autores, año), tipo de molécula ( ADN genómico , ADNc , ADN mitocondrial , ADN de cloroplasto ) y organismo. [4]
Liberar
La nueva información obtenida por dbSNP se pone a disposición del público periódicamente en una serie de “builds” (es decir, revisiones y publicaciones de datos). [4] No hay un cronograma para publicar nuevas builds; en cambio, las builds se publican generalmente cuando hay una nueva build de genoma disponible, asumiendo que el genoma tiene alguna variación catalogada asociada con ella. [6] Esto ocurre aproximadamente cada 3 o 4 meses. Las secuencias del genoma se pueden mejorar con el tiempo, por lo que los SNP de referencia (“refSNP”) de builds anteriores, así como los nuevos SNP enviados, se vuelven a mapear a la secuencia del genoma recientemente disponible. Múltiples SNP enviados, si se asignan a la misma ubicación, se agrupan en un grupo refSNP y se les asigna un número de identificación de SNP de referencia. Sin embargo, si se encuentra que dos registros de grupo refSNP se asignan a la misma ubicación (es decir, son idénticos), dbSNP también fusionará esos registros. En este caso, el ID de número refSNP más pequeño (es decir, el registro más antiguo) ahora representaría ambos registros, y los ID de número refSNP más grandes quedarían obsoletos. Estos números de identificación de refSNP obsoletos no se vuelven a utilizar para nuevos registros. Cuando se produce una fusión de dos registros de refSNP, se realiza un seguimiento del cambio y los números de identificación de refSNP anteriores aún se pueden utilizar como consulta de búsqueda. Este proceso de fusión de registros idénticos reduce la redundancia dentro de dbSNP. [6]
Existen dos excepciones a los criterios de fusión anteriores. En primer lugar, no se fusionan las variaciones de clases diferentes (por ejemplo, un SNP y un DIP). En segundo lugar, los refSNP clínicamente importantes que se han citado en la literatura se denominan “preciosos”; nunca se realiza una fusión que eliminaría un refSNP de ese tipo, ya que podría causar confusión más adelante. [6]
Recuperación
1. Cómo hacerlo
El dbSNP se puede buscar utilizando la herramienta de búsqueda de SNP Entrez. Se puede utilizar una variedad de consultas para buscar: un ID de número de ss, un ID de número de refSNP, un nombre de gen, un método experimental, una clase de población, un detalle de población, una publicación, un marcador, un alelo, un cromosoma, una posición de base, un rango de heterocigosidad o un número de compilación. [6] [7] Además, se pueden recuperar muchos resultados simultáneamente utilizando consultas por lotes. [6] Las búsquedas devuelven los ID de número de refSNP que coinciden con el término de consulta y un resumen de la información disponible para ese grupo de refSNP.
2. Herramientas/Datos
La información disponible para un grupo de refSNP incluye la información básica de cada uno de los envíos individuales (ver “Envío”), así como la información disponible a partir de la combinación de los datos de múltiples envíos (por ejemplo, heterocigosidad, frecuencias genotípicas). Hay muchas herramientas disponibles para examinar un grupo de refSNP con mayor profundidad. La vista de mapa muestra la posición de la variación en el genoma y otras variaciones cercanas. Otra herramienta, la vista de genes, informa la ubicación de la variación dentro de un gen (si está en un gen), el codón antiguo y el nuevo, los aminoácidos codificados por ambos y si el cambio es sinónimo o no sinónimo. El visor de secuencias muestra la posición de la variante en relación con los intrones , exones y otras variantes distantes y cercanas. También está disponible el mapeo de la estructura en 3D, que muestra imágenes en 3D de la proteína codificada.
El dbSNP también está vinculado a muchos otros recursos del NCBI, incluidas las bases de datos de nucleótidos , proteínas , genes , taxonomía y estructura, así como PubMed , UniSTS, PMC , OMIM y UniGene.
3. Estado de validación
El estado de validación enumera las categorías de evidencia que respaldan una variante. Estas incluyen: (1) múltiples presentaciones independientes; (2) datos de frecuencia o genotipo; (3) confirmación del remitente; (4) observación de todos los alelos en al menos dos cromosomas; (5) genotipado por HapMap ; y (6) secuenciado en el Proyecto 1000 Genomas . [6]
Problemas con la calidad de los datos
La calidad de los datos encontrados en dbSNP ha sido cuestionada por muchos grupos de investigación, [8] [9] [10] [11] [12] [13] que sospechan altas tasas de falsos positivos debido a errores de genotipado y de llamada de bases. Estos errores pueden introducirse fácilmente en dbSNP si el remitente utiliza (1) alineaciones bioinformáticas acríticas de secuencias de ADN muy similares pero distintas, y/o (2) PCR con cebadores que no pueden discriminar entre secuencias de ADN similares pero distintas. [8] Mitchell et al. (2004) [9] revisaron cuatro estudios [10] [11] [12] [13] y concluyeron que dbSNP tiene una tasa de falsos positivos de entre el 15 y el 17 % para los SNP, y también que la frecuencia de alelos menores es superior al 10 % para aproximadamente el 80 % de los SNP que no son falsos positivos. De forma similar, Musemeci et al. (2010) [8] afirma que hasta un 8,32% de los SNP codificantes bialélicos en dbSNP son artefactos de secuencias de ADN altamente similares (es decir, genes paralógicos) y se refieren a estas entradas como diferencias de un solo nucleótido (SND). Las altas tasas de error en dbSNP pueden no ser sorprendentes: de los 23,7 millones de entradas refSNP para humanos, solo 14,5 millones han sido validadas, dejando los 9,2 millones restantes como SNP candidatos. Sin embargo, según Musemeci et al. (2010), [8] incluso el código de validación proporcionado en el registro refSNP es solo parcialmente útil: solo la validación HapMap redujo el número de SND (3% frente al 8%), pero solo aceptar este método elimina más de la mitad de los SNP reales en el dbSNP. Estos autores también señalan que una fuente de envíos del grupo Lee está plagada de errores: el 20% de estos envíos son SND (frente al 8% de los envíos). Sin embargo, como señalan los autores, ignorar todas estas presentaciones eliminaría muchos SNP reales.
Los errores en el dbSNP pueden obstaculizar los estudios de asociación de genes candidatos [14] y las investigaciones basadas en haplotipos . [15] Los errores también pueden aumentar las conclusiones falsas en los estudios de asociación: [8] aumentar el número de SNP que se prueban probando SNP falsos requiere más pruebas de hipótesis. Sin embargo, estos SNP falsos en realidad no pueden asociarse con rasgos, por lo que el nivel alfa disminuye más de lo necesario para una prueba rigurosa si solo se probaron los SNP verdaderos y la tasa de falsos negativos aumentará. Musemeci et al. (2010) [8] sugirieron que los autores de estudios de asociación negativa inspeccionaran sus estudios anteriores en busca de SNP falsos (SND), que podrían eliminarse del análisis.
Cómo citar datos de dbSNP
Se puede hacer referencia a las secuencias individuales por sus números de identificación de grupo refSNP (por ejemplo, rs206437). Se debe hacer referencia a dbSNP utilizando el artículo de Sherry et al. de 2001 : Sherry, ST, Ward, MH, Kholodov, M., Baker, J., Phan, L., Smigielski, EM, Sirotkin, K. (2001). dbSNP: la base de datos de variación genética del NCBI. Nucleic Acids Research, 29: 308-311. [5]
Véase también
- SNPedia
- Mapa Hap
- Instituto Nacional de Biología
- Instituto Nacional de Investigación Genética y Geología (NHGRI)
Referencias
- ^ Wheeler DL, Barrett T, Benson DA, et al. (enero de 2007). "Recursos de la base de datos del Centro Nacional de Información Biotecnológica". Nucleic Acids Res . 35 (número de la base de datos): D5–12. doi :10.1093/nar/gkl1031. PMC 1781113 . PMID 17170002.
- ^ ab Sherry ST, Ward M; Sirotkin, K. (1999). "dbSNP - base de datos para polimorfismos de un solo nucleótido y otras clases de variación genética menor". Genome Research . 9 (8): 677–679. doi : 10.1101/gr.9.8.677 . PMID 10447503. S2CID 10775908.
- ^ "Eliminación gradual del soporte para datos de organismos del genoma no humano en dbSNP y dbVar". 2017-05-09 . Consultado el 9 de julio de 2017 .
- ^ abcdef Kitts A; Sherry S (2009). "Base de datos de polimorfismos de un solo nucleótido (dbSNP) de variación de secuencias de nucleótidos". Centro Nacional de Información Biotecnológica (EE. UU.).
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ abc Sherry ST, Ward MH, Kholodov M, Baker J, Phan L, Smigielski EM, Sirotkin K, et al. (2001). "dbSNP: la base de datos de variación genética del NCBI". Nucleic Acids Res . 29 (1): 308–311. doi :10.1093/nar/29.1.308. PMC 29783 . PMID 11125122.
- ^ abcdef NCBI (2010). "Preguntas frecuentes sobre la base de datos de polimorfismos de un solo nucleótido (dbSNP)". Centro Nacional de Información Biotecnológica (EE. UU.).
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ Phillips, C (2007). "Recursos en línea para el análisis de SNP: una revisión y un mapa de ruta". Biotecnología molecular . 35 (1): 65–97. doi :10.1385/MB:35:1:65. PMID 17401150. S2CID 8569553.
- ^ abcdef Musemeci L, Arthur JW, Cheung FS, Hoque S, Lippman S, Reichardt JK, et al. (enero de 2010). "Las diferencias de un solo nucleótido (SND) en la base de datos dbSNP pueden conducir a errores en los estudios de genotipado y haplotipado". Human Mutation . 31 (1): 67–73. doi :10.1002/humu.21137. PMC 2797835 . PMID 19877174.
- ^ ab Mitchell AA, Zwick ME, Chakravarti A, Cutler DJ, et al. (2004). "Discrepancias en las tasas de confirmación de dbSNP y distribuciones de frecuencias de alelos a partir de diferentes tasas y patrones de error de genotipado". Bioinformática . 20 (7): 1022–1032. doi : 10.1093/bioinformatics/bth034 . PMID 14764571.
- ^ ab Carlson CS, Eberle MA, Rieder MJ, Smith JD, Kruglyak L, Nickerson DA, et al. (2003). "SNP adicionales y análisis de desequilibrio de ligamiento son necesarios para estudios de asociación de todo el genoma en humanos". Nature Genetics . 33 (4): 518–521. doi : 10.1038/ng1128 . PMID 12652300. S2CID 11640599.
- ^ ab Cutler DJ, Zwick ME, Carrasquillo MM, Yohn CT, Tobin KP, Kashuk C, Matthews DJ, Shah NA, Elchler EE, Warrington JA, Chakravarti A, et al. (2001). "Detección de variación de alto rendimiento y genotipado mediante microarreglos". Genome Research . 11 (11): 1913–1925. doi :10.1101/gr.197201. PMC 311146 . PMID 11691856.
- ^ ab Gabriel SB; Schaffner SF; Nguyen H; Moore JM; Roy J; Blumenstiel B; Higgins J; DeFelice M; Lochner A; Faggart M; Liu-Cordero SN; Rotimi C; Adeyemo A; Cooper R; Ward R; Lander ES; Daly MJ; Altshuler D; et al. (2003). "La estructura de los bloques de haplotipos en el genoma humano". Science . 296 (5576): 2225–2229. doi : 10.1126/science.1069424 . PMID 12029063. S2CID 10069634.
- ^ ab Reich DE, Gabriel SB, Altshuler D, et al. (2003). "Calidad y completitud de las bases de datos de SNP". Nature Genetics . 33 (4): 457–458. doi : 10.1038/ng1133 . PMID 12652301. S2CID 6303430.
- ^ Dvornyk V, Long JR, Xiong DH, Liu PY, Zhao LJ, Shen H, Zhang YY, Liu YJ, Rocha-Sancher S, Xiao P, Recker RR, Deng HW, et al. (2004). "Limitaciones actuales de los datos de SNP del dominio público para estudios de trastornos complejos: una prueba para diez genes candidatos para la obesidad y la osteoporosis". BMC Genetics . 5 : 4. doi : 10.1186/1471-2156-5-4 . PMC 395827 . PMID 15113403.
- ^ de Bakker PI; Yelensky R; Pe'er I; Gabriel SB; Daly MJ; Altshuler D; et al. (2005). "Eficiencia y potencia en los estudios de asociación genética". Nature Genetics . 37 (11): 1217–1223. doi :10.1038/ng1669. PMID 16244653. S2CID 15464860.
Enlaces externos
- Página de inicio de dbSNP
- [1] Cómo enviar a dbSNP