Articulo de referencia

ANNOVAR

ANNOVAR ( ANNOtate VARiation ) es una herramienta de software bioinformático para la interpretación y priorización de variantes de un solo nucleótido (SNV), inserciones , deleci...

ANNOVAR ( ANNOtate VARiation ) es una herramienta de software bioinformático para la interpretación y priorización de variantes de un solo nucleótido (SNV), inserciones , deleciones y variantes del número de copias (CNV) de un genoma determinado. [ 1 ]

Tiene la capacidad de anotar genomas humanos hg18, hg19, hg38 y genomas de organismos modelo como: ratón ( Mus musculus ), pez cebra ( Danio rerio ), mosca de la fruta ( Drosophila melanogaster ) , nematodo ( Caenorhabditis elegans ), levadura ( Saccharomyces cerevisiae ) y muchos otros. [ 2 ] Las anotaciones podrían usarse para determinar las consecuencias funcionales de las mutaciones en los genes y organismos, inferir bandas citogenéticas, informar puntuaciones de importancia funcional y/o encontrar variantes en regiones conservadas. [ 2 ] ANNOVAR junto con SNP effect ( SnpEFF ) y Variant Effect Predictor (VEP) son tres de las herramientas de anotación de variantes más utilizadas.

Fondo

El costo de la secuenciación de ADN de alto rendimiento se ha reducido drásticamente de alrededor de $100 millones/genoma humano en 2001 a alrededor de $1000/genoma humano en 2017. [ 3 ] Debido a este aumento en la accesibilidad, la secuenciación de ADN de alto rendimiento se ha vuelto más utilizada en entornos de investigación y clínicos. [ 4 ] [ 5 ] Algunas áreas comunes que utilizan ampliamente la secuenciación de ADN de alto rendimiento son: secuenciación del exoma completo , secuenciación del genoma completo (WGS) y estudios de asociación de genoma completo (GWAS) . [ 6 ] [ 7 ]

Existe un número creciente de herramientas disponibles que buscan gestionar, analizar e interpretar de forma integral la enorme cantidad de datos generados por la secuenciación de ADN de alto rendimiento. Se requiere que estas herramientas sean lo suficientemente eficientes y robustas para analizar un gran número de variantes (más de 3 millones en el genoma humano), a la vez que lo suficientemente sensibles para identificar variantes raras y clínicamente relevantes que probablemente sean dañinas/perjudiciales. [ 8 ] ANNOVAR fue desarrollado por Kai Wang en 2010 en el Centro de Genómica Aplicada del Hospital Infantil de Filadelfia . [ 1 ] Es un tipo de herramienta de anotación de variantes que recopila puntuaciones de predicción de variantes genéticas perjudiciales de programas como PolyPhen, ClinVar y CADD, y anota los SNV, inserciones, deleciones y CNV del genoma proporcionado. ANNOVAR es una de las primeras herramientas de anotación de variantes eficientes, configurables, extensibles y compatibles con múltiples plataformas creadas.

En el contexto del flujo de trabajo bioinformático general, ANNOVAR se ubica casi al final, después de que las lecturas de secuenciación de ADN, que incluyen secuencias mapeadas y alineadas, y las variantes predichas a partir de un archivo de alineación (BAM), se hayan identificado. Este proceso genera un archivo VCF , un archivo de texto tabulado con las variantes genéticas como filas. Este archivo se utiliza como entrada para el programa ANNOVAR, que se encarga de la anotación de variantes y proporciona interpretaciones de las variantes identificadas en el proceso bioinformático previo.

Tipos de anotación funcional de variantes genéticas

Anotación basada en genes

Este enfoque identifica si las variantes de entrada causan cambios en la codificación de proteínas y los aminoácidos afectados por las mutaciones. [ 9 ] El archivo de entrada puede estar compuesto por exones, intrones, regiones intergénicas, sitios aceptores/donadores de empalme y regiones no traducidas 5′/3′. El objetivo es explorar la relación entre las mutaciones no sinónimas (SNP, indels o CNV) y su impacto funcional en genes conocidos. [ 10 ] En particular, la anotación basada en genes resaltará el cambio exacto de aminoácidos si la mutación se encuentra en la región exónica y el efecto predicho en la función del gen conocido. Este enfoque es útil para identificar variantes en genes conocidos a partir de datos de secuenciación del exoma completo.

Anotación basada en regiones

Este enfoque identifica variantes deletéreas en regiones genómicas específicas basándose en los elementos genómicos que rodean al gen. [ 11 ] Algunas categorías que la anotación basada en regiones tendrá en cuenta son:

  1. ¿Se encuentra la variante en una región genómica conservada conocida?: Las mutaciones ocurren durante la mitosis y la meiosis . Si no existe presión selectiva para secuencias de nucleótidos específicas, todas las áreas del genoma mutarían a la misma velocidad. Las regiones genómicas altamente conservadas indican secuencias genómicas esenciales para la supervivencia y/o el éxito reproductivo del organismo . Por lo tanto, si la variante afecta una región altamente conservada, es probable que sea altamente perjudicial. [ 12 ]
  2. ¿La variante se encuentra en un sitio de unión de factor de transcripción predicho ?: El ADN se transcribe en ARN mensajero (ARNm) mediante la ARN polimerasa II . Este proceso puede ser modulado por factores de transcripción que pueden potenciar o inhibir la unión de la ARN polimerasa II. Si la variante interrumpe un sitio de unión de factor de transcripción, la transcripción del gen podría alterarse, provocando cambios en el nivel de expresión génica y/o en la cantidad de proteína producida. Estos cambios podrían causar variaciones fenotípicas.
  3. ¿La variante se encuentra en un sitio diana de miRNA predicho ?: El microARN (miRNA) es un tipo de ARN que se une de forma complementaria a una secuencia de ARNm específica para suprimir o silenciar su traducción. Si la variante interrumpe la ubicación diana del miRNA, este podría tener una afinidad de unión alterada al transcrito génico correspondiente, modificando así el nivel de expresión del ARNm. Esto podría afectar aún más los niveles de producción de proteínas, lo que podría causar variaciones fenotípicas.
  4. ¿Se prevé que la variante interrumpa una estructura secundaria estable del ARN?: El ARN puede funcionar a nivel de ARN como ARN no codificante o traducirse en proteínas para procesos posteriores. Las estructuras secundarias del ARN son extremadamente importantes para determinar la vida media y la función correctas de dicho ARN. Dos especies de ARN con estructuras secundarias estrictamente reguladas son el ARN ribosómico (ARNr) y el ARN de transferencia (ARNt), esenciales para la traducción del ARNm a proteína. Si la variante altera la estabilidad de la estructura secundaria del ARN, la vida media del ARN podría acortarse, disminuyendo así su concentración en la célula.

Las regiones no codificantes abarcan el 99 % del genoma humano [ 13 ] y la anotación basada en regiones es extremadamente útil para identificar variantes en dichas regiones. Este enfoque puede utilizarse con datos de secuenciación del genoma completo (WGS).

Anotación basada en filtros

Este enfoque identifica variantes documentadas en bases de datos específicas. [ 14 ] Las variantes se pueden obtener de dbSNP, el Proyecto 1000 Genomas o listas proporcionadas por el usuario. Se puede obtener información adicional a partir de la frecuencia de las variantes en las bases de datos mencionadas o de las puntuaciones de riesgo predichas por PolyPhen, CADD, ClinVar u otras. [ 1 ] Cuanto menos frecuente sea una variante en la base de datos pública, mayor será su riesgo de ser perjudicial. El investigador puede combinar los resultados de diferentes herramientas de predicción de riesgo para realizar una evaluación más precisa de la variante.

En conjunto, estos enfoques se complementan para filtrar más de 4 millones de variantes en un genoma humano. Se eliminan las variantes comunes con baja puntuación de riesgo para revelar las variantes raras con alta puntuación de riesgo, que podrían ser la causa de enfermedades congénitas.

Información técnica

ANNOVAR es una herramienta de línea de comandos escrita en el lenguaje de programación Perl y puede ejecutarse en cualquier sistema operativo que tenga instalado un intérprete de Perl. [ 1 ] Si se utiliza con fines no comerciales, está disponible gratuitamente como un paquete de código abierto que se puede descargar desde el sitio web de ANNOVAR. ANNOVAR puede procesar la mayoría de los datos de secuenciación de nueva generación que se hayan procesado mediante un software de detección de variantes .

Formatos de archivo

El software ANNOVAR acepta archivos de entrada basados ​​en texto, incluido el formato VCF (Variant Call Format) , el estándar de oro para la descripción de loci genéticos.

El script de anotación principal del programa annotate_variation.plrequiere un formato de archivo de entrada personalizado, el formato de entrada ANNOVAR (.avinput). Los tipos de archivo comunes se pueden convertir al formato de entrada ANNOVAR para la anotación mediante un script proporcionado (ver más abajo). Es un archivo de texto simple donde cada línea corresponde a una variante y dentro de cada línea hay columnas delimitadas por tabulaciones que representan los campos de coordenadas genómicas básicas (cromosoma, posición inicial, posición final, nucleótidos de referencia y nucleótidos observados), seguidas de columnas opcionales [ 2 ].

El archivo de entrada ANNOVAR contiene los siguientes campos básicos:

  • Cristo
  • Comenzar
  • Fin
  • Árbitro
  • Alt

Para un uso básico "directo a la caja":

Una función popular de la herramienta ANNOVAR es el uso de un table_annovar.plscript que simplifica el flujo de trabajo a una sola llamada de línea de comandos, dado que las fuentes de datos para la anotación ya se han descargado. La conversión del archivo VCF se realiza dentro de la llamada a la función, seguida de la anotación y la salida a un archivo compatible con Excel. El script toma varios parámetros para la anotación y genera un archivo VCF con las anotaciones como pares clave-valor dentro de la INFOcolumna del archivo VCF para cada variante genética, por ejemplo, "genomic_function=exonic".

Conversión al formato de archivo de entrada ANNOVAR

La conversión de archivos al formato de entrada de ANNOVAR es posible mediante el script de conversión de formato de archivo proporcionado convert2annovar.pl. El programa acepta formatos de archivo comunes generados por herramientas de detección de variantes anteriores . Los scripts de anotación funcional subsiguientes annotate_variation.plutilizan el archivo de entrada de ANNOVAR. Los formatos de archivo que acepta convert2annovar.plincluyen los siguientes: [ 2 ]

Generación de archivos de entrada basados ​​en variantes, transcripciones o regiones genómicas específicas:

Al investigar loci candidatos vinculados a enfermedades, el uso de los formatos de archivo de llamadas de variantes mencionados anteriormente como entrada para ANNOVAR es un flujo de trabajo estándar para la anotación funcional de variantes genéticas generadas por un pipeline bioinformático previo. ANNOVAR también puede utilizarse en otros escenarios, como la consulta de un conjunto de variantes genéticas de interés basadas en una lista de identificadores dbSNP , así como variantes dentro de regiones genómicas o exómicas específicas. [ 2 ]

En el caso de los identificadores dbSNP, al proporcionar al convert2annovar.plscript una lista de identificadores (por ejemplo, rs41534544, rs4308095, rs12345678) en un archivo de texto junto con el genoma de referencia de interés como parámetro, ANNOVAR generará un archivo de entrada ANNOVAR con los campos de coordenadas genómicas para esas variantes, que luego se pueden usar para la anotación funcional. [ 2 ]

En el caso de regiones genómicas, se puede proporcionar un rango genómico de interés (por ejemplo, chr1:2000001-2000003) junto con el genoma de referencia de interés, y ANNOVAR generará un archivo de entrada con todos los loci genéticos que abarcan ese rango. Además, también se puede especificar el tamaño de inserción y deleción, en cuyo caso el script seleccionará todos los loci genéticos donde se encuentre una inserción o deleción de un tamaño específico de interés. [ 2 ]

Por último, si se buscan variantes dentro de regiones exónicas específicas, los usuarios pueden generar archivos de entrada ANNOVAR para todas las variantes posibles en los exones (incluidas las variantes de empalme) cuando convert2annovar.plse proporciona al script un identificador de transcripción de ARN (por ejemplo, NM_022162) basado en la nomenclatura estándar de la HGVS (Sociedad de Variación del Genoma Humano). [ 2 ]

Archivo de salida

Los posibles archivos de salida son un archivo .avinput anotado, CSV , TSV o VCF . Según la estrategia de anotación utilizada (véase la figura a continuación), los archivos de entrada y salida serán diferentes. Es posible configurar los tipos de archivo de salida a partir de un archivo de entrada específico, proporcionando al programa el parámetro correspondiente.

Por ejemplo, si el archivo de entrada del table_annovar.plprograma es VCF, la salida también será un archivo VCF. Si el archivo de entrada es del tipo de formato ANNOVAR, la salida será un archivo TSV por defecto, con la opción de generar un archivo CSV si -csvoutse especifica el parámetro. Al elegir CSV o TSV como tipo de archivo de salida, el usuario puede abrir los archivos para ver las anotaciones en Excel u otra aplicación de hoja de cálculo. Esta es una función muy popular entre los usuarios.

El archivo de salida contendrá todos los datos del archivo de entrada original con columnas adicionales para las anotaciones deseadas. Por ejemplo, al anotar variantes con características como (1) la función genómica y (2) el rol funcional de la variante codificante, el archivo de salida contendrá todas las columnas del archivo de entrada, seguidas de las columnas adicionales "genomic_function" (por ejemplo, con los valores "exonic" o "intronic") y "coding_variant_function" (por ejemplo, con los valores "synonymous SNV" o "non-synonymous SNV").

Flujos de trabajo clave del programa ANNOVAR

eficiencia del sistema

En pruebas realizadas en un ordenador de sobremesa moderno (  CPU Intel Xeon de 3 GHz, 8 GB de memoria), ANNOVAR requiere aproximadamente 4 minutos para realizar la anotación funcional basada en genes, o unos 15 minutos para la reducción gradual de variantes, para un total de 4,7 millones de variantes. Se considera práctico para realizar la anotación y priorización de variantes en cientos de genomas humanos al día. [ 2 ]

ANNOVAR puede acelerarse utilizando un -threadargumento que habilita el procesamiento multihilo, de modo que los archivos de entrada puedan procesarse en paralelo.

Recursos de datos

Para usar ANNOVAR para la anotación funcional de variantes, los conjuntos de datos de anotación se pueden descargar usando el annotate_variation.plscript, que los guarda en el disco local. [ 1 ] Se utilizan diferentes fuentes de datos de anotación para los tres tipos principales de anotación (basada en genes, basada en regiones y basada en filtros).

Estas son algunas de las fuentes de datos para cada tipo de anotación:

Anotación basada en genes

[ 9 ]

Anotación basada en regiones

  • CODIFICAR
  • Bases de datos personalizadas que cumplen con el formato GFF3 (Generic Feature Format versión 3).

[ 11 ]

Anotación basada en filtros

Dado el gran número de fuentes de datos para la anotación basada en filtros, aquí se muestran ejemplos de qué subconjuntos de los conjuntos de datos utilizar para algunos de los casos de uso más comunes. [ 14 ]

  1. Para la frecuencia de variantes en datos de exoma completo : [ 14 ]
    1. ExAC: con frecuencias alélicas para todos los grupos étnicos.
    2. NHLBI-ESP: a partir de 6500 exomas, utilice tres agrupaciones de población.
    3. Frecuencia alélica de gnomAD: con frecuencias alélicas para múltiples poblaciones
  2. Para variantes específicas de la enfermedad: [ 14 ]
    1. ClinVar: con columnas individuales para cada campo ClinVar para cada variante.
    2. COSMIC: mutaciones somáticas del cáncer y frecuencia de aparición en cada subtipo de cáncer.
    3. ICGC: mutaciones del Consorcio Internacional del Genoma del Cáncer
    4. NCI-60: datos de frecuencia alélica de secuenciación del exoma de un panel de células tumorales humanas

[ 14 ]

Ejemplo de aplicación

Descripción general de una aplicación de ANNOVAR para identificar mutaciones en enfermedades raras.

Uso de ANNOVAR para la priorización de variantes genéticas para identificar mutaciones en una enfermedad genética rara.

ANNOVAR es una de las herramientas de anotación más comunes para identificar mutaciones y genes candidatos y causales de enfermedades genéticas raras.

Utilizando una combinación de anotación basada en genes y en filtros, seguida de una reducción de variantes basada en los valores de anotación de las variantes, se puede identificar el gen causal de una enfermedad mendeliana recesiva rara llamada síndrome de Miller. [ 1 ]

Esto implicará la síntesis de un conjunto de datos de todo el genoma de aproximadamente 4,2 millones de variantes de un solo nucleótido (SNV ) y aproximadamente 0,5 millones de inserciones y deleciones ( indels ). [ 1 ] También se incluyen dos mutaciones causales conocidas para el síndrome de Miller (G152R y G202A en el gen DHODH ). [ 1 ]

Pasos para identificar las variantes causales de la enfermedad utilizando ANNOVAR: [ 1 ]

  1. Anotación basada en genes para identificar variantes exónicas/de empalme de la combinación de SNV e indels (~4,7 millones de variantes) donde se identificaron un total de 24.617 variantes exónicas. [ 1 ]
  2. Dado que el síndrome de Miller es una enfermedad mendeliana rara, solo interesan las variantes que alteran las proteínas exónicas, que suman 11.166. [ 1 ] De estas, se identificaron 4860 variantes que se encuentran en regiones genómicas altamente conservadas [ 1 ]
  3. Dado que las bases de datos públicas como dbSNP y el Proyecto 1000 Genomas archivan variantes previamente reportadas, que suelen ser comunes, es menos probable que contengan las variantes causales del síndrome de Miller, que son raras. [ 1 ] Por lo tanto, las variantes encontradas en esas fuentes de datos se filtran y quedan 413 variantes.
  4. Luego, se evalúan los genes para determinar si existen múltiples variantes en el mismo gen como heterocigotos compuestos y quedan 23 genes. [ 1 ]
  5. Finalmente, se eliminan los genes "prescindibles", aquellos que presentan mutaciones sin sentido de alta frecuencia (en más del 1% de los sujetos del Proyecto 1000 Genomas ) que son susceptibles a errores de secuenciación y alineación en plataformas de secuenciación de lectura corta. [ 1 ] Se considera que estos genes tienen menos probabilidades de ser causantes de una enfermedad mendeliana rara . Como resultado, se filtran tres genes y quedan 20 genes candidatos, incluido el gen causal DHODH [ 1 ].

Limitaciones de ANNOVAR

ANNOVAR presenta dos limitaciones relacionadas con la detección de enfermedades comunes y la anotación de variantes estructurales extensas. Estos problemas están presentes en todas las herramientas actuales de anotación de variantes.

Las enfermedades más comunes, como la diabetes y el Alzheimer, tienen múltiples variantes en todo el genoma que son comunes en la población. [ 15 ] [ 16 ] Se espera que estas variantes tengan puntuaciones deletéreas individuales bajas y causen la enfermedad a través de la acumulación de múltiples variantes. Sin embargo, ANNOVAR tiene esquemas predeterminados de "reducción de variantes" que proporcionan una pequeña lista de variantes raras y altamente predichas como deletéreas. [ 10 ] Estas configuraciones predeterminadas podrían optimizarse para que los datos de salida muestren variantes adicionales con puntuaciones deletéreas predichas decrecientes. [ 2 ] ANNOVAR se utiliza principalmente para identificar variantes involucradas en enfermedades raras donde se espera que la mutación causal sea rara y altamente deletérea.

Se ha demostrado que variantes estructurales (VE) de mayor tamaño , como inversiones cromosómicas, translocaciones y VE complejas, causan enfermedades como la hemofilia A y la enfermedad de Alzheimer. [ 17 ] [ 18 ] Sin embargo, las VE suelen ser difíciles de anotar porque es complicado asignar puntuaciones deletéreas específicas a grandes regiones genómicas mutadas. Actualmente, ANNOVAR solo puede anotar genes contenidos en deleciones o duplicaciones, o inserciones/deleciones pequeñas de <50 pb. ANNOVAR no puede inferir VE complejas ni translocaciones. [ 10 ]

Herramientas alternativas de anotación de variantes

También existen otros dos tipos de herramientas de anotación de SNP similares a ANNOVAR: SNP effect ( SnpEFF ) y Variant Effect Predictor (VEP) . Muchas de las características entre ANNOVAR, SnpEFF y VEP son las mismas, incluyendo el formato de archivo de entrada y salida, las anotaciones de regiones reguladoras y las anotaciones de variantes conocidas. Sin embargo, las principales diferencias son que ANNOVAR no puede anotar predicciones de pérdida de función, mientras que tanto SnpEFF como VEP sí pueden. Además, ANNOVAR no puede anotar ubicaciones de unión estructural de microARN, mientras que VEP sí. [ 19 ] Las predicciones de ubicación de unión estructural de microARN pueden ser informativas para revelar el papel de las mutaciones postranscripcionales en la patogénesis de enfermedades. [ 20 ] Las mutaciones de pérdida de función son cambios en el genoma que resultan en la disfunción total del producto génico. Por lo tanto, estas predicciones podrían ser extremadamente informativas en lo que respecta al diagnóstico de enfermedades, especialmente en enfermedades monogénicas raras.

* Tabla adaptada de McLaren et al. (2016).

Referencias

  1. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 Hakonarson, Hakon; Li, Mingyao ; Wang, Kai (2010-09-01). "ANNOVAR: anotación funcional de variantes genéticas a partir de datos de secuenciación de alto rendimiento" . Nucleic Acids Research . 38 (16): e164. doi : 10.1093/nar / gkq603 . ISSN 0305-1048 . PMC 2938201. PMID 20601685 .   
  2. 1 2 3 4 5 6 7 8 9 10 11 12 "Sitio web de ANNOVAR" . www.openbioinformatics.org . Consultado el 28 de febrero de 2019 .
  3. "Costos de secuenciación de ADN: datos" . Instituto Nacional de Investigación del Genoma Humano (NHGRI) . Consultado el 4 de abril de 2019 .
  4. Emerson, Ryan O.; Sherwood, Anna M.; Rieder, Mark J.; Guenthoer, Jamie; Williamson, David W.; Carlson, Christopher S.; Drescher, Charles W.; Tewari, Muneesh; Bielas, Jason H. (diciembre de 2013). "La secuenciación de alto rendimiento de los receptores de células T revela un repertorio homogéneo de linfocitos infiltrantes de tumores en el cáncer de ovario" . The Journal of Pathology . 231 (4): 433– 440. doi : 10.1002 / path.4260 . ISSN 0022-3417 . PMC 5012191. PMID 24027095 .   
  5. Blayney, Jaine K.; Parkes, Eileen; Zheng, Huiru; Taggart, Laura; Browne, Fiona; Haberland, Valeriia; Lightbody, Gaye (2018). "Revisión de las aplicaciones de la secuenciación de alto rendimiento en medicina personalizada: barreras y facilitadores del progreso futuro en la investigación y la aplicación clínica" . Briefings in Bioinformatics . 20 (5): 1795– 1811. doi : 10.1093/bib/bby051 . PMC 6917217. PMID 30084865 .  
  6. Referencia, Genetics Home. "¿Qué son la secuenciación del exoma completo y la secuenciación del genoma completo?" . Referencia de Genetics Home . Consultado el 4 de abril de 2019 .
  7. Referencia, Genetics Home. "¿Qué son los estudios de asociación de genoma completo?" . Referencia de Genetics Home . Consultado el 4 de abril de 2019 .
  8. Consorcio del Proyecto 1000 Genomas (octubre de 2015). "Una referencia global para la variación genética humana" . Nature . 526 (7571): 68–74 . Bibcode : 2015Natur.526...68T . doi : 10.1038 / nature15393 . ISSN 1476-4687 . PMC 4750478. PMID 26432245 .   {{cite journal}}: CS1 maint: nombres numéricos: lista de autores ( enlace )
  9. 1 2 "Anotación basada en genes - Documentación de ANNOVAR" . annovar.openbioinformatics.org . Consultado el 28 de febrero de 2019 .
  10. 1 2 3 Yang, Hui; Wang, Kai (octubre de 2015). "Anotación y priorización de variantes genómicas con ANNOVAR y wANNOVAR" . Nature Protocols . 10 (10): 1556– 1566. doi : 10.1038/nprot.2015.105 . ISSN 1754-2189 . PMC 4718734. PMID 26379229 .   
  11. 1 2 "Anotación basada en regiones - Documentación de ANNOVAR" . annovar.openbioinformatics.org . Consultado el 28 de febrero de 2019 .
  12. Jordan, I. King; Rogozin, Igor B.; Wolf, Yuri I.; Koonin, Eugene V. (junio de 2002). " Los genes esenciales están más conservados evolutivamente que los genes no esenciales en las bacterias" . Genome Research . 12 (6): 962– 968. doi : 10.1101/gr.87702 . ISSN 1088-9051 . PMC 1383730. PMID 12045149 .   
  13. Referencia, Genetics Home. "¿Qué es el ADN no codificante?" . Referencia de Genetics Home . Consultado el 1 de marzo de 2019 .
  14. 1 2 3 4 5 "Anotación basada en filtros - Documentación de ANNOVAR" . annovar.openbioinformatics.org . Consultado el 28 de febrero de 2019 .
  15. Wu, Yiming; Jing, Runyu; Dong, Yongcheng; Kuang, Qifan; Li, Yan; Huang, Ziyan; Gan, Wei; Xue, Yue; Li, Yizhou (2017-03-06). "Anotación funcional de sesenta y cinco SNP de riesgo de diabetes tipo 2 y su aplicación en la predicción de riesgo" . Scientific Reports . 7 43709. Bibcode : 2017NatSR...743709W . doi : 10.1038/srep43709 . ISSN 2045-2322 . PMC 5337961. PMID 28262806 .   
  16. Emahazion, T.; Feuk, L.; Jobs, M.; Sawyer, SL; Fredman, D.; St Clair, D.; Prince, JA; Brookes, AJ (julio de 2001). "Los estudios de asociación de SNP en la enfermedad de Alzheimer resaltan los problemas para el análisis de enfermedades complejas". Trends in Genetics . 17 (7): 407– 413. doi : 10.1016/S0168-9525(01)02342-3 . ISSN 0168-9525 . PMID 11418222 .  
  17. ^ Lakich, Delia; Kazazian, Haig H.; Antonarakis, Stylianos E.; Gitschier, Jane (noviembre de 1993). "Las inversiones que alteran el gen del factor VIII son una causa común de hemofilia A grave". Genética de la Naturaleza . 5 (3): 236– 241. doi : 10.1038/ng1193-236 . ISSN 1061-4036 . PMID 8275087 . S2CID 25636383 .   
  18. Lupski, James R. (junio de 2015). "Mutagénesis de variación estructural del genoma humano: impacto en la enfermedad y la evolución" . Mutagénesis ambiental y molecular . 56 (5): 419– 436. Bibcode : 2015EnvMM..56..419L . doi : 10.1002/em.21943 . ISSN 0893-6692 . PMC 4609214. PMID 25892534 .   
  19. McLaren, William; Gil, Laurent; Hunt, Sarah E.; Riat, Harpreet Singh; Ritchie, Graham RS; Thormann, Anja; Flicek, Paul; Cunningham, Fiona (2016-06-06). " The Ensembl Variant Effect Predictor" . Genome Biology . 17 (1): 122. doi : 10.1186/s13059-016-0974-4 . ISSN 1474-760X . PMC 4893825. PMID 27268795 .   
  20. Jiang Q, Wang Y, Hao Y, Juan L, Teng M, Zhang X, Li M, Wang G, Liu Y (enero de 2009). "miR2Disease: una base de datos curada manualmente para la desregulación de microARN en enfermedades humanas" . Nucleic Acids Research . 37. 37 (número especial de bases de datos): D98–104. doi : 10.1093 / nar/gkn714 . PMC 2686559. PMID 18927107 .