Articulo de referencia

SPAdes (software)

[[Saint Petersburg Academic University|St. Petersburg Academic University]], Russia [[University of California, San Diego]], USA"},"latest release version":{"wt":"4.1.0"},"lates...

SPAdes (St. Petersburg genome assembler ) [ 1 ] es un algoritmo de ensamblaje de genomas diseñado para conjuntos de datos bacterianos de células individuales y multicelulares . Por lo tanto, podría no ser adecuado para proyectos de genomas grandes. [ 1 ] [ 2 ]

SPAdes funciona con lecturas de extremos emparejados, pares de extremos y lecturas individuales de Ion Torrent , PacBio , Oxford Nanopore e Illumina . [ 1 ] Guy Lionel y Philip Mabon integraron SPAdes en las canalizaciones de Galaxy . [ 3 ]

Fondo

El estudio del genoma de células individuales ayudará a rastrear los cambios que ocurren en el ADN a lo largo del tiempo o asociados con la exposición a diferentes condiciones. Además, muchos proyectos como el Proyecto Microbioma Humano y el descubrimiento de antibióticos se beneficiarían enormemente de la secuenciación de células individuales (SCS). [ 4 ] [ 5 ] La SCS tiene una ventaja sobre la secuenciación de ADN extraído de un gran número de células. El problema de promediar las variaciones significativas entre células se puede superar utilizando la SCS. [ 6 ] Las tecnologías experimentales y computacionales se están optimizando para permitir a los investigadores secuenciar células individuales. Por ejemplo, la amplificación del ADN extraído de una sola célula es uno de los desafíos experimentales. Para maximizar la precisión y la calidad de la SCS, se necesita una amplificación de ADN uniforme. Se ha demostrado que el uso de múltiples ciclos de amplificación basados ​​en hibridación y bucle ( MALBAC ) para la amplificación de ADN genera menos sesgo en comparación con la reacción en cadena de la polimerasa ( PCR ) o la amplificación de desplazamiento múltiple (MDA). [ 7 ] Además, se ha reconocido que los desafíos que enfrenta la SCS son computacionales más que experimentales. [ 8 ] Los ensambladores disponibles actualmente, como Velvet , [ 9 ] String Graph Assembler (SGA) [ 10 ] y EULER-SR, [ 11 ] no fueron diseñados para manejar el ensamblaje de SCS. [ 2 ] El ensamblaje de datos de células individuales es difícil debido a la cobertura de lectura no uniforme, la variación en la longitud de inserción, los altos niveles de errores de secuenciación y las lecturas quiméricas . [ 8 ] [ 12 ] [ 13 ] Por lo tanto, el nuevo enfoque algorítmico, SPAdes, fue diseñado para abordar estos problemas.

Enfoque de ensamblaje de SPAdes

SPAdes utiliza k-meros para construir el grafo de De Bruijn inicial y en las etapas siguientes realiza operaciones de teoría de grafos que se basan en la estructura del grafo, la cobertura y las longitudes de secuencia. Además, ajusta los errores iterativamente. [ 2 ] Las etapas de ensamblaje en SPAdes son: [ 2 ]

  • Etapa 1: construcción del grafo de ensamblaje. SPAdes emplea un grafo de De Bruijn de tamaño variable (véase más abajo), que detecta y elimina lecturas con protuberancias/burbujas y lecturas quiméricas.
  • Etapa 2: Ajuste de k-bimeros (pares de k-meros). Se estiman las distancias exactas entre los k-meros del genoma (aristas en el grafo de ensamblaje).
  • Etapa 3: construcción del grafo de ensamblaje por pares.
  • Etapa 4: construcción de contigs. SPAdes genera contigs y permite mapear las lecturas de vuelta a sus posiciones en el grafo de ensamblaje después de la simplificación del grafo ( retroceso ).

Detalles sobre el montaje de SPAdes

Gráfico de cobertura logarítmica para los datos de secuenciación de células individuales del genoma de E. coli . [ 14 ]

SPAdes fue diseñado para superar los problemas asociados con el ensamblaje de datos de células individuales de la siguiente manera: [ 2 ]

1. Cobertura no uniforme . SPAdes utiliza un grafo de De Bruijn de tamaño variable que permite emplear diferentes valores de k. Se ha sugerido utilizar valores más pequeños de k en regiones de baja cobertura para minimizar la fragmentación y valores más grandes de k en regiones de alta cobertura para disminuir el colapso de repeticiones (Etapa 1 anterior).

2. Tamaños de inserción variables de lecturas de extremos emparejados . SPAdes emplea el concepto básico de grafos de De Bruijn emparejados. Sin embargo, De Bruijn emparejado funciona bien en lecturas de extremos emparejados con tamaño de inserción fijo. Por lo tanto, SPAdes estima "distancias" en lugar de usar "tamaños de inserción". La distancia (d) de una lectura de extremos emparejados se define como, para una longitud de lectura L, d = tamaño de inserción – L. Al utilizar el enfoque de ajuste de k-bímeros, las distancias se estiman con precisión. Un k-bímero consta de k-meros 'α' y 'β' junto con la distancia estimada entre ellos en un genoma (α|β,d). Este enfoque divide las lecturas de extremos emparejados en pares de k-meros que se transforman para definir pares de aristas (biaristas) en los grafos de De Bruijn. Estos conjuntos de biaristas están involucrados en la estimación de distancias entre las rutas de aristas entre los k-meros α y β. Mediante la agrupación, se elige la estimación de distancia óptima de cada grupo (etapa 2, arriba). Para construir un grafo de De Bruijn emparejado, se emplean los grafos rectangulares en SPAdes (etapa 3). El enfoque de los grafos rectangulares se introdujo por primera vez en 2012 [ 15 ] para construir grafos de De Bruijn emparejados con distancias dudosas.

3. Abultamientos, puntas y quimeras . Los abultamientos y las puntas se producen debido a errores en la parte media y los extremos de las lecturas, respectivamente. Una conexión quimérica une dos subcadenas no relacionadas del genoma. SPAdes las identifica basándose en la topología del grafo, la longitud y la cobertura de las rutas no ramificadas que incluyen. SPAdes mantiene una estructura de datos para poder rastrear todas las correcciones o eliminaciones.

SPAdes modifica el enfoque de eliminación de abultamientos utilizado anteriormente [ 16 ] y el enfoque iterativo del grafo de De Bruijn de Peng et al (2010) [ 17 ] y crea un nuevo enfoque llamado corremoción de abultamientos , que significa corrección y eliminación de abultamientos. El algoritmo de corremoción de abultamientos se puede resumir de la siguiente manera: un abultamiento simple está formado por dos caminos pequeños y similares (P y Q) que conectan los mismos nodos. Si P es un camino sin ramificaciones (h-camino), entonces SPAdes mapea cada arista en P a una proyección de arista en Q y elimina P del grafo, como resultado la cobertura de Q aumenta. A diferencia de otros ensambladores, que utilizan un umbral de corte de cobertura fijo para la eliminación de abultamientos, SPAdes elimina o proyecta los h-camino con baja cobertura paso a paso. Esto se logra empleando umbrales de corte que aumentan gradualmente e iterando a través de todos los h-camino en orden creciente de cobertura (para la corremoción de abultamientos y la eliminación quimérica) o longitud (para la eliminación de puntas). Además, para garantizar que no se introduzcan nuevas fuentes/sumideros en el grafo, SPAdes elimina una ruta h (en la eliminación de rutas h quiméricas) o proyecta (en la eliminación de correlaciones de abultamiento) solo si sus vértices de inicio y fin tienen al menos dos aristas salientes y dos entrantes . Esto ayuda a eliminar las rutas h de baja cobertura que se producen por errores de secuenciación y lecturas quiméricas, pero no por repeticiones.

Pipelines y rendimiento de SPAdes

SPAdes se compone de las siguientes herramientas: [ 1 ]

  • Herramienta de corrección de errores de lectura, BayesHammer (para datos de Illumina) e IonHammer (para datos de IonTorrent) . [ 14 ] En la corrección de errores tradicional, los k-meros raros se consideran errores. Esto no se puede aplicar para SCS debido a la cobertura no uniforme. Por lo tanto, BayesHammer emplea subagrupamiento probabilístico que examina múltiples nucleótidos centrales, que estarán mejor cubiertos que otros, de k-meros similares. [ 14 ] Se afirmó que para el conjunto de datos de células individuales de Escherichia coli ( E. coli ), BayesHammer se ejecuta en aproximadamente 75 min, toma hasta 10 Gb de RAM para llevar a cabo la corrección de errores de lectura y requiere 10 Gb de espacio adicional en disco para archivos temporales.
  • SPAdes, un ensamblador iterativo de genomas de lectura corta , utiliza el mismo conjunto de datos para este paso, que tarda aproximadamente 75 minutos. La etapa 1 (véase el método de ensamblaje de SPAdes más arriba) requiere aproximadamente el 40 % de este tiempo al usar tres iteraciones (k=22, 34 y 56), y las etapas 2, 3 y 4 requieren aproximadamente el 45 %, el 14 % y el 1 %, respectivamente. Además, el ensamblaje consume hasta 5 GB de RAM y requiere 8 GB de espacio adicional en disco.
  • Corrector de desajustes (que utiliza la herramienta BWA ). Este módulo requiere el mayor tiempo (~120 min) y el mayor espacio adicional en disco (~21 GB) para archivos temporales. Se necesitan hasta 9 GB de RAM para completar la corrección de desajustes del conjunto de datos de células individuales de E. coli ensambladas .
  • Módulo para el ensamblaje de genomas diploides altamente polimórficos, dipSPAdes . dipSPAdes construye contigs más largos aprovechando la divergencia entre haplomas en regiones genómicas repetitivas. Posteriormente, genera contigs de consenso y realiza el ensamblaje de haplotipos .

Comparación de ensambladores

Un estudio [ 18 ] comparó varios ensambladores de genomas en muestras de células individuales de E. coli . Estos ensambladores son EULER-SR, [ 11 ] Velvet, [ 9 ] SOAPdenovo, [ 19 ] Velvet-SC, EULER+ Velvet-SC (E+V-SC), [ 16 ] IDBA-UD [ 20 ] y SPAdes. Se demostró que IDBA-UD y SPAdes tuvieron el mejor desempeño. [ 18 ] SPAdes tuvo el NG50 más grande (99,913, la estadística NG50 es la misma que la N50 excepto que se usa el tamaño del genoma en lugar del tamaño del ensamblaje). [ 21 ] Además, usando el genoma de referencia de E. coli , [ 22 ] SPAdes ensambló el porcentaje más alto del genoma (97%) y el número más alto de genes completos (4,071 de 4,324). [ 18 ] El desempeño de los ensambladores fue el siguiente: [ 18 ]

  • Número de contigs:

IDBA-UD < Velvet < E+V-SC < SPAdes < EULER-SR < Velvet-SC < SOAPdenovo

  • NG50

SPAdes > IDBA-UD >>> E+V-SC > EULER-SR > Velvet > Velvet-SC > SOAPdenovo

  • Contig más grande:

IDBA-UD > SPAdes > > EULER-SR > Velvet= E+V-SC > Velvet-SC > SOAPdenovo

  • Genoma mapeado (%):

SPAdes > IDBA-UD > E+V-SC > Velvet-SC > EULER-SR > SOAPdenovo > Velvet

  • Número de errores de ensamblaje:

E+V-SC = Velvet = Velvet-SC < SOAPdenovo < IDBA-UD < SPADes < EULER-SR

Véase también

Referencias

  1. 1 2 3 4 "Manual de SPAdes 3.0.0" . Archivado del original el 2 de febrero de 2014. Recuperado el 26 de enero de 2014 .
  2. 1 2 3 4 5 Bankevich A; Nurk S; Antipov D; Gurevich AA; Dvorkin M; Kulikov AS; Lesin VM; Nikolenko SI; Pham S; Prjibelski AD; Pyshkin AV; Sirotkin AV; Vyahhi N; Tesler G; Alekseyev MA; Pevzner PA. (2012). "SPAdes: un nuevo algoritmo de ensamblaje de genomas y sus aplicaciones a la secuenciación de células individuales" . Journal of Computational Biology . 19 (5): 455– 477. doi : 10.1089/cmb.2012.0021 . PMC 3342519. PMID 22506599 .  
  3. Cobertizo de herramientas Galaxy
  4. Gill S; Pop M; Deboy R; Eckburg P; Turnbaugh P; Samuel B; Gordon J; Relman D; Fraser-Liggett C; Nelson K (2006). "Análisis metagenómico del microbioma intestinal distal humano" . Science . 312 (5778): 1355– 1359. Bibcode : 2006Sci...312.1355G . doi : 10.1126 /science.1124234 . PMC 3027896. PMID 16741115 .  
  5. Li J; Vederas J (2009). "Descubrimiento de fármacos y productos naturales: ¿fin de una era o una frontera sin fin?" ( PDF) . Science . 325 (5937): 161– 165. Bibcode : 2009Sci...325..161L . doi : 10.1126/science.1168243 . PMID 19589993. S2CID 206517350. Archivado del original (PDF) el 4 de octubre de 2013. Recuperado el 3 de octubre de 2013 .  
  6. Lu S; Zong C; Fan W; Yang M; Li J; Chapman A; Zhu P; Hu X; Xu L; Yan L; FB; Qiao J; Tang F; Li R; Xie X (2012). "Sondeo de la recombinación meiótica y la aneuploidía de espermatozoides individuales mediante secuenciación del genoma completo" . Science . 338 (6114): 1627– 1630. Bibcode : 2012Sci...338.1627L . doi : 10.1126/science.1229112 . PMC 3590491. PMID 23258895 .  
  7. "Una célula es todo lo que necesitas" . 4 de enero de 2013.
  8. 1 2 Rodrigue S; Malmstrom RR; Berlin AM; Birren BW; Henn MR; Chisholm SW (2009). "Amplificación del genoma completo y ensamblaje de novo de células bacterianas individuales" . PLOS ONE . 4 (9) e6864. Bibcode : 2009PLoSO...4.6864R . doi : 10.1371/journal.pone.0006864 . PMC 2731171. PMID 19724646 .  
  9. 1 2 Zerbino D; Birney E (2008). "Velvet: algoritmos para el ensamblaje de lecturas cortas de novo utilizando grafos de De Bruijn" . Genome Research . 18 (5): 821– 829. doi : 10.1101/gr.074492.107 . PMC 2336801. PMID 18349386 .  
  10. Simpson JT; Durbin R (2012). " Ensamblaje de novo eficiente de genomas grandes utilizando estructuras de datos comprimidas" . Genome Research . 22 (3): 549– 556. doi : 10.1101/gr.126953.111 . PMC 3290790. PMID 22156294 .  
  11. 1 2 Pevzner PA; Tang H; Waterman MS (2001). "Un enfoque de ruta euleriana para el ensamblaje de fragmentos de ADN" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 98 (17): 9748– 9753. Bibcode : 2001PNAS...98.9748P . doi : 10.1073/pnas.171285098 . PMC 55524. PMID 11504945 .  
  12. Medvedev P; Scott E; Kakaradov B; Pevzner P (2011). "Corrección de errores de conjuntos de datos de secuenciación de alto rendimiento con cobertura no uniforme" . Bioinformatics . 27 ( 13): i137–141. doi : 10.1093/bioinformatics/btr208 . PMC 3117386. PMID 21685062 .  
  13. Ishoey T; Woyke T; Stepanauskas R; Novotny M; Lasken RS (2008). "Secuenciación genómica de células microbianas individuales de muestras ambientales" . Current Opinion in Microbiology . 11 (3): 198– 204. doi : 10.1016/j.mib.2008.05.006 . PMC 3635501. PMID 18550420 .  
  14. 1 2 3 Nikolenko SI; Korobeynikov AI; Alekseyev MA. (2012). "BayesHammer: Agrupamiento bayesiano para la corrección de errores en la secuenciación de células individuales" . BMC Genomics . 14 (Supl. 1): S7. arXiv : 1211.2756 . doi : 10.1186/1471-2164-14-S1-S7 . PMC 3549815. PMID 23368723 .  
  15. Vyahhi N; Pham SK; Pevzner P (2012). "De los grafos de De Bruijn a los grafos rectangulares para el ensamblaje del genoma". Algoritmos en bioinformática . Notas de clase en bioinformática. Vol. 7534. pp. 249–261 . doi : 10.1007/978-3-642-33122-0_20 . ISBN   978-3-642-33121-3.
  16. 1 2 Chitsaz H; Yee-Greenbaum JL; Tesler G; Lombardo MJ; Dupont CL; Badger JH; Novotny M; Rusch DB; Fraser LJ; Gormley NA; Schulz-Trieglaff O; Smith GP; Evers DJ; Pevzner PA; Lasken RS (2011). "Ensamblaje de novo eficiente de genomas bacterianos de células individuales a partir de conjuntos de datos de lectura corta" . Nat Biotechnol . 29 (10): 915– 921. doi : 10.1038/nbt.1966 . PMC 3558281. PMID 21926975 .  
  17. Peng Y.; Leung HCM; Yiu S.-M; Chin FYL (2010). "IDBA – Un ensamblador iterativo práctico de novo de grafos de De Bruijn" . Investigación en biología molecular computacional . Notas de clase en ciencias de la computación. Vol. 6044. págs. 426–440 . Bibcode : 2010LNCS.6044..426P . CiteSeerX 10.1.1.157.195 . doi : 10.1007/978-3-642-12683-3_28 . hdl : 10722/129571 . ISBN    978-3-642-12682-6. S2CID 16328443 . 
  18. 1 2 3 4 Gurevich A; Saveliev V; Vyahhi N; Tesler G (2013). "QUAST: herramienta de evaluación de calidad para ensamblajes de genomas" . Bioinformatics . 29 ( 8): 1072– 1075. doi : 10.1093/bioinformatics/btt086 . PMC 3624806. PMID 23422339 .  
  19. Li R; Zhu H; Ruan J; Qian W; Fang X; Shi Z; Li Y; Li S; Shan G; Kristiansen K; Li S; Yang H; Wang J; Wang J (2010). "Ensamblaje de novo de genomas humanos con secuenciación masiva paralela de lecturas cortas" ( PDF) . Genome Research . 20 (2): 265– 272. doi : 10.1101/gr.097261.109 . PMC 2813482. PMID 20019144 .  
  20. Peng Y; Leung HCM; Yiu SM; Chin FYL (2012). "IDBA-UD: un ensamblador de novo para datos de secuenciación de células individuales y metagenómicas con profundidad muy desigual" . Bioinformatics . 28 (11): 1– 8. doi : 10.1093/bioinformatics/bts174 . hdl : 10722/152505 . PMID 22495754 . 
  21. "Ensamblador de genomas SPAdes | Laboratorio de biología algorítmica" .
  22. Blattner FR; Plunkett G; Bloch C; Perna N; Burland V; Riley M; Collado-Vides J; Glasner J; Rode C; Mayhew G; Gregor J; Davis N; Kirkpatrick H; Goeden M; Rose D; Mau B; Shao Y (1997). "La secuencia completa del genoma de Escherichia coli K-12" . Science . 277 (5331): 1453– 1462. doi : 10.1126/science.277.5331.1453 . PMID 9278503 .