Articulo de referencia

Agrupamiento de secuencias

En bioinformática , los algoritmos de agrupamiento de secuencias intentan agrupar secuencias biológicas que están relacionadas de alguna manera. Las secuencias pueden ser de ori...

En bioinformática , los algoritmos de agrupamiento de secuencias intentan agrupar secuencias biológicas que están relacionadas de alguna manera. Las secuencias pueden ser de origen genómico , " transcripcional " ( EST ) o proteico . En el caso de las proteínas, las secuencias homólogas se agrupan normalmente en familias . En el caso de los datos EST, el agrupamiento es importante para agrupar secuencias que se originan a partir del mismo gen antes de que los EST se ensamblen para reconstruir el ARNm original .

Algunos algoritmos de agrupamiento utilizan el agrupamiento de enlace simple , construyendo un cierre transitivo de secuencias con una similitud sobre un umbral particular. UCLUST [1] y CD-HIT [2] utilizan un algoritmo voraz que identifica una secuencia representativa para cada grupo y asigna una nueva secuencia a ese grupo si es suficientemente similar al representante; si una secuencia no coincide, se convierte en la secuencia representativa para un nuevo grupo. La puntuación de similitud a menudo se basa en la alineación de secuencias . El agrupamiento de secuencias se utiliza a menudo para crear un conjunto no redundante de secuencias representativas .

Los grupos de secuencias suelen ser sinónimos de familias de proteínas (pero no idénticos a ellas) . Determinar una estructura terciaria representativa para cada grupo de secuencias es el objetivo de muchas iniciativas de genómica estructural .

Algoritmos y paquetes de agrupamiento de secuencias

  • Éxito en CD [2]
  • UCLUST en USEARCH [1]
  • Starcode: [3] un algoritmo de agrupamiento rápido de secuencias basado en la búsqueda exacta de todos los pares. [4]
  • OrthoFinder: [5] un método rápido, escalable y preciso para agrupar proteínas en familias de genes (ortogrupos) [6] [7]
  • Linclust: [8] primer algoritmo cuyo tiempo de ejecución escala linealmente con el tamaño del conjunto de entrada, muy rápido, parte de MMseqs2 [9] paquete de software para búsqueda de secuencias rápida y sensible y agrupamiento de grandes conjuntos de secuencias
  • TribeMCL: un método para agrupar proteínas en grupos relacionados [10]
  • BAG: un algoritmo de agrupamiento de secuencias basado en la teoría de grafos [11]
  • JESAM: [12] Motor de alineación de ADN escalable y paralelo de código abierto con componente de software de agrupamiento opcional
  • UICluster: [13] Agrupamiento paralelo de secuencias EST (genéticas)
  • Agrupamiento de enlace único BLASTClust con BLAST [14]
  • Clusterer: [15] aplicación Java extensible para agrupamiento de secuencias y análisis de conglomerados
  • PATDB: un programa para identificar rápidamente subcadenas perfectas
  • nrdb: [16] un programa para fusionar secuencias trivialmente redundantes (idénticas)
  • CluSTr: [17] Una base de datos de agrupamiento de secuencias de proteínas de enlace único a partir de similitudes de secuencias de Smith-Waterman; cubre más de 7 millones de secuencias, incluidas UniProt e IPI
  • ICAtools [18] - paquete de agrupamiento de ADN original (antiguo) con muchos algoritmos útiles para el descubrimiento de artefactos o el agrupamiento de EST
  • Herramienta EMBOSS Skipredudant [19] para eliminar secuencias redundantes de un conjunto
  • Algoritmo CLUSS [20] para identificar grupos de secuencias de proteínas relacionadas estructural, funcional o evolutivamente que son difíciles de alinear. Servidor web CLUSS [21]
  • Algoritmo CLUSS2 [22] para agrupar familias de secuencias de proteínas difíciles de alinear con múltiples funciones biológicas. Servidor web CLUSS2 [21]

Bases de datos de secuencias no redundantes

  • PISCES: Un servidor de selección de secuencias de proteínas [23]
  • RDB90 [24]
  • UniRef: una base de datos de secuencias UniProt no redundante [25]
  • Uniclust: Un grupo de secuencias UniProtKB agrupadas a un nivel de identidad de secuencia por pares del 90 %, 50 % y 30 %. [26]
  • Agrupaciones ortólogas de virus: [27] Una base de datos de agrupamiento de secuencias de proteínas virales; contiene todos los genes previstos de once familias de virus organizados en grupos ortólogos por similitud BLASTP

Véase también

Referencias

  1. ^ desde "USEARCH". drive5.com .
  2. ^ ab "CD-HIT: un método ultrarrápido para agrupar secuencias de proteínas y nucleótidos, con muchas aplicaciones nuevas en datos de secuenciación de próxima generación (NGS)". cd-hit.org .
  3. ^ "Repositorio de Starcode". GitHub . 2018-10-11.
  4. ^ Zorita E, Cuscó P, Filion GJ (junio de 2015). "Starcode: agrupamiento de secuencias basado en búsqueda de todos los pares". Bioinformática . 31 (12): 1913–9. doi :10.1093/bioinformatics/btv053. PMC 4765884 . PMID  25638815. 
  5. ^ "OrthoFinder". Laboratorio de Steve Kelly .
  6. ^ Emms DM, Kelly S (agosto de 2015). "OrthoFinder: la resolución de sesgos fundamentales en las comparaciones de todo el genoma mejora drásticamente la precisión de la inferencia de ortogrupos". Genome Biology . 16 (1): 157. doi : 10.1186/s13059-015-0721-2 . PMC 4531804 . PMID  26243257. 
  7. ^ Emms DM, Kelly S (noviembre de 2019). "OrthoFinder: inferencia de ortología filogenética para genómica comparativa". Genome Biology . 20 (1): 238. doi : 10.1186/s13059-019-1832-y . PMC 6857279 . PMID  31727128. 
  8. ^ Steinegger M, Söding J (junio de 2018). "Agrupamiento de grandes conjuntos de secuencias de proteínas en tiempo lineal". Nature Communications . 9 (1): 2542. Bibcode :2018NatCo...9.2542S. doi :10.1038/s41467-018-04964-5. PMC 6026198 . PMID  29959318. 
  9. ^ Steinegger M, Söding J (noviembre de 2017). "MMseqs2 permite la búsqueda sensible de secuencias de proteínas para el análisis de conjuntos de datos masivos". Nature Biotechnology . 35 (11): 1026–1028. doi :10.1038/nbt.3988. hdl : 11858/00-001M-0000-002E-1967-3 . PMID  29035372. S2CID  402352.
  10. ^ Enright AJ, Van Dongen S, Ouzounis CA (abril de 2002). "Un algoritmo eficiente para la detección a gran escala de familias de proteínas". Nucleic Acids Research . 30 (7): 1575–84. doi :10.1093/nar/30.7.1575. PMC 101833 . PMID  11917018. 
  11. ^ "Copia archivada". Archivado desde el original el 6 de diciembre de 2003. Consultado el 19 de febrero de 2004 .{{cite web}}: CS1 maint: copia archivada como título ( enlace )
  12. ^ "Artículo de bioinformática: JESAM: componentes de software CORBA para alineaciones y clústeres EST". littlest.co.uk .
  13. ^ "pedretti@eyeball -- Página de agrupamiento". ratest.eng.uiowa.edu . Archivado desde el original el 9 de abril de 2005.
  14. ^ "Noticias del NCBI: Primavera de 2004-BLASTLab". nih.gov .
  15. ^ "Clusterer: aplicación Java extensible para agrupamiento de secuencias y análisis de conglomerados". bugaco.com .
  16. ^ "Índice de /pub/nrdb". Archivado desde el original el 1 de enero de 2008.
  17. ^ "CluSTr". Archivado desde el original el 24 de septiembre de 2006. Consultado el 23 de noviembre de 2006 .
  18. ^ "Introducción a las herramientas ICA". littlest.co.uk .
  19. ^ "REBAJAR: omitido" . pasteur.fr .
  20. ^ Kelil A, Wang S, Brzezinski R, Fleury A (agosto de 2007). "CLUSS: agrupamiento de secuencias de proteínas basado en una nueva medida de similitud". BMC Bioinformatics . 8 : 286. doi : 10.1186/1471-2105-8-286 . PMC 1976428 . PMID  17683581. 
  21. ^ ab "Página de inicio de CLUSS".
  22. ^ Kelil A, Wang S, Brzezinski R (2008). "CLUSS2: un algoritmo independiente de la alineación para agrupar familias de proteínas con múltiples funciones biológicas". Revista internacional de biología computacional y diseño de fármacos . 1 (2): 122–40. doi :10.1504/ijcbdd.2008.020190. PMID  20058485.
  23. ^ "Laboratorio Dunbrack". fccc.edu .
  24. ^ Holm L, Sander C (junio de 1998). "Eliminación de redundancia de vecinos cercanos en grandes colecciones de secuencias de proteínas". Bioinformática . 14 (5): 423–9. doi : 10.1093/bioinformatics/14.5.423 . PMID  9682055.
  25. ^ "Acerca de UniProt". uniprot.org .
  26. ^ Mirdita M, von den Driesch L, Galiez C, Martin MJ, Söding J, Steinegger M (enero de 2017). "Bases de datos uniclust de secuencias y alineaciones de proteínas agrupadas y profundamente anotadas". Nucleic Acids Research . 45 (D1): D170–D176. doi :10.1093/nar/gkw1081. PMC 5614098 . PMID  27899574. 
  27. ^ "VOCS - Centro de recursos de bioinformática viral". uvic.ca .
Obtenido de "https://es.wikipedia.org/w/index.php?title=Agrupamiento_de_secuencias&oldid=1188065688"