En bioinformática , los algoritmos de agrupamiento de secuencias intentan agrupar secuencias biológicas que están relacionadas de alguna manera. Las secuencias pueden ser de origen genómico , " transcripcional " ( EST ) o proteico . En el caso de las proteínas, las secuencias homólogas se agrupan normalmente en familias . En el caso de los datos EST, el agrupamiento es importante para agrupar secuencias que se originan a partir del mismo gen antes de que los EST se ensamblen para reconstruir el ARNm original .
Algunos algoritmos de agrupamiento utilizan el agrupamiento de enlace simple , construyendo un cierre transitivo de secuencias con una similitud sobre un umbral particular. UCLUST [1] y CD-HIT [2] utilizan un algoritmo voraz que identifica una secuencia representativa para cada grupo y asigna una nueva secuencia a ese grupo si es suficientemente similar al representante; si una secuencia no coincide, se convierte en la secuencia representativa para un nuevo grupo. La puntuación de similitud a menudo se basa en la alineación de secuencias . El agrupamiento de secuencias se utiliza a menudo para crear un conjunto no redundante de secuencias representativas .
Los grupos de secuencias suelen ser sinónimos de familias de proteínas (pero no idénticos a ellas) . Determinar una estructura terciaria representativa para cada grupo de secuencias es el objetivo de muchas iniciativas de genómica estructural .
Algoritmos y paquetes de agrupamiento de secuencias
- Éxito en CD [2]
- UCLUST en USEARCH [1]
- Starcode: [3] un algoritmo de agrupamiento rápido de secuencias basado en la búsqueda exacta de todos los pares. [4]
- OrthoFinder: [5] un método rápido, escalable y preciso para agrupar proteínas en familias de genes (ortogrupos) [6] [7]
- Linclust: [8] primer algoritmo cuyo tiempo de ejecución escala linealmente con el tamaño del conjunto de entrada, muy rápido, parte de MMseqs2 [9] paquete de software para búsqueda de secuencias rápida y sensible y agrupamiento de grandes conjuntos de secuencias
- TribeMCL: un método para agrupar proteínas en grupos relacionados [10]
- BAG: un algoritmo de agrupamiento de secuencias basado en la teoría de grafos [11]
- JESAM: [12] Motor de alineación de ADN escalable y paralelo de código abierto con componente de software de agrupamiento opcional
- UICluster: [13] Agrupamiento paralelo de secuencias EST (genéticas)
- Agrupamiento de enlace único BLASTClust con BLAST [14]
- Clusterer: [15] aplicación Java extensible para agrupamiento de secuencias y análisis de conglomerados
- PATDB: un programa para identificar rápidamente subcadenas perfectas
- nrdb: [16] un programa para fusionar secuencias trivialmente redundantes (idénticas)
- CluSTr: [17] Una base de datos de agrupamiento de secuencias de proteínas de enlace único a partir de similitudes de secuencias de Smith-Waterman; cubre más de 7 millones de secuencias, incluidas UniProt e IPI
- ICAtools [18] - paquete de agrupamiento de ADN original (antiguo) con muchos algoritmos útiles para el descubrimiento de artefactos o el agrupamiento de EST
- Herramienta EMBOSS Skipredudant [19] para eliminar secuencias redundantes de un conjunto
- Algoritmo CLUSS [20] para identificar grupos de secuencias de proteínas relacionadas estructural, funcional o evolutivamente que son difíciles de alinear. Servidor web CLUSS [21]
- Algoritmo CLUSS2 [22] para agrupar familias de secuencias de proteínas difíciles de alinear con múltiples funciones biológicas. Servidor web CLUSS2 [21]
Bases de datos de secuencias no redundantes
- PISCES: Un servidor de selección de secuencias de proteínas [23]
- RDB90 [24]
- UniRef: una base de datos de secuencias UniProt no redundante [25]
- Uniclust: Un grupo de secuencias UniProtKB agrupadas a un nivel de identidad de secuencia por pares del 90 %, 50 % y 30 %. [26]
- Agrupaciones ortólogas de virus: [27] Una base de datos de agrupamiento de secuencias de proteínas virales; contiene todos los genes previstos de once familias de virus organizados en grupos ortólogos por similitud BLASTP
Véase también
Referencias
- ^ desde "USEARCH". drive5.com .
- ^ ab "CD-HIT: un método ultrarrápido para agrupar secuencias de proteínas y nucleótidos, con muchas aplicaciones nuevas en datos de secuenciación de próxima generación (NGS)". cd-hit.org .
- ^ "Repositorio de Starcode". GitHub . 2018-10-11.
- ^ Zorita E, Cuscó P, Filion GJ (junio de 2015). "Starcode: agrupamiento de secuencias basado en búsqueda de todos los pares". Bioinformática . 31 (12): 1913–9. doi :10.1093/bioinformatics/btv053. PMC 4765884 . PMID 25638815.
- ^ "OrthoFinder". Laboratorio de Steve Kelly .
- ^ Emms DM, Kelly S (agosto de 2015). "OrthoFinder: la resolución de sesgos fundamentales en las comparaciones de todo el genoma mejora drásticamente la precisión de la inferencia de ortogrupos". Genome Biology . 16 (1): 157. doi : 10.1186/s13059-015-0721-2 . PMC 4531804 . PMID 26243257.
- ^ Emms DM, Kelly S (noviembre de 2019). "OrthoFinder: inferencia de ortología filogenética para genómica comparativa". Genome Biology . 20 (1): 238. doi : 10.1186/s13059-019-1832-y . PMC 6857279 . PMID 31727128.
- ^ Steinegger M, Söding J (junio de 2018). "Agrupamiento de grandes conjuntos de secuencias de proteínas en tiempo lineal". Nature Communications . 9 (1): 2542. Bibcode :2018NatCo...9.2542S. doi :10.1038/s41467-018-04964-5. PMC 6026198 . PMID 29959318.
- ^ Steinegger M, Söding J (noviembre de 2017). "MMseqs2 permite la búsqueda sensible de secuencias de proteínas para el análisis de conjuntos de datos masivos". Nature Biotechnology . 35 (11): 1026–1028. doi :10.1038/nbt.3988. hdl : 11858/00-001M-0000-002E-1967-3 . PMID 29035372. S2CID 402352.
- ^ Enright AJ, Van Dongen S, Ouzounis CA (abril de 2002). "Un algoritmo eficiente para la detección a gran escala de familias de proteínas". Nucleic Acids Research . 30 (7): 1575–84. doi :10.1093/nar/30.7.1575. PMC 101833 . PMID 11917018.
- ^ "Copia archivada". Archivado desde el original el 6 de diciembre de 2003. Consultado el 19 de febrero de 2004 .
{{cite web}}: CS1 maint: copia archivada como título ( enlace ) - ^ "Artículo de bioinformática: JESAM: componentes de software CORBA para alineaciones y clústeres EST". littlest.co.uk .
- ^ "pedretti@eyeball -- Página de agrupamiento". ratest.eng.uiowa.edu . Archivado desde el original el 9 de abril de 2005.
- ^ "Noticias del NCBI: Primavera de 2004-BLASTLab". nih.gov .
- ^ "Clusterer: aplicación Java extensible para agrupamiento de secuencias y análisis de conglomerados". bugaco.com .
- ^ "Índice de /pub/nrdb". Archivado desde el original el 1 de enero de 2008.
- ^ "CluSTr". Archivado desde el original el 24 de septiembre de 2006. Consultado el 23 de noviembre de 2006 .
- ^ "Introducción a las herramientas ICA". littlest.co.uk .
- ^ "REBAJAR: omitido" . pasteur.fr .
- ^ Kelil A, Wang S, Brzezinski R, Fleury A (agosto de 2007). "CLUSS: agrupamiento de secuencias de proteínas basado en una nueva medida de similitud". BMC Bioinformatics . 8 : 286. doi : 10.1186/1471-2105-8-286 . PMC 1976428 . PMID 17683581.
- ^ ab "Página de inicio de CLUSS".
- ^ Kelil A, Wang S, Brzezinski R (2008). "CLUSS2: un algoritmo independiente de la alineación para agrupar familias de proteínas con múltiples funciones biológicas". Revista internacional de biología computacional y diseño de fármacos . 1 (2): 122–40. doi :10.1504/ijcbdd.2008.020190. PMID 20058485.
- ^ "Laboratorio Dunbrack". fccc.edu .
- ^ Holm L, Sander C (junio de 1998). "Eliminación de redundancia de vecinos cercanos en grandes colecciones de secuencias de proteínas". Bioinformática . 14 (5): 423–9. doi : 10.1093/bioinformatics/14.5.423 . PMID 9682055.
- ^ "Acerca de UniProt". uniprot.org .
- ^ Mirdita M, von den Driesch L, Galiez C, Martin MJ, Söding J, Steinegger M (enero de 2017). "Bases de datos uniclust de secuencias y alineaciones de proteínas agrupadas y profundamente anotadas". Nucleic Acids Research . 45 (D1): D170–D176. doi :10.1093/nar/gkw1081. PMC 5614098 . PMID 27899574.
- ^ "VOCS - Centro de recursos de bioinformática viral". uvic.ca .