Articulo de referencia

Cazador de patrones

PatternHunter es un software de búsqueda de homología disponible comercialmente que utiliza técnicas de alineamiento de secuencias . Fue desarrollado inicialmente en el año 2002...

PatternHunter es un software de búsqueda de homología disponible comercialmente que utiliza técnicas de alineamiento de secuencias . Fue desarrollado inicialmente en el año 2002 por tres científicos: Bin Ma, John Tramp y Ming Li. [1] : 440  Estos científicos estaban impulsados ​​por el deseo de resolver el problema que enfrentan muchos investigadores durante los estudios que involucran genómica y proteómica . Estos científicos se dieron cuenta de que dichos estudios dependían en gran medida de los estudios de homología que establecían coincidencias de semillas cortas que posteriormente se alargaban. Describir genes homólogos era una parte esencial de la mayoría de los estudios evolutivos y era crucial para la comprensión de la evolución de las familias de genes, la relación entre dominios y familias. [2] : 7  Los genes homólogos solo podían estudiarse de manera efectiva utilizando herramientas de búsqueda que establecieran porciones similares o ubicación local entre dos proteínas o secuencias de ácidos nucleicos . [3] : 15  La homología se cuantificó mediante puntajes obtenidos a partir de secuencias coincidentes, "puntajes de desajuste y brecha". [4] : 164 

Desarrollo

En genómica comparativa , por ejemplo, es necesario comparar cromosomas enormes como los que se encuentran en el genoma humano. Sin embargo, la inmensa expansión de los datos genómicos introduce un predicamento en los métodos disponibles para realizar búsquedas de homología. Por ejemplo, aumentar el tamaño de la semilla reduce la sensibilidad, mientras que reducir el tamaño de la semilla reduce la velocidad de los cálculos. Se han desarrollado varios programas de alineamiento de secuencias para determinar la homología entre genes. Estos incluyen FASTA , la familia BLAST , QUASAR, MUMmer , SENSEI, SIM y REPuter. [1] : 440  En su mayoría utilizan la técnica de alineamiento Smith-Waterman , que compara bases con otras bases, pero es demasiado lenta. BLAST mejora esta técnica al establecer coincidencias de semillas breves y precisas que luego une para formar alineaciones más largas. [5] : 737  Sin embargo, cuando se trata de secuencias largas, las técnicas mencionadas anteriormente son extremadamente lentas y requieren tamaños de memoria considerables. Sin embargo, SENSEI es más eficiente que los otros métodos, pero es incompetente en otras formas de alineación, ya que su punto fuerte reside en el manejo de alineaciones sin espacios. La calidad de la producción de Megablast, por otro lado, es de mala calidad y no se adapta bien a secuencias grandes. Técnicas como MUMmer y QUASAR emplean árboles de sufijos, que se supone que manejan coincidencias exactas. Sin embargo, estos métodos solo se pueden aplicar a la comparación de secuencias que muestran similitudes elevadas. Todos los problemas mencionados anteriormente requieren el desarrollo de una herramienta rápida y confiable que pueda manejar todo tipo de secuencias de manera eficiente sin consumir demasiados recursos en una computadora.

Acercarse

PatternHunter utiliza numerosas semillas (pequeñas cadenas de búsqueda) con intervalos óptimos entre ellas. Las búsquedas que emplean semillas son extremadamente rápidas porque solo determinan la homología en lugares donde se establecen coincidencias. La sensibilidad de una cadena de búsqueda está muy influenciada por la cantidad de espacio entre cadenas adyacentes. Las semillas grandes no pueden encontrar homologías aisladas, mientras que las pequeñas generan numerosas coincidencias arbitrarias que retrasan el cálculo. PatternHunter logra un delicado equilibrio en esta área al proporcionar un espaciado óptimo entre las cadenas de búsqueda. Utiliza k ( k = 11) letras alternas como semillas en contraste con BLAST, que utiliza k letras sucesivas como semillas. La primera etapa en el análisis de PatternHunter implica una fase de filtrado donde el programa busca coincidencias en k puntos alternos según lo denotado por el patrón más ventajoso. [6] : 11  La segunda etapa es la fase de alineación, que es idéntica a BLAST. Además, es posible utilizar más de una semilla a la vez con PatternHunter. Esto eleva la sensibilidad de la herramienta sin interferir con su velocidad.

Velocidad

PatternHunter tarda poco tiempo en analizar todo tipo de secuencias. En un ordenador moderno, puede llevar unos segundos procesar genomas procariotas , minutos procesar secuencias de Arabidopsis thaliana y varias horas procesar un cromosoma humano. [1] : 440  En comparación con otras herramientas, PatternHunter presenta velocidades que son aproximadamente cien veces más rápidas que BLAST y Mega BLAST. [7] Estas velocidades son 3000 veces las que se obtienen con un algoritmo Smith-Waterman . Además, el programa tiene una interfaz fácil de usar que permite personalizar los parámetros de búsqueda.

Sensibilidad

En términos de sensibilidad, es posible alcanzar la sensibilidad óptima con PatternHunter manteniendo la misma velocidad que una búsqueda BLAST convencional.

Presupuesto

El diseño de PatternHunter utiliza tecnología Java , por lo que el programa funciona sin problemas cuando se instala en cualquier entorno Java 1.4. [7]

Avances futuros

La búsqueda de homología es un procedimiento muy largo que requiere mucho tiempo. Aún existen desafíos en el manejo de búsquedas ADN-ADN, así como búsquedas ADN-proteína traducidas, debido al gran tamaño de las bases de datos y la pequeña consulta que se utiliza. PatternHunter se ha mejorado a una versión mejorada de PatternHunter II, que acelera las búsquedas ADN-proteína cien veces sin alterar la sensibilidad. Sin embargo, existen planes para mejorar PatternHunter para alcanzar la alta sensibilidad de la herramienta Smith-Waterman y al mismo tiempo obtener la velocidad BLAST. Un nuevo PatternHunter traducido que pretende acelerar tBLASTx. [4] : 174  también está en las etapas de desarrollo.

Referencias

  1. ^ abc Ma, Bin; Tromp, John; Li, Ming (2002). "PatternHunter: búsqueda de homología más rápida y sensible". Bioinformática . 18 (2): 440– 445. doi : 10.1093/bioinformatics/18.3.440 . PMID  11934743.
  2. ^ Joseph, Jacob M. (2012). Sobre la identificación e investigación de familias de genes homólogos, con especial énfasis en la precisión de las familias multidominio (PDF) (PhD). Universidad Carnegie Mellon.
  3. ^ Pevsner, Jonathan (2009). Bioinformática y genómica funcional (2.ª ed.). Nueva Jersey: Wiley Blackwell. ISBN  9780470451489.
  4. ^ ab Li, M.; Ma, B.; Kisman, D.; Tromp, J. (2003). "PatternHunter II: búsqueda de homología altamente sensible y rápida". Informática Genómica. Conferencia Internacional sobre Informática Genómica . 14 : 164– 175. PMID  15706531.
  5. ^ Pearson, WR (1991). "Búsqueda de bibliotecas de secuencias de proteínas: comparación de la sensibilidad y selectividad de los algoritmos Smith-Waterman y FASTA". Genomics . 11 (3): 635– 650. doi :10.1016/0888-7543(91)90071-L. PMID  1774068.
  6. ^ Zhang, Louxin. "Técnicas de búsqueda en bases de datos de secuencias I: herramientas Blast y PatternHunter" (PDF) . Consultado el 6 de diciembre de 2013 .
  7. ^ ab "Folleto PatternHunter" (PDF) . Archivado desde el original (PDF) el 11 de diciembre de 2013. Consultado el 30 de noviembre de 2013 .
Obtenido de "https://es.wikipedia.org/w/index.php?title=PatternHunter&oldid=1189504679"