
En bioinformática , BLAST ( herramienta básica de búsqueda de alineación local ) [ 3 ] es un algoritmo y programa para comparar información de secuencias biológicas primarias , como las secuencias de aminoácidos de las proteínas , los nucleótidos del ADN y/o las secuencias de ARN . Una búsqueda BLAST permite a un investigador comparar una proteína o secuencia de nucleótidos (llamada consulta) con una biblioteca o base de datos de secuencias, e identificar secuencias de la base de datos que se asemejen a la secuencia de consulta por encima de un cierto umbral. Por ejemplo, tras el descubrimiento de un gen previamente desconocido en el ratón , un científico normalmente realizará una búsqueda BLAST en el genoma humano para ver si los humanos poseen un gen similar; BLAST identificará secuencias en el genoma humano que se asemejen al gen del ratón basándose en la similitud de secuencia.
Fondo
BLAST es un programa bioinformático ampliamente utilizado para la búsqueda de secuencias. [ 4 ] Aborda un problema fundamental en la investigación bioinformática. El algoritmo heurístico que utiliza es más rápido para búsquedas a gran escala en comparación con métodos como Smith-Waterman. Este énfasis en la velocidad es vital para que el algoritmo sea práctico en las enormes bases de datos genómicas disponibles actualmente, aunque los algoritmos posteriores podrían ser aún más rápidos.
Desarrollo e historia
El programa BLAST fue diseñado por Eugene Myers, Stephen Altschul, Warren Gish, David J. Lipman y Webb Miller en los NIH y se publicó en J. Mol. Biol. en 1990. BLAST se basa en FASTA , un programa desarrollado previamente para la búsqueda de similitud de secuencias de proteínas y ADN. Incorpora un novedoso modelo estocástico desarrollado por Samuel Karlin y Stephen Altschul . [ 5 ] Propusieron "un método para estimar similitudes entre la secuencia de ADN conocida de un organismo y la de otro", [ 3 ] y su trabajo ha sido descrito como "la base estadística de BLAST". [ 6 ] Posteriormente, Altschul, Gish, Miller, Myers y Lipman diseñaron e implementaron el programa BLAST, que se publicó en el Journal of Molecular Biology en 1990 y ha sido citado más de 100 000 veces desde entonces. [ 7 ]
Algoritmo
Si bien BLAST es más rápido que cualquier implementación de Smith-Waterman en la mayoría de los casos, no puede garantizar la alineación óptima de las secuencias de consulta y de la base de datos, como sí lo hace el algoritmo de Smith-Waterman. Este último fue una extensión de un método óptimo anterior, el algoritmo de Needleman-Wunsch , que fue el primer algoritmo de alineación de secuencias que garantizaba encontrar la mejor alineación posible. Sin embargo, los requisitos de tiempo y espacio de estos algoritmos óptimos superan con creces los de BLAST.
BLAST es más eficiente en cuanto a tiempo que FASTA, ya que busca únicamente los patrones más significativos en las secuencias, manteniendo una sensibilidad comparable. Esto se puede comprender mejor al analizar el algoritmo de BLAST que se presenta a continuación.
Otros ejemplos de preguntas que los investigadores intentan responder con BLAST son:
- ¿Qué especies bacterianas poseen una proteína relacionada en linaje con una determinada proteína de secuencia de aminoácidos conocida?
- ¿Qué otros genes codifican proteínas que exhiben estructuras o motivos como los que se acaban de determinar?
BLAST también se utiliza con frecuencia como parte de otros algoritmos que requieren una coincidencia aproximada de secuencias .
BLAST está disponible en la web en el sitio web del NCBI. Existen diferentes tipos de BLAST según las secuencias de consulta y las bases de datos objetivo. Entre las implementaciones alternativas se incluyen AB-BLAST (anteriormente conocido como WU-BLAST), FSA-BLAST (última actualización en 2006) y ScalaBLAST. [ 8 ] [ 9 ]
El artículo original de Altschul, et al. [ 7 ] fue el artículo más citado publicado en la década de 1990. [ 10 ]
Aporte
Secuencias de entrada (en formato FASTA o Genbank ), base de datos para la búsqueda y otros parámetros opcionales como la matriz de puntuación. [ 11 ]
Producción
Los resultados de BLAST pueden presentarse en diversos formatos, como HTML , texto plano y XML . En la página web del NCBI, el formato predeterminado es HTML. Al realizar una búsqueda BLAST en el NCBI, los resultados se muestran en formato gráfico: una tabla con los identificadores de secuencia y sus puntuaciones, así como alineaciones de la secuencia de interés y los resultados obtenidos con sus respectivas puntuaciones BLAST. La tabla es probablemente la más fácil de leer y la más informativa.
Si se busca una secuencia propietaria o simplemente una que no se encuentra en las bases de datos públicas, como las del NCBI, existe un programa BLAST que se puede descargar gratuitamente a cualquier ordenador. Este programa se encuentra en la sección de ejecutables de BLAST+. También hay programas comerciales disponibles para su compra. Las bases de datos se pueden encontrar en el sitio web del NCBI, así como en el Índice de bases de datos BLAST (FTP).
Proceso
Mediante un método heurístico , BLAST encuentra secuencias similares, localizando coincidencias cortas entre ambas. Este proceso se denomina inicialización. Tras esta primera coincidencia, BLAST comienza a realizar alineamientos locales. Al intentar encontrar similitudes entre secuencias, los conjuntos de letras comunes, conocidos como palabras, son de vital importancia. Por ejemplo, supongamos que la secuencia contiene el siguiente fragmento de letras: GLKFA. Si se realizara un BLAST en condiciones normales, el tamaño de la palabra sería de 3 letras. En este caso, utilizando el fragmento de letras dado, las palabras buscadas serían GLK, LKF y KFA. El algoritmo heurístico de BLAST localiza todas las palabras comunes de tres letras entre la secuencia de interés y la secuencia o secuencias coincidentes de la base de datos. Este resultado se utilizará para construir un alineamiento. Tras crear las palabras para la secuencia de interés, se ensamblan también las demás. Estas palabras deben cumplir el requisito de tener una puntuación de al menos el umbral T , al compararlas mediante una matriz de puntuación.
Una matriz de puntuación comúnmente utilizada para búsquedas BLAST es BLOSUM62 , [ 12 ] aunque la matriz de puntuación óptima depende de la similitud de secuencia. Una vez que tanto las palabras como las palabras vecinas se ensamblan y compilan, se comparan con las secuencias en la base de datos para encontrar coincidencias. La puntuación umbral T determina si una palabra en particular se incluirá o no en la alineación. Una vez realizada la inicialización, la alineación, que tiene solo 3 residuos de longitud, se extiende en ambas direcciones mediante el algoritmo utilizado por BLAST. Cada extensión afecta la puntuación de la alineación, aumentándola o disminuyéndola. Si esta puntuación es mayor que un T predeterminado, la alineación se incluirá en los resultados proporcionados por BLAST. Sin embargo, si esta puntuación es menor que este T predeterminado , la alineación dejará de extenderse, evitando que las áreas de mala alineación se incluyan en los resultados de BLAST. Tenga en cuenta que aumentar la puntuación T limita la cantidad de espacio disponible para la búsqueda, disminuyendo el número de palabras vecinas, al tiempo que acelera el proceso de BLAST.
Algoritmo
Para ejecutar el software, BLAST requiere una secuencia de consulta para buscar y una secuencia de referencia (también llamada secuencia objetivo) o una base de datos de secuencias que contenga varias de estas secuencias. BLAST encontrará en la base de datos subsecuencias similares a las de la secuencia de consulta. En el uso habitual, la secuencia de consulta es mucho más pequeña que la base de datos; por ejemplo, la consulta puede tener mil nucleótidos, mientras que la base de datos contiene varios miles de millones de nucleótidos.
La idea principal de BLAST es que a menudo hay pares de segmentos de alta puntuación (HSP) contenidos en una alineación estadísticamente significativa. BLAST busca alineaciones de secuencias de alta puntuación entre la secuencia de consulta y las secuencias existentes en la base de datos utilizando un enfoque heurístico que se aproxima al algoritmo de Smith-Waterman . Sin embargo, el enfoque exhaustivo de Smith-Waterman es demasiado lento para buscar en grandes bases de datos genómicas como GenBank . Por lo tanto, el algoritmo BLAST utiliza un enfoque heurístico que es menos preciso que el algoritmo de Smith-Waterman pero más de 50 veces más rápido. [ 13 ] La velocidad y la precisión relativamente buena de BLAST se encuentran entre las innovaciones técnicas de los programas BLAST. Los pasos clave del algoritmo incluyen filtrar regiones de baja complejidad, identificar coincidencias de palabras de alta puntuación y evaluar estadísticamente las alineaciones.
A continuación se presenta una descripción general del algoritmo BLAST (una búsqueda de proteína a proteína): [ 13 ]
- Elimine las regiones o secuencias repetidas de baja complejidad en la secuencia de consulta.
- Una "región de baja complejidad" se refiere a una región de una secuencia compuesta por pocos tipos de elementos. Estas regiones pueden generar puntuaciones altas que confunden al programa a la hora de encontrar las secuencias realmente significativas en la base de datos, por lo que deben filtrarse. Las regiones se marcarán con una X (secuencias de proteínas) o una N (secuencias de ácidos nucleicos) y, posteriormente, el programa BLAST las ignorará. Para filtrar las regiones de baja complejidad, se utiliza el programa SEG para secuencias de proteínas y el programa DUST para secuencias de ADN. Por otro lado, el programa XNU se utiliza para enmascarar las repeticiones en tándem en las secuencias de proteínas.
- Crea una lista de palabras de k letras de la secuencia de consulta.
- Tomemos como ejemplo k = 3. Enumeramos las palabras de longitud 3 en la secuencia de proteína de consulta ( k suele ser 11 para una secuencia de ADN) de forma secuencial, hasta incluir la última letra de la secuencia de consulta. El método se ilustra en la figura 1.

Fig. 1 Método para establecer la lista de palabras de consulta de k letras. [ 14 ]
- Tomemos como ejemplo k = 3. Enumeramos las palabras de longitud 3 en la secuencia de proteína de consulta ( k suele ser 11 para una secuencia de ADN) de forma secuencial, hasta incluir la última letra de la secuencia de consulta. El método se ilustra en la figura 1.
- Enumera las posibles palabras coincidentes.
- Este paso es una de las principales diferencias entre BLAST y FASTA. FASTA considera todas las palabras comunes en la base de datos y las secuencias de consulta que se enumeran en el paso 2; sin embargo, BLAST solo considera las palabras con puntuaciones altas. Las puntuaciones se crean comparando la palabra de la lista del paso 2 con todas las palabras de 3 letras. Al usar la matriz de puntuación ( matriz de sustitución ) para puntuar la comparación de cada par de residuos, hay 20^3 posibles puntuaciones de coincidencia para una palabra de 3 letras. Por ejemplo, la puntuación obtenida al comparar PQG con PEG y PQA es de 15 y 12 respectivamente con el esquema de ponderación BLOSUM62 . Para las palabras de ADN, una coincidencia se puntúa como +5 y una discrepancia como -4, o como +2 y -3. Después de eso, se usa un umbral de puntuación de palabras vecinas T para reducir el número de posibles palabras coincidentes. Las palabras cuyas puntuaciones sean mayores que el umbral T permanecerán en la lista de posibles palabras coincidentes, mientras que aquellas con puntuaciones más bajas se descartarán. Por ejemplo, se mantiene el PEG, pero se abandona el PQA cuando T es 13.
- Organiza las palabras restantes con mayor puntuación en un árbol de búsqueda eficiente.
- Esto permite que el programa compare rápidamente las palabras con mayor puntuación con las secuencias de la base de datos.
- Repita los pasos 3 y 4 para cada palabra de k letras en la secuencia de consulta.
- Analizar las secuencias de la base de datos para encontrar coincidencias exactas con las palabras restantes de alta puntuación.
- El programa BLAST analiza las secuencias de la base de datos en busca de la palabra con mayor puntuación restante, como PEG, en cada posición. Si se encuentra una coincidencia exacta, esta se utiliza como punto de partida para una posible alineación sin huecos entre la secuencia de consulta y la de la base de datos.
- Ampliar las coincidencias exactas a pares de segmentos de alta puntuación (HSP).
- La versión original de BLAST extiende una alineación más larga entre la secuencia de consulta y la de la base de datos, tanto a la izquierda como a la derecha, desde la posición donde se produjo la coincidencia exacta. La extensión no se detiene hasta que la puntuación total acumulada del HSP comienza a disminuir. En la figura 2 se presenta un ejemplo simplificado.

Figura 2. Proceso para extender la coincidencia exacta. Adaptado de Análisis de secuencias biológicas I, Temas actuales en análisis genómico.. 
Figura 3. Posiciones de las coincidencias exactas. - Para ahorrar tiempo, se ha desarrollado una versión más reciente de BLAST, denominada BLAST2 o BLAST con huecos. BLAST2 adopta un umbral de puntuación de palabras vecinas más bajo para mantener el mismo nivel de sensibilidad en la detección de similitud de secuencias. Por lo tanto, la lista de posibles palabras coincidentes en el paso 3 se alarga. A continuación, las regiones coincidentes exactas, dentro de una distancia A entre sí en la misma diagonal de la figura 3, se unirán para formar una nueva región más larga. Finalmente, las nuevas regiones se extienden mediante el mismo método que en la versión original de BLAST, y las puntuaciones de los HSP (pares de segmentos de alta puntuación) de las regiones extendidas se crean utilizando una matriz de sustitución como antes.
- La versión original de BLAST extiende una alineación más larga entre la secuencia de consulta y la de la base de datos, tanto a la izquierda como a la derecha, desde la posición donde se produjo la coincidencia exacta. La extensión no se detiene hasta que la puntuación total acumulada del HSP comienza a disminuir. En la figura 2 se presenta un ejemplo simplificado.
- Enumera todas las personas altamente sensibles (PAS) de la base de datos cuya puntuación sea lo suficientemente alta como para ser consideradas.
- Enumeramos los HSP cuyos puntajes son mayores que el puntaje de corte S determinado empíricamente . Al examinar la distribución de los puntajes de alineación modelados mediante la comparación de secuencias aleatorias, se puede determinar un puntaje de corte S cuyo valor sea lo suficientemente grande como para garantizar la significancia de los HSP restantes.
- Evaluar la importancia de la puntuación HSP.
- A continuación, BLAST evalúa la significación estadística de cada puntuación HSP mediante la distribución de valores extremos (DVE) de Gumbel. (Está demostrado que la distribución de las puntuaciones de alineación local de Smith-Waterman entre dos secuencias aleatorias sigue la DVE de Gumbel. Para alineaciones locales que contienen huecos, esto no está demostrado). De acuerdo con la DVE de Gumbel, la probabilidad p de observar una puntuación S igual o mayor que x viene dada por la ecuación
- dónde
- Los parámetros estadísticosyse estiman ajustando la distribución de las puntuaciones de alineación local sin huecos, de la secuencia de consulta y muchas versiones aleatorizadas (aleatorización global o local) de una secuencia de base de datos, a la distribución de valores extremos de Gumbel. Tenga en cuenta queydependen de la matriz de sustitución, las penalizaciones por huecos y la composición de la secuencia (las frecuencias de las letras).yson las longitudes efectivas de las secuencias de consulta y de la base de datos, respectivamente. La longitud de la secuencia original se acorta a la longitud efectiva para compensar el efecto de borde (es probable que un inicio de alineación cerca del final de una de las secuencias de consulta o de la base de datos no tenga suficiente secuencia para construir una alineación óptima). Se pueden calcular como
- dóndees la puntuación promedio esperada por par de residuos alineados en una alineación de dos secuencias aleatorias. Altschul y Gish dieron los valores típicos,,, y, para alineación local sin huecos usando BLOSUM62 como matriz de sustitución. El uso de valores típicos para evaluar la significancia se llama método de tabla de búsqueda; no es preciso. La puntuación esperada E de una coincidencia de base de datos es el número de veces que una secuencia de base de datos no relacionada obtendría una puntuación S mayor que x por casualidad. La expectativa E obtenida en una búsqueda para una base de datos de secuencias D viene dada por
- Además, cuando, E podría aproximarse mediante la distribución de Poisson como
- Este valor esperado "E" (a menudo denominado puntuación E , valor E o valor e ), que evalúa la significancia de la puntuación HSP para la alineación local sin huecos, se informa en los resultados de BLAST. El cálculo que se muestra aquí se modifica si se combinan HSP individuales, como al producir alineaciones con huecos (que se describen más adelante), debido a la variación de los parámetros estadísticos.
- A continuación, BLAST evalúa la significación estadística de cada puntuación HSP mediante la distribución de valores extremos (DVE) de Gumbel. (Está demostrado que la distribución de las puntuaciones de alineación local de Smith-Waterman entre dos secuencias aleatorias sigue la DVE de Gumbel. Para alineaciones locales que contienen huecos, esto no está demostrado). De acuerdo con la DVE de Gumbel, la probabilidad p de observar una puntuación S igual o mayor que x viene dada por la ecuación
- Alinea dos o más regiones HSP para formar una alineación más larga.
- A veces, encontramos dos o más regiones HSP en una secuencia de base de datos que pueden formar una alineación más larga. Esto proporciona evidencia adicional de la relación entre la secuencia de consulta y la de la base de datos. Existen dos métodos, el método de Poisson y el método de suma de puntuaciones, para comparar la significancia de las regiones HSP recién combinadas. Supongamos que hay dos regiones HSP combinadas con los pares de puntuaciones (65, 40) y (52, 45), respectivamente. El método de Poisson otorga mayor significancia al conjunto con la puntuación mínima máxima (45>40). Sin embargo, el método de suma de puntuaciones prefiere el primer conjunto, porque 65+40 (105) es mayor que 52+45 (97). El BLAST original utiliza el método de Poisson; el BLAST con huecos y el WU-BLAST utilizan el método de suma de puntuaciones.
- Muestre los alineamientos locales de Smith-Waterman con huecos de la secuencia de consulta y de cada una de las secuencias coincidentes de la base de datos.
- El BLAST original solo genera alineaciones sin huecos que incluyen los HSP encontrados inicialmente de forma individual, incluso cuando se encuentra más de un HSP en una secuencia de la base de datos.
- BLAST2 genera una única alineación con huecos que pueden incluir todas las regiones HSP encontradas inicialmente. Cabe destacar que el cálculo de la puntuación y su valor E correspondiente implica el uso de penalizaciones adecuadas para los huecos.
- Informe cada partido cuya puntuación esperada sea inferior a un parámetro umbral E.
Tipos de BLAST
- BLASTn (BLAST de nucleótidos)
BLASTn ofrece búsquedas de nucleótidos a nucleótidos. Esto es útil cuando se intenta identificar relaciones evolutivas entre organismos. [ 15 ]
- tBLASTn
tBLASTn se utiliza para realizar búsquedas de proteínas en ADN traducido. Esto resulta útil para buscar regiones codificantes de proteínas similares en secuencias de ADN que no han sido completamente anotadas, como EST (secuencias cortas de ADNc de lectura única) y HTG (secuencias de genomas borrador). Dado que estas secuencias no tienen traducciones de proteínas conocidas, solo podemos buscarlas utilizando tBLASTn. [ 15 ]
- BLASTx
BLASTx compara una secuencia de consulta de nucleótidos (que puede traducirse en seis secuencias de proteínas diferentes) con una base de datos de proteínas. Esta herramienta es útil cuando el marco de lectura de la secuencia de ADN es incierto o contiene errores que podrían causar errores en la codificación de proteínas. BLASTx proporciona estadísticas combinadas de coincidencias en todos los marcos, lo que resulta útil para el análisis inicial de nuevas secuencias de ADN. [ 15 ]
- BLASTp

BLASTp, o Protein BLAST, se utiliza para comparar secuencias de proteínas. Puedes introducir una o más secuencias de proteínas que quieras comparar con una única secuencia de proteína o con una base de datos de secuencias de proteínas. Esto resulta útil cuando intentas identificar una proteína buscando secuencias similares en bases de datos de proteínas existentes. [ 15 ]
Explosión paralela
Las versiones paralelas de BLAST para bases de datos divididas se implementan utilizando MPI y Pthreads , y se han adaptado a diversas plataformas, incluyendo Windows , Linux , Solaris , Mac OS X y AIX . Los enfoques más comunes para paralelizar BLAST incluyen la distribución de consultas, la segmentación de tablas hash, la paralelización de cálculos y la segmentación (partición) de bases de datos. Las bases de datos se dividen en partes de igual tamaño y se almacenan localmente en cada nodo. Cada consulta se ejecuta en todos los nodos en paralelo y los archivos de salida BLAST resultantes de todos los nodos se combinan para obtener el resultado final. Algunas implementaciones específicas incluyen MPIblast, ScalaBLAST, DCBLAST, etc. [ 16 ]
MPIblast utiliza una técnica de segmentación de bases de datos para paralelizar el proceso de cálculo. [ 17 ] Esto permite mejoras significativas en el rendimiento al realizar búsquedas BLAST en un conjunto de nodos de un clúster. En algunos casos, se puede lograr una aceleración superlineal. Esto hace que MPIblast sea adecuado para los extensos conjuntos de datos genómicos que se utilizan habitualmente en bioinformática.
BLAST generalmente se ejecuta a una velocidad de O(n) , donde n es el tamaño de la base de datos. [ 18 ] El tiempo para completar la búsqueda aumenta linealmente a medida que aumenta el tamaño de la base de datos. MPIblast utiliza procesamiento paralelo para acelerar la búsqueda. La velocidad ideal para cualquier computación paralela es una complejidad de O(n/p), donde n es el tamaño de la base de datos y p es el número de procesadores. Esto indicaría que el trabajo se distribuye uniformemente entre los p procesadores. Esto se visualiza en el gráfico adjunto. La aceleración superlineal que a veces puede ocurrir con MPIblast puede tener una complejidad mejor que O(n/p). Esto sucede porque la memoria caché se puede usar para disminuir el tiempo de ejecución. [ 19 ]
Alternativas a BLAST
FASTA , el predecesor de BLAST , también se puede utilizar para la búsqueda de similitud entre proteínas y ADN. FASTA ofrece un conjunto similar de programas para comparar proteínas con bases de datos de proteínas y ADN, ADN con bases de datos de ADN y proteínas, e incluye programas adicionales para trabajar con péptidos cortos no ordenados y secuencias de ADN. Además, el paquete FASTA proporciona SSEARCH, una implementación vectorizada del riguroso algoritmo de Smith-Waterman . FASTA es más lento que BLAST, pero ofrece una gama mucho más amplia de matrices de puntuación, lo que facilita la adaptación de la búsqueda a una distancia evolutiva específica.
Una alternativa extremadamente rápida pero considerablemente menos sensible a BLAST es BLAT ( Blast Like Alignment Tool ). Mientras que BLAST realiza una búsqueda lineal, BLAT se basa en la indexación de la base de datos mediante k-meros y, por lo tanto , a menudo puede encontrar semillas más rápido. [ 20 ] Otra alternativa de software similar a BLAT es PatternHunter .
Los avances en la tecnología de secuenciación a finales de la década de 2000 convirtieron la búsqueda de coincidencias de nucleótidos muy similares en un problema importante. Los nuevos programas de alineación diseñados para este fin suelen utilizar la indexación BWT de la base de datos objetivo (normalmente un genoma). Las secuencias de entrada se pueden mapear muy rápidamente y la salida suele ser un archivo BAM. Algunos ejemplos de programas de alineación son BWA , SOAP y Bowtie .
Para la identificación de proteínas, una alternativa popular es la búsqueda de dominios conocidos (por ejemplo, de Pfam ) mediante la comparación con modelos ocultos de Markov , como HMMER .
Una alternativa a BLAST para comparar dos bancos de secuencias es PLAST. PLAST proporciona una herramienta de búsqueda de similitud de secuencias de alto rendimiento y propósito general entre bancos, basada en los algoritmos PLAST [ 21 ] y ORIS [ 22 ] . Los resultados de PLAST son muy similares a los de BLAST, pero PLAST es significativamente más rápido y capaz de comparar grandes conjuntos de secuencias con un bajo consumo de memoria (RAM).
Para aplicaciones en metagenómica, donde la tarea consiste en comparar miles de millones de lecturas cortas de ADN con decenas de millones de referencias de proteínas, DIAMOND [ 23 ] se ejecuta hasta 20 000 veces más rápido que BLASTX, manteniendo un alto nivel de sensibilidad.
El software de código abierto MMseqs es una alternativa a BLAST/PSI-BLAST, que mejora las herramientas de búsqueda actuales en todo el rango de compensación velocidad-sensibilidad, logrando sensibilidades mejores que PSI-BLAST a más de 400 veces su velocidad. [ 24 ]
Se han propuesto enfoques de computación óptica como alternativas prometedoras a las implementaciones eléctricas actuales. OptCAM es un ejemplo de estos enfoques y se ha demostrado que es más rápido que BLAST. [ 25 ]
Comparación entre BLAST y el proceso Smith-Waterman
Si bien tanto Smith-Waterman como BLAST se utilizan para encontrar secuencias homólogas mediante la búsqueda y comparación de una secuencia de consulta con las de las bases de datos, presentan algunas diferencias.
Debido a que BLAST se basa en un algoritmo heurístico, los resultados obtenidos no incluyen todas las coincidencias posibles en la base de datos. BLAST omite coincidencias difíciles de encontrar.
Una alternativa para encontrar todas las coincidencias posibles sería utilizar el algoritmo Smith-Waterman. Este método se diferencia del método BLAST en dos aspectos: precisión y velocidad. La opción Smith-Waterman ofrece mayor precisión, ya que encuentra coincidencias que BLAST no puede, al no excluir ninguna información. Por lo tanto, es esencial para la homología remota. Sin embargo, en comparación con BLAST, consume más tiempo y requiere una gran cantidad de potencia de cálculo y memoria. No obstante, se han logrado avances para acelerar drásticamente el proceso de búsqueda de Smith-Waterman. Estos avances incluyen chips FPGA y tecnología SIMD .
Para obtener resultados más completos con BLAST, se pueden modificar los ajustes predeterminados. Sin embargo, la configuración óptima para una secuencia determinada puede variar. Los ajustes que se pueden modificar son el valor E, los costos de los huecos, los filtros, el tamaño de palabra y la matriz de sustitución.
Cabe señalar que el algoritmo utilizado para BLAST se desarrolló a partir del algoritmo utilizado para Smith-Waterman. BLAST emplea un alineamiento que encuentra "alineamientos locales entre secuencias mediante la búsqueda de coincidencias cortas y, a partir de estas coincidencias iniciales, se crean alineamientos (locales)". [ 26 ]
Visualización de la salida de BLAST
Para ayudar a los usuarios a interpretar los resultados de BLAST, hay disponible software diverso. Según la instalación y el uso, las características de análisis y la tecnología, aquí hay algunas herramientas disponibles: [ 27 ]
- Servicio BLAST del NCBI
- Intérpretes generales de salida BLAST, basados en GUI: JAMBLAST, Blast Viewer, BLASTGrabber
- Entornos BLAST integrados: PLAN, BlastStation-Free, SequenceServer
- Analizadores de salida de BLAST: MuSeqBox, Zerg, BioParser, BLAST-Explorer, SequenceServer
- Herramientas especializadas relacionadas con BLAST: MEGAN , BLAST2GENE, BOV, Circoletto
En las figuras 4 y 5 se muestran ejemplos de visualizaciones de los resultados de BLAST.


Usos de BLAST
BLAST se puede utilizar para diversos fines. Entre ellos se incluyen la identificación de especies, la localización de dominios, el establecimiento de filogenias, el mapeo de ADN y la comparación.
- Identificación de especies
- Mediante BLAST, es posible identificar correctamente una especie o encontrar especies homólogas. Esto puede resultar útil, por ejemplo, al trabajar con una secuencia de ADN de una especie desconocida.
- Localización de dominios
- Al trabajar con una secuencia de proteínas, puede introducirla en BLAST para localizar dominios conocidos dentro de la secuencia de interés.
- Establecimiento de la filogenia
- Utilizando los resultados obtenidos mediante BLAST, puede crear un árbol filogenético en la página web de BLAST. Las filogenias basadas únicamente en BLAST son menos fiables que otros métodos filogenéticos computacionales diseñados específicamente para este fin , por lo que solo deben utilizarse para análisis filogenéticos preliminares.
- mapeo de ADN
- Cuando se trabaja con una especie conocida y se busca secuenciar un gen en una ubicación desconocida, BLAST puede comparar la posición cromosómica de la secuencia de interés con secuencias relevantes en la(s) base(s) de datos. El NCBI dispone de una herramienta llamada "Magic-BLAST", basada en BLAST, para este propósito. [ 28 ]
- Comparación
- Al trabajar con genes, BLAST puede localizar genes comunes en dos especies relacionadas y puede utilizarse para mapear anotaciones de un organismo a otro.
- Clasificación taxonómica
- BLAST puede utilizar secuencias genéticas para comparar múltiples taxones con datos taxonómicos conocidos. De esta forma, puede proporcionar una visión de las relaciones evolutivas entre diversas especies (Fig. 6). Este método resulta útil para identificar genes huérfanos , ya que si el gen aparece en un organismo fuera del linaje ancestral, no se clasificaría como tal.

Figura 6. Resultado de una búsqueda BLASTP que muestra que un gen encontrado en Bufo japonicus también se encuentra en muchas otras especies del linaje de la rana ( Anura ). - Si bien este método es útil, algunas opciones más precisas para encontrar homólogos serían mediante el alineamiento de secuencias por pares y el alineamiento de secuencias múltiples .
Véase también
Referencias
- ↑ Notas de la versión de BLAST . Centro Nacional de Información Biotecnológica (EE. UU.). 24 de junio de 2024.
- ↑ "Información para desarrolladores de BLAST" . blast.ncbi.nlm.nih.gov .
- 1 2 Douglas Martin (21 de febrero de 2008). "Samuel Karlin, matemático versátil, muere a los 83 años" . The New York Times .
- ↑ RM Casey (2005). "Las secuencias BLAST ayudan en genómica y proteómica" . Business Intelligence Network.
- ↑ "Temas BLAST" .
- ↑ Dan Stober (16 de enero de 2008). "Sam Karlin, matemático que mejoró el análisis del ADN, muere a los 83 años" . Stanford.edu . Archivado del original el 12 de junio de 2016. Consultado el 16 de julio de 2019 .
- 1 2 Stephen Altschul ; Warren Gish ; Webb Miller ; Eugene Myers ; David J. Lipman (1990). "Herramienta básica de búsqueda de alineación local" . Journal of Molecular Biology . 215 (3): 403– 410. doi : 10.1016/S0022-2836(05)80360-2 . PMID 2231712. S2CID 14441902 .
- ↑ Oehmen, C.; Nieplocha, J. (2006). "ScalaBLAST: Una implementación escalable de BLAST para análisis bioinformáticos intensivos en datos de alto rendimiento" . IEEE Transactions on Parallel and Distributed Systems . 17 (8): 740. doi : 10.1109/TPDS.2006.112 . S2CID 11122366 .
- ↑ Oehmen, CS; Baxter, DJ (2013). "ScalaBLAST 2.0: Cálculos BLAST rápidos y robustos en sistemas multiprocesador" . Bioinformatics . 29 (6): 797– 798. doi : 10.1093/bioinformatics/btt013 . PMC 3597145. PMID 23361326 .
- ↑ "Interpretación de secuencias: Stephen F. Altschul sobre cómo mejorar BLAST" . ScienceWatch. Julio-agosto de 2000. Archivado del original el 7 de octubre de 2007.
- ↑ Penumarthi, Lasya R.; Baptista, Rodrigo P.; Beaudry, Megan S.; Glenn, Travis C.; Kissinger, Jessica C. (2024-12-18). "Un nuevo ensamblaje y anotación del genoma a nivel cromosómico de Cryptosporidium meleagridis" . Scientific Data . 11 (1): 1388. Bibcode : 2024NatSD..11.1388P . doi : 10.1038/ s41597-024-04235-7 . ISSN 2052-4463 . PMC 11655656. PMID 39695163 .
- ↑ Steven Henikoff ; Jorja Henikoff (1992). " Matrices de sustitución de aminoácidos a partir de bloques de proteínas" . PNAS . 89 (22): 10915–10919 . Bibcode : 1992PNAS...8910915H . doi : 10.1073/pnas.89.22.10915 . PMC 50453. PMID 1438297 .
- 1 2 Mount, DW (2004). Bioinformática: Análisis de secuencias y genomas (2.ª ed.). Cold Spring Harbor Press. ISBN 978-0-87969-712-9.
- ↑ Adaptado de Análisis de secuencias biológicas I, Temas actuales en análisis del genoma.
- 1 2 3 4 "Guías de la biblioteca: Recursos bioinformáticos del NCBI: Una introducción: BLAST: Comparar e identificar secuencias" .
- ↑ Yim, WC; Cushman, JC (2017). "Divide and Conquer (DC) BLAST: ejecución rápida y sencilla de BLAST en entornos HPC" . PeerJ . 5 e3486. doi : 10.7717/peerj.3486 . PMC 5483034. PMID 28652936 .
- ↑ Darling, Ace; Carey, Lewis; Feng, Wei-Chun (2003). "El diseño, la implementación y la evaluación de mpiBLAST" (PDF) . Universidad de Wisconsin-Madison . Recuperado el 17 de abril de 2023 .
- ↑ Kellis, Manolis (5 de octubre de 2020). "El algoritmo Blast (herramienta básica de búsqueda de alineación)" . LibreTexts . Recuperado el 17 de abril de 2023 .
- ↑ Darling, Ace; Carey, Lewis; Feng, Wei-Chun (2003). "El diseño, la implementación y la evaluación de mpiBLAST" (PDF) . Universidad de Wisconsin-Madison . Recuperado el 17 de abril de 2023 .
- ↑ Kent, W. James (1 de abril de 2002). "BLAT: la herramienta de alineación similar a BLAST" . Genome Research . 12 (4): 656–664 . doi : 10.1101/gr.229202 . ISSN 1088-9051 . PMC 187518. PMID 11932250 .
- ↑ Lavenier, D.; Lavenier, Dominique (2009). "PLAST: herramienta de búsqueda de alineación local paralela para comparación de bases de datos" . BMC Bioinformatics . 10 : 329. doi : 10.1186/1471-2105-10-329 . PMC 2770072. PMID 19821978 .
- ↑ Lavenier, D. (2009). "Algoritmo de semilla de índice ordenado para la comparación intensiva de secuencias de ADN" (PDF) . Simposio Internacional IEEE de Procesamiento Paralelo y Distribuido de 2008 (PDF) . págs. 1–8 . CiteSeerX 10.1.1.155.3633 . doi : 10.1109/IPDPS.2008.4536172 . ISBN 978-1-4244-1693-6. S2CID 10804289 .
- ↑ Buchfink, Xie y Huson (2015). "Alineación rápida y sensible de proteínas mediante DIAMOND". Nature Methods . 12 (1): 59– 60. doi : 10.1038/nmeth.3176 . PMID 25402007. S2CID 5346781 .
- ↑ Steinegger, Martin; Soeding, Johannes (16 de octubre de 2017). "MMseqs2 permite la búsqueda sensible de secuencias de proteínas para el análisis de conjuntos de datos masivos". Nature Biotechnology . 35 (11): 1026– 1028. doi : 10.1038/nbt.3988 . hdl : 11858 / 00-001M-0000-002E-1967-3 . PMID 29035372. S2CID 402352 .
- ^ Maleki, Ehsan; Koohi, Somayyeh; Kavehvash, Zahra; Mashaghi, Alireza (2020). "OptCAM: una arquitectura totalmente óptica ultrarrápida para el descubrimiento de variantes de ADN" . Revista de Biofotónica . 13 (1) e201900227. doi : 10.1002/jbio.201900227 . PMID 31397961 .
- ↑ "Bioinformática explicada: BLAST frente a Smith-Waterman" (PDF) . 4 de julio de 2007.
- ↑ Neumann, Kumar y Shalchian-Tabrizi (2014). "Visualización de la salida de BLAST en la nueva era de la secuenciación" . Briefings in Bioinformatics . 15 (4): 484– 503. doi : 10.1093/bib/bbt009 . PMID 23603091 .
- ↑ "NCBI Magic-BLAST" . ncbi.github.io . Consultado el 16 de mayo de 2019 .
Enlaces externos
- Sitio web oficial
- Archivos ejecutables de BLAST+ : descargas gratuitas del código fuente
- Algoritmos bioinformáticos
- Software de filogenética
- Software de laboratorio
- Software de dominio público
- Software bioinformático gratuito