FASTA es un paquete de software de alineación de secuencias de ADN y proteínas descrito por primera vez por David J. Lipman y William R. Pearson en 1985. [ 1 ] Su legado es el formato FASTA , que ahora es omnipresente en bioinformática .
Historia
El programa FASTA original fue diseñado para la búsqueda de similitud de secuencias de proteínas. Debido a la expansión exponencial de la información genética y la velocidad y memoria limitadas de las computadoras en la década de 1980, se introdujeron métodos heurísticos para alinear una secuencia de consulta con bases de datos completas. FASTA, publicado en 1987, añadió la capacidad de realizar búsquedas de ADN:ADN, búsquedas de proteína traducida:ADN y también proporcionó un programa de aleatorización más sofisticado para evaluar la significancia estadística. [ 2 ] Hay varios programas en este paquete que permiten la alineación de secuencias de proteínas y secuencias de ADN. Hoy en día, el mayor rendimiento de las computadoras permite realizar búsquedas para la detección de alineación local en una base de datos utilizando el algoritmo de Smith-Waterman .
FASTA se pronuncia "fast A" y significa "FAST-All" (rápido), porque funciona con cualquier alfabeto, una extensión de las herramientas de alineación originales "FAST-P" (proteína) y "FAST-N" (nucleótido).

Usos
El paquete FASTA actual contiene programas para búsquedas de proteínas:proteínas, ADN:ADN, proteínas:ADN traducido (con cambios de marco de lectura) y péptidos ordenados o no ordenados. Las versiones recientes del paquete FASTA incluyen algoritmos de búsqueda traducidos especiales que manejan correctamente los errores de cambio de marco de lectura (que las búsquedas traducidas de seis marcos de lectura no manejan muy bien) al comparar datos de secuencias de nucleótidos con datos de secuencias de proteínas.
Además de los métodos de búsqueda heurística rápida, el paquete FASTA proporciona SSEARCH, una implementación del algoritmo óptimo de Smith-Waterman .
Un objetivo principal del paquete es el cálculo de estadísticas de similitud precisas, de modo que los biólogos puedan determinar si una alineación probablemente se produjo por casualidad o si puede utilizarse para inferir homología . El paquete FASTA está disponible en la Universidad de Virginia [ 3 ] y en el Instituto Europeo de Bioinformática [ 4 ] .
El formato de archivo FASTA utilizado como entrada para este software ahora es ampliamente utilizado por otras herramientas de búsqueda en bases de datos de secuencias (como BLAST ) y programas de alineación de secuencias ( Clustal , T-Coffee , etc.).
Método de búsqueda
FASTA toma una secuencia de nucleótidos o aminoácidos dada y busca en una base de datos de secuencias correspondiente utilizando la alineación de secuencias local para encontrar coincidencias con secuencias similares de la base de datos.
El programa FASTA sigue un método mayormente heurístico que contribuye a su alta velocidad de ejecución. Inicialmente, observa el patrón de coincidencias de palabras, es decir, coincidencias palabra por palabra de una longitud determinada, y marca las posibles coincidencias antes de realizar una búsqueda optimizada, que consume más tiempo, utilizando un algoritmo tipo Smith-Waterman .
El tamaño de la palabra, definido por el parámetro k-mer, controla la sensibilidad y la velocidad del programa. Al aumentar el valor de k-mer, disminuye el número de coincidencias de fondo detectadas. A partir de las coincidencias de palabras obtenidas, el programa busca segmentos que contengan un grupo de coincidencias cercanas. A continuación, analiza estos segmentos en busca de una posible coincidencia.
Existen algunas diferencias entre fastn y fastp relacionadas con el tipo de secuencias utilizadas, pero ambas emplean cuatro pasos y calculan tres puntuaciones para describir y formatear los resultados de similitud de secuencias. Estas son:
- Identificar las regiones de mayor densidad en cada comparación de secuencias. Tomar un k-mer igual a 1 o 2.
- En este paso, se encuentran todas o un grupo de las identidades entre dos secuencias utilizando una tabla de búsqueda. El valor k-mer determina cuántas identidades consecutivas se requieren para que se declare una coincidencia. Por lo tanto, cuanto menor sea el valor k-mer, más sensible será la búsqueda. Los usuarios suelen usar k-mer=2 para secuencias de proteínas y k-mer=4 o 6 para secuencias de nucleótidos. Los oligonucleótidos cortos generalmente se procesan con k-mer=1. El programa luego encuentra todas las regiones locales similares , representadas como diagonales de cierta longitud en un diagrama de puntos, entre las dos secuencias contando coincidencias k-mer y penalizando las discrepancias intermedias. De esta manera, las regiones locales con mayor densidad de coincidencias en una diagonal se aíslan de las coincidencias de fondo. Para las secuencias de proteínas, se utilizan los valores BLOSUM50 para puntuar las coincidencias k-mer. Esto garantiza que los grupos de identidades con puntuaciones de similitud altas contribuyan más a la puntuación diagonal local que las identidades con puntuaciones de similitud bajas. Las secuencias de nucleótidos utilizan la matriz de identidad para el mismo propósito. A continuación, se guardan las 10 mejores regiones locales seleccionadas de entre todas las diagonales.
- Vuelva a escanear las regiones tomadas utilizando las matrices de puntuación, recortando los extremos de la región para incluir solo aquellos que contribuyen a la puntuación más alta.
- Reanaliza las 10 regiones seleccionadas. Esta vez, utiliza la matriz de puntuación correspondiente para permitir secuencias de identidades más cortas que el valor k-mer. Además, durante la reevaluación, se toman los reemplazos conservadores que contribuyen a la puntuación de similitud. Si bien las secuencias de proteínas utilizan la matriz BLOSUM50 , también se pueden usar con el programa matrices de puntuación basadas en el número mínimo de cambios de bases requeridos para un reemplazo específico, en identidades únicamente o en una medida de similitud alternativa como PAM . Para cada una de las regiones diagonales reanalizadas de esta manera, se identifica una subregión con la puntuación máxima. Las puntuaciones iniciales encontradas en el paso 1 se utilizan para clasificar las secuencias de la biblioteca. La puntuación más alta se denomina puntuación init1 .
- En una alineación, si se encuentran varias regiones iniciales con puntuaciones superiores a un valor CUTOFF, compruebe si las regiones iniciales recortadas pueden unirse para formar una alineación aproximada con huecos. Calcule una puntuación de similitud que es la suma de las regiones unidas, penalizando cada hueco con 20 puntos. Esta puntuación de similitud inicial ( initn ) se utiliza para clasificar las secuencias de la biblioteca. Se informa la puntuación de la mejor región inicial encontrada en el paso 2 ( init1 ).
- Aquí, el programa calcula una alineación óptima de las regiones iniciales como una combinación de regiones compatibles con la puntuación máxima. Esta alineación óptima de las regiones iniciales se puede calcular rápidamente mediante un algoritmo de programación dinámica. La puntuación resultante initn se utiliza para clasificar las secuencias de la biblioteca. Este proceso de unión aumenta la sensibilidad, pero disminuye la selectividad. Por lo tanto, se utiliza un valor de corte cuidadosamente calculado para controlar dónde se implementa este paso, un valor que es aproximadamente una desviación estándar por encima de la puntuación promedio esperada de secuencias no relacionadas en la biblioteca. Una secuencia de consulta de 200 residuos con k-mer 2 utiliza un valor de 28.
- Utilice un algoritmo Smith-Waterman con bandas para calcular una puntuación óptima para la alineación.
- Este paso utiliza un algoritmo de Smith-Waterman con bandas para generar una puntuación optimizada ( opt ) para cada alineación de la secuencia de consulta con una secuencia de la base de datos (biblioteca). Para calcular la alineación óptima, se utiliza una banda de 32 residuos centrada en la región init1 del paso 2. Tras analizar todas las secuencias, el programa representa gráficamente las puntuaciones iniciales de cada secuencia de la base de datos en un histograma y calcula la significación estadística de la puntuación "opt". Para secuencias de proteínas, la alineación final se genera mediante una alineación completa de Smith-Waterman . Para secuencias de ADN, se proporciona una alineación con bandas.

FASTA puede eliminar regiones de complejidad antes de alinear las secuencias codificando las regiones de baja complejidad en minúsculas y utilizando la opción -S. Sin embargo, el programa BLAST ofrece más opciones para corregir las estadísticas de composición sesgadas. Por lo tanto, el programa PRSS se ha añadido al paquete de distribución de FASTA. PRSS reordena las secuencias coincidentes en la base de datos, ya sea a nivel de una letra o mediante segmentos cortos cuya longitud puede determinar el usuario. Las secuencias reordenadas se alinean de nuevo y, si la puntuación sigue siendo superior a la esperada, esto se debe a que las regiones de baja complejidad siguen mezcladas y se corresponden con la secuencia de consulta. Según la puntuación que alcancen las secuencias reordenadas, PRSS puede predecir la significancia de la puntuación de las secuencias originales. Cuanto mayor sea la puntuación de las secuencias reordenadas, menos significativas serán las coincidencias encontradas entre la base de datos original y la secuencia de consulta. [ 5 ]
Los programas FASTA encuentran regiones de similitud local o global entre secuencias de proteínas o ADN, ya sea mediante la búsqueda en bases de datos de proteínas o ADN, o mediante la identificación de duplicaciones locales dentro de una secuencia. Otros programas proporcionan información sobre la significación estadística de una alineación. Al igual que BLAST, FASTA puede utilizarse para inferir relaciones funcionales y evolutivas entre secuencias, así como para ayudar a identificar miembros de familias de genes.
Significancia estadística
La significación estadística de la puntuación se determina generalmente mediante una prueba de permutación : los datos de consulta se reordenan aleatoriamente (la proporción nucleótido/aminoácido permanece inalterada) y se calcula la puntuación correspondiente. Al comparar puntuaciones, no se hacen suposiciones basadas en modelos evolutivos, sino que se opta por ordenar aleatoriamente los datos subyacentes como un indicador de no significación ( hipótesis nula ). Esto contrasta con BLAST, que emplea una prueba estadística basada en una distribución modelada (el estadístico de prueba de Karlin-Altschul [ 6 ] ) derivada de una matriz de sustitución (típicamente BLOSUM o PAM para aminoácidos). Si bien esto ralentiza considerablemente la prueba de hipótesis , también permite el manejo de composiciones de aminoácidos inusuales.
Véase también
Referencias
- ↑ Lipman, DJ; Pearson, WR (1985). "Búsquedas rápidas y sensibles de similitud de proteínas". Science . 227 (4693): 1435– 41. Bibcode : 1985Sci...227.1435L . doi : 10.1126/science.2983426 . PMID 2983426 .

- ↑ Pearson, WR; Lipman, DJ (1988). "Herramientas mejoradas para la comparación de secuencias biológicas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 85 ( 8): 2444– 8. Bibcode : 1988PNAS...85.2444P . doi : 10.1073/pnas.85.8.2444 . PMC 280013. PMID 3162770 .
- ↑ "Programas FASTA" . Archivado del original el 4 de marzo de 2000.
- ↑ "FASTA/SSEARCH/GGSEARCH/GLSEARCH < Búsqueda de similitud de secuencias < EMBL-EBI" .
- ↑ David W. Mount: Bioinformática, Secuencia y Análisis del Genoma , Edición 1, Cold Spring Harbor Laboratory Press, 2001, pp. 295–297.
- ↑ Karlin, S; Altschul, SF (1990-03-15). "Métodos para evaluar la significación estadística de las características de la secuencia molecular mediante el uso de esquemas de puntuación generales" . Actas de la Academia Nacional de Ciencias . 87 (6): 2264– 2268. doi : 10.1073/pnas.87.6.2264 . PMC 53667. PMID 2315319 .
- Software de filogenética