Articulo de referencia

Frase

Phrap es un programa muy utilizado para el ensamblaje de secuencias de ADN . Forma parte del paquete Phred - Phrap- Consed . Historia Phrap fue desarrollado originalmente por el...

Phrap es un programa muy utilizado para el ensamblaje de secuencias de ADN . Forma parte del paquete Phred - Phrap- Consed .

Historia

Phrap fue desarrollado originalmente por el profesor Phil Green para el ensamblaje de cósmidos en la secuenciación masiva de cósmidos del Proyecto Genoma Humano . Phrap se ha utilizado ampliamente en diversos proyectos de ensamblaje de secuencias, incluyendo el ensamblaje de genomas bacterianos y el ensamblaje de EST.

Phrap se diseñó como un programa de línea de comandos para facilitar su integración en flujos de trabajo automatizados de datos en centros de secuenciación genómica. Para los usuarios que deseen utilizar Phrap desde una interfaz gráfica, están disponibles los programas comerciales MacVector (solo para Mac OS X ) y CodonCode Aligner (para Mac OS X y Microsoft Windows ).

Métodos

Una descripción detallada (aunque parcialmente desactualizada) de los algoritmos de Phrap se puede encontrar en la documentación de Phrap . Un tema recurrente dentro de los algoritmos de Phrap es el uso de puntuaciones de calidad Phred . Phrap usó puntuaciones de calidad para mitigar un problema con el que otros programas de ensamblaje habían tenido dificultades al comienzo del Proyecto Genoma Humano : el ensamblaje correcto de repeticiones imperfectas frecuentes, en particular secuencias Alu . Phrap usa puntuaciones de calidad para determinar si las diferencias observadas en las regiones repetidas probablemente se deban a ambigüedades aleatorias en el proceso de secuenciación, o más probablemente a que las secuencias provienen de diferentes copias de la repetición Alu. Por lo general, Phrap no tenía problemas para diferenciar entre las diferentes copias de Alu en un cósmido y para ensamblar correctamente los cósmidos (o, más tarde, los BAC ). La lógica es simple: una llamada de base con una alta probabilidad de ser correcta nunca debería alinearse con otra base diferente pero de alta calidad. Sin embargo, Phrap no descarta por completo tales alineamientos, y las penalizaciones de alineación y de brecha de coincidencia cruzada utilizadas al buscar alineamientos locales no siempre son óptimas para errores de secuenciación típicos y una búsqueda de secuencias superpuestas (contiguas). (Las brechas afines son útiles para búsquedas de homología, pero no suelen ser útiles para el alineamiento de errores de secuenciación). Phrap intenta clasificar quimeras, secuencias vectoriales y regiones terminales de baja calidad en un solo alineamiento y, en ocasiones, cometerá errores. Además, Phrap tiene más de una ronda de construcción de ensamblaje internamente y las rondas posteriores son menos estrictas (algoritmo voraz).

Estas decisiones de diseño fueron útiles en la década de 1990, cuando se escribió originalmente el programa (en la Universidad de Washington en San Luis ), pero ahora lo son menos. Phrap parece propenso a errores en comparación con ensambladores más recientes como Euler y no puede usar la información de pares de extremos directamente para guiar el ensamblaje y ensamblar más allá de repeticiones perfectas. Phrap no es software libre, por lo que no se ha extendido ni mejorado como el software de código abierto menos restringido Sequence Assembly .

Secuencias de consenso basadas en la calidad

Otro uso de las puntuaciones de calidad Phred por parte de Phrap que contribuyó al éxito del programa fue la determinación de secuencias consenso utilizando calidades de secuencia. En efecto, Phrap automatizó un paso que fue un importante cuello de botella en las fases iniciales del Proyecto Genoma Humano : determinar la secuencia consenso correcta en todas las posiciones donde las secuencias ensambladas tenían bases discrepantes. Este enfoque había sido sugerido por Bonfield y Staden en 1995, [ 1 ] y fue implementado y optimizado posteriormente en Phrap. Básicamente, en cualquier posición consenso con bases discrepantes, Phrap examina las puntuaciones de calidad de las secuencias alineadas para encontrar la secuencia de mayor calidad. En el proceso, Phrap tiene en cuenta la confirmación de la secuencia local por otras lecturas, después de considerar la dirección y la química de secuenciación.

Las matemáticas de este método eran bastante sencillas, ya que las puntuaciones de calidad Phred están vinculadas logarítmicamente a las probabilidades de error. Esto significa que las puntuaciones de calidad de las lecturas confirmatorias se pueden sumar simplemente, siempre que las distribuciones de error sean suficientemente independientes. Para cumplir con este criterio de independencia, las lecturas deben estar orientadas en direcciones diferentes, puesto que los patrones de picos que provocan errores de identificación de bases suelen ser idénticos cuando una región se secuencia varias veces en la misma dirección.

Si una base de consenso está cubierta tanto por secuencias de alta calidad como por secuencias de baja calidad (discrepantes), la selección de la secuencia de mayor calidad por parte de Phrap será correcta en la mayoría de los casos. Phrap asigna entonces la calidad de base confirmada a la base de la secuencia de consenso. Esto facilita (a) la identificación de regiones de consenso que no están cubiertas por secuencias de alta calidad (que también tendrán baja calidad) y (b) el cálculo rápido de una estimación razonablemente precisa de la tasa de error de la secuencia de consenso. Esta información puede utilizarse para orientar las tareas de finalización, por ejemplo, la resecuenciación de regiones problemáticas.

La combinación de puntuaciones de calidad precisas y específicas para cada base, junto con una secuencia de consenso basada en la calidad, fue un elemento crucial para el éxito del Proyecto Genoma Humano . Phred y Phrap, y programas similares que retomaron las ideas pioneras de estos dos programas, permitieron el ensamblaje de gran parte del genoma humano (y muchos otros genomas) con una precisión sustancialmente mayor (menos de 1 error en 10 000 bases) que la precisión típica de las secuencias cuidadosamente editadas a mano que se habían enviado previamente a la base de datos GenBank . [ 2 ]

Referencias

  1. Bonfield, JK; Staden, R (abril de 1995). "La aplicación de estimaciones numéricas de la precisión de la llamada de bases a proyectos de secuenciación de ADN" . Nucleic Acids Res . 23 : 1406–10 . PMC 306869. PMID 7753633 .  
  2. Krawetz SA (1989): Errores de secuencia descritos en GenBank: un medio para determinar la precisión de la interpretación de secuencias de ADN. Nucleic Acids Res. 25 de mayo de 1989;17(10):3951-7
  • Página principal de Phrap

Otro software

Obtenido de " https://en.wikipedia.org/w/index.php?title=Phrap&oldid=1340157113 "