
La codificación de 2 bases , también llamada SOLiD ( secuenciación por ligación y detección de oligonucleótidos ), es una tecnología de secuenciación de nueva generación desarrollada por Applied Biosystems y disponible comercialmente desde 2008. Estas tecnologías generan cientos de miles de lecturas de secuencias pequeñas a la vez. Ejemplos conocidos de estos métodos de secuenciación de ADN incluyen la pirosecuenciación 454 (introducida en 2005), el sistema Solexa (introducido en 2006) y el sistema SOLiD (introducido en 2007). Estos métodos han reducido el costo de $0.01/base en 2004 a casi $0.0001/base en 2006 y han aumentado la capacidad de secuenciación de 1,000,000 bases/máquina/día en 2004 a más de 100,000,000 bases/máquina/día en 2006.
La codificación de 2 bases se basa en la secuenciación por ligación en lugar de la secuenciación por síntesis. [ 1 ] Sin embargo, en lugar de utilizar sondas fluorescentes de 9 nucleótidos que distinguen solo 6 bases, la codificación de 2 bases aprovecha las sondas fluorescentes de 8 nucleótidos que distinguen las dos bases más cercanas a la posición 3', pero que pueden ciclarse de forma similar al método de Macevicz, por lo que se pueden obtener lecturas de más de 6 pb (25-50 pb publicadas, [ 2 ] 50 pb en NCBI en febrero de 2008). La codificación de 2 bases permite leer cada base dos veces sin duplicar el trabajo. [ 3 ] [ 4 ] [ 5 ] [ 6 ]
Características generales
Los pasos generales comunes a muchas de estas técnicas de secuenciación de próxima generación incluyen:
- Fragmentación aleatoria del ADN genómico
- Inmovilización de fragmentos de ADN individuales sobre un soporte sólido como una microesfera o una superficie sólida plana.
- Amplificación de fragmentos de ADN en la superficie sólida mediante PCR y formación de colonias de polimerasa [ 7 ].
- Secuenciación y posterior interrogación in situ después de cada ciclo mediante escaneo de fluorescencia o quimioluminiscencia. [ 8 ]
En 1988, Whiteley et al. demostraron el uso de la ligación de oligonucleótidos marcados con fluorescencia para la detección de variantes de ADN. [ 9 ] En 1995, Macevicz [ 10 ] demostró la ligación repetida de oligonucleótidos para detectar variantes de ADN contiguas. En 2003, Dressman et al. [ 11 ] demostraron el uso de PCR en emulsión para generar millones de perlas amplificadas clonalmente en las que se podían realizar estos ensayos de ligación repetida. En 2005, Shendure et al. realizaron un procedimiento de secuenciación que combinó las técnicas de Whiteley y Dressman realizando la ligación de sondas de 9 mer "degeneradas de 8 bases" marcadas con fluorescencia que distinguían una base diferente según la etiqueta de la sonda y la base no degenerada. Este proceso se repitió (sin regenerar un extremo extensible como en Macevicz) utilizando cebadores idénticos pero con sondas con etiquetas que identificaban bases no degeneradas diferentes para secuenciar lecturas de 6 pb en dirección 5->3 y lecturas de 7 pb en dirección 3->5.
Cómo funciona
El sistema de secuenciación SOLiD utiliza sondas con codificación de doble base.
La química subyacente se resume en los siguientes pasos: [ 12 ]
- Paso 1, Preparación de la biblioteca: Este paso comienza con la fragmentación del ADN genómico en pequeños fragmentos. A continuación, se añaden dos adaptadores diferentes (por ejemplo, A1 y A2). La biblioteca resultante contiene fragmentos de ADN molde, marcados con un adaptador en cada extremo (A1-molde-A2).
- Paso 2, PCR en emulsión: En este paso, la reacción de PCR en emulsión (gotas de agua suspendidas en aceite) se realiza utilizando fragmentos de ADN de la biblioteca, dos cebadores (P1 y P2) que complementan los adaptadores utilizados previamente (P1 con A1 y P2 con A2), otros componentes de la reacción de PCR y microesferas de 1 μm acopladas a uno de los cebadores (por ejemplo, P1) para realizar una dilución de la biblioteca de ADN y maximizar la cantidad de gotas que contienen un fragmento de ADN y una microesfera en una sola gota de emulsión.
En cada gota, la plantilla de ADN se une a la microesfera acoplada a P1 desde su lado A1. A continuación, la ADN polimerasa se extiende desde P1 para sintetizar la secuencia complementaria, lo que da como resultado una microesfera enriquecida con productos de PCR a partir de una única plantilla. Tras la reacción de PCR, las plantillas se desnaturalizan y se disocian de las microesferas. Dressman et al. describieron esta técnica por primera vez en 2003.
- Paso 3, Enriquecimiento de microesferas: En la práctica, solo el 30 % de las microesferas contienen el ADN diana. Para aumentar la cantidad de microesferas con ADN diana, se añaden a la solución microesferas grandes de poliestireno recubiertas con A2. De esta forma, cualquier microesfera que contenga los productos extendidos se unirá a la microesfera de poliestireno a través de su extremo P2. El complejo resultante se separará de las microesferas no diana y se disociará, separando así las microesferas diana del poliestireno. Este paso puede aumentar el rendimiento de este sistema del 30 % antes del enriquecimiento al 80 % después del mismo.
Tras el enriquecimiento, el extremo 3' de los productos (extremo P2) se modifica, lo que les permite formar enlaces covalentes en el siguiente paso. Por lo tanto, los productos de este paso son microesferas acopladas a ADN con modificación en el extremo 3' de cada hebra de ADN.
- Paso 4, Deposición de microesferas: En este paso, los productos del paso anterior se depositan sobre un portaobjetos de vidrio. Las microesferas se adhieren a la superficie del vidrio de forma aleatoria mediante enlaces covalentes entre las microesferas modificadas en el extremo 3' y el vidrio.
- Paso 5, Reacción de secuenciación: Como se mencionó anteriormente, a diferencia de otros métodos de próxima generación que realizan la secuenciación mediante síntesis, la codificación de 2 bases se basa en la secuenciación por ligación. La ligación se realiza utilizando sondas específicas de 8 nucleótidos:
Estas sondas tienen ocho bases de longitud con un grupo hidroxilo libre en el extremo 3', un colorante fluorescente en el extremo 5' y un sitio de escisión entre el quinto y el sexto nucleótido. Las dos primeras bases (empezando por el extremo 3') son complementarias a los nucleótidos que se están secuenciando. Las bases 3 a 5 son degeneradas y pueden aparearse con cualquier nucleótido de la secuencia molde. Las bases 6 a 8 también son degeneradas, pero se escinden, junto con el colorante fluorescente, a medida que avanza la reacción. La escisión del colorante fluorescente y de las bases 6 a 8 deja un grupo fosfato 5' libre, listo para una ligación posterior. De esta manera, las posiciones n+1 y n+2 se aparean correctamente, seguidas de n+6 y n+7, y así sucesivamente. La composición de las bases n+3, n+4 y n+5 permanece indeterminada hasta rondas posteriores de la reacción de secuenciación.
La etapa de secuenciación se compone básicamente de cinco rondas, y cada ronda consta de aproximadamente 5 a 7 ciclos (Figura 2). Cada ronda comienza con la adición de un cebador universal complementario a P1. Este cebador tiene, por ejemplo, n nucleótidos y su extremo 5' coincide exactamente con el extremo 3' de P1. En cada ciclo, se añaden sondas de 8 nucleótidos y se ligan según sus bases primera y segunda. A continuación, se eliminan las sondas no unidas, se mide la señal fluorescente de la sonda unida y esta se escinde entre su quinto y sexto nucleótido. Finalmente, el cebador y las sondas se reinician para la siguiente ronda.
En la siguiente ronda, un nuevo cebador universal se une a la posición n-1 (su extremo 5' coincide con la base justo antes del extremo 3' del P1) y los ciclos subsiguientes se repiten de forma similar a la primera ronda. Las tres rondas restantes se realizarán con nuevos cebadores universales que se unen a las posiciones n-2, n-3 y n-4 con respecto al extremo 3' del P1.
Una reacción completa de cinco rondas permite la secuenciación de aproximadamente 25 pares de bases del molde de P1.
- Paso 6, Decodificación de datos: Para decodificar los datos, representados por colores, primero debemos conocer dos factores importantes. Primero, debemos saber que cada color indica dos bases. Segundo, necesitamos conocer una de las bases de la secuencia: esta base se incorpora a la secuencia en la última (quinta) ronda del paso 5. Esta base conocida es el último nucleótido del extremo 3' del P1 conocido. Por lo tanto, dado que cada color representa dos nucleótidos en los que la segunda base de cada unidad de dinucleótido constituye la primera base del siguiente dinucleótido, conocer solo una base de la secuencia nos permitirá interpretar la secuencia completa (Figura 2). [ 13 ]
2 Consideraciones sobre la codificación base
En la práctica, no se recomienda la traducción directa de lecturas de color a lecturas de base, ya que en el momento en que se encuentre un error en las llamadas de color, se producirá un cambio de marco en las llamadas de base. Para aprovechar al máximo las propiedades de "corrección de errores" de la codificación de dos bases, lo mejor es convertir la secuencia de referencia de base al espacio de color. Existe una conversión inequívoca de una secuencia de referencia de base al espacio de color, y aunque la conversión inversa también es cierta, puede ser muy imprecisa si hay errores de secuenciación. [ 14 ]
La asignación de lecturas de espacio de color a una referencia de espacio de color permite utilizar correctamente las reglas de codificación de dos bases, donde solo las diferencias de color adyacentes pueden representar un verdadero polimorfismo de base. La decodificación o traducción directa de las lecturas de color a bases no puede lograr esto de manera eficiente sin información adicional.
Más concretamente, este método no es una herramienta de corrección de errores, sino de transformación de errores. El espacio de color transforma el modo de error más común (errores de medición individuales) en una frecuencia distinta a la de la forma más común de variación del ADN (SNP o cambios de una sola base). Estos cambios de una sola base afectan a los colores adyacentes en el espacio de color. Existen reglas lógicas que ayudan a corregir los errores adyacentes, clasificándolos como "válidos" o "inválidos".
Se puede estimar la probabilidad de obtener dos errores adyacentes en una lectura de 50 pb. Hay 49 formas de realizar cambios adyacentes en una cadena de 50 letras (lectura de 50 pb). Hay 1225 formas de realizar cambios no adyacentes en una cadena de 50 letras (50 sobre 2). De forma simplificada, si se asume que los errores son completamente aleatorios (suelen tener mayor frecuencia al final de las lecturas), solo 49 de 1225 errores serán candidatos a SNP. Además, solo un tercio de los errores adyacentes pueden ser errores válidos según el etiquetado conocido de las sondas, lo que resulta en solo 16 de 1225 errores que pueden ser candidatos a SNP. Esto es particularmente útil para la detección de SNP con baja cobertura, ya que reduce los falsos positivos en baja cobertura, Smith et al. [ 15 ].
Ventajas
En este método de secuenciación, cada base se lee dos veces. Esto modifica el color de dos llamadas de espacio de color adyacentes; por lo tanto, para que se produzca un error en la identificación de un SNP, deben identificarse erróneamente dos colores adyacentes. Debido a esto, la tasa de errores en la identificación de SNP es del orden de e², donde e es la tasa de error del dispositivo.
Desventajas
Cuando se realiza la llamada de bases, los errores de un solo color provocan errores en la porción restante de la lectura. En la llamada de SNP, esto se puede corregir, lo que resulta en una tasa de error de llamada de SNP más baja. Sin embargo, para el ensamblaje de novo simple, se obtiene la tasa de error del dispositivo sin procesar, que será significativamente mayor que el 0,06 % reportado para la llamada de SNP. El filtrado de calidad de las lecturas puede proporcionar lecturas sin procesar de mayor precisión que, al alinearse para formar contigs de color, pueden proporcionar secuencias de referencia donde se puede aprovechar mejor la codificación de 2 bases. Los ensamblajes híbridos con otras tecnologías también pueden aprovechar mejor la codificación de 2 bases.
Véase también
Referencias
- ↑ Jay Shendure et al. (2005) Secuenciación precisa de polonias multiplexde un genoma bacteriano evolucionado. Science 309(5741), 1728 - 1732
- ↑ Variación de secuencia y estructura en un genoma humano descubierta mediante secuenciación de ligación masivamente paralela de lectura corta utilizando codificación de dos bases. McKernan KJ, Peckham HE, Costa GL, McLaughlin SF, Fu Y, Tsung EF, Clouser CR, Duncan C, Ichikawa JK, Lee CC, Zhang Z, Ranade SS, Dimalanta ET, Hyland FC, Sokolsky TD, Zhang L, Sheridan A, Fu H, Hendrickson CL, Li B, Kotler L, Stuart JR, Malek JA, Manning JM, Antipova AA, Perez DS, Moore MP, Hayashibara KC, Lyons MR, Beaudoin RE, Coleman BE, Laptewicz MW, Sannicandro AE, Rhodes MD, Gottimukkala RK, Yang S, Bafna V, Bashir A, MacBride A, Alkan C, Kidd JM, Eichler EE, Reese MG, De La Vega FM, Blanchard AP. Genoma Res. 2009 septiembre; 19(9):1527-41. Publicado en formato electrónico el 22 de junio de 2009.
- ↑ Patente: Reactivos, métodos y bibliotecas para secuenciación basada en microesferas
- ↑ Artículo: Un mapa de posición de nucleosomas de alta resolución de C. elegans revela una falta de universalidad...
- ↑ Artículo: Perfilado del transcriptoma de células madre mediante secuenciación masiva de ARNm
- ↑ Perfilado mutacional rápido de todo el genoma mediante tecnologías de secuenciación de nueva generación, Genome Research, 2008 18:1638-1642
- ^ Chetverin, NAR, 1993, Vol.21, N° 10 2349-2353
- ↑ MATTHEW E. HUDSON (2008) Avances en la secuenciación para la ecología genómica y la biología evolutiva. Molecular Ecology Resources 8 (1), 3–17
- ↑ Patente estadounidense número 4,883,750 de Whiteley
- ↑ Patente estadounidense número 5,750,341 de Macevicz
- ↑ Transformación de moléculas individuales de ADN en partículas magnéticas fluorescentes para la detección y enumeración de variaciones genéticas, PNAS, 22 de julio de 2004, vol. 100, n.º 15, 8817-8822
- ↑ Biosistemas Aplicados
- ↑ Resumen técnico: SOLiD de ABI (Secuenciación por ligación/detección de oligonucleótidos) - SEQanswers
- ↑Ejemplo de conversión de espacio de color a FastQ
- ↑ Smith et al., Genome Research 2008 18:1638-1642
- Biotecnología
- métodos de secuenciación de ADN