Articulo de referencia

Análisis serial de la expresión génica

Resumen de SAGE. Dentro de los organismos, los genes se transcriben y se empalman (en eucariotas ) para producir transcritos de ARNm maduros (rojo). El ARNm se extrae del organi...

Resumen de SAGE. Dentro de los organismos, los genes se transcriben y se empalman (en eucariotas ) para producir transcritos de ARNm maduros (rojo). El ARNm se extrae del organismo y se utiliza transcriptasa inversa para copiarlo en ADNc bicatenario estable ( ds - cDNA ; azul). En SAGE, el ds-cDNA se digiere con enzimas de restricción (en la posición 'X' y 'X'+11) para producir fragmentos de 'etiqueta' de 11 nucleótidos. Estas etiquetas se concatenan y se secuencian mediante secuenciación Sanger de lectura larga (diferentes tonalidades de azul indican etiquetas de diferentes genes). Las secuencias se deconvolucionan para encontrar la frecuencia de cada etiqueta. La frecuencia de la etiqueta se puede utilizar para informar sobre la transcripción del gen del que proviene la etiqueta. [ 1 ]

El análisis serial de la expresión génica ( SAGE ) es una técnica transcriptómica utilizada por biólogos moleculares para generar una instantánea de la población de ARN mensajero en una muestra de interés, en forma de pequeñas etiquetas que corresponden a fragmentos de dichos transcritos. Desde entonces, se han desarrollado varias variantes, entre las que destacan una versión más robusta, LongSAGE, [ 2 ] RL-SAGE [ 3 ] y la más reciente SuperSAGE. [ 4 ] Muchas de estas variantes han mejorado la técnica mediante la captura de etiquetas más largas, lo que permite una identificación más precisa del gen de origen.

Descripción general

En resumen, los experimentos SAGE se desarrollan de la siguiente manera:

  1. Se aísla el ARNm de una muestra de entrada (por ejemplo, un tumor ) y se utiliza una transcriptasa inversa y cebadores biotinilados para sintetizar ADNc a partir del ARNm .
  2. El ADNc se une a las microesferas de estreptavidina mediante la interacción con la biotina unida a los cebadores, y posteriormente se escinde utilizando una endonucleasa de restricción denominada enzima de anclaje (EA). La ubicación del sitio de escisión y, por lo tanto, la longitud del ADNc restante unido a la microesfera, variará para cada ADNc (ARNm) individual.
  3. El ADNc escindido aguas abajo del sitio de escisión se descarta, y los fragmentos de ADNc inmóviles restantes aguas arriba de los sitios de escisión se dividen por la mitad y se exponen a uno de dos oligonucleótidos adaptadores (A o B) que contienen varios componentes en el siguiente orden aguas arriba del sitio de unión: 1) Extremos cohesivos con el sitio de corte AE para permitir la unión al ADNc escindido; 2) Un sitio de reconocimiento para una endonucleasa de restricción conocida como enzima de etiquetado (TE), que corta aproximadamente 15 nucleótidos aguas abajo de su sitio de reconocimiento (dentro de la secuencia original de ADNc/ARNm); 3) Una secuencia de cebador corta única para el adaptador A o B, que se utilizará posteriormente para una mayor amplificación mediante PCR.
  4. Después de la ligación del adaptador , el ADNc se escinde utilizando TE para eliminarlo de las microesferas, dejando solo una "etiqueta" corta de aproximadamente 11 nucleótidos del ADNc original (15 nucleótidos menos los 4 correspondientes al sitio de reconocimiento AE).
  5. Posteriormente, las etiquetas de ADNc escindidas se reparan con ADN polimerasa para producir fragmentos de ADNc de extremos romos.
  6. Estos fragmentos de etiquetas de ADNc (con cebadores adaptadores y sitios de reconocimiento AE y TE unidos) se ligan, uniendo las dos secuencias de etiquetas y flanqueando los adaptadores A y B en cada extremo. Estas nuevas construcciones, llamadas ditags , se amplifican mediante PCR utilizando cebadores específicos para los anclajes A y B.
  7. Posteriormente, las ditags se escinden utilizando el AE original y se les permite unirse con otras ditags, que se ligarán para crear un concatémero de ADNc , estando cada ditag separada por el sitio de reconocimiento del AE.
  8. Estos concatémeros se transforman posteriormente en bacterias para su amplificación mediante replicación bacteriana.
  9. Posteriormente, los concatémeros de ADNc pueden aislarse y secuenciarse utilizando secuenciadores de ADN modernos de alto rendimiento , y estas secuencias pueden analizarse con programas informáticos que cuantifican la recurrencia de las etiquetas individuales.

Análisis

El resultado de SAGE es una lista de secuencias cortas y el número de veces que se observan. Utilizando bases de datos de secuencias, un investigador suele poder determinar, con bastante certeza, de qué ARNm original (y, por lo tanto, de qué gen ) se extrajo la secuencia.

Se pueden aplicar métodos estadísticos para etiquetar y contabilizar listas de diferentes muestras con el fin de determinar qué genes se expresan en mayor medida. Por ejemplo, se puede comparar una muestra de tejido normal con un tumor correspondiente para determinar qué genes tienden a ser más (o menos) activos.

Historia

En 1979, equipos de Harvard y Caltech extendieron la idea básica de hacer copias de ADN de ARNm in vitro a la amplificación de una biblioteca de tales en plásmidos bacterianos. [ 5 ] En 1982-1983, Greg Sutcliffe y colaboradores exploraron la idea de seleccionar clones aleatorios o semi-aleatorios de dicha biblioteca de ADNc para secuenciación. [ 6 ] y Putney et al., quienes secuenciaron 178 clones de una biblioteca de ADNc de músculo de conejo. [ 7 ] En 1991, Adams y colaboradores acuñaron el término etiqueta de secuencia expresada (EST) e iniciaron una secuenciación más sistemática de ADNc como proyecto (comenzando con 600 ADNc cerebrales). [ 8 ] La identificación de EST procedió rápidamente, y ahora hay millones de EST disponibles en bases de datos públicas (por ejemplo, GenBank ).

En 1995, la idea de reducir la longitud de las etiquetas de 100 a 800 pb a una longitud de etiqueta de 10 a 22 pb ayudó a reducir el costo de los estudios de ARNm. [ 9 ] Ese mismo año, Victor Velculescu, del Centro de Oncología de la Universidad Johns Hopkins , publicó el protocolo SAGE original . [ 9 ] Si bien SAGE se concibió originalmente para su uso en estudios de cáncer, se ha utilizado con éxito para describir el transcriptoma de otras enfermedades y en una amplia variedad de organismos.

Comparación con microarrays de ADN

El objetivo general de la técnica es similar al de los microarrays de ADN . Sin embargo, el muestreo SAGE se basa en la secuenciación del ARNm, no en la hibridación del ARNm con sondas, por lo que los niveles de transcripción se miden de forma más cuantitativa que con los microarrays. Además, no es necesario conocer las secuencias de ARNm de antemano , lo que permite descubrir genes o variantes genéticas desconocidas. Los experimentos con microarrays son mucho más económicos, por lo que los estudios a gran escala no suelen utilizar SAGE. La cuantificación de la expresión génica es más precisa en SAGE, ya que implica el recuento directo del número de transcritos, mientras que la intensidad de los puntos en los microarrays presenta gradientes no discretos y es susceptible al ruido de fondo.

Protocolos variantes

clonación de miRNA

Los microARN , o miRNA por sus siglas en inglés, son pequeños segmentos de ARN (~22 nt) que desempeñan un papel crucial en la regulación génica. Uno de los métodos más utilizados para clonar e identificar miRNA dentro de una célula o tejido fue desarrollado en el Laboratorio Bartel y publicado en un artículo de Lau et al. (2001). Desde entonces, han surgido varios protocolos variantes, pero la mayoría mantiene el mismo formato básico. El procedimiento es bastante similar a SAGE: se aíslan los pequeños ARN, se les añaden adaptadores y el ARN se convierte en ADNc mediante RT-PCR . Posteriormente, los adaptadores, que contienen sitios de restricción internos, se digieren con la enzima de restricción adecuada y los extremos cohesivos se ligan para formar concatámeros. Tras la concatenación, los fragmentos se ligan a plásmidos y se utilizan para transformar bacterias y generar múltiples copias del plásmido que contiene los insertos. Posteriormente, se pueden secuenciar para identificar el miRNA presente, así como analizar los niveles de expresión de un miRNA determinado contando el número de veces que está presente, de forma similar a SAGE.

Salvia larga y salvia RL

LongSAGE fue una versión más robusta del SAGE original desarrollado en 2002 que tenía un mayor rendimiento, utilizando 20 μg de ARNm para generar una biblioteca de ADNc de miles de etiquetas. [ 10 ] LongSage robusto (RL-SAGE) mejoró aún más el protocolo LongSAGE con la capacidad de generar una biblioteca con un tamaño de inserción de 50  ng de ARNm , mucho menor que el tamaño de inserción anterior de LongSAGE de 2 μg de ARNm [ 10 ] y utilizando un menor número de reacciones en cadena de la polimerasa ( PCR ) de ditag para obtener una biblioteca de ADNc completa . [ 11 ]

SuperSAGE

SuperSAGE es un derivado de SAGE que utiliza la endonucleasa de tipo III EcoP15I del fago P1 para cortar etiquetas de secuencia de 26 pb de longitud del ADNc de cada transcrito , lo que aumenta el tamaño de la etiqueta en al menos 6 pb en comparación con las técnicas predecesoras SAGE y LongSAGE. [ 12 ] El mayor tamaño de la etiqueta permite una asignación más precisa de la etiqueta al transcrito correspondiente, ya que cada base adicional aumenta considerablemente la precisión de la anotación.

Al igual que en el protocolo SAGE original, se forman los llamados ditags, utilizando etiquetas de extremos romos . Sin embargo, SuperSAGE evita el sesgo observado durante la ligación de ditags LongSAGE de 20 pb, que es menos aleatoria. [ 13 ] Mediante la secuenciación directa con técnicas de secuenciación de alto rendimiento ( secuenciación de próxima generación , es decir, pirosecuenciación ), se pueden analizar simultáneamente cientos de miles o millones de etiquetas, lo que produce perfiles de expresión génica muy precisos y cuantitativos . Por lo tanto, el perfilado de expresión génica basado en etiquetas, también llamado "perfilado digital de expresión génica" (DGE), puede proporcionar hoy en día los perfiles de transcripción más precisos que superan las limitaciones de los microarrays . [ 14 ] [ 15 ]

Secuenciación del extremo 3' del ARNm, análisis masivo de los extremos del ADNc.

A mediados de la década de 2010, se desarrollaron varias técnicas combinadas con la secuenciación de nueva generación que emplean el principio de "etiqueta" para el "perfilado digital de la expresión génica", pero sin el uso de la enzima de etiquetado. El método "MACE" (Análisis Masivo de los Extremos del ADNc) genera etiquetas en los últimos 1500 pares de bases de un transcrito. Esta técnica ya no depende de enzimas de restricción, evitando así el sesgo relacionado con la ausencia o la ubicación del sitio de restricción dentro del ADNc. En su lugar, el ADNc se fragmenta aleatoriamente y los extremos 3' se secuencian desde el extremo 5' de la molécula de ADNc que contiene la cola de poli-A. La longitud de secuenciación de la etiqueta se puede elegir libremente. Gracias a esto, las etiquetas se pueden ensamblar en contigs y su anotación se puede mejorar drásticamente. Por lo tanto, MACE también se utiliza para el análisis de organismos no modelo. Además, los contigs más largos se pueden analizar para detectar polimorfismos. Dado que las UTR muestran un gran número de polimorfismos entre individuos, el método MACE puede aplicarse para la determinación de alelos, el perfilado de expresión génica específico de alelos y la búsqueda de marcadores moleculares para la selección genética. Además, este método permite determinar la poliadenilación alternativa de los transcritos. Como MACE solo requiere los extremos 3' de los transcritos, incluso el ARN parcialmente degradado puede analizarse con menor sesgo dependiente de la degradación. El método MACE utiliza identificadores moleculares únicos para permitir la identificación del sesgo de la PCR. [ 16 ]

Véase también

Referencias

  1. Shafee, Thomas; Lowe, Rohan (2017). "Estructura genética eucariota y procariota" . WikiJournal of Medicine . 4 (1). doi : 10.15347/wjm/2017.002 . ISSN 2002-4436 . 
  2. Saha S, et al. (2002). "Using the transcriptome to annotate the genome". Nat Biotechnol . 20 (5): 508– 12. doi : 10.1038/nbt0502-508 . PMID 11981567 . S2CID 12709815 .   
  3. Gowda M; Jantasuriyarat C; Dean RA; Wang GL. (2004). "Robust-LongSAGE (RL-SAGE): un método LongSAGE sustancialmente mejorado para el descubrimiento de genes y el análisis del transcriptoma" . Plant Physiol . 134 (3): 890–7 . doi : 10.1104/pp.103.034496 . PMC 389912. PMID 15020752 .  
  4. Matsumura H; Ito A; Saitoh H; Invierno P; Kahl G; Reuters M; Krüger DH; Terauchi R. (2005). "SuperSAGE" . Microbiol celular . 7 (1): 11– 8. doi : 10.1111/j.1462-5822.2004.00478.x . PMID 15617519 . S2CID 221579149 .  
  5. Sim GK; Kafatos FC; Jones CW; Koehler MD; Efstratiadis A; Maniatis T (diciembre de 1979). "Uso de una biblioteca de ADNc para estudios sobre la evolución y la expresión del desarrollo de las familias multigénicas del corion" . Cell . 18 (4): 1303–16 . doi : 10.1016/0092-8674(79)90241-1 . PMID 519770 . 
  6. Sutcliffe JG; Milner RJ; Bloom FE; Lerner RA (agosto de 1982). "Secuencia común de 82 nucleótidos única del ARN cerebral" . Proc Natl Acad Sci USA . 79 (16): 4942–6 . Bibcode : 1982PNAS...79.4942S . doi : 10.1073/pnas.79.16.4942 . PMC 346801. PMID 6956902 .  
  7. Putney SD; Herlihy WC; Schimmel P (1983). "Una nueva troponina T y clones de ADNc para 13 proteínas musculares diferentes, encontrados mediante secuenciación de escopeta". Nature . 302 (5910): 718– 21. Bibcode : 1983Natur.302..718P . doi : 10.1038/302718a0 . PMID 6687628 . S2CID 4364361 .  
  8. Adams MD, Kelley JM, Gocayne JD, et al. (junio de 1991). "Secuenciación de ADN complementario: etiquetas de secuencia expresada y proyecto del genoma humano". Science . 252 ( 5013): 1651– 6. Bibcode : 1991Sci...252.1651A . doi : 10.1126/science.2047873 . PMID 2047873. S2CID 13436211 .   
  9. 1 2 Velculescu VE; Zhang L; Vogelstein B; Kinzler KW. (1995). "Análisis serial de la expresión génica". Science . 270 (5235): 484– 7. Bibcode : 1995Sci...270..484V . doi : 10.1126/science.270.5235.484 . PMID 7570003 . S2CID 16281846 .  
  10. 1 2 Saha, S., et al. (2002). "Uso del transcriptoma para anotar el genoma." Nat Biotechnol 20(5): 508-512.
  11. Gowda, M., et al. (2004). "Robust-LongSAGE (RL-SAGE): un método LongSAGE sustancialmente mejorado para el descubrimiento de genes y el análisis del transcriptoma." Plant Physiol 134(3): 890-897.
  12. Matsumura, H.; Reich, S.; Ito, A.; Saitoh, H.; Kamoun, S.; Winter, P.; Kahl, G.; Reuter, M.; Krüger, D.; Terauchi, R. (2003). "Análisis de la expresión génica de las interacciones planta-patógeno mediante SuperSAGE" . Actas de la Academia Nacional de Ciencias . 100 (26): 15718– 15723. Bibcode : 2003PNAS..10015718M . doi : 10.1073/pnas.2536670100 . PMC 307634. ​​PMID 14676315 .  
  13. Gowda, Malali; Jantasuriyarat, Chatchawan; Dean, Ralph A.; Wang, Guo-Liang (2004-03-01). "Robust-LongSAGE (RL-SAGE): Un método LongSAGE sustancialmente mejorado para el descubrimiento de genes y el análisis del transcriptoma" . Plant Physiology . 134 (3): 890– 897. doi : 10.1104/pp.103.034496 . ISSN 1532-2548 . PMC 389912. PMID 15020752 .   
  14. Shendure, J. (2008). "¿El principio del fin de los microarrays?". Nature Methods . 5 (7): 585– 7. doi : 10.1038/nmeth0708-585 . PMID 18587314. S2CID 29682662 .  
  15. Matsumura, H.; Bin Nasir, KH; Yoshida, K.; Ito, A.; Kahl, GN; Krüger, DH; Terauchi, R. (2006). "SuperSAGE array: el uso directo de etiquetas de transcripción de 26 pares de bases en matrices de oligonucleótidos". Nature Methods . 3 (6): 469– 74. doi : 10.1038/nmeth882 . PMID 16721381 . S2CID 19160070 .  
  16. Zawada, Adam (enero de 2014). "Análisis masivo de extremos de ADNc (MACE) y perfil de expresión de miRNA identifica vías proaterogénicas en la enfermedad renal crónica" . Epigenética . 9 ( 1): 161– 172. doi : 10.4161/epi.26931 . PMC 3928179. PMID 24184689 .  
  • SAGEnet
  • Una reseña de la técnica SAGE en Science Creative Quarterly.